AI Research 技术调研

标签: multimodal-llm

此标签下有5条笔记。

  • 2026年6月25日

    AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model

    • any-modality
    • multimodal-llm
    • llama-2
    • perceiver-resampler
    • frozen-llm
    • audio
    • video
    • imu
    • instruction-tuning
    • understanding
  • 2026年6月25日

    SEED: Planting a SEED of Vision in Large Language Model

    • unified
    • visual-tokenizer
    • discrete-tokens
    • vq
    • multimodal-llm
    • autoregressive
    • q-former
    • image-to-text
    • text-to-image
  • 2026年6月25日

    Chameleon: Mixed-Modal Early-Fusion Foundation Models

    • unified
    • early-fusion
    • token-based
    • autoregressive
    • mixed-modal
    • vqgan
    • image-tokenizer
    • multimodal-llm
  • 2026年6月25日

    Gemini 2.0 Flash 原生图像生成(Native Image Output)

    • native-image-output
    • interleaved-text-image
    • unified
    • multimodal-llm
    • conversational-editing
    • synthid
    • closed-source
    • nano-banana-lineage
  • 2026年6月25日

    Gemini 2.0 Flash 原生图像生成(公开实验版 gemini-2.0-flash-exp,2025-03)

    • gemini
    • native-image-output
    • interleaved-text-image
    • conversational-editing
    • unified
    • multimodal-llm
    • world-knowledge
    • text-rendering
    • synthid
    • closed-source
    • nano-banana-lineage

  • GitHub