AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: multimodal-llm
此标签下有5条笔记。
2026年6月25日
AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
any-modality
multimodal-llm
llama-2
perceiver-resampler
frozen-llm
audio
video
imu
instruction-tuning
understanding
2026年6月25日
SEED: Planting a SEED of Vision in Large Language Model
unified
visual-tokenizer
discrete-tokens
vq
multimodal-llm
autoregressive
q-former
image-to-text
text-to-image
2026年6月25日
Chameleon: Mixed-Modal Early-Fusion Foundation Models
unified
early-fusion
token-based
autoregressive
mixed-modal
vqgan
image-tokenizer
multimodal-llm
2026年6月25日
Gemini 2.0 Flash 原生图像生成(Native Image Output)
native-image-output
interleaved-text-image
unified
multimodal-llm
conversational-editing
synthid
closed-source
nano-banana-lineage
2026年6月25日
Gemini 2.0 Flash 原生图像生成(公开实验版 gemini-2.0-flash-exp,2025-03)
gemini
native-image-output
interleaved-text-image
conversational-editing
unified
multimodal-llm
world-knowledge
text-rendering
synthid
closed-source
nano-banana-lineage