AI Research 技术调研

标签: visual-tokenizer

此标签下有5条笔记。

  • 2026年6月25日

    SEED: Planting a SEED of Vision in Large Language Model

    • unified
    • visual-tokenizer
    • discrete-tokens
    • vq
    • multimodal-llm
    • autoregressive
    • q-former
    • image-to-text
    • text-to-image
  • 2026年6月25日

    HART: Efficient Visual Generation with Hybrid Autoregressive Transformer

    • autoregressive
    • visual-tokenizer
    • residual-diffusion
    • var
    • t2i
    • efficient-inference
    • 1024px
    • Params
    • Step
  • 2026年6月25日

    VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation

    • unified
    • autoregressive
    • next-token
    • visual-tokenizer
    • rq-vae
    • clip-alignment
    • vlm
    • image-generation
    • video-generation
  • 2026年6月25日

    OmniGen-AR: AutoRegressive Any-to-Image Generation

    • autoregressive
    • any-to-image
    • unified-generation
    • next-token
    • visual-tokenizer
    • disentangled-causal-attention
    • image-editing
    • text-to-video
    • neurips-2025
  • 2026年6月25日

    模型架构演进:从 U-Net 扩散到统一 omni 骨干(2020–2026)

    • omni
    • architecture
    • diffusion
    • dit
    • mmdit
    • rectified-flow
    • autoregressive
    • visual-tokenizer
    • vae
    • text-encoder
    • unified-multimodal
    • survey

  • GitHub