AI Research 技术调研

标签: q-former

此标签下有2条笔记。

  • 2026年7月16日

    Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy

    • vla
    • diffusion-transformer
    • in-context-conditioning
    • cross-embodiment
    • open-x-embodiment
    • action-chunking
    • dinov2
    • q-former
    • libero
    • calvin
    • maniskill2
    • simplerenv
  • 2026年6月25日

    SEED: Planting a SEED of Vision in Large Language Model

    • unified
    • visual-tokenizer
    • discrete-tokens
    • vq
    • multimodal-llm
    • autoregressive
    • q-former
    • image-to-text
    • text-to-image

  • GitHub