AI Research 技术调研

标签: multimodal-conditioning

此标签下有2条笔记。

  • 2026年7月16日

    RoboDreamer: Learning Compositional World Models for Robot Imagination

    • world-model
    • video-diffusion
    • compositional-generation
    • text-conditioned
    • multimodal-conditioning
    • robot-manipulation
    • RLBench
    • RT-1
    • text-parsing
    • energy-based-composition
  • 2026年7月16日

    WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens

    • world-model
    • video-generation
    • masked-token-prediction
    • vqgan
    • transformer
    • multimodal-conditioning
    • action-conditioning
    • autonomous-driving
    • parallel-decoding

  • GitHub