AI Research 技术调研

标签: multimodal-fusion

此标签下有1条笔记。

  • 2026年7月16日

    JEPA-T: Joint-Embedding Predictive Architecture with Text Fusion for Image Generation

    • jepa
    • text-to-image
    • cross-attention
    • flow-matching
    • masked-prediction
    • imagenet
    • multimodal-fusion
    • clip
    • mar
    • non-generative-lineage

  • GitHub