AI Research 技术调研

标签: vit

此标签下有5条笔记。

  • 2026年7月16日

    Real-World Robot Learning with Masked Visual Pre-training

    • visual-pretraining
    • masked-autoencoder
    • vit
    • frozen-features
    • behavior-cloning
    • egocentric-video
    • real-world-robots
    • cross-embodiment
    • scaling
  • 2026年7月16日

    Understanding Physical Dynamics with Counterfactual World Modeling

    • world-model
    • self-supervised
    • masked-prediction
    • video-transformer
    • counterfactual-reasoning
    • physical-dynamics
    • vit
    • physion-benchmark
    • non-generative
  • 2026年6月25日

    Vector-quantized Image Modeling with Improved VQGAN (ViT-VQGAN)

    • tokenizer
    • vqgan
    • vit
    • vector-quantization
    • autoregressive
    • codebook
    • image-generation
    • representation-learning
  • 2026年6月25日

    Scalable Diffusion Models with Transformers (DiT)

    • dit
    • diffusion-transformer
    • latent-diffusion
    • adaln-zero
    • scaling
    • imagenet
    • backbone
    • vit
  • 2026年6月25日

    All are Worth Words: A ViT Backbone for Diffusion Models (U-ViT)

    • diffusion
    • vit
    • backbone
    • transformer
    • long-skip-connection
    • latent-diffusion
    • t2i
    • class-conditional
    • Layers
    • Heads
    • Params

  • GitHub