AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: vit
此标签下有5条笔记。
2026年7月16日
Real-World Robot Learning with Masked Visual Pre-training
visual-pretraining
masked-autoencoder
vit
frozen-features
behavior-cloning
egocentric-video
real-world-robots
cross-embodiment
scaling
2026年7月16日
Understanding Physical Dynamics with Counterfactual World Modeling
world-model
self-supervised
masked-prediction
video-transformer
counterfactual-reasoning
physical-dynamics
vit
physion-benchmark
non-generative
2026年6月25日
Vector-quantized Image Modeling with Improved VQGAN (ViT-VQGAN)
tokenizer
vqgan
vit
vector-quantization
autoregressive
codebook
image-generation
representation-learning
2026年6月25日
Scalable Diffusion Models with Transformers (DiT)
dit
diffusion-transformer
latent-diffusion
adaln-zero
scaling
imagenet
backbone
vit
2026年6月25日
All are Worth Words: A ViT Backbone for Diffusion Models (U-ViT)
diffusion
vit
backbone
transformer
long-skip-connection
latent-diffusion
t2i
class-conditional
Layers
Heads
Params