AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: vq-vae
此标签下有15条笔记。
2026年7月16日
Latent Action Pretraining from Videos (LAPA)
vla
latent-action
vq-vae
video-pretraining
unsupervised
cross-embodiment
openvla
iclr-2025
2026年7月16日
Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos
latent-action
video-pretraining
vq-vae
autoregressive-transformer
action-chunking
cross-embodiment
human-video-pretraining
calvin
simpler
co-fine-tuning
2026年7月16日
Learning from Massive Human Videos for Universal Humanoid Pose Control
humanoid
whole-body-control
action-tokenization
vq-vae
transformer
motion-retargeting
internet-video
text-conditioned-control
unitree-h1
ppo
2026年7月16日
VQ-BeT: Behavior Generation with Latent Actions
vq-vae
residual-vector-quantization
action-tokenization
behavior-cloning
imitation-learning
multimodal-behavior-generation
transformer-policy
goal-conditioning
autonomous-driving
2026年7月16日
UniVLA: Learning to Act Anywhere with Task-centric Latent Actions
vla
latent-action
vq-vae
cross-embodiment
dinov2
prismatic-vlm
navigation
manipulation
human-video
libero
calvin
r2r
rss-2025
2026年7月16日
WholeBodyVLA: Towards Unified Latent VLA for Whole-body Loco-manipulation Control
vla
humanoid
loco-manipulation
latent-action-model
vq-vae
reinforcement-learning
whole-body-control
agibot-x2
prismatic-vlm
iclr-2026
2026年7月16日
OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving
world-model
autonomous-driving
occupancy-generation
diffusion-transformer
4d-occupancy
trajectory-conditioning
nuscenes
vq-vae
dit
2026年7月16日
MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft
world-model
minecraft
autoregressive-transformer
vq-vae
action-conditioning
parallel-decoding
diagonal-decoding
real-time-interaction
vpt-dataset
controllability-metric
2026年6月25日
Jukebox: A Generative Model for Music
music-generation
raw-audio
vq-vae
sparse-transformer
autoregressive
codec-tokens
lyrics-conditioning
2026年6月25日
Taming Transformers for High-Resolution Image Synthesis (VQGAN)
vqgan
vq-vae
autoregressive
transformer
discrete-tokenizer
codebook
gan
perceptual-loss
image-synthesis
2026年6月25日
GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions
text-to-video
autoregressive
vq-vae
sparse-attention
t2v
howto100m
msr-vtt
2026年6月25日
VideoGPT: Video Generation using VQ-VAE and Transformers
video-generation
vq-vae
autoregressive
transformer
gpt
axial-attention
likelihood-based
2026年6月25日
VQ-Diffusion:用于文生图的向量量化扩散模型
discrete-diffusion
mask-and-replace
vq-vae
text-to-image
non-autoregressive
masked-generation
2026年6月25日
MAGVIT-v2 — Language Model Beats Diffusion: Tokenizer is Key to Visual Generation
tokenizer
lfq
lookup-free-quantization
video-generation
image-generation
masked-lm
vq-vae
discrete-tokens
2026年6月25日
Genie: Generative Interactive Environments
world-model
video
latent-action
unsupervised
maskgit
st-transformer
vq-vae
foundation-model
playable
agents
Params