AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: world-model
此标签下有205条笔记。
2026年7月16日
Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI
embodied-ai
survey
vla
world-model
sim-to-real
embodied-perception
vln
embodied-qa
simulators
mllm-agent
2026年7月16日
GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation
vla
video-generation
generative-pretraining
world-model
manipulation
cvae
action-chunking
calvin
bin-picking
bytedance
2026年7月16日
Towards Generalist Robot Learning from Internet Video: A Survey
survey
learning-from-video
LfV
robot-learning
video-foundation-model
action-representation
world-model
internet-video
generalist-robot
JAIR
2026年7月16日
A Survey on Vision-Language-Action Models for Embodied AI
survey
VLA
embodied-ai
robotics
control-policy
task-planner
world-model
taxonomy
2026年7月16日
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
vla
humanoid
dual-system
flow-matching
diffusion-transformer
cross-embodiment
latent-action
world-model
data-pyramid
eagle-2
2026年7月16日
1X NEO + Redwood AI (learned world-model policy)
humanoid
home-robot
vla
world-model
diffusion-policy
whole-body-control
inverse-dynamics-model
video-generation
reinforcement-learning
consumer-robotics
2026年7月16日
RoboVerse: Towards a Unified Platform, Dataset and Benchmark for Scalable and Generalizable Robot Learning
simulation
metasim
cross-simulator
cross-embodiment
robot-learning-benchmark
imitation-learning
reinforcement-learning
world-model
sim-to-real
teleoperation
2026年7月16日
RynnVLA-002: A Unified Vision-Language-Action and World Model
vla
world-model
chameleon
unified-tokenization
action-transformer
action-chunking
libero
lerobot
so100
alibaba
2026年7月16日
WorldVLA: Towards Autoregressive Action World Model
vla
world-model
chameleon
autoregressive-transformer
unified-tokenization
discrete-action-tokens
attention-mask
libero
alibaba
2026年7月16日
InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
vla
mixture-of-transformers
latent-foresight
world-model
flow-matching
qwen3.5
gated-deltanet
wan2.2
compositional-generalization
fast-tokenizer
2026年7月16日
InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation
vla
mixture-of-transformers
world-model
visual-foresight
flow-matching
cosmos-tokenizer
internvl3
qwen3-vl
sim-to-real
robotwin
2026年7月16日
π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
vla
robot-foundation-model
flow-matching
cross-embodiment
world-model
subgoal-image
compositional-generalization
gemma3
bagel
2026年7月16日
VLA 谱系(RT-1→RT-2→OpenVLA→Octo→π0→GR00T→Gemini Robotics)
vla
vision-language-action
generalist-policy
action-head
flow-matching
diffusion-policy
dual-system
cross-embodiment
autoregressive-action
world-model
deep-dive
2026年7月16日
世界模型技术演进调研(2017 → 2026)· 主汇总
world-model
model-based-rl
video-generation
jepa
driving-world-model
game-world-model
physical-ai
survey
2026年7月16日
Value Prediction Network
world-model
model-based-rl
value-equivalent-model
td-search
q-learning
atari
options
planning
muzero-precursor
2026年7月16日
Learning Latent Dynamics for Planning from Pixels (PlaNet)
world-model
model-based-rl
rssm
latent-planning
cem
pomdp
dreamer-lineage
dm-control
latent-overshooting
2026年7月16日
World Models (Recurrent World Models Facilitate Policy Evolution)
world-model
model-based-rl
vae
mdn-rnn
rnn
cma-es
evolution-strategies
latent-imagination
foundational
2026年7月16日
Dream to Control: Learning Behaviors by Latent Imagination (Dreamer)
world-model
model-based-rl
rssm
actor-critic
latent-imagination
value-gradient
dm-control
continuous-control
2026年7月16日
When to Trust Your Model: Model-Based Policy Optimization
world-model
model-based-rl
dyna
branched-rollout
sac
ensemble-dynamics-model
monotonic-improvement
mujoco
mbpo
2026年7月16日
Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model (MuZero)
world-model
model-based-rl
mcts
value-equivalent-model
planning
latent-dynamics
atari
alphazero
reanalyze
2026年7月16日
Model-Based Reinforcement Learning for Atari
world-model
model-based-rl
video-prediction
atari
stochastic-discrete-latent
sample-efficiency
dyna
ppo
tensor2tensor
2026年7月16日
Mastering Atari with Discrete World Models (DreamerV2)
world-model
model-based-rl
rssm
categorical-latent
straight-through-gradient
kl-balancing
actor-critic
atari
latent-imagination
2026年7月16日
Learning to Simulate Dynamic Environments with GameGAN
world-model
game-simulation
gan
action-conditioned
neural-game-engine
memory-module
disentanglement
pacman
vizdoom
cvpr
2026年7月16日
Mastering Atari Games with Limited Data (EfficientZero)
world-model
model-based-rl
muzero
mcts
sample-efficiency
self-supervised
atari-100k
simsiam
value-prefix
off-policy-correction
2026年7月16日
Online and Offline Reinforcement Learning by Planning with a Learned Model (MuZero Unplugged)
world-model
model-based-rl
mcts
offline-rl
reanalyse
muzero
atari
dm-control
planning
2026年7月16日
Physion: Evaluating Physical Prediction from Vision in Humans and Machines
world-model
intuitive-physics
benchmark
physical-prediction
human-comparison
object-centric
graph-neural-network
threedworld
neurips2021
2026年7月16日
Playable Video Generation
world-model
game-wm
unsupervised-learning
latent-action
discrete-bottleneck
gumbel-softmax
video-generation
action-conditioning
cvpr2021
2026年7月16日
Learning and Planning in Complex Action Spaces (Sampled MuZero)
world-model
model-based-rl
mcts
sampled-actions
continuous-control
muzero
dm-control
policy-iteration
2026年7月16日
Vector Quantized Models for Planning
world-model
model-based-rl
mcts
vqvae
discrete-latent
offline-rl
muzero
chess
deepmind-lab
planning
2026年7月16日
DayDreamer: World Models for Physical Robot Learning
world-model
model-based-rl
rssm
dreamer
real-world-rl
robot-learning
quadruped-locomotion
visual-manipulation
actor-critic
sim-free
2026年7月16日
Deep Hierarchical Planning from Pixels (Director)
world-model
hierarchical-rl
feudal-rl
model-based-rl
rssm
goal-conditioned
latent-imagination
sparse-reward
quadruped-navigation
atari
2026年7月16日
Transformers are Sample-Efficient World Models (IRIS)
world-model
model-based-rl
transformer
discrete-autoencoder
vqvae
autoregressive
image-tokens
atari-100k
sample-efficiency
latent-imagination
Superhuman
2026年7月16日
Iso-Dream: Isolating and Leveraging Noncontrollable Visual Dynamics in World Models
world-model
model-based-rl
dreamer
rssm
disentanglement
inverse-dynamics
autonomous-driving
video-prediction
actor-critic
carla
2026年7月16日
A Path Towards Autonomous Machine Intelligence
world-model
jepa
energy-based-model
self-supervised-learning
cognitive-architecture
vicreg
hierarchical-planning
position-paper
lecun
2026年7月16日
Planning in Stochastic Environments with a Learned Model (Stochastic MuZero)
world-model
model-based-rl
mcts
afterstate
vqvae
chance-node
muzero
stochastic-planning
2048
backgammon
2026年7月16日
Temporal Difference Learning for Model Predictive Control
world-model
model-based-rl
mpc
latent-planning
td-learning
continuous-control
mppi
dmcontrol
meta-world
2026年7月16日
TransDreamer: Reinforcement Learning with Transformer World Models
world-model
model-based-rl
transformer
state-space-model
tssm
dreamer
memory-based-reasoning
actor-critic
partial-observability
2026年7月16日
ADriver-I: A General World Model for Autonomous Driving
world-model
autonomous-driving
mllm
video-diffusion
action-conditioning
vicuna
nuscenes
closed-loop
control-signal-prediction
2026年7月16日
Learning to Act from Actionless Videos through Dense Correspondences
world-model
video-diffusion
dense-correspondence
optical-flow
action-free-learning
inverse-kinematics
robot-manipulation
navigation
cross-embodiment
replanning
2026年7月16日
Cam4DOcc: Benchmark for Camera-Only 4D Occupancy Forecasting in Autonomous Driving Applications
world-model
autonomous-driving
occupancy-forecasting
benchmark
camera-only
4d-occupancy
nuscenes
lyft-level5
cvpr2024
2026年7月16日
Copilot4D: Learning Unsupervised World Models for Autonomous Driving via Discrete Diffusion
world-model
autonomous-driving
discrete-diffusion
lidar
point-cloud-forecasting
vqvae
maskgit
tokenizer
iclr2024
2026年7月16日
Understanding Physical Dynamics with Counterfactual World Modeling
world-model
self-supervised
masked-prediction
video-transformer
counterfactual-reasoning
physical-dynamics
vit
physion-benchmark
non-generative
2026年7月16日
Mastering Diverse Domains through World Models (DreamerV3)
world-model
model-based-rl
rssm
actor-critic
imagination
latent-dynamics
minecraft
2026年7月16日
Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving (Drive-WM)
world-model
autonomous-driving
multiview-video
latent-diffusion
video-generation
end-to-end-planning
nuscenes
tree-rollout
2026年7月16日
DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving
world-model
autonomous-driving
diffusion
video-generation
action-conditioning
nuscenes
hdmap
3d-box
planning
2026年7月16日
DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion model
world-model
autonomous-driving
diffusion
multi-view-generation
video-generation
layout-conditioning
nuscenes
consistency-attention
data-augmentation
2026年7月16日
Learning to Model the World With Language (Dynalang)
world-model
language-grounding
rssm
dreamerv3
multimodal
model-based-rl
imitation-free
text-pretraining
vision-language-navigation
2026年7月16日
GAIA-1: A Generative World Model for Autonomous Driving
world-model
autonomous-driving
autoregressive-transformer
video-generation
diffusion-decoder
vq-tokenizer
action-conditioning
scaling-laws
neural-simulator
2026年7月16日
HarmonyDream: Task Harmonization Inside World Models
world-model
model-based-rl
multi-task-learning
loss-balancing
dreamer
atari-100k
meta-world
rlbench
sample-efficiency
2026年7月16日
Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture (I-JEPA)
jepa
self-supervised
world-model
vision-transformer
latent-prediction
non-generative
masking
representation-learning
2026年7月16日
LightZero: A Unified Benchmark for Monte Carlo Tree Search in General Sequential Decision Scenarios
world-model
mcts
muzero
alphazero
model-based-rl
benchmark
open-source-toolkit
tree-search
reinforcement-learning
2026年7月16日
MagicDrive: Street View Generation with Diverse 3D Geometry Control
world-model
autonomous-driving
diffusion
multi-view-generation
controlnet
bev
3d-bounding-box
nuscenes
data-augmentation
cross-view-attention
2026年7月16日
MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features
jepa
self-supervised
world-model
optical-flow
multi-task-learning
vicreg
convnext
video
motion-features
2026年7月16日
OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving
world-model
autonomous-driving
3d-occupancy
vqvae
gpt
autoregressive
4d-forecasting
planning
nuscenes
occ3d
2026年7月16日
Panacea: Panoramic and Controllable Video Generation for Autonomous Driving
world-model
autonomous-driving
diffusion
multi-view-generation
video-generation
bev
controlnet
nuscenes
data-augmentation
4d-attention
2026年7月16日
Physion++: Evaluating Physical Scene Understanding that Requires Online Inference of Different Physical Properties
world-model
intuitive-physics
benchmark
physical-property-inference
latent-properties
threedworld
neurips2023
human-comparison
object-centric
dpi-net
2026年7月16日
General World Models: The Next Frontier in AI Research
world-model
general-world-models
video-generation
research-agenda
runway
gen-series
simulation
robotics
2026年7月16日
Facing Off World Model Backbones: RNNs, Transformers, and S4
world-model
model-based-rl
structured-state-space
s4
s5
transformer-xl
rnn
long-term-memory
memory-maze
neurips-2023
2026年7月16日
STORM: Efficient Stochastic Transformer based World Models for Reinforcement Learning
world-model
model-based-rl
transformer
categorical-vae
atari-100k
imagination
actor-critic
sample-efficiency
2026年7月16日
TD-MPC2: Scalable, Robust World Models for Continuous Control
world-model
model-based-rl
mpc
latent-planning
td-learning
continuous-control
multitask
simnorm
mppi
enc-layers
Q
enc层
2026年7月16日
Transformer-based World Models Are Happy With 100k Interactions (TWM)
world-model
model-based-rl
transformer-xl
atari-100k
sample-efficiency
latent-imagination
autoregressive
actor-critic
kl-balancing
2026年7月16日
Learning Universal Policies via Text-Guided Video Generation
world-model
video-generation
video-diffusion
text-conditioned
inverse-dynamics
planning-as-generation
robot-manipulation
generalist-policy
UPDP
2026年7月16日
Learning Interactive Real-World Simulators (UniSim)
world-model
video-diffusion
action-conditioned
real-world-simulator
embodied-ai
sim-to-real
model-based-rl
robot-learning
2026年7月16日
VBench: Comprehensive Benchmark Suite for Video Generative Models
world-model
video-generation
benchmark
evaluation
human-alignment
t2v
vbench
cvpr2024
2026年7月16日
Visual Point Cloud Forecasting enables Scalable Autonomous Driving (ViDAR)
world-model
autonomous-driving
self-supervised-pretraining
point-cloud-forecasting
bev
latent-rendering
nuscenes
cvpr2024
2026年7月16日
Video Language Planning
world-model
video-generation
video-diffusion
vision-language-model
tree-search
PaLM-E
robot-manipulation
long-horizon-planning
goal-conditioned-policy
2026年7月16日
WonderJourney: Going from Anywhere to Everywhere
world-model
perpetual-view-generation
3d-scene-generation
point-cloud
llm-planning
vlm-verification
text-guided-outpainting
monocular-depth
training-free
2026年7月16日
WoVoGen: World Volume-aware Diffusion for Controllable Multi-camera Driving Scene Generation
world-model
autonomous-driving
diffusion
controlnet
multi-camera
video-generation
nuscenes
occupancy
hdmap
action-conditioning
2026年7月16日
1X World Model
world-model
humanoid-robot
video-prediction
action-conditioned
genie
magvit2
policy-evaluation
eve-robot
open-dataset
2026年7月16日
3D-VLA: A 3D Vision-Language-Action Generative World Model
world-model
vla
3d-llm
embodied-diffusion
point-cloud-generation
goal-image-generation
interaction-tokens
action-planning
icml2024
2026年7月16日
AVID: Adapting Video Diffusion Models to World Models
world-model
video-diffusion
adapter
action-conditioning
frozen-backbone
product-of-experts
controlnet
procgen
rt1
dynamicrafter
2026年7月16日
Oasis: A Universe in a Transformer
world-model
playable-game
minecraft
diffusion-transformer
diffusion-forcing
autoregressive-video
action-conditioning
real-time
vpt
sohu-asic
2026年7月16日
Genie 2: A Large-Scale Foundation World Model
world-model
foundation-world-model
latent-diffusion
autoregressive
action-conditioning
playable
embodied-agents
imagen-3
sima
game-wm
2026年7月16日
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
world-model
autonomous-driving
diffusion
multi-view-generation
long-video-generation
bev
controlnet
nuscenes
failure-case-mining
uniad
data-augmentation
2026年7月16日
Efficient World Models with Context-Aware Tokenization (Δ-IRIS)
world-model
model-based-rl
transformer
discrete-autoencoder
vqvae
autoregressive
delta-tokens
crafter
atari-100k
imagination
Superhuman
2026年7月16日
Diffusion for World Modeling: Visual Details Matter in Atari (DIAMOND)
world-model
diffusion
EDM
atari-100k
model-based-rl
neural-game-engine
csgo
action-conditioning
imagination
rl-wm
超人游戏
2026年7月16日
Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion
world-model
diffusion-forcing
video-generation
per-token-noise
causal-diffusion
long-horizon-rollout
planning
guidance
monte-carlo-guidance
neurips-2024
2026年7月16日
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
world-model
diffusion-model
offline-rl
d4rl
model-based-rl
value-expansion
classifier-free-guidance
td3-bc
iql
rl-wm
2026年7月16日
DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning
world-model
jepa
dinov2
latent-dynamics
model-predictive-control
zero-shot-planning
offline
patch-features
non-reconstructive
lecun
2026年7月16日
DOME: Taming Diffusion Model into High-Fidelity Controllable Occupancy World Model
world-model
autonomous-driving
occupancy-prediction
diffusion-transformer
vae
trajectory-conditioning
nuscenes
occ3d
4d-forecasting
2026年7月16日
Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving
world-model
autonomous-driving
occupancy-forecasting
4d-occupancy
action-conditioned
end-to-end-planning
nuscenes
lyft-level5
aaai2025
2026年7月16日
DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation
world-model
4d-gaussian-splatting
driving-scene-reconstruction
data-machine
novel-trajectory-generation
drivedreamer-2
waymo
closed-loop-simulation
2026年7月16日
DriveWorld: 4D Pre-trained Scene Understanding via World Models for Autonomous Driving
world-model
autonomous-driving
4d-pretraining
occupancy
rssm
bev
cvpr2024
uniad
bevformer
2026年7月16日
EfficientZero V2: Mastering Discrete and Continuous Control with Limited Data
world-model
model-based-rl
mcts
gumbel-search
sample-efficiency
continuous-control
atari-100k
dmcontrol
off-policy-correction
2026年7月16日
GameGen-X: Interactive Open-world Game Video Generation
world-model
game-generation
diffusion-transformer
interactive-video
instructnet
open-world
action-conditioning
video-continuation
dataset
game-wm
2026年7月16日
Diffusion Models Are Real-Time Game Engines (GameNGen)
world-model
neural-game-engine
diffusion
stable-diffusion
DOOM
action-conditioning
autoregressive-drift
noise-augmentation
game-wm
2026年7月16日
GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
world-model
autonomous-driving
occupancy-prediction
3d-gaussian-splatting
streaming-perception
4d-forecasting
nuscenes
surroundocc
2026年7月16日
GenAD: Generalized Predictive Model for Autonomous Driving
world-model
autonomous-driving
video-prediction
latent-diffusion
sdxl
opendv
planning
cvpr2024
2026年7月16日
Genesis: A Generative and Universal Physics Engine for Robotics and Beyond
world-model
generative-simulation
physics-engine
differentiable-simulation
vlm-agent
robotics
embodied-ai
gpu-acceleration
sim-to-real
2026年7月16日
GenEx: Generating an Explorable World
world-model
panoramic-video-generation
spherical-consistent-learning
embodied-ai
imagination-augmented-policy
stable-video-diffusion
action-conditioning
multi-agent-theory-of-mind
game-wm
2026年7月16日
IRASim: A Fine-Grained World Model for Robot Manipulation
world-model
diffusion-transformer
action-conditioned-video
trajectory-to-video
frame-level-conditioning
robot-manipulation
model-based-planning
policy-evaluation
iccv-2025
2026年7月16日
iVideoGPT: Interactive VideoGPTs are Scalable World Models
world-model
ivideogpt
autoregressive-transformer
compressive-tokenization
conditional-vqgan
video-prediction
model-based-rl
mbpo
open-x-embodiment
neurips-2024
2026年7月16日
Learning and Leveraging World Models in Visual Representation Learning
jepa
world-model
self-supervised-learning
vision-transformer
equivariant-representation
predictor-finetuning
latent-prediction
representation-learning
2026年7月16日
LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior
video-tokenizer
autoregressive
holistic-tokenization
stochastic-vector-quantization
world-model
FVD
UCF-101
kinetics-600
ICLR2025
Tokens
2026年7月16日
World Model on Million-Length Video And Language With Blockwise RingAttention
world-model
ring-attention
long-context
million-token-context
video-language-model
autoregressive-transformer
vqgan
blockwise-parallel-transformer
tpu-training
rope-scaling
2026年7月16日
MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes
world-model
autonomous-driving
3d-gaussian-splatting
video-generation
nuscenes
bev
controllable-generation
scene-generation
data-engine
2026年7月16日
MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control
world-model
autonomous-driving
diffusion-transformer
flow-matching
multi-view-generation
3d-vae
long-video-generation
controlnet
nuscenes
sequence-parallel
2026年7月16日
Navigation World Models
world-model
navigation
diffusion-transformer
CDiT
action-conditioning
video-prediction
MPC-planning
egocentric-video
robotics
cross-embodiment
goals
context
2026年7月16日
OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving
world-model
autonomous-driving
occupancy-generation
diffusion-transformer
4d-occupancy
trajectory-conditioning
nuscenes
vq-vae
dit
2026年7月16日
Owl-1: Omni World Model for Consistent Long Video Generation
world-model
long-video-generation
latent-state
video-diffusion
dynamicrafter
chameleon
autoregressive-lmm
world-dynamics-prediction
vbench
multi-stage-training
2026年7月16日
Pandora: Towards General World Model with Natural Language Actions and Video States
world-model
autoregressive-diffusion-hybrid
natural-language-action-control
video-generation
llm-video-alignment
instruction-tuning
cross-domain-action-transfer
staged-training
chat-univi
dynamicrafter
2026年7月16日
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
world-model
video-generation
physical-commonsense
benchmark
vlm-evaluator
text-to-video
hierarchical-evaluation
phygenbench
phygeneval
2026年7月16日
Playable Game Generation
world-model
neural-game-engine
diffusion-forcing
DiT
action-conditioning
super-mario-bros
doom
playability-evaluation
long-tailed-learning
game-wm
2026年7月16日
PWM: Policy Learning with Multi-Task World Models
world-model
model-based-rl
first-order-gradient
differentiable-simulation
multitask
td-mpc2
continuous-control
policy-extraction
2026年7月16日
Mastering Memory Tasks with World Models
world-model
state-space-model
s4
dreamerv3
model-based-rl
long-term-memory
credit-assignment
pomdp
iclr2024
2026年7月16日
ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration
world-model
driving-scene-reconstruction
gaussian-splatting
online-restoration
drivedreamer-2
video-diffusion
waymo
closed-loop-simulation
2026年7月16日
Improving Token-Based World Models with Parallel Observation Prediction
world-model
model-based-rl
retnet
retention-network
token-based-world-model
parallel-decoding
atari-100k
imagination
vqvae
icml2024
Superhuman
2026年7月16日
RoboDreamer: Learning Compositional World Models for Robot Imagination
world-model
video-diffusion
compositional-generation
text-conditioned
multimodal-conditioning
robot-manipulation
RLBench
RT-1
text-parsing
energy-based-composition
2026年7月16日
Scaling Instructable Agents Across Many Simulated Worlds
world-model
embodied-agent
instruction-following
vision-language-action
keyboard-mouse-control
behavioral-cloning
classifier-free-guidance
video-games
sima
google-deepmind
2026年7月16日
Stem-JEPA: A Joint-Embedding Predictive Architecture for Musical Stem Compatibility Estimation
jepa
world-model
self-supervised
music
audio
representation-learning
stem-separation
non-generative
retrieval
ismir
2026年7月16日
The Matrix: Infinite-Horizon World Generation with Real-Time Moving Control
world-model
game-generation
video-diffusion-transformer
action-conditioning
infinite-video-generation
consistency-model
real-time-control
domain-generalization
gamedata
2026年7月16日
Understanding World or Predicting Future? A Comprehensive Survey of World Models
world-model
survey
taxonomy
video-generation
embodied-ai
autonomous-driving
robotics
social-simulacra
sora
jepa
2026年7月16日
UniZero: Generalized and Efficient Planning with Scalable Latent World Models
world-model
transformer
mcts
muzero
model-based-rl
atari-100k
dmcontrol
multitask-learning
lightzero
latent-world-model
2026年7月16日
Revisiting Feature Prediction for Learning Visual Representations from Video (V-JEPA)
jepa
world-model
self-supervised
video-representation
latent-prediction
non-generative
masking
vision-transformer
frozen-evaluation
lecun
样本
2026年7月16日
VideoPhy: Evaluating Physical Commonsense for Video Generation
world-model
video-generation
physical-commonsense
benchmark
evaluation
auto-evaluator
videocon-physics
text-to-video
iclr-2025
2026年7月16日
WonderWorld: Interactive 3D Scene Generation from a Single Image
world-model
3d-scene-generation
gaussian-splatting
interactive-generation
guided-depth-diffusion
single-image-to-3d
training-free-inference
llm-scene-planning
2026年7月16日
WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens
world-model
video-generation
masked-token-prediction
vqgan
transformer
multimodal-conditioning
action-conditioning
autonomous-driving
parallel-decoding
2026年7月16日
WorldSimBench: Towards Video Generation Models as World Simulators
world-model
video-generation
benchmark
world-simulator
human-preference-evaluator
embodied-evaluation
autonomous-driving
robot-manipulation
minecraft
closed-loop-evaluation
指令
视频
维度
动作类别
正例
负例
2026年7月16日
AdaWorld: Learning Adaptable World Models with Latent Actions
world-model
latent-action
unsupervised-action-learning
action-transfer
few-shot-adaptation
stable-video-diffusion
model-predictive-control
beta-vae
icml-2025
2026年7月16日
Aether: Geometric-Aware Unified World Modeling
world-model
4d-reconstruction
video-diffusion
action-conditioned-prediction
visual-planning
synthetic-data
zero-shot-transfer
camera-pose
cogvideox
2026年7月16日
Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models
world-model
autonomous-driving
synthetic-data
controlnet
multi-view
lidar-generation
diffusion
dit
cosmos
data-flywheel
2026年7月16日
World Simulation with Video Foundation Models for Physical AI (Cosmos-Predict2.5 & Cosmos-Transfer2.5)
world-model
physical-ai
video-foundation-model
flow-matching
controlnet
robotics
autonomous-driving
sim2real
cosmos
2026年7月16日
Cosmos-Predict2: A Suite of Diffusion-based World Foundation Models Available in 2B, and 14B
world-model
physical-ai
video-generation
text-to-image
diffusion-transformer
robotics
autonomous-driving
natten
action-conditioned
cosmos
2026年7月16日
MirageLSD: The First Live-Stream Diffusion AI Video Model
world-model
live-stream-diffusion
real-time-video
diffusion-forcing
autoregressive
zero-latency
video-transformation
mega-kernel
shortcut-distillation
2026年7月16日
MirageLSD: Zero-Latency, Real-Time, Infinite Video Generation
world-model
video-to-video
real-time-generation
diffusion-forcing
live-stream-diffusion
autoregressive-video
world-transformation
streaming
decart
mirage
2026年7月16日
SIMA 2: A Generalist Embodied Agent for Virtual Worlds
embodied-agent
vla
generalist-agent
gemini
self-improvement
world-model
genie-3
rlvr
keyboard-mouse
3d-games
2026年7月16日
Drive&Gen: Co-Evaluating End-to-End Driving and Video Generation Models
world-model
autonomous-driving
video-generation
end-to-end-planning
co-evaluation
behavior-permutation-test
diffusion-transformer
vlm-planner
synthetic-data-augmentation
ood-generalization
2026年7月16日
EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation
world-model
video-diffusion
robotic-manipulation
multi-view
free-anchor-view
4d-gaussian-splatting
sim2real
chunk-autoregressive
sparse-memory
libero
2026年7月16日
GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving
world-model
autonomous-driving
latent-diffusion
flow-matching
multi-camera
video-tokenizer
controllable-generation
safety-critical
synthetic-data
2026年7月16日
GameFactory: Creating New Games with Generative Interactive Videos
world-model
game-generation
minecraft
video-diffusion
action-control
scene-generalization
lora
autoregressive-generation
diffusion-forcing
dataset
2026年7月16日
GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
world-model
autonomous-driving
3d-gaussian-splatting
vision-language-model
visual-grounding
scene-understanding
video-generation
langsplat
dual-condition-diffusion
cvpr2026
2026年7月16日
Genie 3: A new frontier for world models
world-model
interactive
real-time
autoregressive
video-generation
embodied-agent
agi
promptable-world-events
sima
2026年7月16日
Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation
world-model
robotic-manipulation
video-diffusion
vla
flow-matching
dual-arm
cross-embodiment
neural-simulator
benchmark
2026年7月16日
History-Guided Video Diffusion
world-model
video-diffusion
diffusion-forcing
history-guidance
classifier-free-guidance
dit
long-video-generation
autoregressive-rollout
icml-2025
2026年7月16日
HunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or Pixels
world-model
3d-generation
panorama
diffusion-transformer
mesh-export
scene-layering
gaussian-splatting
text-to-3d
image-to-3d
open-source
2026年7月16日
Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation
world-model
video-diffusion
rgb-d-generation
camera-control
3d-reconstruction
autoregressive-generation
point-cloud
scene-exploration
hunyuanvideo
2026年7月16日
I2-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting
world-model
autonomous-driving
4d-occupancy
tokenization
residual-quantization
occupancy-forecasting
nuscenes
occ3d
iccv2025
2026年7月16日
Impossible Videos
world-model
video-generation
video-understanding
benchmark
counterfactual
physical-commonsense
Video-LLM
taxonomy
ICML2025
2026年7月16日
Intuitive physics understanding emerges from self-supervised pretraining on natural videos
jepa
world-model
intuitive-physics
violation-of-expectation
self-supervised
latent-prediction
video-representation
multimodal-llm-baseline
lecun
2026年7月16日
Ray3 and Luma's Multimodal World-Model Program
world-model
video-generation
reasoning-video-model
hdr-video
luma-ai
ray3
dream-machine
multimodal-agi
2026年7月16日
Matrix-3D: Omnidirectional Explorable 3D World Generation
world-model
panoramic-video
3d-gaussian-splatting
scene-generation
diffusion-transformer
video-diffusion
feed-forward-reconstruction
synthetic-dataset
2026年7月16日
PAN: A World Model for General, Interactable, and Long-Horizon World Simulation
world-model
generative-latent-prediction
glp
autoregressive
video-diffusion
causal-swin-dpm
qwen2.5-vl
wan2.1
long-horizon
simulative-reasoning
2026年7月16日
World and Human Action Models towards gameplay ideation (WHAM / Muse)
world-model
game-wm
autoregressive
transformer
vqgan
tokenizer
action-conditioning
bleeding-edge
nature
muse
2026年7月16日
MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft
world-model
minecraft
autoregressive-transformer
vq-vae
action-conditioning
parallel-decoding
diagonal-decoding
real-time-interaction
vpt-dataset
controllability-metric
2026年7月16日
Mirage: Real-Time AI-Native UGC Game Engine
world-model
game-wm
ugc
autoregressive-diffusion
causal-transformer
distillation
kv-cache
cloud-gaming
real-time-generation
startup
2026年7月16日
Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control
world-model
diffusion
dit
controlnet
multimodal-control
sim2real
autonomous-driving
robotics
physical-ai
video-generation
2026年7月16日
Odyssey-1: A Playable World Model
world-model
interactive-video
real-time-generation
action-conditioned
autoregressive
gaussian-splatting
odyssey
ex-wayve
generative-simulation
2026年7月16日
Do generative video models understand physical principles?
world-model
video-generation
benchmark
physical-understanding
evaluation
intuitive-physics
Sora
VideoPoet
2026年7月16日
PhyWorldBench: A Comprehensive Evaluation of Physical Realism in Text-to-Video Models
world-model
video-generation
benchmark
physical-realism
evaluation
anti-physics
text-to-video
MLLM-evaluator
2026年7月16日
PlayerOne: Egocentric World Simulator
world-model
egocentric-video
human-motion-control
video-diffusion-transformer
part-disentangled-motion-injection
4d-reconstruction
ego-exo-dataset
causal-distillation
wan-2-1
2026年7月16日
Learning from Reward-Free Offline Data: A Case for Planning with Latent Dynamics Models
jepa
world-model
offline-rl
planning
mpc
latent-dynamics
goal-conditioned
trajectory-stitching
lecun
vicreg
2026年7月16日
RoboScape: Physics-informed Embodied World Model
world-model
embodied-ai
physics-informed
depth-prediction
keypoint-dynamics
autoregressive-transformer
magvit
agibot-world
synthetic-data
policy-evaluation
2026年7月16日
Semi-Supervised Vision-Centric 3D Occupancy World Model for Autonomous Driving
world-model
autonomous-driving
3d-occupancy
semi-supervised-learning
volume-rendering
nerf
4d-forecasting
motion-planning
nuscenes
occ3d
2026年7月16日
Matrix-Game 2.0: An Open-Source, Real-Time, and Streaming Interactive World Model
world-model
interactive-video
autoregressive-diffusion
self-forcing
distillation
kv-cache
real-time
game
action-conditioning
unreal-engine
2026年7月16日
Matrix-Game: Interactive World Foundation Model
world-model
game-generation
minecraft
interactive
image-to-world
diffusion-transformer
action-control
benchmark
open-source
2026年7月16日
SparseWorld: A Flexible, Adaptive, and Efficient 4D Occupancy World Model Powered by Sparse and Dynamic Queries
world-model
autonomous-driving
4d-occupancy
sparse-query
occupancy-forecasting
motion-planning
nuscenes
occ3d
aaai2026
2026年7月16日
SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model
world-model
autonomous-driving
4d-occupancy
sparse-query
trajectory-conditioning
transformer
feed-forward
nuscenes
occ3d
chamfer-distance
2026年7月16日
The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey
world-model
survey
autonomous-driving
taxonomy
driving-world-model
occupancy
point-cloud
video-generation
benchmark
2026年7月16日
Hunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Condition
world-model
game-generation
interactive-video
camera-control
action-conditioning
autoregressive
diffusion-transformer
distillation
aaa-games
open-source
2026年7月16日
Yan: Foundational Interactive Video Generation
world-model
game-generation
interactive-video
diffusion-forcing
dit
video-diffusion
real-time-simulation
video-editing
action-conditioning
autoregressive-generation
2026年7月16日
TesserAct: Learning 4D Embodied World Models
world-model
4d-scene-reconstruction
rgb-depth-normal
video-diffusion
cogvideox
action-conditioned-prediction
robotic-manipulation
inverse-dynamics
point-cloud
iccv2025
2026年7月16日
Learning Transformer-based World Models with Contrastive Predictive Coding (TWISTER)
world-model
transformer-state-space-model
contrastive-predictive-coding
action-conditioning
atari-100k
deepmind-control-suite
model-based-rl
iclr-2025
2026年7月16日
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
world-model
jepa
self-supervised
video
action-conditioned
zero-shot-planning
robot-manipulation
predictive-embedding
non-generative
2026年7月16日
VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
world-model
video-generation
benchmark
evaluation
human-alignment
physics
commonsense
vbench
t2v
2026年7月16日
Vidar: Embodied Video Diffusion Model for Generalist Manipulation
world-model
video-diffusion
robot-manipulation
bimanual-manipulation
inverse-dynamics
cross-embodiment
test-time-scaling
rectified-flow
aloha-robot
2026年7月16日
VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation
world-model
video-generation
physical-commonsense
benchmark
evaluation
auto-evaluator
action-centric
text-to-video
iclr-2026
2026年7月16日
WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation
world-model
video-generation
physics-aware
text-to-video
mixture-of-experts
cogvideox
wan2.1
physical-commonsense
dataset
lora
2026年7月16日
Marble: A Multimodal World Model
world-model
3d-gaussian-splatting
panorama
text-to-3d
image-to-3d
spatial-intelligence
marble
world-labs
2026年7月16日
RTFM: A Real-Time Frame Model
world-model
real-time-rendering
autoregressive-diffusion-transformer
spatial-memory
persistent-3d
kv-cache
world-labs
rtfm
2026年7月16日
World4Drive: End-to-End Autonomous Driving via Intention-aware Physical Latent World Model
world-model
autonomous-driving
end-to-end-planning
latent-world-model
self-supervised
vision-foundation-model
multi-modal-trajectory
nuscenes
navsim
iccv2025
2026年7月16日
WorldMem: Long-term Consistent World Simulation with Memory
world-model
memory-mechanism
diffusion-forcing
minecraft
long-horizon-consistency
plucker-embedding
cross-attention-memory
neurips-2025
2026年7月16日
WorldModelBench: Judging Video Generation Models As World Models
world-model
video-generation
benchmark
physics-adherence
instruction-following
VLM-judge
human-annotation
reward-gradient
T2V
I2V
2026年7月16日
WorldScore: A Unified Evaluation Benchmark for World Generation
world-model
benchmark
evaluation
video-generation
3d-scene-generation
4d-generation
camera-control
controllability
stanford
iccv-2025
2026年7月16日
WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving
world-model
autonomous-driving
gaussian-splatting
feed-forward-reconstruction
latent-diffusion
controlnet
novel-view-synthesis
4d-scene-generation
rectified-flow
iclr2026
2026年7月16日
WoW: Towards a World omniscient World model Through Embodied Interaction
world-model
video-diffusion
embodied-ai
robot-manipulation
diffusion-transformer
inverse-dynamics-model
vlm-critic
physical-reasoning
benchmark
scaling-law
2026年7月16日
Yume: An Interactive World Generation Model
world-model
video-diffusion
image-to-video
camera-control
keyboard-control
masked-diffusion-transformer
diffusion-acceleration
sekai
open-source
2026年7月16日
ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space
world-model
3d-gaussian-splatting
panoramic-video
spatial-generative-primitive
diffusion-transformer
video-diffusion
reinforcement-learning
scene-reconstruction
alibaba
amap
2026年7月16日
AlayaWorld: Long-Horizon and Playable Video World Generation
world-model
interactive-video
autoregressive-dit
camera-control
3d-cache
long-horizon
real-time-generation
dmd-distillation
open-source
2026年7月16日
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
world-model
4d-scene-modeling
rgb-depth-optical-flow
tri-branch-diffusion
wan2.2
robotic-manipulation
bimanual-manipulation
inverse-dynamics-policy
cross-modal-attention
rynn-series
2026年7月16日
RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
world-model
robot-learning
teleoperation
action-conditioned-video
diffusion-transformer
autoregressive-distillation
sim2real
dexterous-manipulation
data-engine
2026年7月16日
DreamX-World 1.0: A General-Purpose Interactive World Model
world-model
video-generation
camera-control
autoregressive
diffusion-transformer
memory-conditioning
event-control
reinforcement-learning
wan2.2
alibaba
2026年7月16日
GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
world-model
robot-policy-evaluation
benchmark
video-diffusion
autoregressive-generation
action-conditioning
dmd2-distillation
vlm-judge
wan
2026年7月16日
JEPA-VLA: Video Predictive Embedding is Needed for VLA Models
jepa
vla
world-model
v-jepa-2
visual-representation
policy-prior
gated-cross-attention
libero
robotwin
cortexbench
2026年7月16日
MoWorld: A Flash World Model
world-model
flash-world-model
video-generation
camera-control
autoregressive-distillation
diffusion-transformer
npu
ascend
wan2.2
self-forcing
2026年7月16日
MultiWorld: Scalable Multi-Agent Multi-View Video World Models
world-model
multi-agent
multi-view
video-generation
flow-matching
action-conditioning
robotics-manipulation
embodied-ai
HKU
VGGT
RoPE
2026年7月16日
Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
world-model
robot-policy
video-diffusion-model
visuomotor-control
model-based-planning
diffusion-transformer
cosmos
vla
imitation-learning
2026年7月16日
NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation
world-model
autonomous-driving
closed-loop-simulation
diffusion-transformer
autoregressive-generation
self-forcing
distillation
cosmos
multi-view-generation
world-action-model
2026年7月16日
Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory
world-model
interactive-video
long-horizon-memory
diffusion-transformer
distillation
dmd
real-time
game
action-conditioning
unreal-engine
2026年7月16日
World Action Models: A Survey
survey
world-action-model
world-model
VLA
taxonomy
video-generation
embodied-ai
robot-learning
action-coupling
2026年7月16日
自动驾驶世界模型族(GAIA · DriveDreamer · Vista · OccWorld · 占据/点云预测)
world-model
autonomous-driving
deep-dive
driving-wm
video-generation
occupancy-forecasting
point-cloud-forecasting
multi-view-generation
closed-loop-simulation
2026年7月16日
生成式交互世界族(Genie · GameNGen · Oasis · Cosmos · UniSim · World Labs · 平台)
world-model
interactive-world
neural-game-engine
video-world-model
playable-world
genie
gamengen
oasis
cosmos
world-labs
matrix-game
autoregressive-diffusion
diffusion-forcing
deep-dive
2026年7月16日
JEPA 谱系:I-JEPA · V-JEPA · V-JEPA 2 · DINO-WM · 非生成预测式世界模型
jepa
world-model
self-supervised
latent-prediction
non-generative
i-jepa
v-jepa
dino-wm
deep-dive
2026年7月16日
RL 世界模型族(World Models · PlaNet · Dreamer · MuZero · TD-MPC · IRIS/DIAMOND)
world-model
model-based-rl
latent-imagination
mcts
value-equivalent-model
mpc
transformer-world-model
diffusion-world-model
deep-dive
2026年7月16日
世界模型架构演进(RSSM · Transformer/AR · 扩散 · JEPA · 因果 tokenizer · 动作条件)
world-model
architecture
rssm
transformer
diffusion
jepa
tokenizer
action-conditioning
2026年7月16日
世界模型评测(物理一致性 · 3D 一致性 · 动作保真 · 下游 RL/规划 · 驾驶指标)
world-model
benchmark
evaluation
physics
controllability
planning
autonomous-driving
超人
2026年7月16日
世界模型数据(视频语料 · 驾驶数据 · 仿真 · 动作标注 · 配比)
world-model
data
video-corpus
driving
simulation
action-labeling
curation
2026年7月16日
世界模型 Infra(训练算力 · 并行 · 因果 tokenizer 工程 · 实时推理)
world-model
infra
compute
parallelism
tokenizer
real-time
inference
fps
latency
distillation
2026年7月16日
世界模型五大范式对比(RL-WM · 生成视频 · 交互/游戏 · 驾驶 · JEPA)
world-model
paradigms
rl-world-model
dreamer
muzero
video-generation
world-simulator
game-world-model
driving-world-model
jepa
survey
2026年7月16日
世界模型训练方法(想象力 RL · 扩散/流 · next-token · JEPA 回归 · 蒸馏)
world-model
training
imagination-rl
dreamer
muzero
diffusion
flow-matching
diffusion-forcing
autoregressive
jepa
distillation
2026年6月25日
Runway Gen-3 Alpha
text-to-video
image-to-video
video-generation
closed-source
world-model
diffusion
c2pa
2026年6月25日
Genie: Generative Interactive Environments
world-model
video
latent-action
unsupervised
maskgit
st-transformer
vq-vae
foundation-model
playable
agents
Params
2026年6月25日
Cosmos World Foundation Model Platform for Physical AI (Cosmos-Predict1)
world-model
physical-ai
video-generation
diffusion
autoregressive
dit
tokenizer
robotics
autonomous-driving
open-weight
2026年6月25日
Emu3.5: Native Multimodal Models are World Learners
native-multimodal
autoregressive
next-token-prediction
world-model
interleaved
x2i
discrete-diffusion
open-source
2026年6月25日
MAGI-1: Autoregressive Video Generation at Scale
video
autoregressive
diffusion
flow-matching
chunk-wise
world-model
streaming
open-weights
2026年6月25日
Sora 2
video
audio
text-to-video
world-model
diffusion
synced-audio
cameo
closed-source