AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
Home
❯
world model
❯
2024
文件夹: world-model/2024
此文件夹下有61条笔记。
2026年7月16日
1X World Model
world-model
humanoid-robot
video-prediction
action-conditioned
genie
magvit2
policy-evaluation
eve-robot
open-dataset
2026年7月16日
3D-VLA: A 3D Vision-Language-Action Generative World Model
world-model
vla
3d-llm
embodied-diffusion
point-cloud-generation
goal-image-generation
interaction-tokens
action-planning
icml2024
2026年7月16日
AVID: Adapting Video Diffusion Models to World Models
world-model
video-diffusion
adapter
action-conditioning
frozen-backbone
product-of-experts
controlnet
procgen
rt1
dynamicrafter
2026年7月16日
Brain-JEPA: Brain Dynamics Foundation Model with Gradient Positioning and Spatiotemporal Masking
jepa
self-supervised
fmri
brain-foundation-model
neuroimaging
positional-encoding
medical-ai
spatiotemporal-masking
2026年7月16日
Oasis: A Universe in a Transformer
world-model
playable-game
minecraft
diffusion-transformer
diffusion-forcing
autoregressive-video
action-conditioning
real-time
vpt
sohu-asic
2026年7月16日
Genie 2: A Large-Scale Foundation World Model
world-model
foundation-world-model
latent-diffusion
autoregressive
action-conditioning
playable
embodied-agents
imagen-3
sima
game-wm
2026年7月16日
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
world-model
autonomous-driving
diffusion
multi-view-generation
long-video-generation
bev
controlnet
nuscenes
failure-case-mining
uniad
data-augmentation
2026年7月16日
Efficient World Models with Context-Aware Tokenization (Δ-IRIS)
world-model
model-based-rl
transformer
discrete-autoencoder
vqvae
autoregressive
delta-tokens
crafter
atari-100k
imagination
Superhuman
2026年7月16日
Diffusion for World Modeling: Visual Details Matter in Atari (DIAMOND)
world-model
diffusion
EDM
atari-100k
model-based-rl
neural-game-engine
csgo
action-conditioning
imagination
rl-wm
超人游戏
2026年7月16日
Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion
world-model
diffusion-forcing
video-generation
per-token-noise
causal-diffusion
long-horizon-rollout
planning
guidance
monte-carlo-guidance
neurips-2024
2026年7月16日
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
world-model
diffusion-model
offline-rl
d4rl
model-based-rl
value-expansion
classifier-free-guidance
td3-bc
iql
rl-wm
2026年7月16日
DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning
world-model
jepa
dinov2
latent-dynamics
model-predictive-control
zero-shot-planning
offline
patch-features
non-reconstructive
lecun
2026年7月16日
Doe-1: Closed-Loop Autonomous Driving with Large World Model
driving-world-model
closed-loop-autonomous-driving
autoregressive-transformer
chameleon
lumina-mgpt
action-tokenization
unified-multimodal
nuscenes
next-token-prediction
2026年7月16日
DOME: Taming Diffusion Model into High-Fidelity Controllable Occupancy World Model
world-model
autonomous-driving
occupancy-prediction
diffusion-transformer
vae
trajectory-conditioning
nuscenes
occ3d
4d-forecasting
2026年7月16日
Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving
world-model
autonomous-driving
occupancy-forecasting
4d-occupancy
action-conditioned
end-to-end-planning
nuscenes
lyft-level5
aaai2025
2026年7月16日
DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation
driving-world-model
llm
trajectory-generation
hdmap-generation
multi-view-video
stable-video-diffusion
nuscenes
data-augmentation
aaai2025
2026年7月16日
DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation
world-model
4d-gaussian-splatting
driving-scene-reconstruction
data-machine
novel-trajectory-generation
drivedreamer-2
waymo
closed-loop-simulation
2026年7月16日
DriveWorld: 4D Pre-trained Scene Understanding via World Models for Autonomous Driving
world-model
autonomous-driving
4d-pretraining
occupancy
rssm
bev
cvpr2024
uniad
bevformer
2026年7月16日
DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT
driving-world-model
autoregressive-video-generation
gpt-style
temporal-aware-vqvae
ego-trajectory-prediction
long-horizon-generation
next-state-prediction
autonomous-driving
2026年7月16日
EfficientZero V2: Mastering Discrete and Continuous Control with Limited Data
world-model
model-based-rl
mcts
gumbel-search
sample-efficiency
continuous-control
atari-100k
dmcontrol
off-policy-correction
2026年7月16日
GameGen-X: Interactive Open-world Game Video Generation
world-model
game-generation
diffusion-transformer
interactive-video
instructnet
open-world
action-conditioning
video-continuation
dataset
game-wm
2026年7月16日
Diffusion Models Are Real-Time Game Engines (GameNGen)
world-model
neural-game-engine
diffusion
stable-diffusion
DOOM
action-conditioning
autoregressive-drift
noise-augmentation
game-wm
2026年7月16日
GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
world-model
autonomous-driving
occupancy-prediction
3d-gaussian-splatting
streaming-perception
4d-forecasting
nuscenes
surroundocc
2026年7月16日
GenAD: Generalized Predictive Model for Autonomous Driving
world-model
autonomous-driving
video-prediction
latent-diffusion
sdxl
opendv
planning
cvpr2024
2026年7月16日
Genesis: A Generative and Universal Physics Engine for Robotics and Beyond
world-model
generative-simulation
physics-engine
differentiable-simulation
vlm-agent
robotics
embodied-ai
gpu-acceleration
sim-to-real
2026年7月16日
GenEx: Generating an Explorable World
world-model
panoramic-video-generation
spherical-consistent-learning
embodied-ai
imagination-augmented-policy
stable-video-diffusion
action-conditioning
multi-agent-theory-of-mind
game-wm
2026年7月16日
InfinityDrive: Breaking Time Limits in Driving World Models
driving-world-model
video-diffusion
diffusion-transformer
long-video-generation
memory-mechanism
curriculum-learning
image-to-video
text-to-video
autonomous-driving
2026年7月16日
IRASim: A Fine-Grained World Model for Robot Manipulation
world-model
diffusion-transformer
action-conditioned-video
trajectory-to-video
frame-level-conditioning
robot-manipulation
model-based-planning
policy-evaluation
iccv-2025
2026年7月16日
iVideoGPT: Interactive VideoGPTs are Scalable World Models
world-model
ivideogpt
autoregressive-transformer
compressive-tokenization
conditional-vqgan
video-prediction
model-based-rl
mbpo
open-x-embodiment
neurips-2024
2026年7月16日
Learning and Leveraging World Models in Visual Representation Learning
jepa
world-model
self-supervised-learning
vision-transformer
equivariant-representation
predictor-finetuning
latent-prediction
representation-learning
2026年7月16日
LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior
video-tokenizer
autoregressive
holistic-tokenization
stochastic-vector-quantization
world-model
FVD
UCF-101
kinetics-600
ICLR2025
Tokens
2026年7月16日
World Model on Million-Length Video And Language With Blockwise RingAttention
world-model
ring-attention
long-context
million-token-context
video-language-model
autoregressive-transformer
vqgan
blockwise-parallel-transformer
tpu-training
rope-scaling
2026年7月16日
MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes
world-model
autonomous-driving
3d-gaussian-splatting
video-generation
nuscenes
bev
controllable-generation
scene-generation
data-engine
2026年7月16日
MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control
world-model
autonomous-driving
diffusion-transformer
flow-matching
multi-view-generation
3d-vae
long-video-generation
controlnet
nuscenes
sequence-parallel
2026年7月16日
Navigation World Models
world-model
navigation
diffusion-transformer
CDiT
action-conditioning
video-prediction
MPC-planning
egocentric-video
robotics
cross-embodiment
goals
context
2026年7月16日
OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving
world-model
autonomous-driving
occupancy-generation
diffusion-transformer
4d-occupancy
trajectory-conditioning
nuscenes
vq-vae
dit
2026年7月16日
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
tokenizer
visual-tokenization
image-video-joint
vqvae
vae
window-attention
causal-attention
progressive-training
autoregressive-transformer
latent-diffusion
2026年7月16日
Owl-1: Omni World Model for Consistent Long Video Generation
world-model
long-video-generation
latent-state
video-diffusion
dynamicrafter
chameleon
autoregressive-lmm
world-dynamics-prediction
vbench
multi-stage-training
2026年7月16日
Pandora: Towards General World Model with Natural Language Actions and Video States
world-model
autoregressive-diffusion-hybrid
natural-language-action-control
video-generation
llm-video-alignment
instruction-tuning
cross-domain-action-transfer
staged-training
chat-univi
dynamicrafter
2026年7月16日
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
world-model
video-generation
physical-commonsense
benchmark
vlm-evaluator
text-to-video
hierarchical-evaluation
phygenbench
phygeneval
2026年7月16日
Playable Game Generation
world-model
neural-game-engine
diffusion-forcing
DiT
action-conditioning
super-mario-bros
doom
playability-evaluation
long-tailed-learning
game-wm
2026年7月16日
Point-JEPA: A Joint Embedding Predictive Architecture for Self-Supervised Learning on Point Cloud
jepa
self-supervised
point-cloud
3d-vision
latent-prediction
non-generative
masking
representation-learning
transformer
2026年7月16日
PWM: Policy Learning with Multi-Task World Models
world-model
model-based-rl
first-order-gradient
differentiable-simulation
multitask
td-mpc2
continuous-control
policy-extraction
2026年7月16日
Mastering Memory Tasks with World Models
world-model
state-space-model
s4
dreamerv3
model-based-rl
long-term-memory
credit-assignment
pomdp
iclr2024
2026年7月16日
ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration
world-model
driving-scene-reconstruction
gaussian-splatting
online-restoration
drivedreamer-2
video-diffusion
waymo
closed-loop-simulation
2026年7月16日
Improving Token-Based World Models with Parallel Observation Prediction
world-model
model-based-rl
retnet
retention-network
token-based-world-model
parallel-decoding
atari-100k
imagination
vqvae
icml2024
Superhuman
2026年7月16日
ReZero: Boosting MCTS-based Algorithms by Backward-view and Entire-buffer Reanalyze
reinforcement-learning
mcts
muzero
efficientzero
reanalyze
sample-efficiency
tree-search
bandit-theory
lightzero
2026年7月16日
RoboDreamer: Learning Compositional World Models for Robot Imagination
world-model
video-diffusion
compositional-generation
text-conditioned
multimodal-conditioning
robot-manipulation
RLBench
RT-1
text-parsing
energy-based-composition
2026年7月16日
S-JEPA: towards seamless cross-dataset transfer through dynamic spatial attention
jepa
eeg
self-supervised
bci
brain-computer-interface
spatial-masking
transfer-learning
signal-processing
2026年7月16日
Scaling Instructable Agents Across Many Simulated Worlds
world-model
embodied-agent
instruction-following
vision-language-action
keyboard-mouse-control
behavioral-cloning
classifier-free-guidance
video-games
sima
google-deepmind
2026年7月16日
Stem-JEPA: A Joint-Embedding Predictive Architecture for Musical Stem Compatibility Estimation
jepa
world-model
self-supervised
music
audio
representation-learning
stem-separation
non-generative
retrieval
ismir
2026年7月16日
T-JEPA: Augmentation-Free Self-Supervised Learning for Tabular Data
jepa
self-supervised
tabular-data
latent-prediction
non-contrastive
representation-learning
transformer
masking
regularization-token
2026年7月16日
The Matrix: Infinite-Horizon World Generation with Real-Time Moving Control
world-model
game-generation
video-diffusion-transformer
action-conditioning
infinite-video-generation
consistency-model
real-time-control
domain-generalization
gamedata
2026年7月16日
Understanding World or Predicting Future? A Comprehensive Survey of World Models
world-model
survey
taxonomy
video-generation
embodied-ai
autonomous-driving
robotics
social-simulacra
sora
jepa
2026年7月16日
UniZero: Generalized and Efficient Planning with Scalable Latent World Models
world-model
transformer
mcts
muzero
model-based-rl
atari-100k
dmcontrol
multitask-learning
lightzero
latent-world-model
2026年7月16日
Revisiting Feature Prediction for Learning Visual Representations from Video (V-JEPA)
jepa
world-model
self-supervised
video-representation
latent-prediction
non-generative
masking
vision-transformer
frozen-evaluation
lecun
样本
2026年7月16日
VideoPhy: Evaluating Physical Commonsense for Video Generation
world-model
video-generation
physical-commonsense
benchmark
evaluation
auto-evaluator
videocon-physics
text-to-video
iclr-2025
2026年7月16日
Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability
driving-world-model
video-diffusion
stable-video-diffusion
action-conditioning
long-horizon-rollout
reward-model
opendv
autonomous-driving
2026年7月16日
WonderWorld: Interactive 3D Scene Generation from a Single Image
world-model
3d-scene-generation
gaussian-splatting
interactive-generation
guided-depth-diffusion
single-image-to-3d
training-free-inference
llm-scene-planning
2026年7月16日
WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens
world-model
video-generation
masked-token-prediction
vqgan
transformer
multimodal-conditioning
action-conditioning
autonomous-driving
parallel-decoding
2026年7月16日
WorldSimBench: Towards Video Generation Models as World Simulators
world-model
video-generation
benchmark
world-simulator
human-preference-evaluator
embodied-evaluation
autonomous-driving
robot-manipulation
minecraft
closed-loop-evaluation
指令
视频
维度
动作类别
正例
负例