AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: model-based-rl
此标签下有43条笔记。
2026年7月16日
A Survey: Learning Embodied Intelligence from Physical Simulators and World Models
survey
world-models
physical-simulators
embodied-intelligence
humanoid-robot
autonomous-driving
sim2real
robot-taxonomy
benchmark
model-based-rl
2026年7月16日
世界模型技术演进调研(2017 → 2026)· 主汇总
world-model
model-based-rl
video-generation
jepa
driving-world-model
game-world-model
physical-ai
survey
2026年7月16日
Value Prediction Network
world-model
model-based-rl
value-equivalent-model
td-search
q-learning
atari
options
planning
muzero-precursor
2026年7月16日
Learning Latent Dynamics for Planning from Pixels (PlaNet)
world-model
model-based-rl
rssm
latent-planning
cem
pomdp
dreamer-lineage
dm-control
latent-overshooting
2026年7月16日
World Models (Recurrent World Models Facilitate Policy Evolution)
world-model
model-based-rl
vae
mdn-rnn
rnn
cma-es
evolution-strategies
latent-imagination
foundational
2026年7月16日
Dream to Control: Learning Behaviors by Latent Imagination (Dreamer)
world-model
model-based-rl
rssm
actor-critic
latent-imagination
value-gradient
dm-control
continuous-control
2026年7月16日
When to Trust Your Model: Model-Based Policy Optimization
world-model
model-based-rl
dyna
branched-rollout
sac
ensemble-dynamics-model
monotonic-improvement
mujoco
mbpo
2026年7月16日
Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model (MuZero)
world-model
model-based-rl
mcts
value-equivalent-model
planning
latent-dynamics
atari
alphazero
reanalyze
2026年7月16日
Model-Based Reinforcement Learning for Atari
world-model
model-based-rl
video-prediction
atari
stochastic-discrete-latent
sample-efficiency
dyna
ppo
tensor2tensor
2026年7月16日
Mastering Atari with Discrete World Models (DreamerV2)
world-model
model-based-rl
rssm
categorical-latent
straight-through-gradient
kl-balancing
actor-critic
atari
latent-imagination
2026年7月16日
Model-based Reinforcement Learning: A Survey
model-based-rl
planning
survey
taxonomy
dyna
muzero
alphago-zero
implicit-model-based-rl
exploration
hierarchical-rl
2026年7月16日
Mastering Atari Games with Limited Data (EfficientZero)
world-model
model-based-rl
muzero
mcts
sample-efficiency
self-supervised
atari-100k
simsiam
value-prefix
off-policy-correction
2026年7月16日
Online and Offline Reinforcement Learning by Planning with a Learned Model (MuZero Unplugged)
world-model
model-based-rl
mcts
offline-rl
reanalyse
muzero
atari
dm-control
planning
2026年7月16日
Learning and Planning in Complex Action Spaces (Sampled MuZero)
world-model
model-based-rl
mcts
sampled-actions
continuous-control
muzero
dm-control
policy-iteration
2026年7月16日
Vector Quantized Models for Planning
world-model
model-based-rl
mcts
vqvae
discrete-latent
offline-rl
muzero
chess
deepmind-lab
planning
2026年7月16日
DayDreamer: World Models for Physical Robot Learning
world-model
model-based-rl
rssm
dreamer
real-world-rl
robot-learning
quadruped-locomotion
visual-manipulation
actor-critic
sim-free
2026年7月16日
Deep Hierarchical Planning from Pixels (Director)
world-model
hierarchical-rl
feudal-rl
model-based-rl
rssm
goal-conditioned
latent-imagination
sparse-reward
quadruped-navigation
atari
2026年7月16日
Policy Improvement by Planning with Gumbel (Gumbel MuZero)
reinforcement-learning
mcts
alphazero
muzero
policy-improvement
gumbel-top-k
sequential-halving
tree-search
model-based-rl
2026年7月16日
Transformers are Sample-Efficient World Models (IRIS)
world-model
model-based-rl
transformer
discrete-autoencoder
vqvae
autoregressive
image-tokens
atari-100k
sample-efficiency
latent-imagination
Superhuman
2026年7月16日
Iso-Dream: Isolating and Leveraging Noncontrollable Visual Dynamics in World Models
world-model
model-based-rl
dreamer
rssm
disentanglement
inverse-dynamics
autonomous-driving
video-prediction
actor-critic
carla
2026年7月16日
Planning in Stochastic Environments with a Learned Model (Stochastic MuZero)
world-model
model-based-rl
mcts
afterstate
vqvae
chance-node
muzero
stochastic-planning
2048
backgammon
2026年7月16日
Temporal Difference Learning for Model Predictive Control
world-model
model-based-rl
mpc
latent-planning
td-learning
continuous-control
mppi
dmcontrol
meta-world
2026年7月16日
TransDreamer: Reinforcement Learning with Transformer World Models
world-model
model-based-rl
transformer
state-space-model
tssm
dreamer
memory-based-reasoning
actor-critic
partial-observability
2026年7月16日
Mastering Diverse Domains through World Models (DreamerV3)
world-model
model-based-rl
rssm
actor-critic
imagination
latent-dynamics
minecraft
2026年7月16日
Learning to Model the World With Language (Dynalang)
world-model
language-grounding
rssm
dreamerv3
multimodal
model-based-rl
imitation-free
text-pretraining
vision-language-navigation
2026年7月16日
HarmonyDream: Task Harmonization Inside World Models
world-model
model-based-rl
multi-task-learning
loss-balancing
dreamer
atari-100k
meta-world
rlbench
sample-efficiency
2026年7月16日
LightZero: A Unified Benchmark for Monte Carlo Tree Search in General Sequential Decision Scenarios
world-model
mcts
muzero
alphazero
model-based-rl
benchmark
open-source-toolkit
tree-search
reinforcement-learning
2026年7月16日
Facing Off World Model Backbones: RNNs, Transformers, and S4
world-model
model-based-rl
structured-state-space
s4
s5
transformer-xl
rnn
long-term-memory
memory-maze
neurips-2023
2026年7月16日
STORM: Efficient Stochastic Transformer based World Models for Reinforcement Learning
world-model
model-based-rl
transformer
categorical-vae
atari-100k
imagination
actor-critic
sample-efficiency
2026年7月16日
TD-MPC2: Scalable, Robust World Models for Continuous Control
world-model
model-based-rl
mpc
latent-planning
td-learning
continuous-control
multitask
simnorm
mppi
enc-layers
Q
enc层
2026年7月16日
Transformer-based World Models Are Happy With 100k Interactions (TWM)
world-model
model-based-rl
transformer-xl
atari-100k
sample-efficiency
latent-imagination
autoregressive
actor-critic
kl-balancing
2026年7月16日
Learning Interactive Real-World Simulators (UniSim)
world-model
video-diffusion
action-conditioned
real-world-simulator
embodied-ai
sim-to-real
model-based-rl
robot-learning
2026年7月16日
Efficient World Models with Context-Aware Tokenization (Δ-IRIS)
world-model
model-based-rl
transformer
discrete-autoencoder
vqvae
autoregressive
delta-tokens
crafter
atari-100k
imagination
Superhuman
2026年7月16日
Diffusion for World Modeling: Visual Details Matter in Atari (DIAMOND)
world-model
diffusion
EDM
atari-100k
model-based-rl
neural-game-engine
csgo
action-conditioning
imagination
rl-wm
超人游戏
2026年7月16日
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
world-model
diffusion-model
offline-rl
d4rl
model-based-rl
value-expansion
classifier-free-guidance
td3-bc
iql
rl-wm
2026年7月16日
EfficientZero V2: Mastering Discrete and Continuous Control with Limited Data
world-model
model-based-rl
mcts
gumbel-search
sample-efficiency
continuous-control
atari-100k
dmcontrol
off-policy-correction
2026年7月16日
iVideoGPT: Interactive VideoGPTs are Scalable World Models
world-model
ivideogpt
autoregressive-transformer
compressive-tokenization
conditional-vqgan
video-prediction
model-based-rl
mbpo
open-x-embodiment
neurips-2024
2026年7月16日
PWM: Policy Learning with Multi-Task World Models
world-model
model-based-rl
first-order-gradient
differentiable-simulation
multitask
td-mpc2
continuous-control
policy-extraction
2026年7月16日
Mastering Memory Tasks with World Models
world-model
state-space-model
s4
dreamerv3
model-based-rl
long-term-memory
credit-assignment
pomdp
iclr2024
2026年7月16日
Improving Token-Based World Models with Parallel Observation Prediction
world-model
model-based-rl
retnet
retention-network
token-based-world-model
parallel-decoding
atari-100k
imagination
vqvae
icml2024
Superhuman
2026年7月16日
UniZero: Generalized and Efficient Planning with Scalable Latent World Models
world-model
transformer
mcts
muzero
model-based-rl
atari-100k
dmcontrol
multitask-learning
lightzero
latent-world-model
2026年7月16日
Learning Transformer-based World Models with Contrastive Predictive Coding (TWISTER)
world-model
transformer-state-space-model
contrastive-predictive-coding
action-conditioning
atari-100k
deepmind-control-suite
model-based-rl
iclr-2025
2026年7月16日
RL 世界模型族(World Models · PlaNet · Dreamer · MuZero · TD-MPC · IRIS/DIAMOND)
world-model
model-based-rl
latent-imagination
mcts
value-equivalent-model
mpc
transformer-world-model
diffusion-world-model
deep-dive