AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: muzero
此标签下有12条笔记。
2026年7月16日
Model-based Reinforcement Learning: A Survey
model-based-rl
planning
survey
taxonomy
dyna
muzero
alphago-zero
implicit-model-based-rl
exploration
hierarchical-rl
2026年7月16日
Mastering Atari Games with Limited Data (EfficientZero)
world-model
model-based-rl
muzero
mcts
sample-efficiency
self-supervised
atari-100k
simsiam
value-prefix
off-policy-correction
2026年7月16日
Online and Offline Reinforcement Learning by Planning with a Learned Model (MuZero Unplugged)
world-model
model-based-rl
mcts
offline-rl
reanalyse
muzero
atari
dm-control
planning
2026年7月16日
Learning and Planning in Complex Action Spaces (Sampled MuZero)
world-model
model-based-rl
mcts
sampled-actions
continuous-control
muzero
dm-control
policy-iteration
2026年7月16日
Vector Quantized Models for Planning
world-model
model-based-rl
mcts
vqvae
discrete-latent
offline-rl
muzero
chess
deepmind-lab
planning
2026年7月16日
Policy Improvement by Planning with Gumbel (Gumbel MuZero)
reinforcement-learning
mcts
alphazero
muzero
policy-improvement
gumbel-top-k
sequential-halving
tree-search
model-based-rl
2026年7月16日
Planning in Stochastic Environments with a Learned Model (Stochastic MuZero)
world-model
model-based-rl
mcts
afterstate
vqvae
chance-node
muzero
stochastic-planning
2048
backgammon
2026年7月16日
LightZero: A Unified Benchmark for Monte Carlo Tree Search in General Sequential Decision Scenarios
world-model
mcts
muzero
alphazero
model-based-rl
benchmark
open-source-toolkit
tree-search
reinforcement-learning
2026年7月16日
ReZero: Boosting MCTS-based Algorithms by Backward-view and Entire-buffer Reanalyze
reinforcement-learning
mcts
muzero
efficientzero
reanalyze
sample-efficiency
tree-search
bandit-theory
lightzero
2026年7月16日
UniZero: Generalized and Efficient Planning with Scalable Latent World Models
world-model
transformer
mcts
muzero
model-based-rl
atari-100k
dmcontrol
multitask-learning
lightzero
latent-world-model
2026年7月16日
世界模型五大范式对比(RL-WM · 生成视频 · 交互/游戏 · 驾驶 · JEPA)
world-model
paradigms
rl-world-model
dreamer
muzero
video-generation
world-simulator
game-world-model
driving-world-model
jepa
survey
2026年7月16日
世界模型训练方法(想象力 RL · 扩散/流 · next-token · JEPA 回归 · 蒸馏)
world-model
training
imagination-rl
dreamer
muzero
diffusion
flow-matching
diffusion-forcing
autoregressive
jepa
distillation