AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: video-diffusion
此标签下有31条笔记。
2026年7月16日
ADriver-I: A General World Model for Autonomous Driving
world-model
autonomous-driving
mllm
video-diffusion
action-conditioning
vicuna
nuscenes
closed-loop
control-signal-prediction
2026年7月16日
Learning to Act from Actionless Videos through Dense Correspondences
world-model
video-diffusion
dense-correspondence
optical-flow
action-free-learning
inverse-kinematics
robot-manipulation
navigation
cross-embodiment
replanning
2026年7月16日
Learning Universal Policies via Text-Guided Video Generation
world-model
video-generation
video-diffusion
text-conditioned
inverse-dynamics
planning-as-generation
robot-manipulation
generalist-policy
UPDP
2026年7月16日
Learning Interactive Real-World Simulators (UniSim)
world-model
video-diffusion
action-conditioned
real-world-simulator
embodied-ai
sim-to-real
model-based-rl
robot-learning
2026年7月16日
Video Language Planning
world-model
video-generation
video-diffusion
vision-language-model
tree-search
PaLM-E
robot-manipulation
long-horizon-planning
goal-conditioned-policy
2026年7月16日
AVID: Adapting Video Diffusion Models to World Models
world-model
video-diffusion
adapter
action-conditioning
frozen-backbone
product-of-experts
controlnet
procgen
rt1
dynamicrafter
2026年7月16日
InfinityDrive: Breaking Time Limits in Driving World Models
driving-world-model
video-diffusion
diffusion-transformer
long-video-generation
memory-mechanism
curriculum-learning
image-to-video
text-to-video
autonomous-driving
2026年7月16日
Owl-1: Omni World Model for Consistent Long Video Generation
world-model
long-video-generation
latent-state
video-diffusion
dynamicrafter
chameleon
autoregressive-lmm
world-dynamics-prediction
vbench
multi-stage-training
2026年7月16日
ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration
world-model
driving-scene-reconstruction
gaussian-splatting
online-restoration
drivedreamer-2
video-diffusion
waymo
closed-loop-simulation
2026年7月16日
RoboDreamer: Learning Compositional World Models for Robot Imagination
world-model
video-diffusion
compositional-generation
text-conditioned
multimodal-conditioning
robot-manipulation
RLBench
RT-1
text-parsing
energy-based-composition
2026年7月16日
Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability
driving-world-model
video-diffusion
stable-video-diffusion
action-conditioning
long-horizon-rollout
reward-model
opendv
autonomous-driving
2026年7月16日
Aether: Geometric-Aware Unified World Modeling
world-model
4d-reconstruction
video-diffusion
action-conditioned-prediction
visual-planning
synthetic-data
zero-shot-transfer
camera-pose
cogvideox
2026年7月16日
EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation
world-model
video-diffusion
robotic-manipulation
multi-view
free-anchor-view
4d-gaussian-splatting
sim2real
chunk-autoregressive
sparse-memory
libero
2026年7月16日
GameFactory: Creating New Games with Generative Interactive Videos
world-model
game-generation
minecraft
video-diffusion
action-control
scene-generalization
lora
autoregressive-generation
diffusion-forcing
dataset
2026年7月16日
Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation
world-model
robotic-manipulation
video-diffusion
vla
flow-matching
dual-arm
cross-embodiment
neural-simulator
benchmark
2026年7月16日
History-Guided Video Diffusion
world-model
video-diffusion
diffusion-forcing
history-guidance
classifier-free-guidance
dit
long-video-generation
autoregressive-rollout
icml-2025
2026年7月16日
Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation
world-model
video-diffusion
rgb-d-generation
camera-control
3d-reconstruction
autoregressive-generation
point-cloud
scene-exploration
hunyuanvideo
2026年7月16日
Matrix-3D: Omnidirectional Explorable 3D World Generation
world-model
panoramic-video
3d-gaussian-splatting
scene-generation
diffusion-transformer
video-diffusion
feed-forward-reconstruction
synthetic-dataset
2026年7月16日
PAN: A World Model for General, Interactable, and Long-Horizon World Simulation
world-model
generative-latent-prediction
glp
autoregressive
video-diffusion
causal-swin-dpm
qwen2.5-vl
wan2.1
long-horizon
simulative-reasoning
2026年7月16日
Yan: Foundational Interactive Video Generation
world-model
game-generation
interactive-video
diffusion-forcing
dit
video-diffusion
real-time-simulation
video-editing
action-conditioning
autoregressive-generation
2026年7月16日
TesserAct: Learning 4D Embodied World Models
world-model
4d-scene-reconstruction
rgb-depth-normal
video-diffusion
cogvideox
action-conditioned-prediction
robotic-manipulation
inverse-dynamics
point-cloud
iccv2025
2026年7月16日
Vidar: Embodied Video Diffusion Model for Generalist Manipulation
world-model
video-diffusion
robot-manipulation
bimanual-manipulation
inverse-dynamics
cross-embodiment
test-time-scaling
rectified-flow
aloha-robot
2026年7月16日
WoW: Towards a World omniscient World model Through Embodied Interaction
world-model
video-diffusion
embodied-ai
robot-manipulation
diffusion-transformer
inverse-dynamics-model
vlm-critic
physical-reasoning
benchmark
scaling-law
2026年7月16日
Yume: An Interactive World Generation Model
world-model
video-diffusion
image-to-video
camera-control
keyboard-control
masked-diffusion-transformer
diffusion-acceleration
sekai
open-source
2026年7月16日
ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space
world-model
3d-gaussian-splatting
panoramic-video
spatial-generative-primitive
diffusion-transformer
video-diffusion
reinforcement-learning
scene-reconstruction
alibaba
amap
2026年7月16日
GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
world-model
robot-policy-evaluation
benchmark
video-diffusion
autoregressive-generation
action-conditioning
dmd2-distillation
vlm-judge
wan
2026年6月25日
Imagen Video: High Definition Video Generation with Diffusion Models
text-to-video
cascaded-diffusion
v-prediction
classifier-free-guidance
progressive-distillation
video-diffusion
u-net
2026年6月25日
I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models
image-to-video
video-diffusion
cascaded-diffusion
vldm
ldm
sdedit
open-source
2026年6月25日
LaVie: High-Quality Video Generation with Cascaded Latent Diffusion Models
t2v
video-diffusion
latent-diffusion
cascaded
temporal-attention
rope
joint-image-video
vimeo25m
open-source
2026年6月25日
MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model
human-animation
pose-driven
densepose
appearance-encoder
temporal-attention
video-diffusion
controlnet
sd15
2026年6月25日
W.A.L.T: Photorealistic Video Generation with Diffusion Models
video-diffusion
latent-diffusion
transformer
dit
window-attention
causal-3d-vae
text-to-video
magvit-v2