AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: video-generation
此标签下有72条笔记。
2026年7月16日
GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation
vla
video-generation
generative-pretraining
world-model
manipulation
cvae
action-chunking
calvin
bin-picking
bytedance
2026年7月16日
1X NEO + Redwood AI (learned world-model policy)
humanoid
home-robot
vla
world-model
diffusion-policy
whole-body-control
inverse-dynamics-model
video-generation
reinforcement-learning
consumer-robotics
2026年7月16日
Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image)与 Gemini Omni Flash 开发者 GA
nano-banana
gemini-3-1-flash-lite-image
gemini-omni-flash
any-to-any
video-generation
conversational-editing
interactions-api
synthid
closed-source
tpu
2026年7月16日
世界模型技术演进调研(2017 → 2026)· 主汇总
world-model
model-based-rl
video-generation
jepa
driving-world-model
game-world-model
physical-ai
survey
2026年7月16日
Playable Video Generation
world-model
game-wm
unsupervised-learning
latent-action
discrete-bottleneck
gumbel-softmax
video-generation
action-conditioning
cvpr2021
2026年7月16日
Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving (Drive-WM)
world-model
autonomous-driving
multiview-video
latent-diffusion
video-generation
end-to-end-planning
nuscenes
tree-rollout
2026年7月16日
DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving
world-model
autonomous-driving
diffusion
video-generation
action-conditioning
nuscenes
hdmap
3d-box
planning
2026年7月16日
DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion model
world-model
autonomous-driving
diffusion
multi-view-generation
video-generation
layout-conditioning
nuscenes
consistency-attention
data-augmentation
2026年7月16日
GAIA-1: A Generative World Model for Autonomous Driving
world-model
autonomous-driving
autoregressive-transformer
video-generation
diffusion-decoder
vq-tokenizer
action-conditioning
scaling-laws
neural-simulator
2026年7月16日
Panacea: Panoramic and Controllable Video Generation for Autonomous Driving
world-model
autonomous-driving
diffusion
multi-view-generation
video-generation
bev
controlnet
nuscenes
data-augmentation
4d-attention
2026年7月16日
General World Models: The Next Frontier in AI Research
world-model
general-world-models
video-generation
research-agenda
runway
gen-series
simulation
robotics
2026年7月16日
Learning Universal Policies via Text-Guided Video Generation
world-model
video-generation
video-diffusion
text-conditioned
inverse-dynamics
planning-as-generation
robot-manipulation
generalist-policy
UPDP
2026年7月16日
VBench: Comprehensive Benchmark Suite for Video Generative Models
world-model
video-generation
benchmark
evaluation
human-alignment
t2v
vbench
cvpr2024
2026年7月16日
Video Language Planning
world-model
video-generation
video-diffusion
vision-language-model
tree-search
PaLM-E
robot-manipulation
long-horizon-planning
goal-conditioned-policy
2026年7月16日
WoVoGen: World Volume-aware Diffusion for Controllable Multi-camera Driving Scene Generation
world-model
autonomous-driving
diffusion
controlnet
multi-camera
video-generation
nuscenes
occupancy
hdmap
action-conditioning
2026年7月16日
Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion
world-model
diffusion-forcing
video-generation
per-token-noise
causal-diffusion
long-horizon-rollout
planning
guidance
monte-carlo-guidance
neurips-2024
2026年7月16日
MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes
world-model
autonomous-driving
3d-gaussian-splatting
video-generation
nuscenes
bev
controllable-generation
scene-generation
data-engine
2026年7月16日
Pandora: Towards General World Model with Natural Language Actions and Video States
world-model
autoregressive-diffusion-hybrid
natural-language-action-control
video-generation
llm-video-alignment
instruction-tuning
cross-domain-action-transfer
staged-training
chat-univi
dynamicrafter
2026年7月16日
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
world-model
video-generation
physical-commonsense
benchmark
vlm-evaluator
text-to-video
hierarchical-evaluation
phygenbench
phygeneval
2026年7月16日
Understanding World or Predicting Future? A Comprehensive Survey of World Models
world-model
survey
taxonomy
video-generation
embodied-ai
autonomous-driving
robotics
social-simulacra
sora
jepa
2026年7月16日
VideoPhy: Evaluating Physical Commonsense for Video Generation
world-model
video-generation
physical-commonsense
benchmark
evaluation
auto-evaluator
videocon-physics
text-to-video
iclr-2025
2026年7月16日
WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens
world-model
video-generation
masked-token-prediction
vqgan
transformer
multimodal-conditioning
action-conditioning
autonomous-driving
parallel-decoding
2026年7月16日
WorldSimBench: Towards Video Generation Models as World Simulators
world-model
video-generation
benchmark
world-simulator
human-preference-evaluator
embodied-evaluation
autonomous-driving
robot-manipulation
minecraft
closed-loop-evaluation
指令
视频
维度
动作类别
正例
负例
2026年7月16日
Cosmos-Predict2: A Suite of Diffusion-based World Foundation Models Available in 2B, and 14B
world-model
physical-ai
video-generation
text-to-image
diffusion-transformer
robotics
autonomous-driving
natten
action-conditioned
cosmos
2026年7月16日
Drive&Gen: Co-Evaluating End-to-End Driving and Video Generation Models
world-model
autonomous-driving
video-generation
end-to-end-planning
co-evaluation
behavior-permutation-test
diffusion-transformer
vlm-planner
synthetic-data-augmentation
ood-generalization
2026年7月16日
GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
world-model
autonomous-driving
3d-gaussian-splatting
vision-language-model
visual-grounding
scene-understanding
video-generation
langsplat
dual-condition-diffusion
cvpr2026
2026年7月16日
Genie 3: A new frontier for world models
world-model
interactive
real-time
autoregressive
video-generation
embodied-agent
agi
promptable-world-events
sima
2026年7月16日
Impossible Videos
world-model
video-generation
video-understanding
benchmark
counterfactual
physical-commonsense
Video-LLM
taxonomy
ICML2025
2026年7月16日
Ray2 (Luma Dream Machine video model)
video-generation
t2v
i2v
closed-source
dream-machine
luma-ai
ray2
camera-motion
keyframes
world-model-narrative
2026年7月16日
Ray3 and Luma's Multimodal World-Model Program
world-model
video-generation
reasoning-video-model
hdr-video
luma-ai
ray3
dream-machine
multimodal-agi
2026年7月16日
Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control
world-model
diffusion
dit
controlnet
multimodal-control
sim2real
autonomous-driving
robotics
physical-ai
video-generation
2026年7月16日
Do generative video models understand physical principles?
world-model
video-generation
benchmark
physical-understanding
evaluation
intuitive-physics
Sora
VideoPoet
2026年7月16日
PhyWorldBench: A Comprehensive Evaluation of Physical Realism in Text-to-Video Models
world-model
video-generation
benchmark
physical-realism
evaluation
anti-physics
text-to-video
MLLM-evaluator
2026年7月16日
The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey
world-model
survey
autonomous-driving
taxonomy
driving-world-model
occupancy
point-cloud
video-generation
benchmark
2026年7月16日
VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
world-model
video-generation
benchmark
evaluation
human-alignment
physics
commonsense
vbench
t2v
2026年7月16日
VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation
world-model
video-generation
physical-commonsense
benchmark
evaluation
auto-evaluator
action-centric
text-to-video
iclr-2026
2026年7月16日
WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation
world-model
video-generation
physics-aware
text-to-video
mixture-of-experts
cogvideox
wan2.1
physical-commonsense
dataset
lora
2026年7月16日
WorldModelBench: Judging Video Generation Models As World Models
world-model
video-generation
benchmark
physics-adherence
instruction-following
VLM-judge
human-annotation
reward-gradient
T2V
I2V
2026年7月16日
WorldScore: A Unified Evaluation Benchmark for World Generation
world-model
benchmark
evaluation
video-generation
3d-scene-generation
4d-generation
camera-control
controllability
stanford
iccv-2025
2026年7月16日
DreamX-World 1.0: A General-Purpose Interactive World Model
world-model
video-generation
camera-control
autoregressive
diffusion-transformer
memory-conditioning
event-control
reinforcement-learning
wan2.2
alibaba
2026年7月16日
MoWorld: A Flash World Model
world-model
flash-world-model
video-generation
camera-control
autoregressive-distillation
diffusion-transformer
npu
ascend
wan2.2
self-forcing
2026年7月16日
MultiWorld: Scalable Multi-Agent Multi-View Video World Models
world-model
multi-agent
multi-view
video-generation
flow-matching
action-conditioning
robotics-manipulation
embodied-ai
HKU
VGGT
RoPE
2026年7月16日
World Action Models: A Survey
survey
world-action-model
world-model
VLA
taxonomy
video-generation
embodied-ai
robot-learning
action-coupling
2026年7月16日
自动驾驶世界模型族(GAIA · DriveDreamer · Vista · OccWorld · 占据/点云预测)
world-model
autonomous-driving
deep-dive
driving-wm
video-generation
occupancy-forecasting
point-cloud-forecasting
multi-view-generation
closed-loop-simulation
2026年7月16日
世界模型五大范式对比(RL-WM · 生成视频 · 交互/游戏 · 驾驶 · JEPA)
world-model
paradigms
rl-world-model
dreamer
muzero
video-generation
world-simulator
game-world-model
driving-world-model
jepa
survey
2026年6月25日
Omni / 多模态生成技术演进调研 (2020 → 2026-07) · 主汇总
omni
multimodal-generation
text-to-image
image-editing
unified-understanding-generation
any-to-any
video-generation
diffusion
autoregressive
survey
2026年6月25日
VideoGPT: Video Generation using VQ-VAE and Transformers
video-generation
vq-vae
autoregressive
transformer
gpt
axial-attention
likelihood-based
2026年6月25日
MAGVIT: Masked Generative Video Transformer
video-generation
video-tokenizer
3d-vq
masked-token-modeling
maskgit
non-autoregressive
cvpr2023
2026年6月25日
Phenaki: Variable Length Video Generation from Open Domain Textual Descriptions
text-to-video
video-generation
c-vivit
maskgit
masked-transformer
vq
story-generation
autoregressive
2026年6月25日
Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models (Video LDM)
video-generation
latent-diffusion
text-to-video
temporal-layers
super-resolution
driving-simulation
cvpr2023
2026年6月25日
Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning
t2v
video-generation
diffusion
image-conditioning
factorized
latent-diffusion
zero-snr
meta
2026年6月25日
MAGVIT-v2 — Language Model Beats Diffusion: Tokenizer is Key to Visual Generation
tokenizer
lfq
lookup-free-quantization
video-generation
image-generation
masked-lm
vq-vae
discrete-tokens
2026年6月25日
Make Pixels Dance: High-Dynamic Video Generation (PixelDance)
video-generation
diffusion
image-conditioned
first-last-frame
latent-diffusion
high-dynamic
long-video
bytedance
2026年6月25日
Runway Gen-3 Alpha
text-to-video
image-to-video
video-generation
closed-source
world-model
diffusion
c2pa
2026年6月25日
Kling (可灵) 视频生成大模型
video-generation
t2v
i2v
dit
3d-vae
spatiotemporal-attention
closed-source
kuaishou
2026年6月25日
Movie Gen: A Cast of Media Foundation Models
video-generation
text-to-video
flow-matching
video-editing
personalization
video-to-audio
llama3-backbone
temporal-autoencoder
2026年6月25日
Sora(Sora Turbo)公开发布
video-generation
text-to-video
diffusion-transformer
dit
spacetime-patches
world-simulator
recaptioning
closed-source
2026年6月25日
Pyramid Flow:金字塔式流匹配的高效视频生成
video-generation
flow-matching
pyramidal-flow
autoregressive
dit
mm-dit
efficient-training
2026年6月25日
Sora: Video generation models as world simulators
video-generation
text-to-video
diffusion-transformer
dit
spacetime-patches
world-simulator
recaptioning
native-resolution
scaling
closed-source
2026年6月25日
Veo 2
video-generation
text-to-video
image-to-video
closed-source
cinematography
latent-diffusion
synthid
4k
2026年6月25日
VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation
unified
autoregressive
next-token
visual-tokenizer
rq-vae
clip-alignment
vlm
image-generation
video-generation
2026年6月25日
Cosmos World Foundation Model Platform for Physical AI (Cosmos-Predict1)
world-model
physical-ai
video-generation
diffusion
autoregressive
dit
tokenizer
robotics
autonomous-driving
open-weight
2026年6月25日
FramePack: Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models
video-generation
long-video
next-frame-prediction
diffusion-transformer
context-compression
anti-drifting
hunyuanvideo
wan
low-vram
2026年6月25日
Goku: Flow Based Video Generative Foundation Models
video-generation
text-to-image
image-to-video
rectified-flow
dit
joint-image-video
3d-vae
bytedance
2026年6月25日
HunyuanVideo 1.5
video-generation
dit
t2v
i2v
flow-matching
sparse-attention
sparse-attn
video-super-resolution
open-source
lightweight
muon
distillation
2026年6月25日
Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
video-generation
text-to-video
image-to-video
text-to-image
image-editing
latent-diffusion
flow-matching
dit
crossdit
nabla
sparse-attention
open-source
russian
2026年6月25日
可灵 Kling 2.0 / 2.1 / 2.5 Turbo
video-generation
t2v
i2v
dit
closed-source
kuaishou
kling
mvl
video-editing
2026年6月25日
Veo 3 与 Veo 3.1
video-generation
text-to-video
image-to-video
native-audio
audiovisual
diffusion
closed-model
google-deepmind
flow
2026年6月25日
Wan 2.2
video-generation
t2v
i2v
ti2v
moe
diffusion-transformer
flow-matching
vae
open-source
cinematic
2026年6月25日
可灵 3.0 系列模型(Kling 3.0:Video 3.0 / Video 3.0 Omni / Image 3.0 / Image 3.0 Omni)
video-generation
omni
multimodal
native-audio
multi-shot
character-reference
closed-source
kuaishou
kling
2026年6月25日
Luma Ray3.14
video-generation
text-to-video
image-to-video
video-editing
hdr
reasoning-video
closed-source
dream-machine
2026年6月25日
视频生成族横向对比(Sora · Veo · Wan · Movie Gen · HunyuanVideo · Kling · CogVideoX 及其谱系)
video-generation
text-to-video
image-to-video
diffusion-transformer
flow-matching
3d-vae
vbench
sora
veo
wan
movie-gen
hunyuanvideo
kling
cogvideox
deep-dive