AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: text-to-video
此标签下有39条笔记。
2026年7月16日
Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction
bimanual-manipulation
video-prediction
optical-flow
cogvideox
diffusion-policy
foundation-policy
goal-conditioned-policy
text-to-video
2026年7月16日
Muse Image(含 Muse Video 预览)
agentic-image-gen
tool-use
self-refinement
test-time-compute
rl
meta-ai
watermark
image-editing
multi-reference
text-to-video
closed-source
2026年7月16日
InfinityDrive: Breaking Time Limits in Driving World Models
driving-world-model
video-diffusion
diffusion-transformer
long-video-generation
memory-mechanism
curriculum-learning
image-to-video
text-to-video
autonomous-driving
2026年7月16日
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
world-model
video-generation
physical-commonsense
benchmark
vlm-evaluator
text-to-video
hierarchical-evaluation
phygenbench
phygeneval
2026年7月16日
VideoPhy: Evaluating Physical Commonsense for Video Generation
world-model
video-generation
physical-commonsense
benchmark
evaluation
auto-evaluator
videocon-physics
text-to-video
iclr-2025
2026年7月16日
PhyWorldBench: A Comprehensive Evaluation of Physical Realism in Text-to-Video Models
world-model
video-generation
benchmark
physical-realism
evaluation
anti-physics
text-to-video
MLLM-evaluator
2026年7月16日
VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation
world-model
video-generation
physical-commonsense
benchmark
evaluation
auto-evaluator
action-centric
text-to-video
iclr-2026
2026年7月16日
WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation
world-model
video-generation
physics-aware
text-to-video
mixture-of-experts
cogvideox
wan2.1
physical-commonsense
dataset
lora
2026年6月25日
GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions
text-to-video
autoregressive
vq-vae
sparse-attention
t2v
howto100m
msr-vtt
2026年6月25日
NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion
unified-generation
autoregressive
vq-gan
3d-transformer
sparse-attention
text-to-image
text-to-video
image-editing
any-to-vision
2026年6月25日
CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers
text-to-video
autoregressive
transformer
vqvae
cogview2
open-source
2026年6月25日
Imagen Video: High Definition Video Generation with Diffusion Models
text-to-video
cascaded-diffusion
v-prediction
classifier-free-guidance
progressive-distillation
video-diffusion
u-net
2026年6月25日
Make-A-Video: Text-to-Video Generation without Text-Video Data
text-to-video
diffusion
t2i-prior
pseudo-3d
spatiotemporal
unsupervised-video
cascaded-diffusion
2026年6月25日
Phenaki: Variable Length Video Generation from Open Domain Textual Descriptions
text-to-video
video-generation
c-vivit
maskgit
masked-transformer
vq
story-generation
autoregressive
2026年6月25日
Video Diffusion Models (VDM)
video
diffusion
3d-unet
factorized-attention
reconstruction-guidance
text-to-video
video-prediction
2026年6月25日
Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models (Video LDM)
video-generation
latent-diffusion
text-to-video
temporal-layers
super-resolution
driving-simulation
cvpr2023
2026年6月25日
GenTron: Diffusion Transformers for Image and Video Generation
dit
diffusion-transformer
text-to-image
text-to-video
scaling
motion-free-guidance
t2i-compbench
Param
2026年6月25日
ModelScopeT2V(ModelScope Text-to-Video Technical Report)
text-to-video
latent-diffusion
spatio-temporal
unet3d
open-source
webvid
vqgan
2026年6月25日
Pika 1.0
video
text-to-video
image-to-video
consumer-product
closed-source
generative-video
2026年6月25日
Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
text-to-video
diffusion
pixel-diffusion
latent-diffusion
cascade
expert-translation
deepfloyd-if
webvid
vbench
2026年6月25日
Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
video
image-to-video
text-to-video
latent-diffusion
data-curation
open-source
edm
multi-view
Clips
2026年6月25日
VideoPoet: A Large Language Model for Zero-Shot Video Generation
video
autoregressive
llm
discrete-token
multimodal
text-to-video
image-to-video
audio
magvit-v2
zero-shot
2026年6月25日
W.A.L.T: Photorealistic Video Generation with Diffusion Models
video-diffusion
latent-diffusion
transformer
dit
window-attention
causal-3d-vae
text-to-video
magvit-v2
2026年6月25日
Allegro: Open the Black Box of Commercial-Level Video Generation Model
text-to-video
dit
video-vae
3d-rope
full-attention
open-weights
flow-free-diffusion
rhymes-ai
2026年6月25日
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
text-to-video
diffusion-transformer
3d-vae
expert-adaln
dit
open-source
i2v
2026年6月25日
Runway Gen-3 Alpha
text-to-video
image-to-video
video-generation
closed-source
world-model
diffusion
c2pa
2026年6月25日
Lumiere: A Space-Time Diffusion Model for Video Generation
text-to-video
diffusion
space-time-unet
t2i-inflation
pixel-diffusion
image-to-video
video-inpainting
2026年6月25日
Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers
dit
flow-matching
flag-dit
text-to-image
text-to-video
text-to-3d
text-to-speech
rope
resolution-extrapolation
unified-generation
2026年6月25日
Mochi 1 (preview)
text-to-video
diffusion-transformer
asymmdit
mmdit
3d-attention
flow-matching
open-source
apache-2.0
video-vae
2026年6月25日
Movie Gen: A Cast of Media Foundation Models
video-generation
text-to-video
flow-matching
video-editing
personalization
video-to-audio
llama3-backbone
temporal-autoencoder
2026年6月25日
Sora(Sora Turbo)公开发布
video-generation
text-to-video
diffusion-transformer
dit
spacetime-patches
world-simulator
recaptioning
closed-source
2026年6月25日
Sora: Video generation models as world simulators
video-generation
text-to-video
diffusion-transformer
dit
spacetime-patches
world-simulator
recaptioning
native-resolution
scaling
closed-source
2026年6月25日
Veo 2
video-generation
text-to-video
image-to-video
closed-source
cinematography
latent-diffusion
synthid
4k
2026年6月25日
Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
video-generation
text-to-video
image-to-video
text-to-image
image-editing
latent-diffusion
flow-matching
dit
crossdit
nabla
sparse-attention
open-source
russian
2026年6月25日
Sora 2
video
audio
text-to-video
world-model
diffusion
synced-audio
cameo
closed-source
2026年6月25日
Veo 3 与 Veo 3.1
video-generation
text-to-video
image-to-video
native-audio
audiovisual
diffusion
closed-model
google-deepmind
flow
2026年6月25日
Luma Ray3.14
video-generation
text-to-video
image-to-video
video-editing
hdr
reasoning-video
closed-source
dream-machine
2026年6月25日
OmniGen-AR: AutoRegressive Any-to-Image Generation
autoregressive
any-to-image
unified-generation
next-token
visual-tokenizer
disentangled-causal-attention
image-editing
text-to-video
neurips-2025
2026年6月25日
视频生成族横向对比(Sora · Veo · Wan · Movie Gen · HunyuanVideo · Kling · CogVideoX 及其谱系)
video-generation
text-to-video
image-to-video
diffusion-transformer
flow-matching
3d-vae
vbench
sora
veo
wan
movie-gen
hunyuanvideo
kling
cogvideox
deep-dive