AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: diffusion-transformer
此标签下有55条笔记。
2026年7月16日
CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
vla
diffusion-transformer
componentized-vla
prismatic-vlm
llama-2
open-x-embodiment
action-ensemble
simpler-env
robot-manipulation
2026年7月16日
RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
vla
diffusion-policy
bimanual-manipulation
diffusion-transformer
imitation-learning
unified-action-space
action-chunking
aloha
2026年7月16日
Track2Act: Predicting Point Tracks from Internet Videos enables Generalizable Robot Manipulation
point-tracking
web-video-manipulation-learning
zero-shot-manipulation
embodiment-agnostic-representation
diffusion-transformer
residual-policy
cotracker
rigid-transform-estimation
cross-embodiment
robot-learning
2026年7月16日
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
vla
diffusion-transformer
in-context-conditioning
cross-embodiment
open-x-embodiment
action-chunking
dinov2
q-former
libero
calvin
maniskill2
simplerenv
2026年7月16日
GR00T N1.5: An Improved Open Foundation Model for Generalist Humanoid Robots
vla
humanoid
frozen-vlm
flow-matching
diffusion-transformer
flare
world-model-objective
cross-embodiment
dreamgen
eagle-2.5
2026年7月16日
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
vla
humanoid
dual-system
flow-matching
diffusion-transformer
cross-embodiment
latent-action
world-model
data-pyramid
eagle-2
2026年7月16日
R3D: Revisiting 3D Policy Learning
3d-policy-learning
point-cloud
diffusion-transformer
layer-normalization
data-augmentation
robotwin
maniskill2
spatially-aware-decoding
3d-pretraining
imitation-learning
2026年7月16日
Qwen-Music Technical Report
qwen
text-to-music
song-generation
cover-song
music-tokenizer
bestrq
melody-cot
diffusion-transformer
spec-vae
dpo
gspo
vocal-synthesis
2026年7月16日
Oasis: A Universe in a Transformer
world-model
playable-game
minecraft
diffusion-transformer
diffusion-forcing
autoregressive-video
action-conditioning
real-time
vpt
sohu-asic
2026年7月16日
DOME: Taming Diffusion Model into High-Fidelity Controllable Occupancy World Model
world-model
autonomous-driving
occupancy-prediction
diffusion-transformer
vae
trajectory-conditioning
nuscenes
occ3d
4d-forecasting
2026年7月16日
GameGen-X: Interactive Open-world Game Video Generation
world-model
game-generation
diffusion-transformer
interactive-video
instructnet
open-world
action-conditioning
video-continuation
dataset
game-wm
2026年7月16日
InfinityDrive: Breaking Time Limits in Driving World Models
driving-world-model
video-diffusion
diffusion-transformer
long-video-generation
memory-mechanism
curriculum-learning
image-to-video
text-to-video
autonomous-driving
2026年7月16日
IRASim: A Fine-Grained World Model for Robot Manipulation
world-model
diffusion-transformer
action-conditioned-video
trajectory-to-video
frame-level-conditioning
robot-manipulation
model-based-planning
policy-evaluation
iccv-2025
2026年7月16日
MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control
world-model
autonomous-driving
diffusion-transformer
flow-matching
multi-view-generation
3d-vae
long-video-generation
controlnet
nuscenes
sequence-parallel
2026年7月16日
Navigation World Models
world-model
navigation
diffusion-transformer
CDiT
action-conditioning
video-prediction
MPC-planning
egocentric-video
robotics
cross-embodiment
goals
context
2026年7月16日
OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving
world-model
autonomous-driving
occupancy-generation
diffusion-transformer
4d-occupancy
trajectory-conditioning
nuscenes
vq-vae
dit
2026年7月16日
Cosmos-Predict2: A Suite of Diffusion-based World Foundation Models Available in 2B, and 14B
world-model
physical-ai
video-generation
text-to-image
diffusion-transformer
robotics
autonomous-driving
natten
action-conditioned
cosmos
2026年7月16日
Drive&Gen: Co-Evaluating End-to-End Driving and Video Generation Models
world-model
autonomous-driving
video-generation
end-to-end-planning
co-evaluation
behavior-permutation-test
diffusion-transformer
vlm-planner
synthetic-data-augmentation
ood-generalization
2026年7月16日
Epona: Autoregressive Diffusion World Model for Autonomous Driving
driving-world-model
autoregressive-diffusion
diffusion-transformer
rectified-flow
trajectory-planning
long-horizon-generation
chain-of-forward
deep-compression-autoencoder
nuplan
nuscenes
2026年7月16日
GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
driving-world-model
4d-occupancy
tri-plane-vae
occupancy-forecasting
multi-view-video-generation
wan2.1
diffusion-transformer
mutual-control-attention
nuscenes
cvpr2026
2026年7月16日
HunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or Pixels
world-model
3d-generation
panorama
diffusion-transformer
mesh-export
scene-layering
gaussian-splatting
text-to-3d
image-to-3d
open-source
2026年7月16日
Matrix-3D: Omnidirectional Explorable 3D World Generation
world-model
panoramic-video
3d-gaussian-splatting
scene-generation
diffusion-transformer
video-diffusion
feed-forward-reconstruction
synthetic-dataset
2026年7月16日
Matrix-Game: Interactive World Foundation Model
world-model
game-generation
minecraft
interactive
image-to-world
diffusion-transformer
action-control
benchmark
open-source
2026年7月16日
Hunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Condition
world-model
game-generation
interactive-video
camera-control
action-conditioning
autoregressive
diffusion-transformer
distillation
aaa-games
open-source
2026年7月16日
WoW: Towards a World omniscient World model Through Embodied Interaction
world-model
video-diffusion
embodied-ai
robot-manipulation
diffusion-transformer
inverse-dynamics-model
vlm-critic
physical-reasoning
benchmark
scaling-law
2026年7月16日
ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space
world-model
3d-gaussian-splatting
panoramic-video
spatial-generative-primitive
diffusion-transformer
video-diffusion
reinforcement-learning
scene-reconstruction
alibaba
amap
2026年7月16日
RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
world-model
robot-learning
teleoperation
action-conditioned-video
diffusion-transformer
autoregressive-distillation
sim2real
dexterous-manipulation
data-engine
2026年7月16日
DreamX-World 1.0: A General-Purpose Interactive World Model
world-model
video-generation
camera-control
autoregressive
diffusion-transformer
memory-conditioning
event-control
reinforcement-learning
wan2.2
alibaba
2026年7月16日
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision–Language–Action for Autonomous Driving
driving-world-model
vision-language-action
latent-space-world-model
flow-matching
diffusion-transformer
bev-representation
navsim
nuscenes
closed-loop-planning
internvl
2026年7月16日
MoWorld: A Flash World Model
world-model
flash-world-model
video-generation
camera-control
autoregressive-distillation
diffusion-transformer
npu
ascend
wan2.2
self-forcing
2026年7月16日
Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
world-model
robot-policy
video-diffusion-model
visuomotor-control
model-based-planning
diffusion-transformer
cosmos
vla
imitation-learning
2026年7月16日
NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation
world-model
autonomous-driving
closed-loop-simulation
diffusion-transformer
autoregressive-generation
self-forcing
distillation
cosmos
multi-view-generation
world-action-model
2026年7月16日
Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory
world-model
interactive-video
long-horizon-memory
diffusion-transformer
distillation
dmd
real-time
game
action-conditioning
unreal-engine
2026年7月16日
Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation (WorldDrive)
driving-world-model
trajectory-vocabulary
diffusion-transformer
cogvideox
representation-inheritance
multi-modal-planner
future-aware-rewarder
navsim
nuscenes
2026年7月16日
Xiaomi Auto World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving
driving-world-model
3d-gaussian-splatting
feedforward-reconstruction
diffusion-transformer
causal-video-generation
distillation
sparse-query
autonomous-driving
2026年6月25日
Scalable Diffusion Models with Transformers (DiT)
dit
diffusion-transformer
latent-diffusion
adaln-zero
scaling
imagenet
backbone
vit
2026年6月25日
GenTron: Diffusion Transformers for Image and Video Generation
dit
diffusion-transformer
text-to-image
text-to-video
scaling
motion-free-guidance
t2i-compbench
Param
2026年6月25日
PixArt-α: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
t2i
dit
diffusion-transformer
cross-attention
t5
low-cost-training
re-captioning
open-source
Params
Images
2026年6月25日
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
text-to-video
diffusion-transformer
3d-vae
expert-adaln
dit
open-source
i2v
2026年6月25日
Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
t2i
diffusion-transformer
dit
chinese
bilingual
multi-resolution
rope
recaptioning
mllm
open-source
2026年6月25日
Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT
text-to-image
diffusion-transformer
next-dit
flow-matching
rectified-flow
rope
resolution-extrapolation
few-step-sampling
multilingual
unified-generation
2026年6月25日
Mochi 1 (preview)
text-to-video
diffusion-transformer
asymmdit
mmdit
3d-attention
flow-matching
open-source
apache-2.0
video-vae
2026年6月25日
Sora(Sora Turbo)公开发布
video-generation
text-to-video
diffusion-transformer
dit
spacetime-patches
world-simulator
recaptioning
closed-source
2026年6月25日
PixArt-Σ: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation
t2i
dit
diffusion-transformer
4k
kv-compression
weak-to-strong
efficient
pixart
Params
2026年6月25日
REPA: Representation Alignment for Generation — Training Diffusion Transformers Is Easier Than You Think
diffusion-transformer
representation-alignment
dinov2
sit
dit
self-supervised
training-efficiency
flow-matching
imagenet
2026年6月25日
Sana: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers
t2i
diffusion-transformer
linear-attention
deep-compression-ae
rectified-flow
efficient
on-device
gemma
2026年6月25日
Sora: Video generation models as world simulators
video-generation
text-to-video
diffusion-transformer
dit
spacetime-patches
world-simulator
recaptioning
native-resolution
scaling
closed-source
2026年6月25日
BLIP3-o: A Family of Fully Open Unified Multimodal Models
unified-multimodal
clip-feature-diffusion
flow-matching
diffusion-transformer
sequential-training
fully-open
image-generation
image-understanding
2026年6月25日
FramePack: Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models
video-generation
long-video
next-frame-prediction
diffusion-transformer
context-compression
anti-drifting
hunyuanvideo
wan
low-vram
2026年6月25日
HunyuanImage 2.1:高效的 2K 高分辨率文生图扩散模型
t2i
mmdit
diffusion-transformer
high-resolution
2k
distillation
meanflow
rlhf
text-rendering
byt5
vae
repa
open-source
2026年6月25日
Diffusion Transformers with Representation Autoencoders (RAE)
diffusion-transformer
representation-encoder
dinov2
autoencoder
latent-diffusion
imagenet
flow-matching
dit
2026年6月25日
Wan 2.2
video-generation
t2v
i2v
ti2v
moe
diffusion-transformer
flow-matching
vae
open-source
cinematic
2026年6月25日
Z-Image / Z-Image-Turbo:单流扩散 Transformer 的高效 6B 文生图基础模型
t2i
diffusion-transformer
single-stream
dmd
distillation
rlhf
bilingual-text
image-editing
efficient
2026年6月25日
Krea 2
t2i
diffusion-transformer
flow-matching
dit
style-reference
moodboard
open-weights
distillation
rl
dpo
krea
2026年6月25日
视频生成族横向对比(Sora · Veo · Wan · Movie Gen · HunyuanVideo · Kling · CogVideoX 及其谱系)
video-generation
text-to-video
image-to-video
diffusion-transformer
flow-matching
3d-vae
vbench
sora
veo
wan
movie-gen
hunyuanvideo
kling
cogvideox
deep-dive