AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: diffusion
此标签下有113条笔记。
2026年7月16日
DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving
world-model
autonomous-driving
diffusion
video-generation
action-conditioning
nuscenes
hdmap
3d-box
planning
2026年7月16日
DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion model
world-model
autonomous-driving
diffusion
multi-view-generation
video-generation
layout-conditioning
nuscenes
consistency-attention
data-augmentation
2026年7月16日
MagicDrive: Street View Generation with Diverse 3D Geometry Control
world-model
autonomous-driving
diffusion
multi-view-generation
controlnet
bev
3d-bounding-box
nuscenes
data-augmentation
cross-view-attention
2026年7月16日
Panacea: Panoramic and Controllable Video Generation for Autonomous Driving
world-model
autonomous-driving
diffusion
multi-view-generation
video-generation
bev
controlnet
nuscenes
data-augmentation
4d-attention
2026年7月16日
WoVoGen: World Volume-aware Diffusion for Controllable Multi-camera Driving Scene Generation
world-model
autonomous-driving
diffusion
controlnet
multi-camera
video-generation
nuscenes
occupancy
hdmap
action-conditioning
2026年7月16日
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
world-model
autonomous-driving
diffusion
multi-view-generation
long-video-generation
bev
controlnet
nuscenes
failure-case-mining
uniad
data-augmentation
2026年7月16日
Diffusion for World Modeling: Visual Details Matter in Atari (DIAMOND)
world-model
diffusion
EDM
atari-100k
model-based-rl
neural-game-engine
csgo
action-conditioning
imagination
rl-wm
超人游戏
2026年7月16日
Diffusion Models Are Real-Time Game Engines (GameNGen)
world-model
neural-game-engine
diffusion
stable-diffusion
DOOM
action-conditioning
autoregressive-drift
noise-augmentation
game-wm
2026年7月16日
Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models
world-model
autonomous-driving
synthetic-data
controlnet
multi-view
lidar-generation
diffusion
dit
cosmos
data-flywheel
2026年7月16日
Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control
world-model
diffusion
dit
controlnet
multimodal-control
sim2real
autonomous-driving
robotics
physical-ai
video-generation
2026年7月16日
世界模型架构演进(RSSM · Transformer/AR · 扩散 · JEPA · 因果 tokenizer · 动作条件)
world-model
architecture
rssm
transformer
diffusion
jepa
tokenizer
action-conditioning
2026年7月16日
世界模型训练方法(想象力 RL · 扩散/流 · next-token · JEPA 回归 · 蒸馏)
world-model
training
imagination-rl
dreamer
muzero
diffusion
flow-matching
diffusion-forcing
autoregressive
jepa
distillation
2026年6月25日
Omni / 多模态生成技术演进调研 (2020 → 2026-07) · 主汇总
omni
multimodal-generation
text-to-image
image-editing
unified-understanding-generation
any-to-any
video-generation
diffusion
autoregressive
survey
2026年6月25日
Denoising Diffusion Implicit Models (DDIM)
diffusion
sampler
fast-sampling
non-markovian
deterministic
ode
ddim-inversion
latent-space
2026年6月25日
Denoising Diffusion Probabilistic Models (DDPM)
diffusion
ddpm
score-matching
image-generation
generative-model
unet
cifar10
lsun
2026年6月25日
Score-Based Generative Modeling through Stochastic Differential Equations (Score SDE)
diffusion
score-matching
sde
probability-flow-ode
predictor-corrector
ncsn++
ddpm++
continuous-time
iclr2021
2026年6月25日
Cascaded Diffusion Models for High Fidelity Image Generation (CDM)
diffusion
cascade
super-resolution
conditioning-augmentation
imagenet
class-conditional
fid
2026年6月25日
CLIP-Guided Diffusion (Katherine Crowson / 社区版)
clip-guidance
classifier-guidance
diffusion
text-to-image
training-free
community
ablated-diffusion
2026年6月25日
Diffusion Models Beat GANs on Image Synthesis (ADM / Classifier Guidance)
diffusion
classifier-guidance
adm
unet
imagenet
fid
generative-model
2026年6月25日
GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models
diffusion
classifier-free-guidance
clip-guidance
text-to-image
inpainting
adm
openai
2026年6月25日
ILVR: Conditioning Method for Denoising Diffusion Probabilistic Models
diffusion
ddpm
training-free
conditioning
image-translation
editing
low-pass-filter
iccv2021
2026年6月25日
Improved Denoising Diffusion Probabilistic Models (Improved DDPM / IDDPM)
diffusion
ddpm
learned-variance
cosine-schedule
fast-sampling
log-likelihood
unet
image-generation
2026年6月25日
Palette: Image-to-Image Diffusion Models
diffusion
image-to-image
inpainting
colorization
uncropping
jpeg-restoration
conditional-diffusion
unet
multi-task
2026年6月25日
SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations
diffusion
image-editing
sde
score-based
img2img
training-free
stroke-to-image
compositing
2026年6月25日
Classifier-Free Diffusion Guidance (CFG)
diffusion
guidance
cfg
conditional-generation
sampling
score-matching
2026年6月25日
DALL·E 2 / unCLIP(Hierarchical Text-Conditional Image Generation with CLIP Latents)
t2i
diffusion
unclip
clip
prior-decoder
guidance
openai
2026年6月25日
DiffEdit: Diffusion-based Semantic Image Editing with Mask Guidance
diffusion
image-editing
training-free
mask-guidance
ddim-inversion
semantic-editing
stable-diffusion
2026年6月25日
DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps
diffusion
ode-solver
fast-sampling
exponential-integrator
training-free
neurips2022
2026年6月25日
DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation
personalization
subject-driven
finetuning
diffusion
imagen
stable-diffusion
prior-preservation
2026年6月25日
eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers
diffusion
text-to-image
ensemble-of-experts
cascaded-diffusion
t5
clip
paint-with-words
edm
nvidia
2026年6月25日
Elucidating the Design Space of Diffusion-Based Generative Models (EDM)
diffusion
ode-sampler
heun
preconditioning
noise-schedule
score-matching
fid
cifar10
imagenet64
neurips2022
2026年6月25日
ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts
text-to-image
diffusion
latent-diffusion
mixture-of-experts
knowledge-enhanced
chinese
baidu
cvpr2023
params
图
2026年6月25日
Flow Matching for Generative Modeling
flow-matching
rectified-flow
continuous-normalizing-flow
optimal-transport
ode
diffusion
generative-model
2026年6月25日
Imagen: Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
t2i
diffusion
cascaded-diffusion
t5
classifier-free-guidance
drawbench
pixel-space
2026年6月25日
Imagic: Text-Based Real Image Editing with Diffusion Models
image-editing
diffusion
text-guided
non-rigid-edit
embedding-interpolation
fine-tuning
imagen
stable-diffusion
tedbench
2026年6月25日
InstructPix2Pix: Learning to Follow Image Editing Instructions
diffusion
image-editing
instruction-following
synthetic-data
gpt-3
stable-diffusion
prompt-to-prompt
classifier-free-guidance
2026年6月25日
Make-A-Video: Text-to-Video Generation without Text-Video Data
text-to-video
diffusion
t2i-prior
pseudo-3d
spatiotemporal
unsupervised-video
cascaded-diffusion
2026年6月25日
Midjourney (公测 V1–V4)
t2i
closed-source
diffusion
discord
aesthetic
midjourney
niji
commercial
2026年6月25日
Null-text Inversion for Editing Real Images using Guided Diffusion Models
diffusion
image-editing
inversion
classifier-free-guidance
ddim
prompt-to-prompt
stable-diffusion
training-free
2026年6月25日
Point·E: A System for Generating 3D Point Clouds from Complex Prompts
text-to-3d
point-cloud
diffusion
transformer
glide
clip
image-to-3d
2026年6月25日
Prompt-to-Prompt Image Editing with Cross Attention Control
diffusion
image-editing
cross-attention
training-free
text-to-image
attention-injection
imagen
stable-diffusion
2026年6月25日
RAPHAEL: Text-to-Image Generation via Large Mixture of Diffusion Paths
t2i
diffusion
mixture-of-experts
space-moe
time-moe
latent-diffusion
edge-supervised
coco-fid
2026年6月25日
RePaint: Inpainting using Denoising Diffusion Probabilistic Models
inpainting
diffusion
ddpm
training-free
resampling
image-editing
celeba-hq
imagenet
2026年6月25日
Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation
video
t2v
video-editing
one-shot
diffusion
fine-tuning
stable-diffusion
ddim-inversion
attention-inflation
2026年6月25日
All are Worth Words: A ViT Backbone for Diffusion Models (U-ViT)
diffusion
vit
backbone
transformer
long-skip-connection
latent-diffusion
t2i
class-conditional
Layers
Heads
Params
2026年6月25日
UniDiffuser: One Transformer Fits All Distributions in Multi-Modal Diffusion
unified
multimodal
diffusion
transformer
u-vit
t2i
i2t
joint-generation
latent-diffusion
2026年6月25日
Versatile Diffusion: Text, Images and Variations All in One Diffusion Model
unified
multimodal
diffusion
multi-flow
t2i
image-to-text
image-variation
ldm
clip
2026年6月25日
Video Diffusion Models (VDM)
video
diffusion
3d-unet
factorized-attention
reconstruction-guidance
text-to-video
video-prediction
2026年6月25日
Adobe Firefly(首个图像模型 + Photoshop Generative Fill)
t2i
diffusion
commercial-safe
generative-fill
editing
closed-source
adobe-stock
content-credentials
2026年6月25日
Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation
character-animation
image-to-video
pose-guided
referencenet
diffusion
stable-diffusion
animatediff
human-video
2026年6月25日
AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
video
t2v
motion-module
plug-and-play
diffusion
sd1.5
lora
motionlora
iclr2024
2026年6月25日
Concept Sliders: LoRA Adaptors for Precise Control in Diffusion Models
lora
diffusion
controllable-generation
image-editing
disentanglement
sdxl
concept-control
2026年6月25日
Consistency Models
consistency-models
distillation
few-step
one-step
diffusion
pf-ode
generative-models
icml2023
2026年6月25日
ControlNet: Adding Conditional Control to Text-to-Image Diffusion Models
controllable-generation
diffusion
stable-diffusion
conditional-control
zero-convolution
peft
image-to-image
2026年6月25日
D3PO: Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model
diffusion
rlhf
dpo
preference-alignment
reward-free
mdp
text-to-image
cvpr2024
2026年6月25日
DALL·E 3
t2i
diffusion
latent-diffusion
recaptioning
synthetic-caption
prompt-following
chatgpt
t5
2026年6月25日
DDPO: Training Diffusion Models with Reinforcement Learning
diffusion
rl
rlhf
rlaif
policy-gradient
ppo
mdp
text-to-image
reward-optimization
vlm-feedback
2026年6月25日
Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization
diffusion
dpo
alignment
rlhf
preference-optimization
sdxl
text-to-image
2026年6月25日
DragGAN / DragDiffusion: 基于点的交互式拖拽图像编辑
drag-editing
point-based
interactive-editing
stylegan
diffusion
lora
motion-supervision
point-tracking
dragbench
2026年6月25日
DreamLLM: Synergistic Multimodal Comprehension and Creation
unified
mllm
interleaved
diffusion
score-distillation
image-generation
multimodal
2026年6月25日
Emu Edit: Precise Image Editing via Recognition and Generation Tasks
instruction-editing
image-editing
multi-task
task-embedding
diffusion
benchmark
emu
2026年6月25日
Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning
t2v
video-generation
diffusion
image-conditioning
factorized
latent-diffusion
zero-snr
meta
2026年6月25日
FreeU: Free Lunch in Diffusion U-Net
freeu
training-free
unet
skip-connection
backbone
fourier
frequency
inference-time
diffusion
stable-diffusion
cvpr2024
2026年6月25日
GLIGEN: Open-Set Grounded Text-to-Image Generation
grounded-generation
layout2img
controllable-t2i
diffusion
gated-attention
open-set
bounding-box
2026年6月25日
Ideogram 0.1
text-to-image
typography
text-rendering
closed-source
commercial
imagen-team
diffusion
2026年6月25日
Imagen 2
text-to-image
diffusion
closed-source
google-deepmind
vertex-ai
synthid
inpainting
outpainting
aesthetics-conditioning
recaptioning
2026年6月25日
InstructDiffusion: A Generalist Modeling Interface for Vision Tasks
instruction-editing
unified-vision
diffusion
segmentation
keypoint
generalist
instructpix2pix
2026年6月25日
Latent Consistency Models (LCM / LCM-LoRA)
diffusion
distillation
consistency-model
few-step
lora
acceleration
text-to-image
stable-diffusion
2026年6月25日
Make Pixels Dance: High-Dynamic Video Generation (PixelDance)
video-generation
diffusion
image-conditioned
first-last-frame
latent-diffusion
high-dynamic
long-video
bytedance
2026年6月25日
Marigold: Repurposing Diffusion-Based Image Generators for Monocular Depth Estimation
depth-estimation
diffusion
latent-diffusion
fine-tuning
zero-shot
dense-prediction
generative-prior
affine-invariant
2026年6月25日
MasaCtrl: Tuning-Free Mutual Self-Attention Control for Consistent Image Synthesis and Editing
diffusion
image-editing
self-attention
training-free
non-rigid-editing
stable-diffusion
consistency
attention-control
2026年6月25日
MGIE: Guiding Instruction-based Image Editing via Multimodal Large Language Models
instruction-editing
mllm
llava
diffusion
instructpix2pix
expressive-instruction
apple
2026年6月25日
Midjourney V5 / V5.1 / V5.2
t2i
diffusion
closed-source
commercial
photorealism
outpainting
style-tuner
discord
2026年6月25日
Pix2Pix-Zero: Zero-shot Image-to-Image Translation
diffusion
image-editing
training-free
cross-attention
ddim-inversion
structure-preservation
stable-diffusion
2026年6月25日
Playground v2 (1024px Aesthetic)
t2i
diffusion
sdxl
latent-diffusion
aesthetic
open-weights
mjhq-30k
2026年6月25日
ProlificDreamer: High-Fidelity and Diverse Text-to-3D Generation with Variational Score Distillation
text-to-3d
score-distillation
vsd
nerf
dmtet
diffusion
particle-vi
neurips2023
2026年6月25日
ImageReward & ReFL: Learning and Evaluating Human Preferences for Text-to-Image Generation
t2i
reward-model
rlhf
refl
human-preference
alignment
diffusion
2026年6月25日
Rerender A Video: Zero-Shot Text-Guided Video-to-Video Translation
video-to-video
zero-shot
stylization
diffusion
optical-flow
cross-frame-attention
ebsynth
controlnet
siggraph-asia
2026年6月25日
SDXL-Turbo / Adversarial Diffusion Distillation (ADD)
t2i
distillation
diffusion
gan
few-step
real-time
sdxl
score-distillation
2026年6月25日
Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
text-to-video
diffusion
pixel-diffusion
latent-diffusion
cascade
expert-translation
deepfloyd-if
webvid
vbench
2026年6月25日
Subject-Diffusion: Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning
subject-driven
personalization
tuning-free
multi-subject
diffusion
sdd-dataset
cross-attention-control
siggraph2024
2026年6月25日
Uni-ControlNet: All-in-One Control to Text-to-Image Diffusion Models
controllable-generation
adapter
diffusion
stable-diffusion
multi-condition
composable
spade
clip
neurips2023
2026年6月25日
UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild
controllable-generation
controlnet
diffusion
multi-task
hypernet
moe
c2i
zero-shot
2026年6月25日
VideoCrafter1: Open Diffusion Models for High-Quality Video Generation
video
t2v
i2v
diffusion
lvdm
open-source
unet
2026年6月25日
X-Adapter: Adding Universal Compatibility of Plugins for Upgraded Diffusion Model
adapter
plugin-compatibility
controlnet
lora
sdxl
sd15
training-free-plugin
feature-remapping
diffusion
2026年6月25日
Zero-1-to-3: Zero-shot One Image to 3D Object
novel-view-synthesis
image-to-3d
diffusion
view-conditioned
sjc
objaverse
zero-shot
nerf
2026年6月25日
Zero123++: a Single Image to Consistent Multi-view Diffusion Base Model
3d
multi-view
novel-view-synthesis
diffusion
stable-diffusion
reference-attention
controlnet
objaverse
2026年6月25日
ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
t2i
diffusion
llm-text-encoder
adapter
prompt-following
dpg-bench
resampler
adaln
sd15
sdxl
training-free-unet
可训练参数
2026年6月25日
Runway Gen-3 Alpha
text-to-video
image-to-video
video-generation
closed-source
world-model
diffusion
c2pa
2026年6月25日
Ideogram 2.0
t2i
typography
text-rendering
closed-source
diffusion
product-launch
2026年6月25日
Lumiere: A Space-Time Diffusion Model for Video Generation
text-to-video
diffusion
space-time-unet
t2i-inflation
pixel-diffusion
image-to-video
video-inpainting
2026年6月25日
Midjourney V6 / V6.1
t2i
diffusion
aesthetics
closed-source
text-rendering
midjourney
2026年6月25日
OmniGen: Unified Image Generation
unified-generation
diffusion
rectified-flow
image-editing
subject-driven
controlnet-free
instruction-following
x2i
phi-3
2026年6月25日
Open-Sora Plan / Open-Sora(2024 开源复现 Sora)
video
t2v
i2v
dit
diffusion
sora-reproduction
open-source
wf-vae
skiparse-attention
rectified-flow
2026年6月25日
Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models
t2i
diffusion
dit
deep-fusion
llm-text-encoder
llama3
graphic-design
text-rendering
capsbench
closed-source
2026年6月25日
Seed-TTS: A Family of High-Quality Versatile Speech Generation Models
tts
speech-synthesis
zero-shot
voice-cloning
autoregressive
diffusion
dit
rl
voice-conversion
in-context-learning
2026年6月25日
SeedEdit: Align Image Re-Generation to Image Editing
image-editing
instruction-editing
diffusion
t2i-bootstrap
self-distillation
causal-attention
iterative-alignment
bytedance-seed
2026年6月25日
SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers
diffusion
flow-matching
stochastic-interpolant
dit
imagenet
t2i-backbone
sde
ode
2026年6月25日
Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model
unified
multimodal
diffusion
next-token
transformer
late-fusion
chameleon
vae
2026年6月25日
UltraEdit: Instruction-based Fine-Grained Image Editing at Scale
image-editing
instruction-edit
dataset
region-based
diffusion
sdxl-turbo
prompt-to-prompt
neurips-2024
2026年6月25日
ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling
instruction-edit
subject-reference
flux
inpainting
lora
diffusion
rectified-flow
dit
2026年6月25日
Cosmos World Foundation Model Platform for Physical AI (Cosmos-Predict1)
world-model
physical-ai
video-generation
diffusion
autoregressive
dit
tokenizer
robotics
autonomous-driving
open-weight
2026年6月25日
HunyuanImage 3.0 Technical Report
t2i
unified-multimodal
autoregressive
moe
diffusion
transfusion
chain-of-thought
open-source
rlhf
2026年6月25日
Ideogram 3.0
t2i
typography
text-rendering
style-reference
graphic-design
closed-source
diffusion
product-launch
inpaint
fine-tuning
2026年6月25日
Imagen 4 / Imagen 4 Ultra / Imagen 4 Fast
text-to-image
diffusion
typography
imagen
google-deepmind
closed-source
synthid
2026年6月25日
MAGI-1: Autoregressive Video Generation at Scale
video
autoregressive
diffusion
flow-matching
chunk-wise
world-model
streaming
open-weights
2026年6月25日
SeedEdit 3.0: Fast and High-Quality Generative Image Editing
image-editing
instruction-editing
diffusion
vlm
reward-model
rectified-flow
distillation
bytedance
2026年6月25日
Sora 2
video
audio
text-to-video
world-model
diffusion
synced-audio
cameo
closed-source
2026年6月25日
Veo 3 与 Veo 3.1
video-generation
text-to-video
image-to-video
native-audio
audiovisual
diffusion
closed-model
google-deepmind
flow
2026年6月25日
Reve 2.0
t2i
layout
image-editing
4k
diffusion
llm-planner
qwen
agentic
closed-source
2026年6月25日
图像编辑与可控生成族横向对比:从 ControlNet/InstructPix2Pix 到 Kontext/Step1X/Qwen-Edit
image-editing
controllable-generation
controlnet
instruction-editing
personalization
inversion
attention-control
unified-editing
diffusion
flux
deep-dive
2026年6月25日
统一/Omni 模型族横向对比:Chameleon · Emu · Janus · BAGEL · OmniGen · Show-o · VAR 谱系
unified-multimodal
omni
autoregressive
diffusion
flow-matching
next-scale-prediction
understanding-generation
image-editing
deep-dive
2026年6月25日
模型架构演进:从 U-Net 扩散到统一 omni 骨干(2020–2026)
omni
architecture
diffusion
dit
mmdit
rectified-flow
autoregressive
visual-tokenizer
vae
text-encoder
unified-multimodal
survey