AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: latent-diffusion
此标签下有51条笔记。
2026年7月16日
Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving (Drive-WM)
world-model
autonomous-driving
multiview-video
latent-diffusion
video-generation
end-to-end-planning
nuscenes
tree-rollout
2026年7月16日
Genie 2: A Large-Scale Foundation World Model
world-model
foundation-world-model
latent-diffusion
autoregressive
action-conditioning
playable
embodied-agents
imagen-3
sima
game-wm
2026年7月16日
GenAD: Generalized Predictive Model for Autonomous Driving
world-model
autonomous-driving
video-prediction
latent-diffusion
sdxl
opendv
planning
cvpr2024
2026年7月16日
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
tokenizer
visual-tokenization
image-video-joint
vqvae
vae
window-attention
causal-attention
progressive-training
autoregressive-transformer
latent-diffusion
2026年7月16日
GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving
world-model
autonomous-driving
latent-diffusion
flow-matching
multi-camera
video-tokenizer
controllable-generation
safety-critical
synthetic-data
2026年7月16日
WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving
world-model
autonomous-driving
gaussian-splatting
feed-forward-reconstruction
latent-diffusion
controlnet
novel-view-synthesis
4d-scene-generation
rectified-flow
iclr2026
2026年6月25日
High-Resolution Image Synthesis with Latent Diffusion Models (LDM)
latent-diffusion
ldm
vae
u-net
cross-attention
text-to-image
stable-diffusion
two-stage
2026年6月25日
Blended Latent Diffusion
image-editing
inpainting
local-editing
latent-diffusion
mask-blending
zero-shot
training-free
2026年6月25日
Scalable Diffusion Models with Transformers (DiT)
dit
diffusion-transformer
latent-diffusion
adaln-zero
scaling
imagenet
backbone
vit
2026年6月25日
ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts
text-to-image
diffusion
latent-diffusion
mixture-of-experts
knowledge-enhanced
chinese
baidu
cvpr2023
params
图
2026年6月25日
Magic3D: High-Resolution Text-to-3D Content Creation
text-to-3d
sds
nerf
dmtet
mesh
instant-ngp
latent-diffusion
coarse-to-fine
2026年6月25日
RAPHAEL: Text-to-Image Generation via Large Mixture of Diffusion Paths
t2i
diffusion
mixture-of-experts
space-moe
time-moe
latent-diffusion
edge-supervised
coco-fid
2026年6月25日
Stable Diffusion v1 (CompVis / Stability AI / Runway)
latent-diffusion
text-to-image
open-weights
ldm
unet
clip
laion
2026年6月25日
Stable Diffusion 2.0 / 2.1
latent-diffusion
text-to-image
open-weights
ldm
unet
openclip
v-prediction
upscaler
depth2img
laion
2026年6月25日
Stable Diffusion Inpainting / img2img (SD v1.5 编辑权重)
stable-diffusion
inpainting
img2img
sdedit
latent-diffusion
editing
open-weights
runway
2026年6月25日
An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion
personalization
textual-inversion
embedding-optimization
latent-diffusion
subject-driven
pseudo-word
2026年6月25日
All are Worth Words: A ViT Backbone for Diffusion Models (U-ViT)
diffusion
vit
backbone
transformer
long-skip-connection
latent-diffusion
t2i
class-conditional
Layers
Heads
Params
2026年6月25日
UniDiffuser: One Transformer Fits All Distributions in Multi-Modal Diffusion
unified
multimodal
diffusion
transformer
u-vit
t2i
i2t
joint-generation
latent-diffusion
2026年6月25日
Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models (Video LDM)
video-generation
latent-diffusion
text-to-video
temporal-layers
super-resolution
driving-simulation
cvpr2023
2026年6月25日
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
audio
text-to-audio
text-to-music
text-to-speech
latent-diffusion
self-supervised
audiomae
gpt-2
unified
2026年6月25日
CommonCanvas: An Open Diffusion Model Trained with Creative-Commons Images
t2i
latent-diffusion
creative-commons
synthetic-caption
copyright
blip-2
stable-diffusion
data-efficient
2026年6月25日
DALL·E 3
t2i
diffusion
latent-diffusion
recaptioning
synthetic-caption
prompt-following
chatgpt
t5
2026年6月25日
Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack
text-to-image
latent-diffusion
quality-tuning
aesthetic-alignment
sft
meta
2026年6月25日
Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning
t2v
video-generation
diffusion
image-conditioning
factorized
latent-diffusion
zero-snr
meta
2026年6月25日
HyperHuman: Hyper-Realistic Human Generation with Latent Structural Diffusion
human-generation
latent-diffusion
structural-diffusion
controllable-generation
depth-normal
joint-denoising
pose-conditioned
snap
iclr2024
2026年6月25日
Kandinsky 2.x (Image Prior + Latent Diffusion)
t2i
unclip
image-prior
latent-diffusion
movq
multilingual
open-source
clip
2026年6月25日
LaVie: High-Quality Video Generation with Cascaded Latent Diffusion Models
t2v
video-diffusion
latent-diffusion
cascaded
temporal-attention
rope
joint-image-video
vimeo25m
open-source
2026年6月25日
Make Pixels Dance: High-Dynamic Video Generation (PixelDance)
video-generation
diffusion
image-conditioned
first-last-frame
latent-diffusion
high-dynamic
long-video
bytedance
2026年6月25日
Marigold: Repurposing Diffusion-Based Image Generators for Monocular Depth Estimation
depth-estimation
diffusion
latent-diffusion
fine-tuning
zero-shot
dense-prediction
generative-prior
affine-invariant
2026年6月25日
ModelScopeT2V(ModelScope Text-to-Video Technical Report)
text-to-video
latent-diffusion
spatio-temporal
unet3d
open-source
webvid
vqgan
2026年6月25日
Playground v2 (1024px Aesthetic)
t2i
diffusion
sdxl
latent-diffusion
aesthetic
open-weights
mjhq-30k
2026年6月25日
Gen-1: Structure and Content-Guided Video Synthesis with Diffusion Models
video-editing
video-to-video
latent-diffusion
depth-conditioning
temporal-layers
structure-content
clip
runway
2026年6月25日
SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
latent-diffusion
text-to-image
unet
dual-text-encoder
refiner
micro-conditioning
multi-aspect
open-weights
2026年6月25日
Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
text-to-video
diffusion
pixel-diffusion
latent-diffusion
cascade
expert-translation
deepfloyd-if
webvid
vbench
2026年6月25日
Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
video
image-to-video
text-to-video
latent-diffusion
data-curation
open-source
edm
multi-view
Clips
2026年6月25日
W.A.L.T: Photorealistic Video Generation with Diffusion Models
video-diffusion
latent-diffusion
transformer
dit
window-attention
causal-3d-vae
text-to-video
magvit-v2
2026年6月25日
Würstchen: An Efficient Architecture for Large-Scale Text-to-Image Diffusion Models
t2i
latent-diffusion
cascade
compression
vqgan
efficient-training
convnext
stable-cascade
2026年6月25日
CogView3: Finer and Faster Text-to-Image Generation via Relay Diffusion
t2i
relay-diffusion
cascaded-diffusion
latent-diffusion
distillation
recaption
unet
dit
cogview
2026年6月25日
DALL·E 3 系列产品化(ChatGPT 集成 / API)
t2i
latent-diffusion
recaptioning
prompt-following
chatgpt
closed-source
openai
safety
system-card
2026年6月25日
Imagen 3
t2i
latent-diffusion
google
gemini
closed-source
synthetic-caption
human-eval
synthid
2026年6月25日
Kolors(可图): Effective Training of Diffusion Model for Photorealistic Text-to-Image Synthesis
t2i
latent-diffusion
unet
sdxl
chatglm
bilingual
chinese-text-rendering
recaption
open-source
2026年6月25日
LTX-Video: Realtime Video Latent Diffusion
video
t2v
i2v
dit
latent-diffusion
rectified-flow
video-vae
realtime
open-source
2026年6月25日
Stable Audio: Fast Timing-Conditioned Latent Audio Diffusion
audio
music-generation
latent-diffusion
text-to-audio
timing-conditioning
stereo
vae
clap
2026年6月25日
Stable Cascade (Würstchen v3)
text-to-image
latent-diffusion
cascade
wuerstchen
efficient
convnext
vqgan
semantic-compressor
open-weights
2026年6月25日
Veo 2
video-generation
text-to-video
image-to-video
closed-source
cinematography
latent-diffusion
synthid
4k
2026年6月25日
Imagen 4 Fast / Imagen 4(Ultra) GA 与 GPT Image 1 mini
t2i
closed-source
api
cost-tier
imagen-4
gpt-image-1
autoregressive
latent-diffusion
synthid
c2pa
2026年6月25日
Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
video-generation
text-to-video
image-to-video
text-to-image
image-editing
latent-diffusion
flow-matching
dit
crossdit
nabla
sparse-attention
open-source
russian
2026年6月25日
Diffusion Transformers with Representation Autoencoders (RAE)
diffusion-transformer
representation-encoder
dinov2
autoencoder
latent-diffusion
imagenet
flow-matching
dit
2026年6月25日
ERNIE-Image Technical Report
text-to-image
dit
single-stream
latent-diffusion
flow-matching
dpo
distillation
dmd
text-rendering
open-weights
chinese
2026年6月25日
Qwen-Image-VAE-2.0 Technical Report
vae
high-compression
latent-diffusion
tokenizer
text-rendering
semantic-alignment
dit
image-generation
2026年6月25日
模型族横向对比:Stable Diffusion → SDXL → SD3 → FLUX 谱系
deep-dive
lineage
stable-diffusion
sdxl
sd3
flux
latent-diffusion
mmdit
rectified-flow
t2i
open-weights