AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
Home
❯
omni
❯
2022
文件夹: omni/2022
此文件夹下有45条笔记。
2026年6月25日
AudioLM: a Language Modeling Approach to Audio Generation
audio
speech
music
neural-codec
semantic-tokens
autoregressive
soundstream
w2v-bert
textless-nlp
2026年6月25日
Blended Latent Diffusion
image-editing
inpainting
local-editing
latent-diffusion
mask-blending
zero-shot
training-free
2026年6月25日
Classifier-Free Diffusion Guidance (CFG)
diffusion
guidance
cfg
conditional-generation
sampling
score-matching
2026年6月25日
CM3: A Causal Masked Multimodal Model of the Internet
autoregressive
decoder-only
causal-masking
multimodal
html
vqvae-gan
zero-shot
infilling
entity-linking
unified
2026年6月25日
CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers
text-to-video
autoregressive
transformer
vqvae
cogview2
open-source
2026年6月25日
CogView2: Faster and Better Text-to-Image Generation via Hierarchical Transformers
autoregressive
hierarchical-transformer
bilingual
vqvae
super-resolution
masked-generation
lopar
coglm
2026年6月25日
DALL·E 2 / unCLIP(Hierarchical Text-Conditional Image Generation with CLIP Latents)
t2i
diffusion
unclip
clip
prior-decoder
guidance
openai
2026年6月25日
DiffEdit: Diffusion-based Semantic Image Editing with Mask Guidance
diffusion
image-editing
training-free
mask-guidance
ddim-inversion
semantic-editing
stable-diffusion
2026年6月25日
Scalable Diffusion Models with Transformers (DiT)
dit
diffusion-transformer
latent-diffusion
adaln-zero
scaling
imagenet
backbone
vit
2026年6月25日
DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps
diffusion
ode-solver
fast-sampling
exponential-integrator
training-free
neurips2022
2026年6月25日
DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation
personalization
subject-driven
finetuning
diffusion
imagen
stable-diffusion
prior-preservation
2026年6月25日
DreamFusion: Text-to-3D using 2D Diffusion
text-to-3d
sds
score-distillation
nerf
diffusion-prior
imagen
zero-shot-3d
2026年6月25日
eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers
diffusion
text-to-image
ensemble-of-experts
cascaded-diffusion
t5
clip
paint-with-words
edm
nvidia
2026年6月25日
Elucidating the Design Space of Diffusion-Based Generative Models (EDM)
diffusion
ode-sampler
heun
preconditioning
noise-schedule
score-matching
fid
cifar10
imagenet64
neurips2022
2026年6月25日
ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts
text-to-image
diffusion
latent-diffusion
mixture-of-experts
knowledge-enhanced
chinese
baidu
cvpr2023
params
图
2026年6月25日
Flow Matching for Generative Modeling
flow-matching
rectified-flow
continuous-normalizing-flow
optimal-transport
ode
diffusion
generative-model
2026年6月25日
GET3D: A Generative Model of High Quality 3D Textured Shapes Learned from Images
3d
gan
textured-mesh
dmtet
differentiable-rendering
stylegan
triplane
nvidia
2026年6月25日
Imagen Video: High Definition Video Generation with Diffusion Models
text-to-video
cascaded-diffusion
v-prediction
classifier-free-guidance
progressive-distillation
video-diffusion
u-net
2026年6月25日
Imagen: Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
t2i
diffusion
cascaded-diffusion
t5
classifier-free-guidance
drawbench
pixel-space
2026年6月25日
Imagic: Text-Based Real Image Editing with Diffusion Models
image-editing
diffusion
text-guided
non-rigid-edit
embedding-interpolation
fine-tuning
imagen
stable-diffusion
tedbench
2026年6月25日
InstructPix2Pix: Learning to Follow Image Editing Instructions
diffusion
image-editing
instruction-following
synthetic-data
gpt-3
stable-diffusion
prompt-to-prompt
classifier-free-guidance
2026年6月25日
Magic3D: High-Resolution Text-to-3D Content Creation
text-to-3d
sds
nerf
dmtet
mesh
instant-ngp
latent-diffusion
coarse-to-fine
2026年6月25日
MAGVIT: Masked Generative Video Transformer
video-generation
video-tokenizer
3d-vq
masked-token-modeling
maskgit
non-autoregressive
cvpr2023
2026年6月25日
Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors
t2i
autoregressive
vqgan
scene-control
segmentation
classifier-free-guidance
human-prior
meta
2026年6月25日
Make-A-Video: Text-to-Video Generation without Text-Video Data
text-to-video
diffusion
t2i-prior
pseudo-3d
spatiotemporal
unsupervised-video
cascaded-diffusion
2026年6月25日
MaskGIT: Masked Generative Image Transformer
masked-generation
parallel-decoding
vq
transformer
image-synthesis
non-autoregressive
params
steps
2026年6月25日
Midjourney (公测 V1–V4)
t2i
closed-source
diffusion
discord
aesthetic
midjourney
niji
commercial
2026年6月25日
Null-text Inversion for Editing Real Images using Guided Diffusion Models
diffusion
image-editing
inversion
classifier-free-guidance
ddim
prompt-to-prompt
stable-diffusion
training-free
2026年6月25日
Parti: Scaling Autoregressive Models for Content-Rich Text-to-Image Generation
autoregressive
text-to-image
vit-vqgan
seq2seq
scaling
classifier-free-guidance
tpu
partiprompts
2026年6月25日
Phenaki: Variable Length Video Generation from Open Domain Textual Descriptions
text-to-video
video-generation
c-vivit
maskgit
masked-transformer
vq
story-generation
autoregressive
2026年6月25日
Point·E: A System for Generating 3D Point Clouds from Complex Prompts
text-to-3d
point-cloud
diffusion
transformer
glide
clip
image-to-3d
2026年6月25日
Prompt-to-Prompt Image Editing with Cross Attention Control
diffusion
image-editing
cross-attention
training-free
text-to-image
attention-injection
imagen
stable-diffusion
2026年6月25日
RAPHAEL: Text-to-Image Generation via Large Mixture of Diffusion Paths
t2i
diffusion
mixture-of-experts
space-moe
time-moe
latent-diffusion
edge-supervised
coco-fid
2026年6月25日
Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow
rectified-flow
reflow
flow-matching
ode
one-step-generation
distillation
optimal-transport
generative-modeling
2026年6月25日
RePaint: Inpainting using Denoising Diffusion Probabilistic Models
inpainting
diffusion
ddpm
training-free
resampling
image-editing
celeba-hq
imagenet
2026年6月25日
Stable Diffusion v1 (CompVis / Stability AI / Runway)
latent-diffusion
text-to-image
open-weights
ldm
unet
clip
laion
2026年6月25日
Stable Diffusion 2.0 / 2.1
latent-diffusion
text-to-image
open-weights
ldm
unet
openclip
v-prediction
upscaler
depth2img
laion
2026年6月25日
Stable Diffusion Inpainting / img2img (SD v1.5 编辑权重)
stable-diffusion
inpainting
img2img
sdedit
latent-diffusion
editing
open-weights
runway
2026年6月25日
StyleGAN-XL: Scaling StyleGAN to Large Diverse Datasets
gan
stylegan
projected-gan
imagenet
progressive-growing
classifier-guidance
image-synthesis
2026年6月25日
An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion
personalization
textual-inversion
embedding-optimization
latent-diffusion
subject-driven
pseudo-word
2026年6月25日
Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation
video
t2v
video-editing
one-shot
diffusion
fine-tuning
stable-diffusion
ddim-inversion
attention-inflation
2026年6月25日
All are Worth Words: A ViT Backbone for Diffusion Models (U-ViT)
diffusion
vit
backbone
transformer
long-skip-connection
latent-diffusion
t2i
class-conditional
Layers
Heads
Params
2026年6月25日
UniDiffuser: One Transformer Fits All Distributions in Multi-Modal Diffusion
unified
multimodal
diffusion
transformer
u-vit
t2i
i2t
joint-generation
latent-diffusion
2026年6月25日
Versatile Diffusion: Text, Images and Variations All in One Diffusion Model
unified
multimodal
diffusion
multi-flow
t2i
image-to-text
image-variation
ldm
clip
2026年6月25日
Video Diffusion Models (VDM)
video
diffusion
3d-unet
factorized-attention
reconstruction-guidance
text-to-video
video-prediction