AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
Home
❯
omni
❯
2023
文件夹: omni/2023
此文件夹下有91条笔记。
2026年6月25日
3D Gaussian Splatting for Real-Time Radiance Field Rendering
3dgs
gaussian-splatting
radiance-field
novel-view-synthesis
nerf
point-based-rendering
rasterization
siggraph-2023
2026年6月25日
Adobe Firefly(首个图像模型 + Photoshop Generative Fill)
t2i
diffusion
commercial-safe
generative-fill
editing
closed-source
adobe-stock
content-credentials
2026年6月25日
Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models (Video LDM)
video-generation
latent-diffusion
text-to-video
temporal-layers
super-resolution
driving-simulation
cvpr2023
2026年6月25日
Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation
character-animation
image-to-video
pose-guided
referencenet
diffusion
stable-diffusion
animatediff
human-video
2026年6月25日
AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
video
t2v
motion-module
plug-and-play
diffusion
sd1.5
lora
motionlora
iclr2024
2026年6月25日
AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
any-modality
multimodal-llm
llama-2
perceiver-resampler
frozen-llm
audio
video
imu
instruction-tuning
understanding
2026年6月25日
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
audio
text-to-audio
text-to-music
text-to-speech
latent-diffusion
self-supervised
audiomae
gpt-2
unified
2026年6月25日
CM3Leon: Scaling Autoregressive Multi-Modal Models (Pretraining and Instruction Tuning)
autoregressive
token-based
retrieval-augmented
text-to-image
image-to-text
instruction-tuning
contrastive-decoding
cm3
chameleon-lineage
2026年6月25日
CommonCanvas: An Open Diffusion Model Trained with Creative-Commons Images
t2i
latent-diffusion
creative-commons
synthetic-caption
copyright
blip-2
stable-diffusion
data-efficient
2026年6月25日
Concept Sliders: LoRA Adaptors for Precise Control in Diffusion Models
lora
diffusion
controllable-generation
image-editing
disentanglement
sdxl
concept-control
2026年6月25日
Consistency Models
consistency-models
distillation
few-step
one-step
diffusion
pf-ode
generative-models
icml2023
2026年6月25日
ControlNet: Adding Conditional Control to Text-to-Image Diffusion Models
controllable-generation
diffusion
stable-diffusion
conditional-control
zero-convolution
peft
image-to-image
2026年6月25日
D3PO: Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model
diffusion
rlhf
dpo
preference-alignment
reward-free
mdp
text-to-image
cvpr2024
2026年6月25日
DALL·E 3
t2i
diffusion
latent-diffusion
recaptioning
synthetic-caption
prompt-following
chatgpt
t5
2026年6月25日
DDPO: Training Diffusion Models with Reinforcement Learning
diffusion
rl
rlhf
rlaif
policy-gradient
ppo
mdp
text-to-image
reward-optimization
vlm-feedback
2026年6月25日
DeepFloyd IF
text-to-image
cascaded-diffusion
pixel-diffusion
t5-xxl
imagen-style
open-source
text-rendering
super-resolution
2026年6月25日
Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization
diffusion
dpo
alignment
rlhf
preference-optimization
sdxl
text-to-image
2026年6月25日
One-step Diffusion with Distribution Matching Distillation (DMD)
diffusion-distillation
one-step
distribution-matching
vsd
score-distillation
text-to-image
acceleration
2026年6月25日
DragGAN / DragDiffusion: 基于点的交互式拖拽图像编辑
drag-editing
point-based
interactive-editing
stylegan
diffusion
lora
motion-supervision
point-tracking
dragbench
2026年6月25日
DreamLLM: Synergistic Multimodal Comprehension and Creation
unified
mllm
interleaved
diffusion
score-distillation
image-generation
multimodal
2026年6月25日
Emu Edit: Precise Image Editing via Recognition and Generation Tasks
instruction-editing
image-editing
multi-task
task-embedding
diffusion
benchmark
emu
2026年6月25日
Emu: Generative Pretraining in Multimodality
unified
autoregressive
lmm
multimodal-generation
interleaved
video-text
eva-clip
llama
stable-diffusion
in-context-learning
2026年6月25日
Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack
text-to-image
latent-diffusion
quality-tuning
aesthetic-alignment
sft
meta
2026年6月25日
Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning
t2v
video-generation
diffusion
image-conditioning
factorized
latent-diffusion
zero-snr
meta
2026年6月25日
FreeU: Free Lunch in Diffusion U-Net
freeu
training-free
unet
skip-connection
backbone
fourier
frequency
inference-time
diffusion
stable-diffusion
cvpr2024
2026年6月25日
GenTron: Diffusion Transformers for Image and Video Generation
dit
diffusion-transformer
text-to-image
text-to-video
scaling
motion-free-guidance
t2i-compbench
Param
2026年6月25日
GILL: Generating Images with Multimodal Language Models
unified
frozen-llm
interleaved
retrieval
image-generation
mapping-network
opt
stable-diffusion
neurips-2023
2026年6月25日
GLIGEN: Open-Set Grounded Text-to-Image Generation
grounded-generation
layout2img
controllable-t2i
diffusion
gated-attention
open-set
bounding-box
2026年6月25日
Human Preference Score v2 (HPS v2): A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis
t2i
human-preference
reward-model
benchmark
clip
rlhf
evaluation
dataset
2026年6月25日
HyperDreamBooth: HyperNetworks for Fast Personalization of Text-to-Image Models
personalization
hypernetwork
lora
dreambooth
face
fine-tuning
stable-diffusion
2026年6月25日
HyperHuman: Hyper-Realistic Human Generation with Latent Structural Diffusion
human-generation
latent-diffusion
structural-diffusion
controllable-generation
depth-normal
joint-denoising
pose-conditioned
snap
iclr2024
2026年6月25日
I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models
image-to-video
video-diffusion
cascaded-diffusion
vldm
ldm
sdedit
open-source
2026年6月25日
Ideogram 0.1
text-to-image
typography
text-rendering
closed-source
commercial
imagen-team
diffusion
2026年6月25日
Imagen 2
text-to-image
diffusion
closed-source
google-deepmind
vertex-ai
synthid
inpainting
outpainting
aesthetics-conditioning
recaptioning
2026年6月25日
InstaFlow: One Step is Enough for High-Quality Diffusion-Based Text-to-Image Generation
t2i
rectified-flow
reflow
distillation
one-step
flow-matching
acceleration
stable-diffusion
2026年6月25日
InstantBooth: Personalized Text-to-Image Generation without Test-Time Finetuning
personalization
subject-driven
adapter
encoder-based
dreambooth
identity-preservation
tuning-free
2026年6月25日
InstructDiffusion: A Generalist Modeling Interface for Vision Tasks
instruction-editing
unified-vision
diffusion
segmentation
keypoint
generalist
instructpix2pix
2026年6月25日
IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models
image-prompt
adapter
cross-attention
clip
ip-adapter
faceid
controlnet
stable-diffusion
2026年6月25日
Kandinsky 2.x (Image Prior + Latent Diffusion)
t2i
unclip
image-prior
latent-diffusion
movq
multilingual
open-source
clip
2026年6月25日
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
mllm
subject-driven
personalization
zero-shot
image-as-foreign-language
score-distillation
alignernet
kosmos
stable-diffusion
2026年6月25日
Latent Consistency Models (LCM / LCM-LoRA)
diffusion
distillation
consistency-model
few-step
lora
acceleration
text-to-image
stable-diffusion
2026年6月25日
LaVie: High-Quality Video Generation with Cascaded Latent Diffusion Models
t2v
video-diffusion
latent-diffusion
cascaded
temporal-attention
rope
joint-image-video
vimeo25m
open-source
2026年6月25日
LCM-LoRA: A Universal Stable-Diffusion Acceleration Module
distillation
lcm
lora
consistency-model
few-step
acceleration
stable-diffusion
sdxl
pf-ode
task-arithmetic
2026年6月25日
LEDITS++: Limitless Image Editing using Text-to-Image Models
image-editing
real-image-editing
diffusion-inversion
training-free
semantic-guidance
dpm-solver
multi-edit
implicit-masking
2026年6月25日
LRM: Large Reconstruction Model for Single Image to 3D
3d-reconstruction
single-image-to-3d
triplane
nerf
transformer
feed-forward
objaverse
2026年6月25日
MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model
human-animation
pose-driven
densepose
appearance-encoder
temporal-attention
video-diffusion
controlnet
sd15
2026年6月25日
MagicBrush: A Manually Annotated Dataset for Instruction-Guided Image Editing
image-editing
instruction-guided
dataset
benchmark
multi-turn
dall-e-2
instructpix2pix
neurips-2023
2026年6月25日
MAGVIT-v2 — Language Model Beats Diffusion: Tokenizer is Key to Visual Generation
tokenizer
lfq
lookup-free-quantization
video-generation
image-generation
masked-lm
vq-vae
discrete-tokens
2026年6月25日
Make Pixels Dance: High-Dynamic Video Generation (PixelDance)
video-generation
diffusion
image-conditioned
first-last-frame
latent-diffusion
high-dynamic
long-video
bytedance
2026年6月25日
Marigold: Repurposing Diffusion-Based Image Generators for Monocular Depth Estimation
depth-estimation
diffusion
latent-diffusion
fine-tuning
zero-shot
dense-prediction
generative-prior
affine-invariant
2026年6月25日
MasaCtrl: Tuning-Free Mutual Self-Attention Control for Consistent Image Synthesis and Editing
diffusion
image-editing
self-attention
training-free
non-rigid-editing
stable-diffusion
consistency
attention-control
2026年6月25日
MGIE: Guiding Instruction-based Image Editing via Multimodal Large Language Models
instruction-editing
mllm
llava
diffusion
instructpix2pix
expressive-instruction
apple
2026年6月25日
Midjourney V5 / V5.1 / V5.2
t2i
diffusion
closed-source
commercial
photorealism
outpainting
style-tuner
discord
2026年6月25日
ModelScopeT2V(ModelScope Text-to-Video Technical Report)
text-to-video
latent-diffusion
spatio-temporal
unet3d
open-source
webvid
vqgan
2026年6月25日
Muse: Text-To-Image Generation via Masked Generative Transformers
t2i
masked-generative
transformer
vqgan
parallel-decoding
maskgit
t5
discrete-tokens
2026年6月25日
MusicGen / AudioCraft: Simple and Controllable Music Generation
music-generation
text-to-music
audio-lm
encodec
rvq
codebook-interleaving
autoregressive
transformer
open-source
2026年6月25日
MusicLM: Generating Music From Text
text-to-music
audio-generation
discrete-tokens
autoregressive
audiolm
soundstream
mulan
hierarchical
2026年6月25日
MVDream: Multi-view Diffusion for 3D Generation
text-to-3d
multi-view-diffusion
sds
score-distillation
janus-problem
nerf
dreambooth3d
objaverse
2026年6月25日
NExT-GPT: Any-to-Any Multimodal LLM
any-to-any
mm-llm
omni
diffusion-decoder
imagebind
vicuna
instruction-tuning
mosit
projection-layer
2026年6月25日
One-2-3-45: Any Single Image to 3D Mesh in 45 Seconds without Per-Shape Optimization
image-to-3d
single-image-reconstruction
zero123
sdf
sparseneus
feed-forward
neurips-2023
multi-view
2026年6月25日
Controlling Text-to-Image Diffusion by Orthogonal Finetuning (OFT / COFT)
finetuning
peft
subject-driven
controllable-generation
dreambooth
controlnet
orthogonal
hyperspherical-energy
stable-diffusion
2026年6月25日
Pika 1.0
video
text-to-video
image-to-video
consumer-product
closed-source
generative-video
2026年6月25日
Pix2Pix-Zero: Zero-shot Image-to-Image Translation
diffusion
image-editing
training-free
cross-attention
ddim-inversion
structure-preservation
stable-diffusion
2026年6月25日
PixArt-α: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
t2i
dit
diffusion-transformer
cross-attention
t5
low-cost-training
re-captioning
open-source
Params
Images
2026年6月25日
Playground v2 (1024px Aesthetic)
t2i
diffusion
sdxl
latent-diffusion
aesthetic
open-weights
mjhq-30k
2026年6月25日
ProlificDreamer: High-Fidelity and Diverse Text-to-3D Generation with Variational Score Distillation
text-to-3d
score-distillation
vsd
nerf
dmtet
diffusion
particle-vi
neurips2023
2026年6月25日
ImageReward & ReFL: Learning and Evaluating Human Preferences for Text-to-Image Generation
t2i
reward-model
rlhf
refl
human-preference
alignment
diffusion
2026年6月25日
Rerender A Video: Zero-Shot Text-Guided Video-to-Video Translation
video-to-video
zero-shot
stylization
diffusion
optical-flow
cross-frame-attention
ebsynth
controlnet
siggraph-asia
2026年6月25日
Gen-1: Structure and Content-Guided Video Synthesis with Diffusion Models
video-editing
video-to-video
latent-diffusion
depth-conditioning
temporal-layers
structure-content
clip
runway
2026年6月25日
SDXL-Turbo / Adversarial Diffusion Distillation (ADD)
t2i
distillation
diffusion
gan
few-step
real-time
sdxl
score-distillation
2026年6月25日
SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
latent-diffusion
text-to-image
unet
dual-text-encoder
refiner
micro-conditioning
multi-aspect
open-weights
2026年6月25日
SEED: Planting a SEED of Vision in Large Language Model
unified
visual-tokenizer
discrete-tokens
vq
multimodal-llm
autoregressive
q-former
image-to-text
text-to-image
2026年6月25日
Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
text-to-video
diffusion
pixel-diffusion
latent-diffusion
cascade
expert-translation
deepfloyd-if
webvid
vbench
2026年6月25日
Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
video
image-to-video
text-to-video
latent-diffusion
data-curation
open-source
edm
multi-view
Clips
2026年6月25日
StyleDrop: Text-to-Image Generation in Any Style
style-tuning
personalization
few-shot
adapter
peft
muse
masked-transformer
t2i
feedback
2026年6月25日
StyleGAN-T: Unlocking the Power of GANs for Fast Large-Scale Text-to-Image Synthesis
gan
stylegan
text-to-image
fast-inference
clip
dino
single-step
2026年6月25日
Subject-Diffusion: Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning
subject-driven
personalization
tuning-free
multi-subject
diffusion
sdd-dataset
cross-attention-control
siggraph2024
2026年6月25日
SyncDreamer: Generating Multiview-consistent Images from a Single-view Image
3d
multiview-diffusion
single-view-reconstruction
novel-view-synthesis
zero123
image-to-3d
Points
2026年6月25日
T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models
controllable-generation
adapter
plug-and-play
stable-diffusion
conditional-control
sketch
depth
segmentation
pose
color
sdxl
2026年6月25日
TokenFlow: Consistent Diffusion Features for Consistent Video Editing
video-editing
diffusion-features
zero-shot
training-free
temporal-consistency
stable-diffusion
plug-and-play
iclr2024
2026年6月25日
Uni-ControlNet: All-in-One Control to Text-to-Image Diffusion Models
controllable-generation
adapter
diffusion
stable-diffusion
multi-condition
composable
spade
clip
neurips2023
2026年6月25日
UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild
controllable-generation
controlnet
diffusion
multi-task
hypernet
moe
c2i
zero-shot
2026年6月25日
VALL-E: Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers
tts
zero-shot
voice-cloning
neural-codec
audio-lm
in-context-learning
encodec
autoregressive
2026年6月25日
VideoCrafter1: Open Diffusion Models for High-Quality Video Generation
video
t2v
i2v
diffusion
lvdm
open-source
unet
2026年6月25日
VideoPoet: A Large Language Model for Zero-Shot Video Generation
video
autoregressive
llm
discrete-token
multimodal
text-to-video
image-to-video
audio
magvit-v2
zero-shot
2026年6月25日
W.A.L.T: Photorealistic Video Generation with Diffusion Models
video-diffusion
latent-diffusion
transformer
dit
window-attention
causal-3d-vae
text-to-video
magvit-v2
2026年6月25日
Wonder3D: Single Image to 3D using Cross-Domain Diffusion
image-to-3d
multi-view-diffusion
cross-domain
normal-maps
sdf
stable-diffusion
objaverse
2026年6月25日
Würstchen: An Efficient Architecture for Large-Scale Text-to-Image Diffusion Models
t2i
latent-diffusion
cascade
compression
vqgan
efficient-training
convnext
stable-cascade
2026年6月25日
X-Adapter: Adding Universal Compatibility of Plugins for Upgraded Diffusion Model
adapter
plugin-compatibility
controlnet
lora
sdxl
sd15
training-free-plugin
feature-remapping
diffusion
2026年6月25日
Zero-1-to-3: Zero-shot One Image to 3D Object
novel-view-synthesis
image-to-3d
diffusion
view-conditioned
sjc
objaverse
zero-shot
nerf
2026年6月25日
Zero123++: a Single Image to Consistent Multi-view Diffusion Base Model
3d
multi-view
novel-view-synthesis
diffusion
stable-diffusion
reference-attention
controlnet
objaverse