AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: image-generation
此标签下有18条笔记。
2026年7月16日
Generative Image as Action Models
manipulation
diffusion-model
controlnet
stable-diffusion
action-representation
act
behavior-cloning
rlbench
visuomotor
image-generation
2026年6月25日
Denoising Diffusion Probabilistic Models (DDPM)
diffusion
ddpm
score-matching
image-generation
generative-model
unet
cifar10
lsun
2026年6月25日
Improved Denoising Diffusion Probabilistic Models (Improved DDPM / IDDPM)
diffusion
ddpm
learned-variance
cosine-schedule
fast-sampling
log-likelihood
unet
image-generation
2026年6月25日
Vector-quantized Image Modeling with Improved VQGAN (ViT-VQGAN)
tokenizer
vqgan
vit
vector-quantization
autoregressive
codebook
image-generation
representation-learning
2026年6月25日
DreamLLM: Synergistic Multimodal Comprehension and Creation
unified
mllm
interleaved
diffusion
score-distillation
image-generation
multimodal
2026年6月25日
GILL: Generating Images with Multimodal Language Models
unified
frozen-llm
interleaved
retrieval
image-generation
mapping-network
opt
stable-diffusion
neurips-2023
2026年6月25日
MAGVIT-v2 — Language Model Beats Diffusion: Tokenizer is Key to Visual Generation
tokenizer
lfq
lookup-free-quantization
video-generation
image-generation
masked-lm
vq-vae
discrete-tokens
2026年6月25日
Aurora (Grok Image Generation)
autoregressive
mixture-of-experts
next-token
interleaved
multimodal
image-generation
image-editing
photorealism
closed-source
grok
2026年6月25日
GPT-4o 原生图像生成 (4o image generation / gpt-image-1)
omni
autoregressive
native-image
image-generation
text-rendering
image-editing
multimodal
closed-source
2026年6月25日
Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction (VAR)
autoregressive
next-scale-prediction
image-generation
scaling-laws
vqvae
imagenet
neurips-best-paper
参数
Step
2026年6月25日
VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation
unified
autoregressive
next-token
visual-tokenizer
rq-vae
clip-alignment
vlm
image-generation
video-generation
2026年6月25日
BLIP3-o: A Family of Fully Open Unified Multimodal Models
unified-multimodal
clip-feature-diffusion
flow-matching
diffusion-transformer
sequential-training
fully-open
image-generation
image-understanding
2026年6月25日
Fractal Generative Models (FractalGen)
fractal
autoregressive
mar
pixel-by-pixel
image-generation
imagenet
divide-and-conquer
likelihood
params
2026年6月25日
Gemini 2.5 Flash Image(Nano Banana)
gemini
image-generation
image-editing
character-consistency
multi-image-fusion
conversational-editing
world-knowledge
synthid
closed-source
native-multimodal
2026年6月25日
Gemini 3 Pro Image(Nano Banana Pro)
gemini
image-generation
image-editing
text-rendering
reasoning
search-grounding
multi-reference
4k
synthid
closed-source
native-multimodal
2026年6月25日
Ming-Omni / Ming-Lite-Omni: A Unified Multimodal Model for Perception and Generation
omni
moe
unified
any-to-any
speech
image-generation
video
gpt-4o-class
open-source
2026年6月25日
X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again
unified
autoregressive
discrete-token
rl
grpo
text-rendering
image-generation
image-understanding
tokenizer
siglip
flux
2026年6月25日
Qwen-Image-VAE-2.0 Technical Report
vae
high-compression
latent-diffusion
tokenizer
text-rendering
semantic-alignment
dit
image-generation