AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: image-editing
此标签下有57条笔记。
2026年7月16日
Muse Image(含 Muse Video 预览)
agentic-image-gen
tool-use
self-refinement
test-time-compute
rl
meta-ai
watermark
image-editing
multi-reference
text-to-video
closed-source
2026年7月16日
Qwen-Image-2.0-RL Technical Report
qwen
rlhf
grpo
flow-grpo
reward-model
on-policy-distillation
reward-hacking
image-editing
cfg
pointwise-reward
post-training
diffusion-rl
2026年7月16日
Seedream 5.0 Pro
t2i
image-editing
unified-multimodal
interactive-editing
grounding
bbox
layer-separation
infographic
text-rendering
photographic-realism
multilingual
closed-source
2026年6月25日
Omni / 多模态生成技术演进调研 (2020 → 2026-07) · 主汇总
omni
multimodal-generation
text-to-image
image-editing
unified-understanding-generation
any-to-any
video-generation
diffusion
autoregressive
survey
2026年6月25日
Blended Diffusion for Text-driven Editing of Natural Images
image-editing
inpainting
clip-guided-diffusion
ddpm
training-free
mask-based
local-editing
2026年6月25日
NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion
unified-generation
autoregressive
vq-gan
3d-transformer
sparse-attention
text-to-image
text-to-video
image-editing
any-to-vision
2026年6月25日
SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations
diffusion
image-editing
sde
score-based
img2img
training-free
stroke-to-image
compositing
2026年6月25日
StyleCLIP: Text-Driven Manipulation of StyleGAN Imagery
stylegan
clip
text-driven-editing
latent-manipulation
gan-inversion
style-space
image-editing
2026年6月25日
VQGAN-CLIP: Open Domain Image Generation and Editing with Natural Language Guidance
vqgan
clip
text-to-image
clip-guidance
training-free
image-editing
ai-art
latent-optimization
eleutherai
2026年6月25日
Blended Latent Diffusion
image-editing
inpainting
local-editing
latent-diffusion
mask-blending
zero-shot
training-free
2026年6月25日
DiffEdit: Diffusion-based Semantic Image Editing with Mask Guidance
diffusion
image-editing
training-free
mask-guidance
ddim-inversion
semantic-editing
stable-diffusion
2026年6月25日
Imagic: Text-Based Real Image Editing with Diffusion Models
image-editing
diffusion
text-guided
non-rigid-edit
embedding-interpolation
fine-tuning
imagen
stable-diffusion
tedbench
2026年6月25日
InstructPix2Pix: Learning to Follow Image Editing Instructions
diffusion
image-editing
instruction-following
synthetic-data
gpt-3
stable-diffusion
prompt-to-prompt
classifier-free-guidance
2026年6月25日
Null-text Inversion for Editing Real Images using Guided Diffusion Models
diffusion
image-editing
inversion
classifier-free-guidance
ddim
prompt-to-prompt
stable-diffusion
training-free
2026年6月25日
Prompt-to-Prompt Image Editing with Cross Attention Control
diffusion
image-editing
cross-attention
training-free
text-to-image
attention-injection
imagen
stable-diffusion
2026年6月25日
RePaint: Inpainting using Denoising Diffusion Probabilistic Models
inpainting
diffusion
ddpm
training-free
resampling
image-editing
celeba-hq
imagenet
2026年6月25日
Concept Sliders: LoRA Adaptors for Precise Control in Diffusion Models
lora
diffusion
controllable-generation
image-editing
disentanglement
sdxl
concept-control
2026年6月25日
Emu Edit: Precise Image Editing via Recognition and Generation Tasks
instruction-editing
image-editing
multi-task
task-embedding
diffusion
benchmark
emu
2026年6月25日
LEDITS++: Limitless Image Editing using Text-to-Image Models
image-editing
real-image-editing
diffusion-inversion
training-free
semantic-guidance
dpm-solver
multi-edit
implicit-masking
2026年6月25日
MagicBrush: A Manually Annotated Dataset for Instruction-Guided Image Editing
image-editing
instruction-guided
dataset
benchmark
multi-turn
dall-e-2
instructpix2pix
neurips-2023
2026年6月25日
MasaCtrl: Tuning-Free Mutual Self-Attention Control for Consistent Image Synthesis and Editing
diffusion
image-editing
self-attention
training-free
non-rigid-editing
stable-diffusion
consistency
attention-control
2026年6月25日
Pix2Pix-Zero: Zero-shot Image-to-Image Translation
diffusion
image-editing
training-free
cross-attention
ddim-inversion
structure-preservation
stable-diffusion
2026年6月25日
Aurora (Grok Image Generation)
autoregressive
mixture-of-experts
next-token
interleaved
multimodal
image-generation
image-editing
photorealism
closed-source
grok
2026年6月25日
GPT-4o 原生图像生成 (4o image generation / gpt-image-1)
omni
autoregressive
native-image
image-generation
text-rendering
image-editing
multimodal
closed-source
2026年6月25日
OmniGen: Unified Image Generation
unified-generation
diffusion
rectified-flow
image-editing
subject-driven
controlnet-free
instruction-following
x2i
phi-3
2026年6月25日
SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation
unified
mllm
external-diffuser
sdxl
image-editing
llama2
vit-bridge
comprehension-generation
2026年6月25日
SeedEdit: Align Image Re-Generation to Image Editing
image-editing
instruction-editing
diffusion
t2i-bootstrap
self-distillation
causal-attention
iterative-alignment
bytedance-seed
2026年6月25日
UltraEdit: Instruction-based Fine-Grained Image Editing at Scale
image-editing
instruction-edit
dataset
region-based
diffusion
sdxl-turbo
prompt-to-prompt
neurips-2024
2026年6月25日
BAGEL: Emerging Properties in Unified Multimodal Pretraining
unified-multimodal
mot
mixture-of-transformers
rectified-flow
interleaved
world-modeling
image-editing
open-source
2026年6月25日
FLUX.2
flux
rectified-flow
mmdit
flow-matching
image-editing
multi-reference
vae
text-rendering
open-weights
2026年6月25日
Gemini 2.5 Flash Image(Nano Banana)
gemini
image-generation
image-editing
character-consistency
multi-image-fusion
conversational-editing
world-knowledge
synthid
closed-source
native-multimodal
2026年6月25日
Gemini 3 Pro Image(Nano Banana Pro)
gemini
image-generation
image-editing
text-rendering
reasoning
search-grounding
multi-reference
4k
synthid
closed-source
native-multimodal
2026年6月25日
GPT Image 1 / 4o 原生图像生成(GPT-4o native image generation)
autoregressive
omnimodal
text-rendering
image-editing
instruction-following
c2pa
gpt-4o
closed-source
2026年6月25日
ICEdit:用 In-Context 生成范式做指令图像编辑(Enabling Instructional Image Editing with In-Context Generation in Large-Scale DiT)
image-editing
instruction-editing
in-context
flux-fill
lora
moe
inference-time-scaling
dit
rectified-flow
neurips2025
2026年6月25日
Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
video-generation
text-to-video
image-to-video
text-to-image
image-editing
latent-diffusion
flow-matching
dit
crossdit
nabla
sparse-attention
open-source
russian
2026年6月25日
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
discrete-diffusion
unified-multimodal
masked-generation
dllm
t2i
image-editing
image-understanding
self-grpo
open-source
2026年6月25日
Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling
autoregressive
t2i
unified-generation
decoder-only
vqgan
image-editing
controllable-generation
speculative-jacobi
2026年6月25日
NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
autoregressive
continuous-tokens
flow-matching
next-token-prediction
t2i
image-editing
qwen2.5
flux-vae
nextstep-grpo
flowgrpo
2026年6月25日
OmniGen2: Towards Instruction-Aligned Multimodal Generation
unified
multimodal-generation
t2i
image-editing
in-context
decoupled-decoding
omni-rope
grpo
rectified-flow
open-source
2026年6月25日
Qwen-Image-Edit / Qwen-Image-Edit-2509
image-editing
mmdit
flow-matching
text-rendering
dual-encoding
qwen2.5-vl
instruction-edit
controlnet
2026年6月25日
Qwen-Image: 阿里巴巴 20B MMDiT 文生图基础模型
t2i
mmdit
text-rendering
image-editing
flow-matching
qwen
chinese-text
open-weights
2026年6月25日
SeedEdit 3.0: Fast and High-Quality Generative Image Editing
image-editing
instruction-editing
diffusion
vlm
reward-model
rectified-flow
distillation
bytedance
2026年6月25日
Seedream 4.0: Toward Next-generation Multimodal Image Generation
t2i
image-editing
multimodal
dit
high-compression-vae
joint-post-training
rlhf
adversarial-distillation
quantization
speculative-decoding
4k
multi-image-reference
in-context-reasoning
closed-source
2026年6月25日
Step1X-Edit: A Practical Framework for General Image Editing
image-editing
instruction-editing
mllm
dit
flux
qwen2.5-vl
rectified-flow
gedit-bench
open-source
2026年6月25日
Z-Image / Z-Image-Turbo:单流扩散 Transformer 的高效 6B 文生图基础模型
t2i
diffusion-transformer
single-stream
dmd
distillation
rlhf
bilingual-text
image-editing
efficient
2026年6月25日
FLUX.2 [klein]
flux
rectified-flow
mmdit
step-distillation
image-editing
multi-reference
apache-2.0
consumer-gpu
Refs
2026年6月25日
GPT Image 2 / ChatGPT Images 2.0(含 Thinking mode)
native-image-gen
autoregressive
thinking-mode
agentic
image-editing
text-rendering
4k
c2pa
watermark
closed-source
2026年6月25日
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
unified
mllm
mmdit
flow-matching
image-editing
text-rendering
cot
internvl
2026年6月25日
OmniGen-AR: AutoRegressive Any-to-Image Generation
autoregressive
any-to-image
unified-generation
next-token
visual-tokenizer
disentangled-causal-attention
image-editing
text-to-video
neurips-2025
2026年6月25日
Qwen-Image-2.0 Technical Report
qwen
mmdit
qwen3-vl
vae
rectified-flow
image-editing
text-rendering
rlhf
grpo
dmd-distillation
unified-generation
2026年6月25日
Qwen-Image-Flash: Beyond Objective Design
few-step-distillation
dmd
flow-matching
t2i
image-editing
distillation-recipe
qwen-image
2026年6月25日
Reve 2.0
t2i
layout
image-editing
4k
diffusion
llm-planner
qwen
agentic
closed-source
2026年6月25日
Seedream 5.0 Lite
t2i
image-editing
unified-multimodal
deep-thinking
visual-reasoning
online-search
web-search
in-context-reasoning
world-knowledge
information-visualization
multi-image-reference
4k
closed-source
elo
magicbench
2026年6月25日
Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling
unified
image-editing
multi-image-composition
hoi
sequence-modeling
mmdit
qwen-image
flow-matching
distillation
dmd
consistency-model
few-step
2026年6月25日
中国系文生图/编辑族横向对比:CogView · Qwen-Image · Hunyuan · Seedream · Kolors · ERNIE 及开源诸侯(2021–2026)
t2i
image-editing
chinese-text-rendering
mmdit
dit
flow-matching
llm-text-encoder
recaption
seedream
qwen-image
cogview
hunyuanimage
ernie
kolors
hidream
lumina
step1x-edit
comparison
2026年6月25日
图像编辑与可控生成族横向对比:从 ControlNet/InstructPix2Pix 到 Kontext/Step1X/Qwen-Edit
image-editing
controllable-generation
controlnet
instruction-editing
personalization
inversion
attention-control
unified-editing
diffusion
flux
deep-dive
2026年6月25日
统一/Omni 模型族横向对比:Chameleon · Emu · Janus · BAGEL · OmniGen · Show-o · VAR 谱系
unified-multimodal
omni
autoregressive
diffusion
flow-matching
next-scale-prediction
understanding-generation
image-editing
deep-dive