AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
Home
❯
omni
❯
2025
文件夹: omni/2025
此文件夹下有66条笔记。
2026年6月25日
ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling
instruction-edit
subject-reference
flux
inpainting
lora
diffusion
rectified-flow
dit
2026年6月25日
BAGEL: Emerging Properties in Unified Multimodal Pretraining
unified-multimodal
mot
mixture-of-transformers
rectified-flow
interleaved
world-modeling
image-editing
open-source
2026年6月25日
BLIP3-o: A Family of Fully Open Unified Multimodal Models
unified-multimodal
clip-feature-diffusion
flow-matching
diffusion-transformer
sequential-training
fully-open
image-generation
image-understanding
2026年6月25日
CogView4-6B
t2i
dit
mmdit
flow-matching
glm
bilingual
chinese-text-rendering
open-source
2026年6月25日
Cosmos World Foundation Model Platform for Physical AI (Cosmos-Predict1)
world-model
physical-ai
video-generation
diffusion
autoregressive
dit
tokenizer
robotics
autonomous-driving
open-weight
2026年6月25日
DreamO: A Unified Framework for Image Customization
image-customization
dit
flux
lora
subject-driven
identity
try-on
style
feature-routing
unified
2026年6月25日
Emu3.5: Native Multimodal Models are World Learners
native-multimodal
autoregressive
next-token-prediction
world-model
interleaved
x2i
discrete-diffusion
open-source
2026年6月25日
Adobe Firefly Image Model 4 / 4 Ultra
t2i
firefly
adobe
commercially-safe
closed-source
creative-cloud
photorealism
2026年6月25日
FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space
flux
in-context-editing
rectified-flow
flow-matching
instruction-editing
character-consistency
mmdit
ladd
open-weights
2026年6月25日
FLUX.1 Krea [dev]
text-to-image
rectified-flow
dit
flux
post-training
rlhf
dpo
aesthetics
photorealism
guidance-distillation
open-weights
2026年6月25日
FLUX.2
flux
rectified-flow
mmdit
flow-matching
image-editing
multi-reference
vae
text-rendering
open-weights
2026年6月25日
Fractal Generative Models (FractalGen)
fractal
autoregressive
mar
pixel-by-pixel
image-generation
imagenet
divide-and-conquer
likelihood
params
2026年6月25日
FramePack: Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models
video-generation
long-video
next-frame-prediction
diffusion-transformer
context-compression
anti-drifting
hunyuanvideo
wan
low-vram
2026年6月25日
Gemini 2.0 Flash 原生图像生成(公开实验版 gemini-2.0-flash-exp,2025-03)
gemini
native-image-output
interleaved-text-image
conversational-editing
unified
multimodal-llm
world-knowledge
text-rendering
synthid
closed-source
nano-banana-lineage
2026年6月25日
Gemini 2.5 Flash Image(Nano Banana)
gemini
image-generation
image-editing
character-consistency
multi-image-fusion
conversational-editing
world-knowledge
synthid
closed-source
native-multimodal
2026年6月25日
Gemini 3 Pro Image(Nano Banana Pro)
gemini
image-generation
image-editing
text-rendering
reasoning
search-grounding
multi-reference
4k
synthid
closed-source
native-multimodal
2026年6月25日
Goku: Flow Based Video Generative Foundation Models
video-generation
text-to-image
image-to-video
rectified-flow
dit
joint-image-video
3d-vae
bytedance
2026年6月25日
Imagen 4 Fast / Imagen 4(Ultra) GA 与 GPT Image 1 mini
t2i
closed-source
api
cost-tier
imagen-4
gpt-image-1
autoregressive
latent-diffusion
synthid
c2pa
2026年6月25日
GPT Image 1 / 4o 原生图像生成(GPT-4o native image generation)
autoregressive
omnimodal
text-rendering
image-editing
instruction-following
c2pa
gpt-4o
closed-source
2026年6月25日
HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer
text-to-image
dit
mmdit
moe
sparse-moe
flow-matching
distillation
dmd
gan
open-source
2026年6月25日
Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material
image-to-3d
shape-generation
pbr-texture
flow-matching
dit
vae
multi-view-diffusion
open-source
tencent
2026年6月25日
HunyuanImage 2.1:高效的 2K 高分辨率文生图扩散模型
t2i
mmdit
diffusion-transformer
high-resolution
2k
distillation
meanflow
rlhf
text-rendering
byt5
vae
repa
open-source
2026年6月25日
HunyuanImage 3.0 Technical Report
t2i
unified-multimodal
autoregressive
moe
diffusion
transfusion
chain-of-thought
open-source
rlhf
2026年6月25日
HunyuanVideo 1.5
video-generation
dit
t2v
i2v
flow-matching
sparse-attention
sparse-attn
video-super-resolution
open-source
lightweight
muon
distillation
2026年6月25日
Ideogram 3.0
t2i
typography
text-rendering
style-reference
graphic-design
closed-source
diffusion
product-launch
inpaint
fine-tuning
2026年6月25日
Imagen 4 / Imagen 4 Ultra / Imagen 4 Fast
text-to-image
diffusion
typography
imagen
google-deepmind
closed-source
synthid
2026年6月25日
ICEdit:用 In-Context 生成范式做指令图像编辑(Enabling Instructional Image Editing with In-Context Generation in Large-Scale DiT)
image-editing
instruction-editing
in-context
flux-fill
lora
moe
inference-time-scaling
dit
rectified-flow
neurips2025
2026年6月25日
Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
unified-multimodal
autoregressive
decoupled-visual-encoding
t2i
vlm
open-source
deepseek
2026年6月25日
Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
video-generation
text-to-video
image-to-video
text-to-image
image-editing
latent-diffusion
flow-matching
dit
crossdit
nabla
sparse-attention
open-source
russian
2026年6月25日
可灵 Kling 2.0 / 2.1 / 2.5 Turbo
video-generation
t2v
i2v
dit
closed-source
kuaishou
kling
mvl
video-editing
2026年6月25日
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
discrete-diffusion
unified-multimodal
masked-generation
dllm
t2i
image-editing
image-understanding
self-grpo
open-source
2026年6月25日
Lumina-Image 2.0: A Unified and Efficient Image Generative Framework
t2i
dit
flow-matching
unified-attention
gemma2
recaptioning
open-source
iccv2025
2026年6月25日
Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling
autoregressive
t2i
unified-generation
decoder-only
vqgan
image-editing
controllable-generation
speculative-jacobi
2026年6月25日
MAGI-1: Autoregressive Video Generation at Scale
video
autoregressive
diffusion
flow-matching
chunk-wise
world-model
streaming
open-weights
2026年6月25日
MeanFlow: Mean Flows for One-step Generative Modeling
one-step
flow-matching
mean-flow
generative-model
imagenet
jvp
distillation-free
2026年6月25日
MetaQueries: Transfer between Modalities with MetaQueries
unified-mm
frozen-mllm
diffusion-decoder
learnable-queries
in-context-learning
knowledge-augmented-generation
subject-driven
2026年6月25日
Midjourney V7
t2i
closed-source
personalization
draft-mode
omni-reference
midjourney
aesthetics
2026年6月25日
Ming-Omni / Ming-Lite-Omni: A Unified Multimodal Model for Perception and Generation
omni
moe
unified
any-to-any
speech
image-generation
video
gpt-4o-class
open-source
2026年6月25日
MMaDA: Multimodal Large Diffusion Language Models
unified
discrete-diffusion
masked-diffusion
dllm
multimodal
t2i
reasoning
rl
grpo
neurips2025
2026年6月25日
NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
autoregressive
continuous-tokens
flow-matching
next-token-prediction
t2i
image-editing
qwen2.5
flux-vae
nextstep-grpo
flowgrpo
2026年6月25日
OmniGen2: Towards Instruction-Aligned Multimodal Generation
unified
multimodal-generation
t2i
image-editing
in-context
decoupled-decoding
omni-rope
grpo
rectified-flow
open-source
2026年6月25日
Ovis-U1: Unified Understanding, Generation and Editing
unified
mllm
t2i
edit
mmdit
flow-matching
qwen3
ovis
open-source
2026年6月25日
Pika 2.0 / 2.1 / 2.2
video
t2v
i2v
keyframe
closed-source
consumer
pikaframes
pikadditions
2026年6月25日
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
t2i
linear-attention
dit
model-growth
depth-pruning
inference-scaling
came-8bit
efficient-scaling
geneval
sana
2026年6月25日
Qwen-Image-Edit / Qwen-Image-Edit-2509
image-editing
mmdit
flow-matching
text-rendering
dual-encoding
qwen2.5-vl
instruction-edit
controlnet
2026年6月25日
Qwen-Image: 阿里巴巴 20B MMDiT 文生图基础模型
t2i
mmdit
text-rendering
image-editing
flow-matching
qwen
chinese-text
open-weights
2026年6月25日
Qwen2.5-Omni Technical Report
omni
multimodal
any-to-any
speech
thinker-talker
tmrope
streaming
open-source
qwen
2026年6月25日
Diffusion Transformers with Representation Autoencoders (RAE)
diffusion-transformer
representation-encoder
dinov2
autoencoder
latent-diffusion
imagenet
flow-matching
dit
2026年6月25日
Reve Image 1.0 (Halfmoon)
t2i
closed-source
prompt-adherence
typography
intent-driven
palo-alto
startup
halfmoon
2026年6月25日
Seedance 1.0: Exploring the Boundaries of Video Generation Models
video
t2v
i2v
dit
mmdit
flow-matching
rlhf
distillation
multi-shot
bytedance
doubao
jimeng
2026年6月25日
SeedEdit 3.0: Fast and High-Quality Generative Image Editing
image-editing
instruction-editing
diffusion
vlm
reward-model
rectified-flow
distillation
bytedance
2026年6月25日
Seedream 3.0 Technical Report
t2i
mmdit
flow-matching
bilingual
text-rendering
high-resolution
reward-model
diffusion-acceleration
repa
2026年6月25日
Seedream 4.0: Toward Next-generation Multimodal Image Generation
t2i
image-editing
multimodal
dit
high-compression-vae
joint-post-training
rlhf
adversarial-distillation
quantization
speculative-decoding
4k
multi-image-reference
in-context-reasoning
closed-source
2026年6月25日
Show-o2: Improved Native Unified Multimodal Models
unified
understanding-generation
autoregressive
flow-matching
3d-causal-vae
video
qwen2.5
omni-attention
2026年6月25日
SkyReels-V2: Infinite-Length Film Generative Model
video
diffusion-forcing
autoregressive
flow-matching
dit
dpo
long-video
open-source
2026年6月25日
Sora 2
video
audio
text-to-video
world-model
diffusion
synced-audio
cameo
closed-source
2026年6月25日
Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction
speech
audio-llm
voice-chat
tts
dual-codebook
rlhf
open-source
multimodal
2026年6月25日
Step1X-Edit: A Practical Framework for General Image Editing
image-editing
instruction-editing
mllm
dit
flux
qwen2.5-vl
rectified-flow
gedit-bench
open-source
2026年6月25日
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
unified
edit
perception
siglip
flux
qwen2.5-vl
flow-matching
open-source
2026年6月25日
UNO: Less-to-More Generalization — Unlocking More Controllability by In-Context Generation
subject-driven
customization
in-context-generation
dit
flux
lora
rope
multi-subject
data-synthesis
2026年6月25日
VACE: All-in-One Video Creation and Editing
video
editing
unified
dit
controllable
inpainting
reference-to-video
wan
ltx-video
iccv2025
2026年6月25日
Veo 3 与 Veo 3.1
video-generation
text-to-video
image-to-video
native-audio
audiovisual
diffusion
closed-model
google-deepmind
flow
2026年6月25日
Wan: Open and Advanced Large-Scale Video Generative Models (Wan 2.1)
video
t2v
i2v
dit
flow-matching
3d-vae
wan-vae
open-source
video-editing
vace
2026年6月25日
Wan 2.2
video-generation
t2v
i2v
ti2v
moe
diffusion-transformer
flow-matching
vae
open-source
cinematic
2026年6月25日
X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again
unified
autoregressive
discrete-token
rl
grpo
text-rendering
image-generation
image-understanding
tokenizer
siglip
flux
2026年6月25日
Z-Image / Z-Image-Turbo:单流扩散 Transformer 的高效 6B 文生图基础模型
t2i
diffusion-transformer
single-stream
dmd
distillation
rlhf
bilingual-text
image-editing
efficient