AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
Home
❯
omni
❯
2026
文件夹: omni/2026
此文件夹下有33条笔记。
2026年7月16日
Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image)与 Gemini Omni Flash 开发者 GA
nano-banana
gemini-3-1-flash-lite-image
gemini-omni-flash
any-to-any
video-generation
conversational-editing
interactions-api
synthid
closed-source
tpu
2026年7月16日
LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing
streaming-video-editing
causal-dit
dmd-distillation
mask-cache
wan2-1
teacher-forcing
real-time
token-pruning
eccv-2026
2026年7月16日
Muse Image(含 Muse Video 预览)
agentic-image-gen
tool-use
self-refinement
test-time-compute
rl
meta-ai
watermark
image-editing
multi-reference
text-to-video
closed-source
2026年7月16日
Nemotron-Labs-Audex-30B-A3B (Audex): Unified Audio Intelligence Without Regressing on Text Intelligence
nvidia
audex
nemotron-cascade-2
audio-llm
moe
mamba-transformer
x-codec2
af-whisper
tts
text-to-audio
speech-to-speech
unified-audio-text
cascade-rl
cfg
2026年7月16日
PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
pixworld
3d-scene-generation
3d-reconstruction
pixel-space-diffusion
3d-gaussian-splatting
two-stream-dit
flow-matching
geometry-perception-loss
novel-view-synthesis
worldscore
feed-forward-3d
vggt
2026年7月16日
Qwen-Image-2.0-RL Technical Report
qwen
rlhf
grpo
flow-grpo
reward-model
on-policy-distillation
reward-hacking
image-editing
cfg
pointwise-reward
post-training
diffusion-rl
2026年7月16日
Qwen-Music Technical Report
qwen
text-to-music
song-generation
cover-song
music-tokenizer
bestrq
melody-cot
diffusion-transformer
spec-vae
dpo
gspo
vocal-synthesis
2026年7月16日
Seedream 5.0 Pro
t2i
image-editing
unified-multimodal
interactive-editing
grounding
bbox
layer-separation
infographic
text-rendering
photographic-realism
multilingual
closed-source
2026年7月16日
Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
spectrareward
reward-model
t2i-rl
mllm-as-reward
self-reward
unified-multimodal
bagel
prompt-likelihood
training-free
group-relative-rl
awm
geneval
2026年7月16日
Vidu S1: A Real-Time Interactive Video Generation Model
vidu
shengshu
real-time
interactive-video
avatar
voice-control
autoregressive-diffusion
diffusion-forcing
dmd
turbodiffusion
turboserve
streaming
2026年7月16日
Vision as Unified Multimodal Generation
sensenova-vision
bagel
unified-multimodal-model
computer-vision
detection
segmentation
depth-estimation
camera-pose
instruction-response
rectified-flow
dahua-lin
ziwei-liu
2026年7月16日
Wan-Streamer v0.2: Higher Resolution, Same Latency
wan-streamer
real-time
full-duplex
audio-visual
streaming-video-generation
digital-human
block-causal-attention
flow-matching
ulysses
context-parallel
kv-cache
low-latency
2026年6月25日
ERNIE-Image Technical Report
text-to-image
dit
single-stream
latent-diffusion
flow-matching
dpo
distillation
dmd
text-rendering
open-weights
chinese
2026年6月25日
FLUX.2 [klein]
flux
rectified-flow
mmdit
step-distillation
image-editing
multi-reference
apache-2.0
consumer-gpu
Refs
2026年6月25日
GPT Image 2 / ChatGPT Images 2.0(含 Thinking mode)
native-image-gen
autoregressive
thinking-mode
agentic
image-editing
text-rendering
4k
c2pa
watermark
closed-source
2026年6月25日
Ideogram 4.0
t2i
open-weight
dit
single-stream
flow-matching
qwen3-vl
json-prompt
text-rendering
bounding-box
2026年6月25日
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
unified
mllm
mmdit
flow-matching
image-editing
text-rendering
cot
internvl
2026年6月25日
可灵 3.0 系列模型(Kling 3.0:Video 3.0 / Video 3.0 Omni / Image 3.0 / Image 3.0 Omni)
video-generation
omni
multimodal
native-audio
multi-shot
character-reference
closed-source
kuaishou
kling
2026年6月25日
Krea 2
t2i
diffusion-transformer
flow-matching
dit
style-reference
moodboard
open-weights
distillation
rl
dpo
krea
2026年6月25日
Luma Ray3.14
video-generation
text-to-video
image-to-video
video-editing
hdr
reasoning-video
closed-source
dream-machine
2026年6月25日
Midjourney V8.1
t2i
midjourney
closed-source
aesthetic-preference
hd
fast-inference
2026年6月25日
OmniGen-AR: AutoRegressive Any-to-Image Generation
autoregressive
any-to-image
unified-generation
next-token
visual-tokenizer
disentangled-causal-attention
image-editing
text-to-video
neurips-2025
2026年6月25日
Qwen-Image-2.0 Technical Report
qwen
mmdit
qwen3-vl
vae
rectified-flow
image-editing
text-rendering
rlhf
grpo
dmd-distillation
unified-generation
2026年6月25日
Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation
t2i
benchmark
evaluation
judge-model
mllm-judge
creator-centric
qwen
2026年6月25日
Qwen-Image-Flash: Beyond Objective Design
few-step-distillation
dmd
flow-matching
t2i
image-editing
distillation-recipe
qwen-image
2026年6月25日
Qwen-Image-VAE-2.0 Technical Report
vae
high-compression
latent-diffusion
tokenizer
text-rendering
semantic-alignment
dit
image-generation
2026年6月25日
Qwen3.5-Omni Technical Report
omni
audio
audio-visual
speech
asr
tts
moe
thinker-talker
streaming
agent
multilingual
2026年6月25日
Recraft V4
t2i
closed-source
design
vector-graphics
svg
raster
text-rendering
aesthetics
api
no-tech-report
2026年6月25日
Reve 2.0
t2i
layout
image-editing
4k
diffusion
llm-planner
qwen
agentic
closed-source
2026年6月25日
Seed3D 2.0: Advancing High-Fidelity Simulation-Ready 3D Content Generation
3d-generation
image-to-3d
pbr
vecset
rectified-flow
dit
moe
vae
articulation
scene-generation
simulation-ready
bytedance
2026年6月25日
Seedance 2.0
video
audio-video
multimodal
t2v
i2v
r2v
editing
binaural-audio
closed-source
2026年6月25日
Seedream 5.0 Lite
t2i
image-editing
unified-multimodal
deep-thinking
visual-reasoning
online-search
web-search
in-context-reasoning
world-knowledge
information-visualization
multi-image-reference
4k
closed-source
elo
magicbench
2026年6月25日
Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling
unified
image-editing
multi-image-composition
hoi
sequence-modeling
mmdit
qwen-image
flow-matching
distillation
dmd
consistency-model
few-step