AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: flow-matching
此标签下有85条笔记。
2026年7月16日
AdaFlow: Imitation Learning with Variance-Adaptive Flow-Based Policies
manipulation
imitation-learning
flow-matching
rectified-flow
diffusion-policy
adaptive-inference
variance-estimation
ode-solver
behavioral-cloning
neurips-2024
2026年7月16日
π0: A Vision-Language-Action Flow Model for General Robot Control
vla
flow-matching
cross-embodiment
paligemma
action-expert
dexterous-manipulation
robot-foundation-model
action-chunking
openpi
2026年7月16日
GR-3 Technical Report
vla
mixture-of-transformers
flow-matching
action-diffusion-transformer
qwen2.5-vl
vision-language-co-training
bimanual-manipulation
mobile-manipulation
vr-teleoperation
bytemini
long-horizon-manipulation
2026年7月16日
Galaxea Open-World Dataset and G0 Dual-System VLA Model
vla
dual-system
mobile-manipulation
whole-body-control
flow-matching
fast-tokenizer
paligemma
qwen2.5-vl
open-world-dataset
cross-embodiment-pretraining
2026年7月16日
GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data
vla
grasping
synthetic-data
sim-to-real
flow-matching
chain-of-thought
open-vocabulary
action-expert
corl2025
2026年7月16日
GR00T N1.5: An Improved Open Foundation Model for Generalist Humanoid Robots
vla
humanoid
frozen-vlm
flow-matching
diffusion-transformer
flare
world-model-objective
cross-embodiment
dreamgen
eagle-2.5
2026年7月16日
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
vla
humanoid
dual-system
flow-matching
diffusion-transformer
cross-embodiment
latent-action
world-model
data-pyramid
eagle-2
2026年7月16日
Hume: Introducing System-2 Thinking in Visual-Language-Action Model
vla
dual-system
value-guided-thinking
flow-matching
offline-rl
cal-ql
cascaded-denoising
best-of-n
pi0
dexterous-manipulation
2026年7月16日
In-N-On: Scaling Egocentric Manipulation with in-the-wild and on-task Data
egocentric-manipulation
human-data
humanoid
flow-matching
domain-adaptation
cross-embodiment
dataset
few-shot-learning
language-following
data-mixture
2026年7月16日
Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
vla
knowledge-insulation
stop-gradient
flow-matching
fast-tokenizer
co-training
paligemma
action-expert
catastrophic-forgetting
2026年7月16日
π*0.6: a VLA That Learns From Experience (RECAP)
vla
reinforcement-learning
offline-rl
advantage-conditioning
flow-matching
robot-learning
dagger
value-function
2026年7月16日
π0.5: a VLA Model with Open-World Generalization
vla
mobile-manipulation
co-training
cross-embodiment
flow-matching
fast-tokenizer
hierarchical-policy
open-world-generalization
paligemma
2026年7月16日
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
flow-matching
rectified-flow
shortcut-models
reinforcement-learning
ppo
policy-gradient
rl-finetuning
action-chunking
noise-injection
embodied-ai
2026年7月16日
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
vla
flow-matching
community-datasets
lerobot
asynchronous-inference
low-cost-robotics
smolvlm
action-chunking
2026年7月16日
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
vla
latent-action
imitation-learning
flow-matching
paligemma
cross-embodiment
simpler
libero
dexterous-hand
2026年7月16日
WALL-OSS: Igniting VLMs toward the Embodied Space
vla
mixture-of-experts
unified-cross-level-cot
flow-matching
fast-tokenization
qwen2.5-vl
embodied-vqa
static-router
long-horizon-manipulation
x-square-robot
2026年7月16日
InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
vla
mixture-of-transformers
latent-foresight
world-model
flow-matching
qwen3.5
gated-deltanet
wan2.2
compositional-generalization
fast-tokenizer
2026年7月16日
InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation
vla
mixture-of-transformers
world-model
visual-foresight
flow-matching
cosmos-tokenizer
internvl3
qwen3-vl
sim-to-real
robotwin
2026年7月16日
One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies
flow-matching
one-step-generation
self-distillation
consistency-model
score-distillation
visuomotor-policy
diffusion-policy
vla-acceleration
robotwin
meanflow
2026年7月16日
π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
vla
robot-foundation-model
flow-matching
cross-embodiment
world-model
subgoal-image
compositional-generalization
gemma3
bagel
2026年7月16日
Ψ₀: An Open Foundation Model Towards Universal Humanoid Loco-Manipulation
vla
humanoid
egocentric-video
flow-matching
mm-dit
real-time-chunking
teleoperation
foundation-model
unitree-g1
action-chunking
2026年7月16日
Wall-OSS-0.5 Technical Report: Pretrain Once, Act Anywhere
vla
mixture-of-transformers
rvq-action-tokenizer
flow-matching
gradient-bridged-co-training
qwen2.5-vl
cross-embodiment
muon-optimizer
zero-shot-manipulation
x-square-robot
2026年7月16日
操作策略族(Diffusion Policy · ACT/ALOHA · 3D 策略 · 流匹配 · 动作表征)
manipulation
diffusion-policy
action-chunking
3d-policy
flow-matching
consistency-model
action-representation
imitation-learning
deep-dive
2026年7月16日
VLA 谱系(RT-1→RT-2→OpenVLA→Octo→π0→GR00T→Gemini Robotics)
vla
vision-language-action
generalist-policy
action-head
flow-matching
diffusion-policy
dual-system
cross-embodiment
autoregressive-action
world-model
deep-dive
2026年7月16日
具身智能架构演进(VLA 骨干 · 动作头 · 扩散策略 · 人形全身控制)
embodied
architecture
vla
action-head
diffusion-policy
flow-matching
action-chunking
dual-system
humanoid
whole-body-control
cross-embodiment
survey
2026年7月16日
具身智能训练方法(模仿学习 · RL · 动作 tokenize · 协同训练 · VLA 后训练)
具身智能
训练方法
模仿学习
强化学习
VLA
动作tokenize
flow-matching
sim-to-real
2026年7月16日
PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
pixworld
3d-scene-generation
3d-reconstruction
pixel-space-diffusion
3d-gaussian-splatting
two-stream-dit
flow-matching
geometry-perception-loss
novel-view-synthesis
worldscore
feed-forward-3d
vggt
2026年7月16日
Wan-Streamer v0.2: Higher Resolution, Same Latency
wan-streamer
real-time
full-duplex
audio-visual
streaming-video-generation
digital-human
block-causal-attention
flow-matching
ulysses
context-parallel
kv-cache
low-latency
2026年7月16日
MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control
world-model
autonomous-driving
diffusion-transformer
flow-matching
multi-view-generation
3d-vae
long-video-generation
controlnet
nuscenes
sequence-parallel
2026年7月16日
World Simulation with Video Foundation Models for Physical AI (Cosmos-Predict2.5 & Cosmos-Transfer2.5)
world-model
physical-ai
video-foundation-model
flow-matching
controlnet
robotics
autonomous-driving
sim2real
cosmos
2026年7月16日
GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving
world-model
autonomous-driving
latent-diffusion
flow-matching
multi-camera
video-tokenizer
controllable-generation
safety-critical
synthetic-data
2026年7月16日
Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation
world-model
robotic-manipulation
video-diffusion
vla
flow-matching
dual-arm
cross-embodiment
neural-simulator
benchmark
2026年7月16日
JEPA-T: Joint-Embedding Predictive Architecture with Text Fusion for Image Generation
jepa
text-to-image
cross-attention
flow-matching
masked-prediction
imagenet
multimodal-fusion
clip
mar
non-generative-lineage
2026年7月16日
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision–Language–Action for Autonomous Driving
driving-world-model
vision-language-action
latent-space-world-model
flow-matching
diffusion-transformer
bev-representation
navsim
nuscenes
closed-loop-planning
internvl
2026年7月16日
MultiWorld: Scalable Multi-Agent Multi-View Video World Models
world-model
multi-agent
multi-view
video-generation
flow-matching
action-conditioning
robotics-manipulation
embodied-ai
HKU
VGGT
RoPE
2026年7月16日
世界模型训练方法(想象力 RL · 扩散/流 · next-token · JEPA 回归 · 蒸馏)
world-model
training
imagination-rl
dreamer
muzero
diffusion
flow-matching
diffusion-forcing
autoregressive
jepa
distillation
2026年6月25日
Flow Matching for Generative Modeling
flow-matching
rectified-flow
continuous-normalizing-flow
optimal-transport
ode
diffusion
generative-model
2026年6月25日
Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow
rectified-flow
reflow
flow-matching
ode
one-step-generation
distillation
optimal-transport
generative-modeling
2026年6月25日
InstaFlow: One Step is Enough for High-Quality Diffusion-Based Text-to-Image Generation
t2i
rectified-flow
reflow
distillation
one-step
flow-matching
acceleration
stable-diffusion
2026年6月25日
FLUX1.1 [pro]
t2i
flux
rectified-flow
flow-matching
mmdit
closed-source
api
high-resolution
2026年6月25日
FLUX.1 Tools (Fill / Canny / Depth / Redux)
flux
inpainting
outpainting
controlnet
structural-conditioning
image-variation
mmdit
flow-matching
guidance-distillation
redux
siglip
2026年6月25日
FLUX.1 suite (pro / dev / schnell)
t2i
rectified-flow
flow-matching
mmdit
dit
ladd
guidance-distillation
open-weights
bfl
2026年6月25日
GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
speech-lm
spoken-chatbot
speech-tokenizer
flow-matching
interleaved-pretraining
streaming
end-to-end
glm
2026年6月25日
HunyuanVideo: A Systematic Framework For Large Video Generative Models
video
t2v
dit
flow-matching
mmdit
3d-vae
open-source
scaling-law
2026年6月25日
Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT
text-to-image
diffusion-transformer
next-dit
flow-matching
rectified-flow
rope
resolution-extrapolation
few-step-sampling
multilingual
unified-generation
2026年6月25日
Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers
dit
flow-matching
flag-dit
text-to-image
text-to-video
text-to-3d
text-to-speech
rope
resolution-extrapolation
unified-generation
2026年6月25日
Mochi 1 (preview)
text-to-video
diffusion-transformer
asymmdit
mmdit
3d-attention
flow-matching
open-source
apache-2.0
video-vae
2026年6月25日
Movie Gen: A Cast of Media Foundation Models
video-generation
text-to-video
flow-matching
video-editing
personalization
video-to-audio
llama3-backbone
temporal-autoencoder
2026年6月25日
Pyramid Flow:金字塔式流匹配的高效视频生成
video-generation
flow-matching
pyramidal-flow
autoregressive
dit
mm-dit
efficient-training
2026年6月25日
REPA: Representation Alignment for Generation — Training Diffusion Transformers Is Easier Than You Think
diffusion-transformer
representation-alignment
dinov2
sit
dit
self-supervised
training-efficiency
flow-matching
imagenet
2026年6月25日
SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers
diffusion
flow-matching
stochastic-interpolant
dit
imagenet
t2i-backbone
sde
ode
2026年6月25日
Scaling Rectified Flow Transformers for High-Resolution Image Synthesis (Stable Diffusion 3 / MMDiT)
t2i
rectified-flow
flow-matching
mmdit
dit
multimodal-transformer
dpo
scaling
open-weights
stability-ai
2026年6月25日
BLIP3-o: A Family of Fully Open Unified Multimodal Models
unified-multimodal
clip-feature-diffusion
flow-matching
diffusion-transformer
sequential-training
fully-open
image-generation
image-understanding
2026年6月25日
CogView4-6B
t2i
dit
mmdit
flow-matching
glm
bilingual
chinese-text-rendering
open-source
2026年6月25日
FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space
flux
in-context-editing
rectified-flow
flow-matching
instruction-editing
character-consistency
mmdit
ladd
open-weights
2026年6月25日
FLUX.2
flux
rectified-flow
mmdit
flow-matching
image-editing
multi-reference
vae
text-rendering
open-weights
2026年6月25日
HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer
text-to-image
dit
mmdit
moe
sparse-moe
flow-matching
distillation
dmd
gan
open-source
2026年6月25日
Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material
image-to-3d
shape-generation
pbr-texture
flow-matching
dit
vae
multi-view-diffusion
open-source
tencent
2026年6月25日
HunyuanVideo 1.5
video-generation
dit
t2v
i2v
flow-matching
sparse-attention
sparse-attn
video-super-resolution
open-source
lightweight
muon
distillation
2026年6月25日
Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
video-generation
text-to-video
image-to-video
text-to-image
image-editing
latent-diffusion
flow-matching
dit
crossdit
nabla
sparse-attention
open-source
russian
2026年6月25日
Lumina-Image 2.0: A Unified and Efficient Image Generative Framework
t2i
dit
flow-matching
unified-attention
gemma2
recaptioning
open-source
iccv2025
2026年6月25日
MAGI-1: Autoregressive Video Generation at Scale
video
autoregressive
diffusion
flow-matching
chunk-wise
world-model
streaming
open-weights
2026年6月25日
MeanFlow: Mean Flows for One-step Generative Modeling
one-step
flow-matching
mean-flow
generative-model
imagenet
jvp
distillation-free
2026年6月25日
NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
autoregressive
continuous-tokens
flow-matching
next-token-prediction
t2i
image-editing
qwen2.5
flux-vae
nextstep-grpo
flowgrpo
2026年6月25日
Ovis-U1: Unified Understanding, Generation and Editing
unified
mllm
t2i
edit
mmdit
flow-matching
qwen3
ovis
open-source
2026年6月25日
Qwen-Image-Edit / Qwen-Image-Edit-2509
image-editing
mmdit
flow-matching
text-rendering
dual-encoding
qwen2.5-vl
instruction-edit
controlnet
2026年6月25日
Qwen-Image: 阿里巴巴 20B MMDiT 文生图基础模型
t2i
mmdit
text-rendering
image-editing
flow-matching
qwen
chinese-text
open-weights
2026年6月25日
Diffusion Transformers with Representation Autoencoders (RAE)
diffusion-transformer
representation-encoder
dinov2
autoencoder
latent-diffusion
imagenet
flow-matching
dit
2026年6月25日
Seedance 1.0: Exploring the Boundaries of Video Generation Models
video
t2v
i2v
dit
mmdit
flow-matching
rlhf
distillation
multi-shot
bytedance
doubao
jimeng
2026年6月25日
Seedream 3.0 Technical Report
t2i
mmdit
flow-matching
bilingual
text-rendering
high-resolution
reward-model
diffusion-acceleration
repa
2026年6月25日
Show-o2: Improved Native Unified Multimodal Models
unified
understanding-generation
autoregressive
flow-matching
3d-causal-vae
video
qwen2.5
omni-attention
2026年6月25日
SkyReels-V2: Infinite-Length Film Generative Model
video
diffusion-forcing
autoregressive
flow-matching
dit
dpo
long-video
open-source
2026年6月25日
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
unified
edit
perception
siglip
flux
qwen2.5-vl
flow-matching
open-source
2026年6月25日
Wan: Open and Advanced Large-Scale Video Generative Models (Wan 2.1)
video
t2v
i2v
dit
flow-matching
3d-vae
wan-vae
open-source
video-editing
vace
2026年6月25日
Wan 2.2
video-generation
t2v
i2v
ti2v
moe
diffusion-transformer
flow-matching
vae
open-source
cinematic
2026年6月25日
ERNIE-Image Technical Report
text-to-image
dit
single-stream
latent-diffusion
flow-matching
dpo
distillation
dmd
text-rendering
open-weights
chinese
2026年6月25日
Ideogram 4.0
t2i
open-weight
dit
single-stream
flow-matching
qwen3-vl
json-prompt
text-rendering
bounding-box
2026年6月25日
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
unified
mllm
mmdit
flow-matching
image-editing
text-rendering
cot
internvl
2026年6月25日
Krea 2
t2i
diffusion-transformer
flow-matching
dit
style-reference
moodboard
open-weights
distillation
rl
dpo
krea
2026年6月25日
Qwen-Image-Flash: Beyond Objective Design
few-step-distillation
dmd
flow-matching
t2i
image-editing
distillation-recipe
qwen-image
2026年6月25日
Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling
unified
image-editing
multi-image-composition
hoi
sequence-modeling
mmdit
qwen-image
flow-matching
distillation
dmd
consistency-model
few-step
2026年6月25日
中国系文生图/编辑族横向对比:CogView · Qwen-Image · Hunyuan · Seedream · Kolors · ERNIE 及开源诸侯(2021–2026)
t2i
image-editing
chinese-text-rendering
mmdit
dit
flow-matching
llm-text-encoder
recaption
seedream
qwen-image
cogview
hunyuanimage
ernie
kolors
hidream
lumina
step1x-edit
comparison
2026年6月25日
统一/Omni 模型族横向对比:Chameleon · Emu · Janus · BAGEL · OmniGen · Show-o · VAR 谱系
unified-multimodal
omni
autoregressive
diffusion
flow-matching
next-scale-prediction
understanding-generation
image-editing
deep-dive
2026年6月25日
视频生成族横向对比(Sora · Veo · Wan · Movie Gen · HunyuanVideo · Kling · CogVideoX 及其谱系)
video-generation
text-to-video
image-to-video
diffusion-transformer
flow-matching
3d-vae
vbench
sora
veo
wan
movie-gen
hunyuanvideo
kling
cogvideox
deep-dive
2026年6月25日
训练方法:目标函数·多阶段·偏好对齐·蒸馏
training
objective
flow-matching
rectified-flow
preference-alignment
rlhf
dpo
grpo
distillation
few-step
consistency
sampler
editing
survey
omni