AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: grpo
此标签下有8条笔记。
2026年7月16日
RoboBrain 2.0 Technical Report
vla
embodied-reasoning
spatial-reasoning
temporal-reasoning
multi-robot-planning
vision-language-model
qwen2.5-vl
grpo
flagscale
chain-of-thought
2026年7月16日
Qwen-Image-2.0-RL Technical Report
qwen
rlhf
grpo
flow-grpo
reward-model
on-policy-distillation
reward-hacking
image-editing
cfg
pointwise-reward
post-training
diffusion-rl
2026年7月16日
Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning
physical-ai
vlm
embodied-reasoning
chain-of-thought
grpo
reinforcement-learning
ontology
benchmark
cosmos
robotics
2026年6月25日
MMaDA: Multimodal Large Diffusion Language Models
unified
discrete-diffusion
masked-diffusion
dllm
multimodal
t2i
reasoning
rl
grpo
neurips2025
2026年6月25日
OmniGen2: Towards Instruction-Aligned Multimodal Generation
unified
multimodal-generation
t2i
image-editing
in-context
decoupled-decoding
omni-rope
grpo
rectified-flow
open-source
2026年6月25日
X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again
unified
autoregressive
discrete-token
rl
grpo
text-rendering
image-generation
image-understanding
tokenizer
siglip
flux
2026年6月25日
Qwen-Image-2.0 Technical Report
qwen
mmdit
qwen3-vl
vae
rectified-flow
image-editing
text-rendering
rlhf
grpo
dmd-distillation
unified-generation
2026年6月25日
训练方法:目标函数·多阶段·偏好对齐·蒸馏
training
objective
flow-matching
rectified-flow
preference-alignment
rlhf
dpo
grpo
distillation
few-step
consistency
sampler
editing
survey
omni