AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: rlaif
此标签下有1条笔记。
2026年6月25日
DDPO: Training Diffusion Models with Reinforcement Learning
diffusion
rl
rlhf
rlaif
policy-gradient
ppo
mdp
text-to-image
reward-optimization
vlm-feedback