AI Research 技术调研

标签: mdp

此标签下有2条笔记。

  • 2026年6月25日

    D3PO: Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model

    • diffusion
    • rlhf
    • dpo
    • preference-alignment
    • reward-free
    • mdp
    • text-to-image
    • cvpr2024
  • 2026年6月25日

    DDPO: Training Diffusion Models with Reinforcement Learning

    • diffusion
    • rl
    • rlhf
    • rlaif
    • policy-gradient
    • ppo
    • mdp
    • text-to-image
    • reward-optimization
    • vlm-feedback

  • GitHub