AI Research 技术调研

标签: policy-gradient

此标签下有3条笔记。

  • 2026年7月16日

    DPPO: Diffusion Policy Policy Optimization

    • manipulation
    • diffusion-policy
    • reinforcement-learning
    • ppo
    • policy-gradient
    • rl-finetuning
    • sim-to-real
    • action-chunking
    • ddim
    • embodied-ai
  • 2026年7月16日

    ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning

    • flow-matching
    • rectified-flow
    • shortcut-models
    • reinforcement-learning
    • ppo
    • policy-gradient
    • rl-finetuning
    • action-chunking
    • noise-injection
    • embodied-ai
  • 2026年6月25日

    DDPO: Training Diffusion Models with Reinforcement Learning

    • diffusion
    • rl
    • rlhf
    • rlaif
    • policy-gradient
    • ppo
    • mdp
    • text-to-image
    • reward-optimization
    • vlm-feedback

  • GitHub