← 返回全部题目← 上一题43 / 100下一题 →题库/模型训练与对齐/Q-1896项目为什么选择 GRPO 而不选择 DPO?知识专题:强化学习与奖励题目类型:比较选型技术难度:进阶相关面经:1 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经1 篇百度端到端决策规划控制算法工程师2026-09-03一面查看原面经 →项目追问为什么用了GRPO而不是DPO?相关题目4 题2914为什么选择 DPO 而不选择 GRPO?题族变体题目类型:比较选型技术难度:进阶相关面经:0 篇0086如何判断强化学习带来的实际收益?同一知识专题题目类型:项目深挖技术难度:进阶相关面经:2 篇0103强化学习包含哪些主要组件?同一知识专题题目类型:概念解释技术难度:基础相关面经:2 篇0104GRPO 算法如何工作?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇← 上一题已到最后一题← 上一题手写 PPO Loss。下一题 →SFT、强化学习和 Agentic CFT 分别解决什么问题?