← 返回全部题目← 上一题48 / 100下一题 →题库/模型训练与对齐/Q-2490GRPO 相比 PPO 做了哪些改进?知识专题:强化学习与奖励题目类型:比较选型技术难度:进阶相关面经:4 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经4 篇字节跳动大模型算法工程师2026-05-08暑期实习一面、二面、三面查看原面经 →ppo grpo的具体原理以及区别顺丰大模型应用开发工程师(RAG 方向)2026-03-17实习查看原面经 →GRPO与PPO的区别;顺丰大模型应用开发工程师(RAG 方向)2025-10-08查看原面经 →GRPO与PPO的区别;美团2025-09-15二面查看原面经 →追问grpo对于ppo的改进相关题目4 题0086如何判断强化学习带来的实际收益?同一知识专题题目类型:项目深挖技术难度:进阶相关面经:2 篇0103强化学习包含哪些主要组件?同一知识专题题目类型:概念解释技术难度:基础相关面经:2 篇0104GRPO 算法如何工作?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0105On-policy 和 Off-policy 有什么区别?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇← 上一题已到最后一题← 上一题GRPO 训练实际使用什么数据?下一题 →DAPO 的改进解决了什么问题?