← 返回全部题目← 上一题7 / 100下一题 →题库/模型训练与对齐/Q-0213GRPO 组内奖励相同或方差接近零时,会有什么问题,如何处理?知识专题:强化学习与奖励题目类型:原理机制技术难度:进阶相关面经:4 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经4 篇唯品会NLP 算法工程师2026-07-18实习一面查看原面经 →GRPO 中相对奖励是如何计算的?同一组奖励方差接近零时如何处理滴滴算法工程师2026-06-21实习查看原面经 →group 里 reward 全 0 / 全 1 会有什么问题美图大模型算法工程师2026-05-24一面、二面、三面、四面查看原面经 →如何保证强化学习的训练效率(平衡效率和稳定),grpo训练过程中出现了全0或者全1怎么解决。同花顺大模型算法工程师(金融)2026-02-04一面查看原面经 →grpo如果对于这个数据 训练出来的一组score都是0或者1 这时候应该怎么办相关题目4 题0086如何判断强化学习带来的实际收益?同一知识专题题目类型:项目深挖技术难度:进阶相关面经:2 篇0103强化学习包含哪些主要组件?同一知识专题题目类型:概念解释技术难度:基础相关面经:2 篇0104GRPO 算法如何工作?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0105On-policy 和 Off-policy 有什么区别?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇← 上一题已到最后一题← 上一题为什么先做 Step-level SFT 再做 GRPO 可能更稳定?下一题 →为什么选择 GRPO,它的优化目标和数学原理是什么?