← 返回全部题目← 上一题3 / 100下一题 →题库/模型训练与对齐/Q-0104GRPO 算法如何工作?知识专题:强化学习与奖励题目类型:原理机制技术难度:进阶相关面经:11 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经11 篇科大讯飞大模型算法工程师2026-09-04秋招一面查看原面经 →简单介绍GRPO算法滴滴大模型算法工程师2026-09-01秋招一面查看原面经 →详细介绍一下grpo算法阿里巴巴大模型算法工程师2026-06-25一面查看原面经 →GRPO相比传统强化学习方案做了哪些优化改进,其中KL散度损失如何计算实现?腾讯大模型算法工程师2026-05-18暑期查看原面经 →讲一下 GRPO 原理字节跳动大模型算法工程师2026-05-08暑期实习一面、二面、三面查看原面经 →ppo grpo的具体原理以及区别展开剩余 6 篇面经MiniMax大模型算法工程师2026-05-06查看原面经 →是否了解或使用过 GRPO 算法?腾讯大模型算法工程师2026-05-05暑期实习一面查看原面经 →讲一下 GRPO 原理京东算法工程师(对话机器人)2026-01-27实习查看原面经 →GRPO,PPO,DPO的算法原理美团Agent 算法工程师2025-09-27查看原面经 →介绍下ppo dpo grpo算法美团2025-09-15二面查看原面经 →讲一下ppo和grpoOPPOAgent 应用开发工程师2025-09-15二面查看原面经 →讲一下grpo相关题目4 题0086如何判断强化学习带来的实际收益?同一知识专题题目类型:项目深挖技术难度:进阶相关面经:2 篇0103强化学习包含哪些主要组件?同一知识专题题目类型:概念解释技术难度:基础相关面经:2 篇0105On-policy 和 Off-policy 有什么区别?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇0169RLHF/PPO 中 Actor、Critic、Reward Model 和 Reference Model 的职责是什么,为什么需要 KL 约束?同一知识专题题目类型:原理机制技术难度:进阶相关面经:2 篇← 上一题已到最后一题← 上一题强化学习包含哪些主要组件?下一题 →On-policy 和 Off-policy 有什么区别?