← 返回全部题目← 上一题53 / 100下一题 →题库/模型训练与对齐/Q-2689强化学习如何选择有效难度的样本并提升复杂任务探索?知识专题:强化学习与奖励题目类型:方案设计技术难度:进阶相关面经:3 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经3 篇百度端到端决策规划控制算法工程师2026-09-04秋招二面查看原面经 →是否考虑通过课程学习等方法来提成策略性能?美团大模型算法工程师2026-07-05一面、二面查看原面经 →RL训练中如何兼顾难易样本,提升模型对高难度业务任务的探索能力?滴滴算法工程师2026-06-21实习查看原面经 →样本难度分层、课程学习和有效样本选择相关题目4 题0086如何判断强化学习带来的实际收益?同一知识专题题目类型:项目深挖技术难度:进阶相关面经:2 篇0103强化学习包含哪些主要组件?同一知识专题题目类型:概念解释技术难度:基础相关面经:2 篇0104GRPO 算法如何工作?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0105On-policy 和 Off-policy 有什么区别?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇← 上一题已到最后一题← 上一题RL 训练初期奖励先降后升时,如何解释和排查?下一题 →SFT、DPO、PPO 与 GRPO 的目标、机制和适用条件如何比较?