← 返回全部题目← 上一题58 / 100下一题 →题库/模型训练与对齐/Q-2704如何根据业务目标设计强化学习奖励?知识专题:强化学习与奖励题目类型:方案设计技术难度:进阶相关面经:8 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经8 篇科大讯飞大模型算法工程师2026-09-04秋招一面查看原面经 →项目追问研究过程如何结合实现奖励函数的百度端到端决策规划控制算法工程师2026-09-03一面查看原面经 →项目追问reward是如何设计的呢?查看该问上下文 →项目追问奖励函数怎么写的?查看该问上下文 →百度Agent 应用开发工程师2026-07-07一面、二面查看原面经 →eward 和 verifier 怎么设计滴滴算法工程师2026-06-21实习查看原面经 →业务场景里的 reward 应该怎么设计美图大模型算法工程师2026-05-24一面、二面、三面、四面查看原面经 →介绍第一篇论文,reward model怎么设计。展开剩余 3 篇面经字节跳动大模型算法工程师2026-05-08暑期实习一面、二面、三面查看原面经 →比如reward怎么设计的荣耀大模型算法工程师2026-03-28实习查看原面经 →RL的时候奖励函数是如何设计的?最终效果怎么样?虾皮大模型算法工程师2026-01-01校招二面查看原面经 →介绍reward fuction相关题目4 题0086如何判断强化学习带来的实际收益?同一知识专题题目类型:项目深挖技术难度:进阶相关面经:2 篇0103强化学习包含哪些主要组件?同一知识专题题目类型:概念解释技术难度:基础相关面经:2 篇0104GRPO 算法如何工作?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0105On-policy 和 Off-policy 有什么区别?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇← 上一题已到最后一题← 上一题轨迹级奖励与 Token 级优化之间如何分配贡献?下一题 →GRPO 生成只命中商品 SID 前两个 Token 时如何给奖励?