跳到主要内容
面试之前,先来面栈
搜索
题库
/
模型训练与对齐
强化学习与奖励
9
个专题 ·
270
道题
专题概览
题目列表
270
强化学习与奖励
继续复习
→
待复习
0
问题类型
问题类型
比较选型
代码题
方案设计
概念解释
故障排查
项目深挖
原理机制
问题类型
技术难度
技术难度
基础
进阶
深入
技术难度
复习状态
复习状态
未标记
待复习
已掌握
复习状态
已筛选
清除筛选
共
100
道题
开始复习 →
排序:
排序
相关面经最多
题集收录最多
题号顺序
最新更新
题号
题目
技术难度
收录情况
复习状态
3011
GRPO 的 Reward 能否迁移到 PPO?
模型训练与对齐
强化学习与奖励
比较选型
已有答案
面前必看
进阶
暂无面经
GRPO 的 Reward 能否迁移到 PPO?的复习状态
未标记
待复习
已掌握
›
3052
GRPO 中 KL 散度损失如何计算实现?
模型训练与对齐
强化学习与奖励
原理机制
已有答案
面前必看
深入
暂无面经
GRPO 中 KL 散度损失如何计算实现?的复习状态
未标记
待复习
已掌握
›
3174
智能点餐场景的多轮 RL Reward 如何设计?
模型训练与对齐
强化学习与奖励
方案设计
已有答案
面前必看
进阶
暂无面经
智能点餐场景的多轮 RL Reward 如何设计?的复习状态
未标记
待复习
已掌握
›
3297
简单介绍后训练和强化学习。
模型训练与对齐
强化学习与奖励
概念解释
已有答案
面前必看
基础
暂无面经
简单介绍后训练和强化学习。的复习状态
未标记
待复习
已掌握
›
3363
项目奖励函数后续有什么改进思路?
模型训练与对齐
强化学习与奖励
项目深挖
已有答案
面前必看
进阶
暂无面经
项目奖励函数后续有什么改进思路?的复习状态
未标记
待复习
已掌握
›
3364
KL 散度有什么作用,为什么使用它?
模型训练与对齐
强化学习与奖励
原理机制
已有答案
面前必看
进阶
暂无面经
KL 散度有什么作用,为什么使用它?的复习状态
未标记
待复习
已掌握
›
3367
了解哪些 GRPO 改进算法?
模型训练与对齐
强化学习与奖励
概念解释
已有答案
面前必看
进阶
暂无面经
了解哪些 GRPO 改进算法?的复习状态
未标记
待复习
已掌握
›
3368
较长对话的强化学习奖励如何设计?
模型训练与对齐
强化学习与奖励
方案设计
已有答案
面前必看
进阶
暂无面经
较长对话的强化学习奖励如何设计?的复习状态
未标记
待复习
已掌握
›
3369
奖励什么时候使用模型,什么时候使用规则?
模型训练与对齐
强化学习与奖励
比较选型
已有答案
面前必看
进阶
暂无面经
奖励什么时候使用模型,什么时候使用规则?的复习状态
未标记
待复习
已掌握
›
3370
如何避免奖励坍缩和 Reward Hacking?
模型训练与对齐
强化学习与奖励
故障排查
已有答案
面前必看
进阶
暂无面经
如何避免奖励坍缩和 Reward Hacking?的复习状态
未标记
待复习
已掌握
›
3011
GRPO 的 Reward 能否迁移到 PPO?
模型训练与对齐
强化学习与奖励
比较选型
已有答案
面前必看
进阶
暂无面经
GRPO 的 Reward 能否迁移到 PPO?的复习状态
未标记
待复习
已掌握
›
未找到相关题目
换个关键词,或清除筛选。
清除筛选
共
100
道题 · 显示 71–80 道
上一页
1
…
6
7
8
9
10
8 / 10
下一页
启用 JavaScript 后可筛选和浏览完整题库;当前显示前 10 道题。