强化学习与奖励

9 个专题 · 270 道题

已筛选

100 道题

排序:

0501
RLHF 奖励模型的训练数据如何构建?
模型训练与对齐强化学习与奖励
方案设计
进阶
0524
GRPO 如何实现,奖励函数尤其长轨迹奖励如何设计?
模型训练与对齐强化学习与奖励
方案设计
深入
0634
了解哪些强化学习优化算法?
模型训练与对齐强化学习与奖励
比较选型
基础
0736
什么是 Reward Hacking,如何识别、定位并治理?
模型训练与对齐强化学习与奖励
故障排查
进阶
2913
什么情况下 GRPO 效果较差?
模型训练与对齐强化学习与奖励
故障排查
进阶
3449
PPO 中需要训练哪几个模型?
模型训练与对齐强化学习与奖励
原理机制
基础
3661
GSPO 的核心机制是什么,与 GRPO 有什么关系?
模型训练与对齐强化学习与奖励
原理机制
进阶
0105
On-policy 和 Off-policy 有什么区别?
模型训练与对齐强化学习与奖励
比较选型
进阶
0212
为什么先做 Step-level SFT 再做 GRPO 可能更稳定?
模型训练与对齐强化学习与奖励
原理机制
进阶
0220
为什么选择 GRPO,它的优化目标和数学原理是什么?
模型训练与对齐强化学习与奖励
比较选型
进阶