强化学习与奖励

9 个专题 · 270 道题

已筛选

100 道题

排序:

2702
GRPO 如何估计组内优势?
模型训练与对齐强化学习与奖励
原理机制
进阶
2703
轨迹级奖励与 Token 级优化之间如何分配贡献?
模型训练与对齐强化学习与奖励
原理机制
进阶
2772
GRPO 生成只命中商品 SID 前两个 Token 时如何给奖励?
模型训练与对齐强化学习与奖励
方案设计
进阶
2790
如何平衡强化学习训练效率与稳定性?
模型训练与对齐强化学习与奖励
方案设计
进阶
2794
小模型做强化学习是否有效,如何选择模型与每轮数据规模?
模型训练与对齐强化学习与奖励
比较选型
进阶
2834
GRPO 训练数据应满足哪些要求?
模型训练与对齐强化学习与奖励
方案设计
进阶
2848
A2C 的基本原理是什么?
模型训练与对齐强化学习与奖励
原理机制
进阶
2914
为什么选择 DPO 而不选择 GRPO?
模型训练与对齐强化学习与奖励
比较选型
进阶
3009
PPO 的 Value Model 如何训练?
模型训练与对齐强化学习与奖励
原理机制
进阶
3010
PPO 的 Reward Model 如何训练?
模型训练与对齐强化学习与奖励
原理机制
进阶