强化学习与奖励

9 个专题 · 270 道题

已筛选

100 道题

排序:

3011
GRPO 的 Reward 能否迁移到 PPO?
模型训练与对齐强化学习与奖励
比较选型
进阶
3052
GRPO 中 KL 散度损失如何计算实现?
模型训练与对齐强化学习与奖励
原理机制
深入
3174
智能点餐场景的多轮 RL Reward 如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
3297
简单介绍后训练和强化学习。
模型训练与对齐强化学习与奖励
概念解释
基础
3363
项目奖励函数后续有什么改进思路?
模型训练与对齐强化学习与奖励
项目深挖
进阶
3364
KL 散度有什么作用,为什么使用它?
模型训练与对齐强化学习与奖励
原理机制
进阶
3367
了解哪些 GRPO 改进算法?
模型训练与对齐强化学习与奖励
概念解释
进阶
3368
较长对话的强化学习奖励如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
3369
奖励什么时候使用模型,什么时候使用规则?
模型训练与对齐强化学习与奖励
比较选型
进阶
3370
如何避免奖励坍缩和 Reward Hacking?
模型训练与对齐强化学习与奖励
故障排查
进阶