强化学习与奖励

9 个专题 · 270 道题

已筛选

100 道题

排序:

0104
GRPO 算法如何工作?
模型训练与对齐强化学习与奖励
原理机制
进阶
0514
PPO 算法原理是什么?
模型训练与对齐强化学习与奖励
原理机制
进阶
0515
DPO 与 PPO 有什么区别?
模型训练与对齐强化学习与奖励
比较选型
进阶
2704
如何根据业务目标设计强化学习奖励?
模型训练与对齐强化学习与奖励
方案设计
进阶
0615
什么情况下使用 PPO,什么情况下使用 GRPO?
模型训练与对齐强化学习与奖励
比较选型
进阶
2490
GRPO 相比 PPO 做了哪些改进?
模型训练与对齐强化学习与奖励
比较选型
进阶
0086
如何判断强化学习带来的实际收益?
模型训练与对齐强化学习与奖励
项目深挖
进阶
0103
强化学习包含哪些主要组件?
模型训练与对齐强化学习与奖励
概念解释
基础
0169
RLHF/PPO 中 Actor、Critic、Reward Model 和 Reference Model 的职责是什么,为什么需要 KL 约束?
模型训练与对齐强化学习与奖励
原理机制
进阶
0213
GRPO 组内奖励相同或方差接近零时,会有什么问题,如何处理?
模型训练与对齐强化学习与奖励
原理机制
进阶