强化学习与奖励

9 个专题 · 270 道题

已筛选

100 道题

排序:

2469
Deep Research 如何与强化学习结合?
模型训练与对齐强化学习与奖励
方案设计
进阶
2474
GRPO 训练实际使用什么数据?
模型训练与对齐强化学习与奖励
项目深挖
进阶
2632
DAPO 的改进解决了什么问题?
模型训练与对齐强化学习与奖励
原理机制
进阶
2689
强化学习如何选择有效难度的样本并提升复杂任务探索?
模型训练与对齐强化学习与奖励
方案设计
进阶
3654
强化学习任务的奖励函数如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
2675
如何判定 SFT 可以结束并进入强化学习阶段?
模型训练与对齐强化学习与奖励
方案设计
进阶
2686
字段提取任务的奖励函数应如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
2688
RL 训练初期奖励先降后升时,如何解释和排查?
模型训练与对齐强化学习与奖励
故障排查
进阶
2697
SFT、DPO、PPO 与 GRPO 的目标、机制和适用条件如何比较?
模型训练与对齐强化学习与奖励
比较选型
进阶
2701
PPO 的 Value Model 或 Critic 起什么作用?
模型训练与对齐强化学习与奖励
原理机制
基础