强化学习与奖励

9 个专题 · 270 道题

已筛选

100 道题

排序:

0259
GUI Agent 奖励如何确认环境状态真实改变,而非只看起来完成?
模型训练与对齐强化学习与奖励
方案设计
进阶
0260
GUI 环境吞吐低于训练吞吐时,如何组织在线强化学习?
模型训练与对齐强化学习与奖励
方案设计
进阶
0607
GRPO 和 DAPO 有什么区别?
模型训练与对齐强化学习与奖励
比较选型
进阶
0609
Reward Model 常用什么结构,与 Value Model 有什么区别?
模型训练与对齐强化学习与奖励
比较选型
进阶
0635
Agentic RL 是什么?
模型训练与对齐强化学习与奖励
原理机制
基础
0679
强化学习训练中的 Reference Model 起什么作用?
模型训练与对齐强化学习与奖励
原理机制
基础
1226
采用 SFT 和 GRPO 后相对原模型改了什么,数据层面有哪些问题和修改?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1229
不同项目为什么分别选择 PPO 和 DDPG?
模型训练与对齐强化学习与奖励
比较选型
进阶
1230
DDPG 项目的 reward 如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
1231
智驾场景中如何处理交互博弈、保守策略与多种行为风格?
模型训练与对齐强化学习与奖励
方案设计
进阶