强化学习与奖励

9 个专题 · 270 道题

已筛选

100 道题

排序:

1232
行为风格如何输入智能体,输入是连续值还是离散值?
模型训练与对齐强化学习与奖励
原理机制
进阶
1233
如何证明模型学到了不同风格的影响,并评估效果?
模型训练与对齐强化学习与奖励
方案设计
进阶
1234
PPO 与 TRPO 有何区别?
模型训练与对齐强化学习与奖励
比较选型
进阶
1235
训练中出现策略坍缩如何解决?
模型训练与对齐强化学习与奖励
故障排查
进阶
1236
如何体现和评估策略鲁棒性?
模型训练与对齐强化学习与奖励
方案设计
进阶
1614
对齐后正常问题也过度拒答,应优先修正什么?
模型训练与对齐强化学习与奖励
故障排查
进阶
1730
项目的 SFT 和 GRPO 是否分为两个阶段?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1733
强化学习项目的决策和动作空间是离散的吗?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1734
当前动作空间不够细致时,如何解释这种粒度设计?
模型训练与对齐强化学习与奖励
项目深挖
深入
1735
决策项目采用多智能体协同有哪些优势和难点?
模型训练与对齐强化学习与奖励
项目深挖
进阶