强化学习与奖励

9 个专题 · 270 道题

已筛选

100 道题

排序:

1736
强化学习决策算法的输入是什么,还使用哪些输入特征?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1739
强化学习项目是否与仿真环境交互,各项目是否相同?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1740
没有原有仿真环境时,是否仍能实现当前强化学习模型?
模型训练与对齐强化学习与奖励
方案设计
进阶
1742
项目奖励函数是稀疏还是稠密的,具体如何设计?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1743
奖励项重要程度不同时,如何平衡各项权重?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1744
项目为什么没有采用 TD3?
模型训练与对齐强化学习与奖励
比较选型
进阶
1750
手写 PPO Loss。
模型训练与对齐强化学习与奖励
代码题
深入
1896
项目为什么选择 GRPO 而不选择 DPO?
模型训练与对齐强化学习与奖励
比较选型
进阶
2144
SFT、强化学习和 Agentic CFT 分别解决什么问题?
模型训练与对齐强化学习与奖励
比较选型
进阶
2468
GRPO 的 Loss 如何计算?
模型训练与对齐强化学习与奖励
原理机制
进阶