模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

1729
项目微调具体更新模型的哪些部分?
模型训练与对齐预训练、续训与 SFT
项目深挖
进阶
1730
项目的 SFT 和 GRPO 是否分为两个阶段?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1733
强化学习项目的决策和动作空间是离散的吗?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1734
当前动作空间不够细致时,如何解释这种粒度设计?
模型训练与对齐强化学习与奖励
项目深挖
深入
1735
决策项目采用多智能体协同有哪些优势和难点?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1736
强化学习决策算法的输入是什么,还使用哪些输入特征?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1739
强化学习项目是否与仿真环境交互,各项目是否相同?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1740
没有原有仿真环境时,是否仍能实现当前强化学习模型?
模型训练与对齐强化学习与奖励
方案设计
进阶
1742
项目奖励函数是稀疏还是稠密的,具体如何设计?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1743
奖励项重要程度不同时,如何平衡各项权重?
模型训练与对齐强化学习与奖励
项目深挖
进阶