模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

0085
当 pass@k 与 pass@1 的差距收敛后,如何继续提升模型能力?
模型训练与对齐预训练、续训与 SFT
方案设计
深入
0088
如何用知识图谱合成 Agent 任务?
模型训练与对齐训练数据构建与治理
方案设计
进阶
0090
除了训练数据,项目中还做了哪些算法改进?
模型训练与对齐训练数据构建与治理
项目深挖
深入
0101
verl 中的 Agent Loop 如何实现?
模型训练与对齐训练框架、调参与排障
原理机制
进阶
0105
On-policy 和 Off-policy 有什么区别?
模型训练与对齐强化学习与奖励
比较选型
进阶
0170
ZeRO-1、ZeRO-2 和 ZeRO-3 有何区别?
模型训练与对齐分布式训练与计算硬件
比较选型
进阶
0206
工具轨迹长度与任务复杂度有什么关系,训练时如何使用不同长度的数据?
模型训练与对齐训练数据构建与治理
原理机制
进阶
0207
基座已有工具调用能力时,Tool-use SFT 的训练目标是什么?
模型训练与对齐预训练、续训与 SFT
原理机制
进阶
0212
为什么先做 Step-level SFT 再做 GRPO 可能更稳定?
模型训练与对齐强化学习与奖励
原理机制
进阶
0214
长轨迹 SFT 如何选择截断、切分和掩码并保持工具依赖?
模型训练与对齐训练数据构建与治理
方案设计
进阶