模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

0498
如何在一个细分场景中微调 Agent?
模型训练与对齐预训练、续训与 SFT
方案设计
进阶
0513
预训练、后训练到推理的流程是什么?
模型训练与对齐预训练、续训与 SFT
原理机制
基础
0517
如何训练模型,使其更精确地提取摘要?
模型训练与对齐预训练、续训与 SFT
方案设计
进阶
0521
轨迹训练数据的规模、字段格式和生成方式是什么?
模型训练与对齐训练数据构建与治理
项目深挖
进阶
0523
线上长轨迹采集有哪些难点,VM 和沙盒环境如何同步?
模型训练与对齐训练数据构建与治理
方案设计
深入
0526
轨迹模型训练使用多少计算资源?
模型训练与对齐分布式训练与计算硬件
项目深挖
进阶
0574
Transformer 中有哪些 LoRA 变体?
模型训练与对齐参数高效微调
比较选型
进阶
0604
DPO 中好坏样例生成概率都下降的问题如何理解?
模型训练与对齐偏好对齐
原理机制
进阶
0605
DPOP 的全称是什么?
模型训练与对齐偏好对齐
原理机制
进阶
0607
GRPO 和 DAPO 有什么区别?
模型训练与对齐强化学习与奖励
比较选型
进阶