模型训练与对齐
9 个专题 · 270 道题
训练数据构建与治理
37 题- 如何合成 Agent 训练任务,并验证任务设计带来的增益?
- 训练数据如何合成与筛选?
预训练、续训与 SFT
42 题- 是否独立做过模型训练或微调?
- 你有哪些大模型后训练经验?
参数高效微调
18 题- LoRA 的原理、常见超参数与注入模块是什么?
- LoRA 效果不好时如何定位和改进?
偏好对齐
11 题- DPO 的算法原理是什么?
- SFT 与偏好数据如何构建,如何控制数据污染和分布偏移?
强化学习与奖励
100 题- GRPO 算法如何工作?
- PPO 算法原理是什么?
Verifier 与训练评测
7 题- 工业故障诊断项目如何排除测试污染与 Judge 偏差,证明训练策略收益?
- 如何判断强化学习训练质量是否达标?
蒸馏与模型合并
5 题- 蒸馏受限时,如何选择后训练方法提升模型能力?
- 项目中的模型蒸馏具体如何实现?
分布式训练与计算硬件
30 题- DCU 与 GPU 有什么区别?
- SIMT 有什么特点,遇到分支会发生什么?
训练框架、调参与排障
20 题- 项目中的强化学习框架是如何搭建的?
- 如何处理梯度消失与梯度爆炸?