模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

0030
DCU 与 GPU 有什么区别?
模型训练与对齐分布式训练与计算硬件
比较选型
进阶
0086
如何判断强化学习带来的实际收益?
模型训练与对齐强化学习与奖励
项目深挖
进阶
0100
项目中的强化学习框架是如何搭建的?
模型训练与对齐训练框架、调参与排障
项目深挖
深入
0103
强化学习包含哪些主要组件?
模型训练与对齐强化学习与奖励
概念解释
基础
0169
RLHF/PPO 中 Actor、Critic、Reward Model 和 Reference Model 的职责是什么,为什么需要 KL 约束?
模型训练与对齐强化学习与奖励
原理机制
进阶
0213
GRPO 组内奖励相同或方差接近零时,会有什么问题,如何处理?
模型训练与对齐强化学习与奖励
原理机制
进阶
0495
你有哪些大模型后训练经验?
模型训练与对齐预训练、续训与 SFT
项目深挖
进阶
0501
RLHF 奖励模型的训练数据如何构建?
模型训练与对齐强化学习与奖励
方案设计
进阶
0506
不同大模型微调方法如何比较?
模型训练与对齐预训练、续训与 SFT
比较选型
进阶
0509
如何处理梯度消失与梯度爆炸?
模型训练与对齐训练框架、调参与排障
故障排查
进阶