模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

0524
GRPO 如何实现,奖励函数尤其长轨迹奖励如何设计?
模型训练与对齐强化学习与奖励
方案设计
深入
0539
LoRA 效果不好时如何定位和改进?
模型训练与对齐参数高效微调
故障排查
进阶
0541
LoRA 有哪些缺点和改进方向?
模型训练与对齐参数高效微调
比较选型
进阶
0634
了解哪些强化学习优化算法?
模型训练与对齐强化学习与奖励
比较选型
基础
0736
什么是 Reward Hacking,如何识别、定位并治理?
模型训练与对齐强化学习与奖励
故障排查
进阶
0896
DPO 的算法原理是什么?
模型训练与对齐偏好对齐
原理机制
进阶
1244
训练一个模型需要哪些步骤和关注点?
模型训练与对齐预训练、续训与 SFT
原理机制
进阶
2913
什么情况下 GRPO 效果较差?
模型训练与对齐强化学习与奖励
故障排查
进阶
3047
SFT 的完整执行流程与训练数据集如何构建?
模型训练与对齐训练数据构建与治理
方案设计
进阶
3449
PPO 中需要训练哪几个模型?
模型训练与对齐强化学习与奖励
原理机制
基础