模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

0219
SFT 数据如何筛选、采样和处理?
模型训练与对齐训练数据构建与治理
方案设计
进阶
0220
为什么选择 GRPO,它的优化目标和数学原理是什么?
模型训练与对齐强化学习与奖励
比较选型
进阶
0259
GUI Agent 奖励如何确认环境状态真实改变,而非只看起来完成?
模型训练与对齐强化学习与奖励
方案设计
进阶
0260
GUI 环境吞吐低于训练吞吐时,如何组织在线强化学习?
模型训练与对齐强化学习与奖励
方案设计
进阶
0273
SFT 与偏好数据如何构建,如何控制数据污染和分布偏移?
模型训练与对齐偏好对齐
方案设计
进阶
0275
如何从 KL 约束的强化学习目标推导 DPO 目标?
模型训练与对齐偏好对齐
原理机制
深入
0276
训练正常而离线评测骤降时,如何定位链路问题?
模型训练与对齐训练框架、调参与排障
故障排查
深入
0278
工业故障诊断项目如何排除测试污染与 Judge 偏差,证明训练策略收益?
模型训练与对齐Verifier 与训练评测
效果评估
深入
0347
项目中的模型蒸馏具体如何实现?
模型训练与对齐蒸馏与模型合并
项目深挖
进阶
0381
资源受限的微调中,如何判断学习率过高或过低?
模型训练与对齐训练框架、调参与排障
故障排查
进阶