模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

0608
组内样本全对或全错有什么问题,DAPO 如何处理?
模型训练与对齐训练数据构建与治理
原理机制
进阶
0609
Reward Model 常用什么结构,与 Value Model 有什么区别?
模型训练与对齐强化学习与奖励
比较选型
进阶
0614
SFT 和 PEFT 训练中使用过哪些技巧?
模型训练与对齐参数高效微调
项目深挖
进阶
0626
如何理解模型训练中的过拟合和欠拟合?
模型训练与对齐训练框架、调参与排障
故障排查
基础
0627
为什么要对大模型微调?
模型训练与对齐参数高效微调
比较选型
基础
0629
模型训练的显存由哪些部分占用?
模型训练与对齐分布式训练与计算硬件
原理机制
进阶
0630
训练语料量和 Batch Size 如何设置,为什么不设为 1 或 2?
模型训练与对齐训练数据构建与治理
方案设计
进阶
0633
给定 7B 模型,如何计算 LoRA 参数及优化器显存分配?
模型训练与对齐参数高效微调
原理机制
进阶
0635
Agentic RL 是什么?
模型训练与对齐强化学习与奖励
原理机制
基础
0637
大模型侧需要做哪些改进以适配 Agent?
模型训练与对齐预训练、续训与 SFT
方案设计
进阶