模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

3473
用 Qwen-3 等大模型奖励打分时是否需要微调?
模型训练与对齐强化学习与奖励
比较选型
进阶
3474
RAG 项目具体做过哪些微调?
模型训练与对齐预训练、续训与 SFT
项目深挖
进阶
3475
RAG 项目为什么没有采用强化学习?
模型训练与对齐强化学习与奖励
比较选型
进阶
3477
如何解决大模型记忆遗忘问题?
模型训练与对齐训练框架、调参与排障
故障排查
进阶
3478
是否使用过 DeepSpeed、DDP 等分布式训练框架?
模型训练与对齐分布式训练与计算硬件
经历介绍
3480
如何设计困难样本挖掘,使项目中的 8B 模型效果超过 14B 模型?
模型训练与对齐训练数据构建与治理
项目深挖
进阶
3482
PPO 的 Critic 如何计算,公式是什么?
模型训练与对齐强化学习与奖励
原理机制
进阶
3483
为什么 DPO 不适合当前项目场景?
模型训练与对齐偏好对齐
比较选型
进阶
3484
SFT 与 RL 数据中的 Reason 是人工标注还是模型生成?
模型训练与对齐训练数据构建与治理
项目深挖
进阶
3485
重新设计项目时,如何改进 SFT 与 RL 流程?
模型训练与对齐预训练、续训与 SFT
方案设计
进阶