模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

3540
PPO 训练应监测哪些指标,如何评价效果?
模型训练与对齐Verifier 与训练评测
效果评估
进阶
3541
RLHF 如何定义对话偏好和好坏标注标准,并构建偏好数据集?
模型训练与对齐偏好对齐
方案设计
进阶
3542
Reward Model 与 Critic 的网络结构如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
3543
如何验证并调优 Reward Model 与 Critic 的有效性?
模型训练与对齐Verifier 与训练评测
效果评估
进阶
3545
Agent 对齐优化为什么选择强化学习,如何与 SFT、DPO、PPO、GRPO 和 RAG 比较?
模型训练与对齐强化学习与奖励
比较选型
进阶
3547
DPO 与 GRPO 的原理、优缺点和适用场景有何差异?
模型训练与对齐强化学习与奖励
比较选型
进阶
3548
如何从算法机制解释 GRPO 的探索能力和训练稳定性?
模型训练与对齐强化学习与奖励
原理机制
进阶
3555
回答效果不佳时,如何分别通过 RAG 和微调改进?
模型训练与对齐训练框架、调参与排障
方案设计
进阶
3556
微调属于预训练还是后训练?
模型训练与对齐预训练、续训与 SFT
概念解释
基础
3622
微调如何权衡数据多样性、长尾采样和 Prompt 设计?
模型训练与对齐训练数据构建与治理
方案设计
进阶