模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

0764
后训练数据有哪些形态?
模型训练与对齐训练数据构建与治理
原理机制
基础
0823
如何考虑为每个业务后训练小模型?
模型训练与对齐预训练、续训与 SFT
方案设计
进阶
0904
是否做过分布式训练,常见的模型并行方式有哪些?
模型训练与对齐分布式训练与计算硬件
原理机制
进阶
1224
LoRA 的低秩矩阵如何初始化?
模型训练与对齐参数高效微调
原理机制
进阶
1226
采用 SFT 和 GRPO 后相对原模型改了什么,数据层面有哪些问题和修改?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1229
不同项目为什么分别选择 PPO 和 DDPG?
模型训练与对齐强化学习与奖励
比较选型
进阶
1230
DDPG 项目的 reward 如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
1231
智驾场景中如何处理交互博弈、保守策略与多种行为风格?
模型训练与对齐强化学习与奖励
方案设计
进阶
1232
行为风格如何输入智能体,输入是连续值还是离散值?
模型训练与对齐强化学习与奖励
原理机制
进阶
1233
如何证明模型学到了不同风格的影响,并评估效果?
模型训练与对齐强化学习与奖励
方案设计
进阶