偏好对齐

9 个专题 · 270 道题

已筛选

11 道题

排序:

0896
DPO 的算法原理是什么?
模型训练与对齐偏好对齐
原理机制
进阶
0273
SFT 与偏好数据如何构建,如何控制数据污染和分布偏移?
模型训练与对齐偏好对齐
方案设计
进阶
0275
如何从 KL 约束的强化学习目标推导 DPO 目标?
模型训练与对齐偏好对齐
原理机制
深入
0604
DPO 中好坏样例生成概率都下降的问题如何理解?
模型训练与对齐偏好对齐
原理机制
进阶
0605
DPOP 的全称是什么?
模型训练与对齐偏好对齐
原理机制
进阶
0737
DPO 是否需要额外加入 KL 约束?
模型训练与对齐偏好对齐
原理机制
进阶
2706
如何构建 chosen/rejected 偏好对,模型答案优于标注答案时如何处理?
模型训练与对齐偏好对齐
方案设计
进阶
2899
DPO 训练有哪些需要注意的事项?
模型训练与对齐偏好对齐
方案设计
进阶
3051
DPO 为什么不需要在线采样,训练数据采用什么格式?
模型训练与对齐偏好对齐
原理机制
进阶
3483
为什么 DPO 不适合当前项目场景?
模型训练与对齐偏好对齐
比较选型
进阶