← 返回全部题目← 上一题6 / 11下一题 →题库/模型训练与对齐/Q-0896DPO 的算法原理是什么?知识专题:偏好对齐题目类型:原理机制技术难度:进阶相关面经:4 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经4 篇腾讯大模型算法工程师2026-05-18暑期查看原面经 →讲一下 DPO 的损失函数怎么计算腾讯大模型算法工程师2026-05-05暑期实习一面查看原面经 →讲一下 DPO 的损失函数怎么计算京东算法工程师(对话机器人)2026-01-27实习查看原面经 →GRPO,PPO,DPO的算法原理美团Agent 算法工程师2025-09-27查看原面经 →介绍下ppo dpo grpo算法相关题目4 题0273SFT 与偏好数据如何构建,如何控制数据污染和分布偏移?同一知识专题题目类型:方案设计技术难度:进阶相关面经:1 篇0275如何从 KL 约束的强化学习目标推导 DPO 目标?同一知识专题题目类型:原理机制技术难度:深入相关面经:1 篇0604DPO 中好坏样例生成概率都下降的问题如何理解?同一知识专题题目类型:原理机制技术难度:进阶相关面经:1 篇0605DPOP 的全称是什么?同一知识专题题目类型:原理机制技术难度:进阶相关面经:1 篇← 上一题已到最后一题← 上一题DPO 是否需要额外加入 KL 约束?下一题 →如何构建 chosen/rejected 偏好对,模型答案优于标注答案时如何处理?