DPO 中好坏样例生成概率都下降的问题如何理解?

暂无参考答案

未标记

本题目录

相关面经

1

阿里巴巴

大模型应用算法工程师
查看原面经 →
dpo训练是同时打压好坏样例的生成概率问题

相关题目

4