Agent 对齐优化为什么选择强化学习,如何与 SFT、DPO、PPO、GRPO 和 RAG 比较?

暂无参考答案

未标记

本题目录

相关面经

1

阿里巴巴

Agent 算法工程师
一面
查看原面经 →
对比选型SFT、DPO、PPO、GRPO、RAG多条技术路线,说明为何选用强化学习做Agent对齐优化,完整输出各方案评估维度、适配场景与选型依据。

相关题目

4