Agent 对齐优化为什么选择强化学习,如何与 SFT、DPO、PPO、GRPO 和 RAG 比较?
暂无参考答案
未标记
本题目录
相关面经
1 篇阿里巴巴
Agent 算法工程师一面
对比选型SFT、DPO、PPO、GRPO、RAG多条技术路线,说明为何选用强化学习做Agent对齐优化,完整输出各方案评估维度、适配场景与选型依据。
暂无参考答案
对比选型SFT、DPO、PPO、GRPO、RAG多条技术路线,说明为何选用强化学习做Agent对齐优化,完整输出各方案评估维度、适配场景与选型依据。