为什么在 SFT 后采用 RL,SFT 遇到了什么问题?

暂无参考答案

未标记

本题目录

相关面经

5

美团

大模型算法工程师
一面、二面
查看原面经 →
已经构建推理类Reasoning训练数据,为什么还需要接入RL训练?仅依靠SFT能否满足业务需求?
大模型训练为什么必须拆分SFT预微调+RL强化优化两个阶段,能否简化流程?

腾讯

大模型算法工程师
暑期
查看原面经 →
为什么 SFT 之后还要进行后训练

快手

面经合集
查看原面经 →
为什么考虑需要强化学习,SFT不是够了吗

腾讯

大模型算法工程师
暑期实习一面
查看原面经 →
为什么 SFT 之后还要进行后训练

荣耀

大模型算法工程师
实习
查看原面经 →
为什么要用rl来优化模型,在sft的时候遇到了哪些问题,又是怎么解决的?

相关题目

4