← 返回全部题目← 上一题12 / 42下一题 →题库/模型训练与对齐/Q-0681为什么在 SFT 后采用 RL,SFT 遇到了什么问题?知识专题:预训练、续训与 SFT题目类型:比较选型技术难度:进阶相关面经:5 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经5 篇美团大模型算法工程师2026-07-05一面、二面查看原面经 →已经构建推理类Reasoning训练数据,为什么还需要接入RL训练?仅依靠SFT能否满足业务需求?查看该问上下文 →大模型训练为什么必须拆分SFT预微调+RL强化优化两个阶段,能否简化流程?查看该问上下文 →腾讯大模型算法工程师2026-05-18暑期查看原面经 →为什么 SFT 之后还要进行后训练快手2026-05-09面经合集查看原面经 →为什么考虑需要强化学习,SFT不是够了吗腾讯大模型算法工程师2026-05-05暑期实习一面查看原面经 →为什么 SFT 之后还要进行后训练荣耀大模型算法工程师2026-03-28实习查看原面经 →为什么要用rl来优化模型,在sft的时候遇到了哪些问题,又是怎么解决的?相关题目4 题0083如何提升 Agent 的长程任务能力?同一知识专题题目类型:方案设计技术难度:进阶相关面经:1 篇0085当 pass@k 与 pass@1 的差距收敛后,如何继续提升模型能力?同一知识专题题目类型:方案设计技术难度:深入相关面经:1 篇0207基座已有工具调用能力时,Tool-use SFT 的训练目标是什么?同一知识专题题目类型:原理机制技术难度:进阶相关面经:1 篇0495你有哪些大模型后训练经验?同一知识专题题目类型:项目深挖技术难度:进阶相关面经:2 篇← 上一题已到最后一题← 上一题是否有从零训练大模型的经历?下一题 →是否独立做过模型训练或微调?