为什么先做 Step-level SFT 再做 GRPO 可能更稳定?

暂无参考答案

未标记

本题目录

相关面经

1

唯品会

NLP 算法工程师
实习一面
查看原面经 →
为什么 Step-level SFT 之后再进行 GRPO,通常比直接从基座模型开始做 GRPO 稳定

相关题目

4