← 返回全部题目← 上一题100 / 100下一题 →题库/模型训练与对齐/Q-3717DeepSeek R1 的训练过程有哪些关键步骤?知识专题:强化学习与奖励题目类型:原理机制技术难度:进阶收录题集:1 份暂无参考答案未标记未标记待复习已掌握收藏本题目录收录题集相关题目收录题集1 份八股集锦(高频问题)小熊饼干_ · 个人整理 · 收录 2 道查看题集 →DeepSeek热门版本训练的关键步骤Deepseek R1 训练关键步骤相关题目4 题0086如何判断强化学习带来的实际收益?同一知识专题题目类型:项目深挖技术难度:进阶相关面经:2 篇0103强化学习包含哪些主要组件?同一知识专题题目类型:概念解释技术难度:基础相关面经:2 篇0104GRPO 算法如何工作?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0105On-policy 和 Off-policy 有什么区别?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇← 上一题已到最后一题← 上一题GSPO 的核心机制是什么,与 GRPO 有什么关系?下一题 →