极兔

1 篇面经8 道面试题

已筛选

8 道题

排序:

0058
Agent 是什么,由哪些核心能力和组件组成?
Agent 原理与系统Agent 基础与运行循环
概念解释
基础
0117
何时沿用开源 Agent 框架,何时选择自行封装或从零开发?
Agent 原理与系统Agent 框架与 Harness
比较选型面前必看
进阶
0169
RLHF/PPO 中 Actor、Critic、Reward Model 和 Reference Model 的职责是什么,为什么需要 KL 约束?
模型训练与对齐强化学习与奖励
原理机制
进阶
0514
PPO 算法原理是什么?
模型训练与对齐强化学习与奖励
原理机制
进阶
0607
GRPO 和 DAPO 有什么区别?
模型训练与对齐强化学习与奖励
比较选型
进阶
0608
组内样本全对或全错有什么问题,DAPO 如何处理?
模型训练与对齐训练数据构建与治理
原理机制
进阶
0609
Reward Model 常用什么结构,与 Value Model 有什么区别?
模型训练与对齐强化学习与奖励
比较选型
进阶
0610
ReAct 与普通函数调用、工作流编排有什么区别?
Agent 原理与系统工作流、状态与执行恢复
比较选型
进阶