百度

32 篇面经507 道面试题

已筛选

507 道题

排序:

3007
Agent 后训练中的 Verifier 如何设计?
模型训练与对齐Verifier 与训练评测
方案设计
进阶
3008
Agent 训练中的 Bad Case 如何回流?
模型训练与对齐训练数据构建与治理
方案设计
进阶
3009
PPO 的 Value Model 如何训练?
模型训练与对齐强化学习与奖励
原理机制
进阶
3010
PPO 的 Reward Model 如何训练?
模型训练与对齐强化学习与奖励
原理机制
进阶
3011
GRPO 的 Reward 能否迁移到 PPO?
模型训练与对齐强化学习与奖励
比较选型
进阶
3012
Code Agent 的 Verifier 如何设计?
AI 应用工程与治理评测体系与实验设计
方案设计
进阶
3019
三数之和的解法复杂度是多少,为什么?
算法与编程题算法复杂度与数据结构基础
原理机制
进阶

另有 1 篇多公司合集,可在面经记录中查看。