百度

32 篇面经507 道面试题

已筛选

507 道题

排序:

0514
PPO 算法原理是什么?
模型训练与对齐强化学习与奖励
原理机制
进阶
0515
DPO 与 PPO 有什么区别?
模型训练与对齐强化学习与奖励
比较选型
进阶
0516
模型如何实现超长上下文能力?
模型基础与推理推理优化与模型压缩
原理机制
进阶
0517
如何训练模型,使其更精确地提取摘要?
模型训练与对齐预训练、续训与 SFT
方案设计
进阶
0518
买卖股票的最佳时机(仅一次交易)。
算法与编程题动态规划、贪心与回溯
代码题
基础
0519
买卖股票的最佳时机 III(最多两次交易)。
算法与编程题动态规划、贪心与回溯
代码题
进阶
0520
买卖股票的最佳时机 IV(最多 k 次交易)。
算法与编程题动态规划、贪心与回溯
代码题
进阶
0524
GRPO 如何实现,奖励函数尤其长轨迹奖励如何设计?
模型训练与对齐强化学习与奖励
方案设计
深入
0544
了解或使用过哪些现有 Agent 产品?
Agent 原理与系统Agent 应用架构与场景设计
经历介绍
0575
手写 Multi-Head Attention。
模型基础与推理Transformer 与注意力
代码题
进阶

另有 1 篇多公司合集,可在面经记录中查看。