滴滴

9 篇面经117 道面试题

已筛选

117 道题

排序:

2689
强化学习如何选择有效难度的样本并提升复杂任务探索?
模型训练与对齐强化学习与奖励
方案设计
进阶
2697
SFT、DPO、PPO 与 GRPO 的目标、机制和适用条件如何比较?
模型训练与对齐强化学习与奖励
比较选型
进阶
2701
PPO 的 Value Model 或 Critic 起什么作用?
模型训练与对齐强化学习与奖励
原理机制
基础
2702
GRPO 如何估计组内优势?
模型训练与对齐强化学习与奖励
原理机制
进阶
2703
轨迹级奖励与 Token 级优化之间如何分配贡献?
模型训练与对齐强化学习与奖励
原理机制
进阶
2704
如何根据业务目标设计强化学习奖励?
模型训练与对齐强化学习与奖励
方案设计
进阶
2752
InnoDB 为什么使用 B+ 树索引?
软件工程基础数据库与 SQL
原理机制
进阶