大模型算法工程师一面、二面、三面面经
完整信息
本篇目录
1️⃣一面
1.深挖项目,比如reward怎么设计的,后续有什么改进思路
2.ppo grpo的具体原理以及区别,ppo的critic模型怎么训练的
3.kl散度有什么用,为什么要用kl散度,以及一些kvcache相关的,mla之类的
4.手撕:链表相加,用双指针
2️⃣二面
1.问项目
2.从transformer八股到agentic rl,再到grpo的改进算法以及reward hacking,最后还聊了harness、Hermes这种比较新的agent设计以及讲讲看的最新的论文
3.没有手撕
3️⃣三面
1.聊项目
2.比较长的对话,强化学习怎么做reward,reward什么时候用模型什么时候用规则
3.如何避免奖励坍缩和hacking,同时有什么工程方法可以处理比较长的问答,多轮对话怎么微调,如何保持上下文记忆
4.agentic rl设计的思路,sft到了什么阶段可以做rl,如何评估,
📳对于想求职算法岗的同学,如果想参加高质量项目辅导,提升面试能力,欢迎后台联系。
本篇目录
- 01
比如reward怎么设计的
- 02
后续有什么改进思路
上一问 ↑ - 03
ppo grpo的具体原理以及区别
- 04
ppo的critic模型怎么训练的
- 05
kl散度有什么用,为什么要用kl散度
- 06
一些kvcache相关的
- 07
mla之类的
- 08
手撕:链表相加,用双指针
- 09
问项目
- 10
从transformer八股到agentic rl
- 11
grpo的改进算法
- 12
reward hacking
- 13
还聊了harness、Hermes这种比较新的agent设计
- 14
讲讲看的最新的论文
- 15
聊项目
- 16
比较长的对话,强化学习怎么做reward
- 17
reward什么时候用模型什么时候用规则
上一问 ↑ - 18
如何避免奖励坍缩和hacking
- 19
有什么工程方法可以处理比较长的问答
- 20
多轮对话怎么微调
- 21
如何保持上下文记忆
- 22
agentic rl设计的思路
- 23
sft到了什么阶段可以做rl
- 24
agentic rl设计的思路,sft到了什么阶段可以做rl,如何评估
上一问 ↑
