端到端决策规划控制算法工程师二面面经
完整信息
本篇目录
日期:2026.8.14
时长:约70分钟
面试类型:技术二面
面试岗位:端到端决策规划控制算法工程师
工作地:上海
内容:
1 自我介绍
面试官说3-5分钟,我差不多就1分多一点吧,有点背熟练了。
2 实习拷打
a 我看你实习是和大模型相关,为什么最后没有选择大模型相关的岗位,你现在面试的岗位偏智驾相关的,你认为有什么(岗位上的)共同点,或者有什么可以迁移的地方吗?
首先对于第一段实习,本质上是……,所以没法实习太久。具体的工作内容是偏AI应用落地。第二段实习为什么是和LLM相关呢,因为这两年我看到了LLM的快速发展,对其(与智驾一样,)同样有浓厚的兴趣。而我能出来实习的时间较早,所以也有机会能进入到相关岗位进行实习。同样我也认为在LLM相关岗位进行实习能进一步加深对智驾的理解,有助于未来我在智驾相关岗位求职。
b 第二段实习用了LoRA微调,介绍一下LoRA微调的初始化。
还是先讲的矩阵分解,再讲r选择,然后接B和A初始化,最后将参数更新。
c 看到你有自己构建数据集,大概是有多少数据量?
经过处理、清洗之后,有效样本大约是xx和xx条。
d 在多大的评估集上评估的?
评估集怎么来的,单个评估集大概是xx条。
e 你采用了SFT+GRPO,相比如原有模型有哪些改动?数据层面有哪些问题和改动?
原有的业务问题是……,属于一个小样本问题的子问题。其面临……,采用传统的xx模型效果其实不太好,考虑到xxx,因此才采用了LLM进行。数据层面问题主要是非结构化、情绪化、样本分布不均等问题。
f 最终输出是什么,就是一个xxx结果吗?
模型输出进行正则化提取后,作为结果。但是从评估集的统计来看模型准确率是……,经过后续的人工校验分析,评估集中存在人工标签错误的情况,经过估算,这类样本大约占xx%,因此模型实际性能表现是被低估的,真实表现会大概在xx%。
g GRPO怎么实现的,或者说reward怎么设计的?
考虑到样本量较小,因此我很难让模型实现真正从0到1的自主推理。所以GRPO更多是在25%样本的demo上进行尝试。reward设计也更多是从当前模型的不足出发进行一个设计,比如……,还有……,针对这两个问题有针对性的奖励项设计。
f 具体怎么设计的?
基本设计思路是基于主目标设计主奖励项,然后看当前模型存在什么问题,再针对问题设计一些奖励项,基本按照这个思路来回答的。
3 项目拷打
a 实习就到这,看你做了不少项目,这些项目是自驱的呢还是说做的是横向、重要项目?又或是自己单纯的学习与尝试?
这些项目都存在真实项目背景,也有各自对应的产出,也是长期学习的过程。其中xx和xx有xx成果,xx正在做xx产出,另一个在做的xx大概完成到xx程度。
b 你xx和xx项目中是xx场景,另一个项目是xx场景,分别用了PPO和DDPG,为什么对于不同场景会有架构差异较大的算法选择,有什么考量的吗?
其实没有特备的考量,首先用PPO主要是项目在快速落地情况下,PPO对超参数设置不是很敏感,可以节约前期的时间,且性能相当不错。后续又尝试DDPG也是我想通过项目之间的不同算法来实际感受算法间的差异,原计划是想做baseline实验的,不过时间不太够,比较可惜。
c 对于DDPG项目的reward,你是如何设计的?
每一个项目的reward设计都需要根据场景来设计。像这个项目中,场景可以划分为x种情况,对于xx情况xx行为就不够合理,虽然可以通过reward来约束,但我选择约束他的动作空间,这样学习到的策略也收敛且合理。而对于……,我引入了xx风险势场,来……。此外还有一些针对实际情况特异化设计的奖励项,……。
d 但对于你这个场景其实在……时候会发生一个强博弈的情况,也就是很多时候你在实际场景中,你不去做xx,那么其他xx也很难去做出xx行为。而且你引入的风险势场也可能让最终策略偏保守。这个时候如果去衡量这种结果,从xx、xx、xx角度来看,也不一定能实现你期望的一个结果,存在多种可能。这种情况应该是有一个多模态的行为和对应的多模态的考量。
这个可以主要考虑不同智能体之间的交互,有的真实场景中xx的行为确实就像您所说不会去做xx,对于在模型学习过程中的多模态,我的做法是在智能体中引入xx使其具有不同的行为风格,这样的话在不同场景中的不同风格组合就会让模型学习到对应的多模态的策略。
e 你所说的风格是如何作为智能体的输入的?
在所有项目中,我是不做xx的。所以我的输入是xx,而不同的风格最终在实际物理量中都会体现在xx和xx上,因此只需要将这些作为输入即可,模型会自己进行学习。
f 你的输入是连续值还是离散值?
绝对的连续是做不到的,所以客观来说是连续时间步的离散值
g 那么你怎么保证模型一定能学到这个不同的风格对其的影响呢,或者说你所说的这种有效的方式,模型是否真的哟校学习,最后如何评估这些不同风格的影响,有评估过吗?
对于训练过程的随机初始化,会确保各个各种风格车辆都会生成,经过多轮训练后就可以确保学习到对应策略。而评估的话,更多是从宏观角度进行评估,如……。
h 说一下PPO和TRPO的一个区别。
TRPO是……,PPO在其基础上进行了改进,是……。
i 在训练过程是否遇到策略坍缩,如何解决的?
遇到过,情况是……,对于这种情况,我一般考虑增加奖励函数的辅助项来解决。
j 是否考虑通过课程学习等方法来提成策略性能?
有看过这种方法,需要通过数据集来……。但是我并没有这么做,原因在于当前场景相对异化,并没有较好的公开数据集。如果有则可以尝试,因为具有……优点。
k 策略鲁棒性如何体现?
主要思路是,通过评估回合的泛化初始化来体现,最后也看评价指标。
l PPO和GRPO在应用领域的区别?
我认为PPO仍然是经典强化学习算法,主要是用在智能体决策或者是长尾情境的conner case提升,而GRPO主要用在LLM领域,简化了对模型的评估,提升了模型训练效率。
4 手撕
a 是否会cpp?
不会
b 给了一个换硬币的题,是动态规划,给一个金额,然后给出按照当前硬币种类前提下,一共能有多少中硬币排列组合,但是没a出来,思路是对的。
5 反问
a 今天表现好的地方,不好地方。
总体还可以,问题的回答有点长了(说我话多哈哈哈)
b 今天面试结果反馈周期
一般1-2周
c 对自己的职业规划,期望第一份工作能深耕,瞄准3-5年以上进行规划,除了cpp之外,我还有哪些需要进行学习?假如我进入到相关的工作岗位,整个团队的大致工作内容、组织架构、晋升条件,不知道您是否方便介绍一下。
cpp必需的,要学,后续可能涉及xx,可以提前看看。晋升具体要看情况(打了下太极)。团队主要还是做xxx。
5 后续
hr约了3面
本篇目录
- 01
自我介绍
- 02
我看你实习是和大模型相关,为什么最后没有选择大模型相关的岗位,你现在面试的岗位偏智驾相关的,你认为有什么(岗位上的)共同点,或者有什么可以迁移的地方吗?
- 03
第二段实习用了LoRA微调,介绍一下LoRA微调的初始化。
- 04
看到你有自己构建数据集,大概是有多少数据量?
- 05
在多大的评估集上评估的?
- 06
你采用了SFT+GRPO,相比如原有模型有哪些改动?数据层面有哪些问题和改动?
- 07
最终输出是什么,就是一个xxx结果吗?
- 08
GRPO怎么实现的,或者说reward怎么设计的?
- 09
具体怎么设计的?
- 10
这些项目是自驱的呢还是说做的是横向、重要项目?又或是自己单纯的学习与尝试?
- 11
分别用了PPO和DDPG,为什么对于不同场景会有架构差异较大的算法选择,有什么考量的吗?
- 12
对于DDPG项目的reward,你是如何设计的?
- 13
这种情况应该是有一个多模态的行为和对应的多模态的考量。
- 14
你所说的风格是如何作为智能体的输入的?
- 15
你的输入是连续值还是离散值?
- 16
那么你怎么保证模型一定能学到这个不同的风格对其的影响呢,或者说你所说的这种有效的方式,模型是否真的哟校学习,最后如何评估这些不同风格的影响,有评估过吗?
- 17
说一下PPO和TRPO的一个区别。
- 18
在训练过程是否遇到策略坍缩,如何解决的?
- 19
是否考虑通过课程学习等方法来提成策略性能?
- 20
策略鲁棒性如何体现?
- 21
PPO和GRPO在应用领域的区别?
- 22
是否会cpp?
- 23
给了一个换硬币的题,是动态规划,给一个金额,然后给出按照当前硬币种类前提下,一共能有多少中硬币排列组合
- 24
今天表现好的地方,不好地方。
- 25
今天面试结果反馈周期
- 26
除了cpp之外,我还有哪些需要进行学习?
- 27
假如我进入到相关的工作岗位,整个团队的大致工作内容、组织架构、晋升条件,不知道您是否方便介绍一下。