智驾 VLA 算法工程师二面面经
完整信息
本篇目录
日期:2026.8.3
时长:约35分钟
面试类型:技术面
面试岗位:智驾VLA算法工程师
工作地:深圳
1 面试官自我介绍
团队base深圳
2 自我介绍
围绕简历介绍
3 从第二段实习开始
a 主要难点是什么
数据层面问题……。
b 我理解你的经历是……。那么未来继续推进这个业务,还有哪些问题需要解决,你的行动项是什么?
数据层面……,模型层面……。
c 发散一下,你已经在用llm了,现在来发散一下。从之前的一段式、两段式到现在的vla vlm,你对这些技术有什么思考?
(这个是有点上强度了,本身小鹏开的比较早,所以投递也比较早,恰好面试这但时间一直在改论文忙飞,所以灭有准备)(当时整体也理解错了,我结合我对技术的认识,和自身经历去说了认知,但不是技术上的发散)
d 没关系,我们先发散聊一聊,然后再聊一些技术细节。最近有看新的paper或者一些成熟的工作吗?
(感觉是第二次机会,但奈何没货,接不住)最近实习+改论文,强度非常饱和,没有太多积累
e 穿插问些基础问题,如果采用xxx系列模型在训练的时候如果有不同分辨率图像,应该训练?
(完全不知道)我不是专门做相关方向的,不过我认为整体可以先尝试卷积的思路,对图像特征进行提取后使得特征维度保持统一。
f (追问)怎么做?具体怎么做?
不知道(此时已经有点绷不住了,和momenta一面压力程度相当)
g 再问些其他问题, 为什么要用Lora微调,为什么不用全量?有什么限制?
当前业务问题是……,数据量在……,因此属于LLM中的子任务,仅通过LoRA就可以获得相应能力……。限制主要在算力资源不够。
h 具体是什么不够?
具体是xxx。
i 还有什么不够?
还有其他的……嘛……我暂时没遇到。
j LoRA这个技术诞生主要用于解决什么问题?
主要是……,可以节约资源。
k 可以节约什么资源?为什么能节约资源?
LoRA原理是……,因此它可以节省……。
l LoRA中的rank是重要参数,有什么含义?
含义是……。
m Rank变大会有什么问题?
会有……。
n 回到训练模型,模型训练可能会有几种bound,比如memory bound、data bound、cpu/gpu bound。你遇到过什么问题?
主要是memory bound
o 是训练还是推理?
都遇到,因此我采用了……来规避/缓解,以提升不同场景下的稳定性。
p 如果用户输入过长,你的profile扛不住,除了限制用户输入,有没有其他工程上方法可以优化?
(不知道)
q 那现在的方法不就很粗暴吗?扛不住上下文就限制输入,没有用其他方法吗?
对于这个问题,其实还采用了……方法,一定程度上对关键信息进行提取及分流。
r 后续的Agent框架可以做一些上下文去重,然后来变相增长上下文,也就是和用户交流的空间对吧?
不是,agent做的是……。
s 回到显存问题,有什么方法可以优化?
围绕DDP+Zero说的。
t zero3是否了解原理?
大概原理是……。
u 如果已经用了zero3,还有什么方法?
还有hbm offload/nvme offload等。
3 技术与论文
对于模型就先聊到这,聊些技术的吧.
a 对于diffusion还有ddpm是否了解?
diffusion看过一次论文,大概原理是……。
b 为什么大家都在尝试diffusion?
连续、多模态、轨迹簇
c 那那些先验生成多模态轨迹的不也行吗?所以你想想diffusion本身的优势,这样建模到底是为什么?我给你点提示,diffusion最早来自生图领域……。首先第一个问题是为什么轨迹生成任务需要多模态能力比较强?
结合驾驶风格来说了下
d 为什么要用diffusion来做这个事?从数学建模角度来说有什么优点?
不知道(简短,铿锵有力)
e (面试官自己解答了d)
4 反问
暂时没有,回及时根据今天面试经历重点学习知识,部分情况上次面试官也为我解答了一些。(已经感觉自己挂了,不找尴尬了)
本篇目录
- 01
2 自我介绍
- 02
主要难点是什么
- 03
那么未来继续推进这个业务,还有哪些问题需要解决,你的行动项是什么?
- 04
发散一下,你已经在用llm了,现在来发散一下。从之前的一段式、两段式到现在的vla vlm,你对这些技术有什么思考?
- 05
最近有看新的paper或者一些成熟的工作吗?
- 06
如果采用xxx系列模型在训练的时候如果有不同分辨率图像,应该训练?
- 07
(追问)怎么做?具体怎么做?
上一问 ↑ - 08
为什么要用Lora微调,为什么不用全量?有什么限制?
- 09
具体是什么不够?
上一问 ↑ - 10
还有什么不够?
上一问 ↑ - 11
LoRA这个技术诞生主要用于解决什么问题?
- 12
可以节约什么资源?为什么能节约资源?
上一问 ↑ - 13
LoRA中的rank是重要参数,有什么含义?
- 14
Rank变大会有什么问题?
上一问 ↑ - 15
回到训练模型,模型训练可能会有几种bound,比如memory bound、data bound、cpu/gpu bound。你遇到过什么问题?
- 16
是训练还是推理?
上一问 ↑ - 17
如果用户输入过长,你的profile扛不住,除了限制用户输入,有没有其他工程上方法可以优化?
- 18
那现在的方法不就很粗暴吗?扛不住上下文就限制输入,没有用其他方法吗?
上一问 ↑ - 19
后续的Agent框架可以做一些上下文去重,然后来变相增长上下文,也就是和用户交流的空间对吧?
- 20
回到显存问题,有什么方法可以优化?
- 21
zero3是否了解原理?
- 22
如果已经用了zero3,还有什么方法?
上一问 ↑ - 23
对于diffusion还有ddpm是否了解?
- 24
为什么大家都在尝试diffusion?
- 25
首先第一个问题是为什么轨迹生成任务需要多模态能力比较强?
上一问 ↑ - 26
那那些先验生成多模态轨迹的不也行吗?所以你想想diffusion本身的优势,这样建模到底是为什么?
上一问 ↑ - 27
为什么要用diffusion来做这个事?从数学建模角度来说有什么优点?
上一问 ↑