小鹏 · 智驾

智驾 VLA 算法工程师二面面经

完整信息

27 条问法 · 20 道题

本篇目录
日期:2026.8.3 时长:约35分钟 面试类型:技术面 面试岗位:智驾VLA算法工程师 工作地:深圳 1 面试官自我介绍 团队base深圳 2 自我介绍 围绕简历介绍 3 从第二段实习开始 a 主要难点是什么 数据层面问题……。 b 我理解你的经历是……。那么未来继续推进这个业务,还有哪些问题需要解决,你的行动项是什么? 数据层面……,模型层面……。 c 发散一下,你已经在用llm了,现在来发散一下。从之前的一段式、两段式到现在的vla vlm,你对这些技术有什么思考? (这个是有点上强度了,本身小鹏开的比较早,所以投递也比较早,恰好面试这但时间一直在改论文忙飞,所以灭有准备)(当时整体也理解错了,我结合我对技术的认识,和自身经历去说了认知,但不是技术上的发散) d 没关系,我们先发散聊一聊,然后再聊一些技术细节。最近有看新的paper或者一些成熟的工作吗? (感觉是第二次机会,但奈何没货,接不住)最近实习+改论文,强度非常饱和,没有太多积累 e 穿插问些基础问题,如果采用xxx系列模型在训练的时候如果有不同分辨率图像,应该训练? (完全不知道)我不是专门做相关方向的,不过我认为整体可以先尝试卷积的思路,对图像特征进行提取后使得特征维度保持统一。 f (追问)怎么做?具体怎么做? 不知道(此时已经有点绷不住了,和momenta一面压力程度相当) g 再问些其他问题, 为什么要用Lora微调,为什么不用全量?有什么限制? 当前业务问题是……,数据量在……,因此属于LLM中的子任务,仅通过LoRA就可以获得相应能力……。限制主要在算力资源不够。 h 具体是什么不够? 具体是xxx。 i 还有什么不够? 还有其他的……嘛……我暂时没遇到。 j LoRA这个技术诞生主要用于解决什么问题? 主要是……,可以节约资源。 k 可以节约什么资源?为什么能节约资源? LoRA原理是……,因此它可以节省……。 l LoRA中的rank是重要参数,有什么含义? 含义是……。 m Rank变大会有什么问题? 会有……。 n 回到训练模型,模型训练可能会有几种bound,比如memory bound、data bound、cpu/gpu bound。你遇到过什么问题? 主要是memory bound o 是训练还是推理? 都遇到,因此我采用了……来规避/缓解,以提升不同场景下的稳定性。 p 如果用户输入过长,你的profile扛不住,除了限制用户输入,有没有其他工程上方法可以优化? (不知道) q 那现在的方法不就很粗暴吗?扛不住上下文就限制输入,没有用其他方法吗? 对于这个问题,其实还采用了……方法,一定程度上对关键信息进行提取及分流。 r 后续的Agent框架可以做一些上下文去重,然后来变相增长上下文,也就是和用户交流的空间对吧? 不是,agent做的是……。 s 回到显存问题,有什么方法可以优化? 围绕DDP+Zero说的。 t zero3是否了解原理? 大概原理是……。 u 如果已经用了zero3,还有什么方法? 还有hbm offload/nvme offload等。 3 技术与论文 对于模型就先聊到这,聊些技术的吧. a 对于diffusion还有ddpm是否了解? diffusion看过一次论文,大概原理是……。 b 为什么大家都在尝试diffusion? 连续、多模态、轨迹簇 c 那那些先验生成多模态轨迹的不也行吗?所以你想想diffusion本身的优势,这样建模到底是为什么?我给你点提示,diffusion最早来自生图领域……。首先第一个问题是为什么轨迹生成任务需要多模态能力比较强? 结合驾驶风格来说了下 d 为什么要用diffusion来做这个事?从数学建模角度来说有什么优点? 不知道(简短,铿锵有力) e (面试官自己解答了d) 4 反问 暂时没有,回及时根据今天面试经历重点学习知识,部分情况上次面试官也为我解答了一些。(已经感觉自己挂了,不找尴尬了)
本篇目录
  1. 01
  2. 02
  3. 03
  4. 04
    发散一下,你已经在用llm了,现在来发散一下。从之前的一段式、两段式到现在的vla vlm,你对这些技术有什么思考?
  5. 05
  6. 06
  7. 07
  8. 08
  9. 09
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14
  15. 15
    项目追问
    回到训练模型,模型训练可能会有几种bound,比如memory bound、data bound、cpu/gpu bound。你遇到过什么问题?
  16. 16
  17. 17
  18. 18
  19. 19
    项目追问
    后续的Agent框架可以做一些上下文去重,然后来变相增长上下文,也就是和用户交流的空间对吧?
  20. 20
  21. 21
  22. 22
  23. 23
  24. 24
  25. 25
  26. 26
    追问
    那那些先验生成多模态轨迹的不也行吗?所以你想想diffusion本身的优势,这样建模到底是为什么?
    上一问 ↑
  27. 27

相关公司