美团

大模型算法工程师一面、二面面经

完整信息

26 条问法 · 23 道题

本篇目录
一面(技术基础+项目+模型八股+手撕)

一、常规问答

1. 简单介绍个人职业发展规划 2. 面试官主动讲解团队业务方向、日常工作内容与技术落地场景

二、大模型核心八股

1. 已经构建推理类Reasoning训练数据,为什么还需要接入RL训练?仅依靠SFT能否满足业务需求? 2. SFT训练达到怎样的效果指标后,才适合接入RL优化阶段? 3. 在模型结构、训练策略层面,是否做过针对性优化改进? 4. Attention机制中为什么需要去除DK相关计算维度,核心作用是什么? 5. 详细区分Workflow和Agent的核心差异与适用场景 6. 对比Memory机制与RAG检索增强的区别、优势和落地场景差异 7. LLM输入维度为b、s的情况下,完整推理过程中Tensor维度的变化逻辑 8. 7B规模模型使用GRPO训练时的显存占用开销及优化方式 9. 简述聚类算法的核心原理、主流实现方法,同时说明K-Means算法是否存在全局最优解

三、手撕算法

基础算法题:两数之和 二面(业务场景专项面,无手撕、无常规项目提问

一、数据层相关问题

1. 实际业务中,如何量化、评估标注数据集的质量? 2. 定义标注数据的合格标准,从哪些维度判定标注有效? 3. 多类型、多场景训练数据的混合策略与配比思路

二、SFT微调专项问题

1. SFT训练过程中,如何平衡简单任务与复杂任务的训练权重? 2. 微调阶段防止模型过拟合的常用方案与实操技巧 3. LLM SFT训练常用的Loss函数及适用场景 4. 模型开启/关闭Thinking推理机制,对微调训练效果的影响 5. SFT的终止判定条件,满足哪些标准可切入RL训练? 6. 大模型训练为什么必须拆分SFT预微调+RL强化优化两个阶段,能否简化流程?

三、RL强化学习专项问题

1. 针对字段提取业务,需要设计哪些维度的Reward函数? 2. 项目中是否遇到过Reward Hacking问题,对应的识别与解决方案? 3. RL训练数据集的构建思路,能否直接复用SFT阶段的训练数据? 4. 如何解释RL训练初期Reward数值先降后升的现象? 5. RL全流程需要重点监控哪些核心训练指标,如何根据指标调优? 6. RL训练中如何兼顾难易样本,提升模型对高难度业务任务的探索能力?
本篇目录
  1. 01
  2. 02
    已经构建推理类Reasoning训练数据,为什么还需要接入RL训练?仅依靠SFT能否满足业务需求?
  3. 03
  4. 04
  5. 05
  6. 06
  7. 07
  8. 08
  9. 09
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14
  15. 15
  16. 16
  17. 17
  18. 18
  19. 19
  20. 20
  21. 21
  22. 22
  23. 23
  24. 24
  25. 25
  26. 26

相关公司