大模型算法工程师一面面经
完整信息
本篇目录
#发面经攒人品#
一、Transformer核心基础
1. 自注意力机制的底层数学逻辑是什么?多头注意力机制设计的核心作用有哪些?
2. 原生自注意力架构,在多轮对话式Agent场景中存在哪些天然短板?
二、大模型训练微调
1. 简述SFT监督微调完整执行流程,配套训练数据集该如何搭建与构造?
2. SFT完成后主流的后置训练方案包含哪些,各类方案的优化目标有什么区别?
3. 完整参数微调、LoRA低秩微调、QLoRA量化低秩微调三者核心差异对比?
4. 针对逻辑推理类任务做微调,设置的低秩矩阵秩r,是否需要高于对话生成任务?
5. 线上推理环节,为消除LoRA带来的额外耗时,行业内是否会将LoRA权重与基座模型合并?
6. 模型经过垂直领域指令微调后,通用基础能力出现衰减,有哪些可行优化方案?
三、检索增强生成RAG
1. RAG技术整体定义是什么?可以从哪些维度优化最终生成文本质量?对比传统检索+生成流水线,核心优势在哪?
2. 一套完整RAG系统,该从哪些维度设计量化评估指标,衡量整体效果好坏?
四、大模型强化学习对齐
1. PPO与DPO两种人类对齐方案核心区别是什么?DPO无需在线采样的底层原理,配套训练数据采用何种格式?
2. GRPO相比传统强化学习方案做了哪些优化改进,其中KL散度损失如何计算实现?
3. 举例说明奖励劫持(reward hacking)典型场景,分析该现象产生根源,以及对应的解决手段。
五、Agent工程落地项目
1. 模块化智能Agent如何实现多步骤任务规划?工具调用的调度逻辑如何搭建?系统异常兜底容错方案怎么设计?
2. 评估一套Agent系统能力,需要覆盖哪些考核维度?
3. 用户输入模糊、需求不明确时,Agent优先反问用户确认需求,还是直接检索知识库作答?
4. 搭建Agent系统时,在不降低任务效果的前提下,如何减少整体token开销?
六、现场手撕算法代码
二选一完成编码:
1. 岛屿数量问题
2. 无重复字符最长子串问题
本篇目录
- 01
自注意力机制的底层数学逻辑是什么?
- 02
多头注意力机制设计的核心作用有哪些?
- 03
原生自注意力架构,在多轮对话式Agent场景中存在哪些天然短板?
- 04
简述SFT监督微调完整执行流程,配套训练数据集该如何搭建与构造?
- 05
SFT完成后主流的后置训练方案包含哪些,各类方案的优化目标有什么区别?
- 06
完整参数微调、LoRA低秩微调、QLoRA量化低秩微调三者核心差异对比?
- 07
针对逻辑推理类任务做微调,设置的低秩矩阵秩r,是否需要高于对话生成任务?
- 08
线上推理环节,为消除LoRA带来的额外耗时,行业内是否会将LoRA权重与基座模型合并?
- 09
模型经过垂直领域指令微调后,通用基础能力出现衰减,有哪些可行优化方案?
- 10
RAG技术整体定义是什么?
- 11
可以从哪些维度优化最终生成文本质量?
- 12
对比传统检索+生成流水线,核心优势在哪?
- 13
一套完整RAG系统,该从哪些维度设计量化评估指标,衡量整体效果好坏?
- 14
PPO与DPO两种人类对齐方案核心区别是什么?
- 15
DPO无需在线采样的底层原理,配套训练数据采用何种格式?
- 16
GRPO相比传统强化学习方案做了哪些优化改进,其中KL散度损失如何计算实现?
- 17
其中KL散度损失如何计算实现?
上一问 ↑ - 18
举例说明奖励劫持(reward hacking)典型场景,分析该现象产生根源,以及对应的解决手段。
- 19
模块化智能Agent如何实现多步骤任务规划?
- 20
工具调用的调度逻辑如何搭建?
- 21
系统异常兜底容错方案怎么设计?
- 22
评估一套Agent系统能力,需要覆盖哪些考核维度?
- 23
用户输入模糊、需求不明确时,Agent优先反问用户确认需求,还是直接检索知识库作答?
- 24
搭建Agent系统时,在不降低任务效果的前提下,如何减少整体token开销?
- 25
岛屿数量问题
- 26
无重复字符最长子串问题
