大模型应用开发工程师(RAG 方向)一面面经
完整信息
本篇目录
一、基本信息与求职动机
1. 请做一个简短的自我介绍。
2. 你现在还在字节跳动实习吗?
3. 已经拿到字节转正 Offer,为什么还要离职?
4. 后续是否还会继续看其他 Offer,并进行综合比较?
---
二、风控归因 Agent 项目
1. 请介绍一下风控归因 Agent 的业务背景、核心场景和整体方案。
2. 为什么把系统设计成三级 Agent 架构?
3. 为什么第二层编排还要单独设计成一个 Agent?
4. 主 Agent、编排 Agent 和原子子 Agent 的职责分别是什么?
5. 主 Agent 与二级 Agent、子 Agent 之间如何通信?
6. 各层 Agent 之间的上下文如何传递?
7. 如何保证传给子 Agent 的上下文足够完整,不会遗漏关键信息?
8. 原来的纯 ReAct 方案只是工具调用不稳定吗,还有哪些问题?
9. 在这个场景中,直接采用 ReAct + Tool 是否也能满足需求?
10. 引入多层 Agent 和多个子 Agent 后,执行效率是否会变慢?
11. 三级架构是否提升了结果准确率,具体体现在哪些场景?
12. 三级架构的可观测性是怎么做的?
13. 如何查看完整执行链路、异常和 Token 消耗?
14. 简历中提到的“工程底座”具体包含哪些能力?
15. TAE Memory 和 Redis Checkpoint 分别解决什么问题?
16. 如果工具调用成功,但 Redis Checkpoint 写入失败,系统如何恢复并避免重复执行?
17. Skill 的多后端可插拔加载是怎么设计的?
18. 这个项目中最困难的问题是什么,你是怎么解决的?
19. 你读过哪些 Claude Code 源码,了解它的上下文管理机制吗?
20. Claude Code 在任务执行过程中收到用户新增要求时,会如何处理和注入这条指令?
---
三、评测与效果验证
1. 为什么选择 20 个真实归因 Case,并重复执行 3 轮?
2. 20 个 Case 是否足以覆盖真实场景?
3. 任务执行完成率从不足 50% 提升到 100%,这个指标是怎么评测出来的?
4. 你有哪些 Agent 评测经验?
5. 评测是人工评估还是机器评估?
6. 评测集和 Ground Truth 是如何构造的?
7. 评测集由研发、产品还是运营整理?
8. 如何保证评测集中的 Ground Truth 真实可靠?
---
四、Java 与工程稳定性
1. 传统 Java 业务项目中遇到过哪些困难,如何解决?
2. 涉及充值、退款和异步消息流转时,如何避免漏退、重复退款和状态错乱?
3. 全链路排查 Skill 的整体执行逻辑是什么?
4. 通过 LogID 拉取日志时,如何确保日志信息完整且足以定位问题?
---
五、RAG 与知识库
1. 请完整介绍 RAG 从文档入库到召回、融合和重排的链路。
2. RAG 检索前的 Query Rewrite 环节有什么作用?
3. 飞书文档、飞书表格和图片等不同内容分别如何切分成 Chunk?
4. 同一文档中的两个表格存在逻辑关联时,应该如何切分和维护这种关联?
---
六、反问面试官
1. 阿里大文娱 AI 创新业务目前主要负责哪些业务?
2. 通用 Agent 与自建 Agent 应该如何选型?
3. 如何看待基于 Claude code、Codex 一类通用 Agent 增加 Skill 和编排层,再用于生产场景的方案? #秋招# #面经# #秋招面试记录# #27届秋招有多难#
本篇目录
- 01
请做一个简短的自我介绍。
- 02
你现在还在字节跳动实习吗?
- 03
已经拿到字节转正 Offer,为什么还要离职?
- 04
后续是否还会继续看其他 Offer,并进行综合比较?
- 05
请介绍一下风控归因 Agent 的业务背景、核心场景和整体方案。
- 06
为什么把系统设计成三级 Agent 架构?
- 07
为什么第二层编排还要单独设计成一个 Agent?
- 08
主 Agent、编排 Agent 和原子子 Agent 的职责分别是什么?
- 09
主 Agent 与二级 Agent、子 Agent 之间如何通信?
- 10
各层 Agent 之间的上下文如何传递?
- 11
如何保证传给子 Agent 的上下文足够完整,不会遗漏关键信息?
- 12
原来的纯 ReAct 方案只是工具调用不稳定吗,还有哪些问题?
- 13
在这个场景中,直接采用 ReAct + Tool 是否也能满足需求?
- 14
引入多层 Agent 和多个子 Agent 后,执行效率是否会变慢?
- 15
三级架构是否提升了结果准确率,具体体现在哪些场景?
- 16
三级架构的可观测性是怎么做的?
- 17
如何查看完整执行链路、异常和 Token 消耗?
- 18
简历中提到的“工程底座”具体包含哪些能力?
- 19
TAE Memory 和 Redis Checkpoint 分别解决什么问题?
- 20
如果工具调用成功,但 Redis Checkpoint 写入失败,系统如何恢复并避免重复执行?
- 21
Skill 的多后端可插拔加载是怎么设计的?
- 22
这个项目中最困难的问题是什么,你是怎么解决的?
- 23
你读过哪些 Claude Code 源码,了解它的上下文管理机制吗?
- 24
Claude Code 在任务执行过程中收到用户新增要求时,会如何处理和注入这条指令?
- 25
为什么选择 20 个真实归因 Case,并重复执行 3 轮?
- 26
20 个 Case 是否足以覆盖真实场景?
- 27
任务执行完成率从不足 50% 提升到 100%,这个指标是怎么评测出来的?
- 28
你有哪些 Agent 评测经验?
- 29
评测是人工评估还是机器评估?
- 30
评测集和 Ground Truth 是如何构造的?
- 31
评测集由研发、产品还是运营整理?
- 32
如何保证评测集中的 Ground Truth 真实可靠?
- 33
传统 Java 业务项目中遇到过哪些困难,如何解决?
- 34
涉及充值、退款和异步消息流转时,如何避免漏退、重复退款和状态错乱?
- 35
全链路排查 Skill 的整体执行逻辑是什么?
- 36
通过 LogID 拉取日志时,如何确保日志信息完整且足以定位问题?
- 37
请完整介绍 RAG 从文档入库到召回、融合和重排的链路。
- 38
RAG 检索前的 Query Rewrite 环节有什么作用?
- 39
飞书文档、飞书表格和图片等不同内容分别如何切分成 Chunk?
- 40
同一文档中的两个表格存在逻辑关联时,应该如何切分和维护这种关联?
- 41
阿里大文娱 AI 创新业务目前主要负责哪些业务?
- 42
通用 Agent 与自建 Agent 应该如何选型?
- 43
如何看待基于 Claude code、Codex 一类通用 Agent 增加 Skill 和编排层,再用于生产场景的方案?
