大数据开发工程师一面面经
完整信息
本篇目录
面试时间:8.25
面试公司:字节跳动
面试岗位:大数据开发工程师
面试官:接下来我们会有50分钟左右的面试沟通,请你先做自我介绍。
面试官:实习近况如何
面试官:你实习的感受如何?
面试官:你日常开发中,代码是AI生成还是手写?
面试官:是用哪些ai工具。
面试官:是直接告知需求,让AI生成完整代码吗?
面试官:你认为一个数据开发需求的完整流程是怎样的?
候选人:结合我做的项目,流程如下:需求澄清,链路开发,迭代优化
面试官:你认为数据开发流程中,哪一步是AI做不了的?
候选人:数据口径统一
面试官:为什么AI无法完成数据口径对齐?
面试官:口径对齐属于需求澄清环节吗?
面试官:有没有办法让AI实现口径对齐?
候选人:可以通过搭建知识库的形式实现
面试官:AI怎么从知识库中召回内容?
面试官:怎么确定召回的是想要的结果?
面试官:抛开你们团队现有的建设,如果由你来设计支撑AI完成需求澄清与口径对齐的知识库,应该怎么设计?可以从三方面思考:知识库包含哪些内容、内容结构是怎样的、AI如何召回内容。
候选人:结合我的使用经验,设计思路如下:
1. 知识库包含的内容:
- 项目业务背景,明确数据产生的业务环节;
- 每个字段的来源、计算口径与具体用途;
- 指标的适用场景,即对应指标会在哪些业务问题中被使用;
- 指标计算的具体示例,辅助AI理解逻辑。 补充业务背景的原因是,不同项目可能存在同名指标,需要通过背景区分当前查询对应的项目。
2. 内容结构: 可以采用结构化存储,既可以用向量库存储文本片段,也可以用哈希映射的形式,存储关键词对应的知识点,方便和自然语言做匹配。
3. 召回方式: 如果采用向量库,通过语义关联度匹配,将最相似的内容加入提示词;如果采用哈希映射,通过自然语言中的关键词,匹配对应知识点。
面试官:你知道Skill的实现模式吗?分几层?
面试官:你写过Skill吗?
面试官:你认为使用Skill的完整流程是怎样的?
面试官:你了解Spark的依赖吗?
面试官:Spark的依赖中,哪些操作对应窄依赖,哪些对应宽依赖?
面试官:DAG里面实际存储的是什么内容?
面试官:动态分区你了解吗?
面试官:你对SQL函数的掌握情况如何?
面试官:你常用的窗口函数有哪些?
面试官:row_number的排序是怎么实现的?
面试官:自定义函数你了解吗,UDF、UDAF、UDTF有什么区别?
面试官:什么场景下会用到UDF?
面试官:请你总结项目的背景、价值与收益。
面试官:请你选一个加工过程中的指标,说明它的数据来源、原始口径、加工表内容、更新周期。
面试官:你设计的底表粒度是什么?
面试官:你设计了多少张表?
面试官:宽表分别是什么粒度、承载什么数据?为什么要设计这么多张表?
面试官:手撕SQL
面试官:如果数据倾斜了,你会怎么处理?
本篇目录
- 01
请你先做自我介绍。
- 02
实习近况如何
- 03
你实习的感受如何?
- 04
你日常开发中,代码是AI生成还是手写?
- 05
是用哪些ai工具。
- 06
是直接告知需求,让AI生成完整代码吗?
- 07
你认为一个数据开发需求的完整流程是怎样的?
- 08
你认为数据开发流程中,哪一步是AI做不了的?
- 09
为什么AI无法完成数据口径对齐?
- 10
口径对齐属于需求澄清环节吗?
- 11
有没有办法让AI实现口径对齐?
上一问 ↑ - 12
AI怎么从知识库中召回内容?
上一问 ↑ - 13
怎么确定召回的是想要的结果?
上一问 ↑ - 14
抛开你们团队现有的建设,如果由你来设计支撑AI完成需求澄清与口径对齐的知识库,应该怎么设计?可以从三方面思考:知识库包含哪些内容、内容结构是怎样的、AI如何召回内容。
- 15
你知道Skill的实现模式吗?分几层?
- 16
你写过Skill吗?
- 17
你认为使用Skill的完整流程是怎样的?
- 18
你了解Spark的依赖吗?
- 19
Spark的依赖中,哪些操作对应窄依赖,哪些对应宽依赖?
- 20
DAG里面实际存储的是什么内容?
- 21
动态分区你了解吗?
- 22
你常用的窗口函数有哪些?
- 23
row_number的排序是怎么实现的?
- 24
自定义函数你了解吗,UDF、UDAF、UDTF有什么区别?
- 25
什么场景下会用到UDF?
- 26
请你总结项目的背景、价值与收益。
- 27
请你选一个加工过程中的指标,说明它的数据来源、原始口径、加工表内容、更新周期。
- 28
你设计的底表粒度是什么?
- 29
你设计了多少张表?
- 30
宽表分别是什么粒度、承载什么数据?为什么要设计这么多张表?
- 31
如果数据倾斜了,你会怎么处理?
