数据开发工程师一面面经
完整信息
本篇目录
笔试时间:9.7
面试公司:OPPO
面试岗位:数据开发工程师
Q:请做一下自我介绍
Q:项目细节追问?
Q:你们工作目标是什么?
Q:数据量大概是什么规模?
Q:数据来源是什么?
Q:数据量级、数据时间范围?
Q:数据交付过程是什么样子的?
Q:你交付的链路和数据表具体是什么样?
Q:讲清楚上游原始数据,清洗转换逻辑。
Q:为什么会出现空值、重复数据?
Q:调度频率?
Q:去重具体实现思路?
Q:聚合逻辑,举实际业务场景
Q:开发过程遇到什么数据异常?如何发现?
Q:技术底座是什么,任务运行时长,性能问题与优化手段?
Q:讲讲Iceberg表原理,和传统数仓区别?
Q:聊聊AI相关,你接触的AI项目
Q:有没有做知识库、MCP相关开发?
Q:AI生成SQL不符合预期,怎么处理?
Q:如何保证AI输出结果符合标准?
Q:写AI辅助代码,提升AI产出代码质量的经验,如何降低bug概率
Q:Spark Shuffle原理,宽依赖、窄依赖
Q:UDF作用
Q:Spark Driver和Executor职责
Q:上游只有100个文件,对应100个task,下游计算很重,想要把task扩充到1000,怎么做?
Q:水位watermark是什么?
Q:你这边有什么想要提问?
A:我想了解这个岗位具体日常工作内容、部门大致人数,岗位工作中主要遇到哪些难点。
本篇目录
- 01
请做一下自我介绍
- 02
你们工作目标是什么?
- 03
数据量大概是什么规模?
- 04
数据来源是什么?
- 05
数据量级、数据时间范围?
- 06
数据交付过程是什么样子的?
- 07
你交付的链路和数据表具体是什么样?
- 08
讲清楚上游原始数据,清洗转换逻辑。
- 09
为什么会出现空值、重复数据?
- 10
调度频率?
- 11
去重具体实现思路?
- 12
聚合逻辑,举实际业务场景
- 13
开发过程遇到什么数据异常?如何发现?
- 14
技术底座是什么,任务运行时长,性能问题与优化手段?
- 15
讲讲Iceberg表原理,和传统数仓区别?
- 16
聊聊AI相关,你接触的AI项目
- 17
有没有做知识库、MCP相关开发?
- 18
AI生成SQL不符合预期,怎么处理?
- 19
如何保证AI输出结果符合标准?
- 20
写AI辅助代码,提升AI产出代码质量的经验,如何降低bug概率
- 21
Spark Shuffle原理,宽依赖、窄依赖
- 22
UDF作用
- 23
Spark Driver和Executor职责
- 24
上游只有100个文件,对应100个task,下游计算很重,想要把task扩充到1000,怎么做?
- 25
水位watermark是什么?
- 26
我想了解这个岗位具体日常工作内容、部门大致人数,岗位工作中主要遇到哪些难点。