字节跳动

大数据开发工程师一面面经

完整信息

31 条问法 · 24 道题

本篇目录
面试时间:8.25 面试公司:字节跳动 面试岗位:大数据开发工程师 面试官:接下来我们会有50分钟左右的面试沟通,请你先做自我介绍。 面试官:实习近况如何 面试官:你实习的感受如何? 面试官:你日常开发中,代码是AI生成还是手写? 面试官:是用哪些ai工具。 面试官:是直接告知需求,让AI生成完整代码吗? 面试官:你认为一个数据开发需求的完整流程是怎样的? 候选人:结合我做的项目,流程如下:需求澄清,链路开发,迭代优化 面试官:你认为数据开发流程中,哪一步是AI做不了的? 候选人:数据口径统一 面试官:为什么AI无法完成数据口径对齐? 面试官:口径对齐属于需求澄清环节吗? 面试官:有没有办法让AI实现口径对齐? 候选人:可以通过搭建知识库的形式实现 面试官:AI怎么从知识库中召回内容? 面试官:怎么确定召回的是想要的结果? 面试官:抛开你们团队现有的建设,如果由你来设计支撑AI完成需求澄清与口径对齐的知识库,应该怎么设计?可以从三方面思考:知识库包含哪些内容、内容结构是怎样的、AI如何召回内容。 候选人:结合我的使用经验,设计思路如下: 1. 知识库包含的内容: - 项目业务背景,明确数据产生的业务环节; - 每个字段的来源、计算口径与具体用途; - 指标的适用场景,即对应指标会在哪些业务问题中被使用; - 指标计算的具体示例,辅助AI理解逻辑。 补充业务背景的原因是,不同项目可能存在同名指标,需要通过背景区分当前查询对应的项目。 2. 内容结构: 可以采用结构化存储,既可以用向量库存储文本片段,也可以用哈希映射的形式,存储关键词对应的知识点,方便和自然语言做匹配。 3. 召回方式: 如果采用向量库,通过语义关联度匹配,将最相似的内容加入提示词;如果采用哈希映射,通过自然语言中的关键词,匹配对应知识点。 面试官:你知道Skill的实现模式吗?分几层? 面试官:你写过Skill吗? 面试官:你认为使用Skill的完整流程是怎样的? 面试官:你了解Spark的依赖吗? 面试官:Spark的依赖中,哪些操作对应窄依赖,哪些对应宽依赖? 面试官:DAG里面实际存储的是什么内容? 面试官:动态分区你了解吗? 面试官:你对SQL函数的掌握情况如何? 面试官:你常用的窗口函数有哪些? 面试官:row_number的排序是怎么实现的? 面试官:自定义函数你了解吗,UDF、UDAF、UDTF有什么区别? 面试官:什么场景下会用到UDF? 面试官:请你总结项目的背景、价值与收益。 面试官:请你选一个加工过程中的指标,说明它的数据来源、原始口径、加工表内容、更新周期。 面试官:你设计的底表粒度是什么? 面试官:你设计了多少张表? 面试官:宽表分别是什么粒度、承载什么数据?为什么要设计这么多张表? 面试官:手撕SQL 面试官:如果数据倾斜了,你会怎么处理?
本篇目录
  1. 01
  2. 02
  3. 03
  4. 04
  5. 05
  6. 06
  7. 07
  8. 08
  9. 09
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14
    抛开你们团队现有的建设,如果由你来设计支撑AI完成需求澄清与口径对齐的知识库,应该怎么设计?可以从三方面思考:知识库包含哪些内容、内容结构是怎样的、AI如何召回内容。
  15. 15
  16. 16
  17. 17
  18. 18
  19. 19
  20. 20
  21. 21
  22. 22
  23. 23
  24. 24
  25. 25
  26. 26
  27. 27
  28. 28
  29. 29
  30. 30
  31. 31

相关公司