字节跳动

AI 评测工程师二面面经

完整信息

8 条问法 · 8 道题

本篇目录
1.开场聊天 2.项目相关 用的什么基础模型?做过基础模型选型对比吗? 介绍一下 RAG Agent 项目 评测集的整体构建思路?题目和真值是怎么设计的? 做评测观测哪些指标?为什么选这两个? 有没有研究过行业通用/开源的评测基准? 3.其他问题 假设你入职后,我让你做"评测集生成 + 更新维护"的行业调研,你怎么开展工作?最快交付什么成果? 追问一:线上 log 是海量的,怎么转化成有限的线下评测集?直白的方法是随机抽样,但随机抽样为什么不行? 追问二:能不能不走"线上转线下评测集",直接对线上 case 做无 GT的打分和效果观测?可行吗?用什么方法推进?
本篇目录
  1. 01
  2. 02
  3. 03
  4. 04
  5. 05
  6. 06
    假设你入职后,我让你做"评测集生成 + 更新维护"的行业调研,你怎么开展工作?最快交付什么成果?
  7. 07
    追问
    追问一:线上 log 是海量的,怎么转化成有限的线下评测集?直白的方法是随机抽样,但随机抽样为什么不行?
    上一问 ↑
  8. 08
    追问
    追问二:能不能不走"线上转线下评测集",直接对线上 case 做无 GT的打分和效果观测?可行吗?用什么方法推进?
    上一问 ↑

相关公司