跳到主要内容
面试之前,先来面栈
搜索
题库
/
AI 应用工程与治理
评测体系与实验设计
10
个专题 ·
567
道题
专题概览
题目列表
567
评测体系与实验设计
继续复习
→
待复习
0
问题类型
问题类型
比较选型
代码题
方案设计
概念解释
故障排查
经历介绍
开放讨论
系统设计
项目深挖
效果评估
原理机制
问题类型
技术难度
技术难度
基础
进阶
深入
技术难度
复习状态
复习状态
未标记
待复习
已掌握
复习状态
已筛选
清除筛选
共
127
道题
开始复习 →
排序:
排序
相关面经最多
题集收录最多
题号顺序
最新更新
题号
题目
技术难度
收录情况
复习状态
3546
如何评估 DPO 全流程效果,并结合业务分析其短板?
AI 应用工程与治理
评测体系与实验设计
效果评估
已有答案
面前必看
进阶
暂无面经
如何评估 DPO 全流程效果,并结合业务分析其短板?的复习状态
未标记
待复习
已掌握
›
3635
实习工作如何衡量,从冷启动到上线如何利用用户反馈持续改进?
AI 应用工程与治理
评测体系与实验设计
项目深挖
已有答案
面前必看
进阶
暂无面经
实习工作如何衡量,从冷启动到上线如何利用用户反馈持续改进?的复习状态
未标记
待复习
已掌握
›
3766
上线两周后,安全 Agent 的误报率高达 40%,工程师开始忽略它的输出。怎么处理?
AI 应用工程与治理
评测体系与实验设计
故障排查
已有答案
面前必看
深入
暂无面经
1
份题集
上线两周后,安全 Agent 的误报率高达 40%,工程师开始忽略它的输出。怎么处理?的复习状态
未标记
待复习
已掌握
›
3790
Braintrust / LangSmith / Weave / PromptFoo 这类 eval 平台解决了什么核心问题?选型时如何权衡?
AI 应用工程与治理
评测体系与实验设计
比较选型
已有答案
面前必看
进阶
暂无面经
1
份题集
Braintrust / LangSmith / Weave / PromptFoo 这类 eval 平台解决了什么核心问题?选型时如何权衡?的复习状态
未标记
待复习
已掌握
›
3791
Eval dataset 的构建策略有哪些?如何从生产流量中自动挖掘高价值测试用例?
AI 应用工程与治理
评测体系与实验设计
方案设计
已有答案
面前必看
进阶
暂无面经
1
份题集
Eval dataset 的构建策略有哪些?如何从生产流量中自动挖掘高价值测试用例?的复习状态
未标记
待复习
已掌握
›
3792
如何设计 regression test suite,确保每次 Prompt 修改或模型升级不引入退化?
AI 应用工程与治理
评测体系与实验设计
方案设计
已有答案
面前必看
进阶
暂无面经
1
份题集
如何设计 regression test suite,确保每次 Prompt 修改或模型升级不引入退化?的复习状态
未标记
待复习
已掌握
›
3793
Benchmark 过拟合问题(Benchmark contamination / Goodhart's Law)在 Agent eval 中如何规避?
AI 应用工程与治理
评测体系与实验设计
方案设计
已有答案
面前必看
深入
暂无面经
1
份题集
Benchmark 过拟合问题(Benchmark contamination / Goodhart's Law)在 Agent eval 中如何规避?的复习状态
未标记
待复习
已掌握
›
3546
如何评估 DPO 全流程效果,并结合业务分析其短板?
AI 应用工程与治理
评测体系与实验设计
效果评估
已有答案
面前必看
进阶
暂无面经
如何评估 DPO 全流程效果,并结合业务分析其短板?的复习状态
未标记
待复习
已掌握
›
未找到相关题目
换个关键词,或清除筛选。
清除筛选
共
127
道题 · 显示 121–127 道
上一页
1
…
9
10
11
12
13
13 / 13
下一页
启用 JavaScript 后可筛选和浏览完整题库;当前显示前 10 道题。