评测体系与实验设计

10 个专题 · 567 道题

已筛选

127 道题

排序:

2120
用户直接在系统中向模型提问时,有哪些评测方式?
AI 应用工程与治理评测体系与实验设计
方案设计
进阶
2165
开发过程中是否进行大量 Agent 自测?
AI 应用工程与治理评测体系与实验设计
项目深挖
进阶
2172
如何确认 RAG 产出是否存在幻觉?
AI 应用工程与治理评测体系与实验设计
方案设计
进阶
2203
Agent 每次迭代后如何证明新版本优于旧版本?
AI 应用工程与治理评测体系与实验设计
方案设计
进阶
2204
除了成功率和得分,如何评价 Token、工具与 Skill 使用、执行路径等过程指标?
AI 应用工程与治理评测体系与实验设计
方案设计
进阶
2205
一万条 Case 的 Agent 执行路径由谁判断,如何规模化评估?
AI 应用工程与治理评测体系与实验设计
方案设计
深入
2206
使用 Agent 或 LLM Judge 评测时,如何设计评测 Prompt?
AI 应用工程与治理评测体系与实验设计
方案设计
进阶
2207
面对一万个不同 Case,评测 Prompt 如何通用化?
AI 应用工程与治理评测体系与实验设计
方案设计
深入
2208
ToC 每天上万条任务时,如何自动发现执行问题而不对每条任务额外运行一次模型?
AI 应用工程与治理评测体系与实验设计
方案设计
深入
2311
如何生成或组织 AI 测试报告?
AI 应用工程与治理评测体系与实验设计
方案设计
进阶