评测体系与实验设计

10 个专题 · 567 道题

已筛选

127 道题

排序:

2603
测试 Agent 时可以在哪些环节用 AI 提效,需要设计或接入哪些工具?
AI 应用工程与治理评测体系与实验设计
方案设计
进阶
2900
Agent 如何分别评估规划能力与幻觉率?
AI 应用工程与治理评测体系与实验设计
效果评估
进阶
2905
如何区分视觉编码器与 LLM 推理瓶颈,并避免 Caption 替代实验泄露答案?
AI 应用工程与治理评测体系与实验设计
方案设计
深入
2906
如何量化回答不确定性,Top-K Token 分差与长文本哪些部分参与计算?
AI 应用工程与治理评测体系与实验设计
效果评估
深入
2908
为什么选用三个维度设计推理能力评测题?
AI 应用工程与治理评测体系与实验设计
方案设计
进阶
2942
如何验证新 AI 改善游戏体验,而非单纯增加难度?
AI 应用工程与治理评测体系与实验设计
效果评估
进阶
2979
如何评估语义或意图识别的准确率?
AI 应用工程与治理评测体系与实验设计
效果评估
进阶
3012
Code Agent 的 Verifier 如何设计?
AI 应用工程与治理评测体系与实验设计
方案设计
进阶
3028
同时运行多实验且各有多个分组时,如何分配用户并保证实验互不影响?
AI 应用工程与治理评测体系与实验设计
系统设计
深入
3072
33% 缓存命中率是总体还是单层,如何测得?
AI 应用工程与治理评测体系与实验设计
项目深挖
进阶