阿里巴巴

74 篇面经595 道面试题

已筛选

595 道题

排序:

3482
PPO 的 Critic 如何计算,公式是什么?
模型训练与对齐强化学习与奖励
原理机制
进阶
3483
为什么 DPO 不适合当前项目场景?
模型训练与对齐偏好对齐
比较选型
进阶
3484
SFT 与 RL 数据中的 Reason 是人工标注还是模型生成?
模型训练与对齐训练数据构建与治理
项目深挖
进阶
3485
重新设计项目时,如何改进 SFT 与 RL 流程?
模型训练与对齐预训练、续训与 SFT
方案设计
进阶
3486
如何理解 Multi-Agent?
Agent 原理与系统多 Agent 编排与协作
概念解释
基础
3487
子 Agent 是否使用父 Agent 的全部上下文?
Agent 原理与系统多 Agent 编排与协作
原理机制
基础
3488
如何设计尽可能准确回答用户提问的客服 Agent?
Agent 原理与系统Agent 应用架构与场景设计
系统设计
进阶
3489
客服 Agent 如何减少回答幻觉?
AI 应用工程与治理生成质量与幻觉治理
方案设计
进阶
3490
电商大促出现流量尖刺时,客服 Agent 服务如何应对?
AI 应用工程与治理性能、时延与成本
方案设计
进阶
3491
JVM 调优时如何查看内存对象,使用哪些工具?
软件工程基础Java、Spring 与 JVM
操作实践
进阶