← 返回全部题目← 上一题10 / 21下一题 →题库/模型基础与推理/Q-2898多轮 Agent 对话中 Attention 有哪些局限?知识专题:Transformer 与注意力题目类型:原理机制技术难度:进阶相关面经:2 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经2 篇阿里巴巴大模型算法工程师2026-06-25一面查看原面经 →原生自注意力架构,在多轮对话式Agent场景中存在哪些天然短板?MiniMax大模型算法工程师2026-05-06查看原面经 →在 Agent 多轮对话任务中,Attention 的局限性体现在哪些方面?相关题目4 题0036Transformer 中的 Attention 如何计算?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0268Self-Attention 为何利于并行训练,与 RNN 相比有哪些局限?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇0572Self-Attention 为什么需要 Scaling?同一知识专题题目类型:原理机制技术难度:进阶相关面经:2 篇0575手写 Multi-Head Attention。同一知识专题题目类型:代码题技术难度:进阶相关面经:2 篇← 上一题已到最后一题← 上一题多头注意力机制如何工作?下一题 →Transformer Decoder 的结构和机制是什么?