← 返回全部题目← 上一题11 / 21下一题 →题库/模型基础与推理/Q-2964Transformer Decoder 的结构和机制是什么?知识专题:Transformer 与注意力题目类型:原理机制技术难度:进阶相关面经:1 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经1 篇阿里巴巴大模型应用开发工程师(RAG 方向)2026-05-01转正实习一面、二面查看原面经 →八股相关: Transformer 中的 Decoder 介绍一下你的理解?相关题目4 题0036Transformer 中的 Attention 如何计算?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0268Self-Attention 为何利于并行训练,与 RNN 相比有哪些局限?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇0572Self-Attention 为什么需要 Scaling?同一知识专题题目类型:原理机制技术难度:进阶相关面经:2 篇0575手写 Multi-Head Attention。同一知识专题题目类型:代码题技术难度:进阶相关面经:2 篇← 上一题已到最后一题← 上一题多轮 Agent 对话中 Attention 有哪些局限?下一题 →为什么使用多头注意力而不换成单头?