← 返回全部题目← 上一题16 / 21下一题 →题库/模型基础与推理/Q-3657GQA 的原理是什么,如何在效果、速度和显存之间折中?知识专题:Transformer 与注意力题目类型:原理机制技术难度:进阶相关面经:1 篇收录题集:1 份暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经收录题集相关题目相关面经1 篇阿里巴巴大模型算法工程师2026-07-17查看原面经 →GQA、MLA原理收录题集1 份大模型工程面试题小林 Coding · 个人整理 · 收录 1 道查看题集 →多头注意力(MHA)有哪些局限?MQA、GQA、Flash Attention 怎么解决?相关题目4 题0036Transformer 中的 Attention 如何计算?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0268Self-Attention 为何利于并行训练,与 RNN 相比有哪些局限?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇0572Self-Attention 为什么需要 Scaling?同一知识专题题目类型:原理机制技术难度:进阶相关面经:2 篇0575手写 Multi-Head Attention。同一知识专题题目类型:代码题技术难度:进阶相关面经:2 篇← 上一题已到最后一题← 上一题Self-Attention 的时间复杂度是多少,如何推导?下一题 →Transformer 编码器与解码器中的注意力机制有什么区别?