← 返回全部题目← 上一题17 / 23下一题 →题库/模型基础与推理/Q-2776如何降低 KV Cache 空间开销,MQA 等结构起什么作用?知识专题:推理优化与模型压缩题目类型:方案设计技术难度:进阶相关面经:1 篇收录题集:2 份暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经收录题集相关题目相关面经1 篇阿里巴巴大模型推荐算法工程师2026-06-01一面查看原面经 →怎么降低kvcache空间计算,使用多头注意力?MQA,MoE?收录题集2 份八股集锦(高频问题)小熊饼干_ · 个人整理 · 收录 1 道查看题集 →如何优化KV Cache,有什么方式大模型工程面试题小林 Coding · 个人整理 · 收录 1 道查看题集 →多头注意力(MHA)有哪些局限?MQA、GQA、Flash Attention 怎么解决?相关题目4 题0274Decoder-only 的 KV Cache 为什么缓存 K、V 而通常不缓存 Q?同一知识专题题目类型:原理机制技术难度:进阶相关面经:1 篇0277FlashAttention 为什么能节省显存并提速,是否改变注意力结果?同一知识专题题目类型:原理机制技术难度:进阶相关面经:2 篇0502有哪些大模型推理加速技术?同一知识专题题目类型:方案设计技术难度:进阶相关面经:2 篇0503模型剪枝、GPTQ 与 AWQ 量化方法。同一知识专题题目类型:比较选型技术难度:进阶相关面经:2 篇← 上一题已到最后一题← 上一题如何用 KV Cache 和稀疏注意力节省计算与存储?下一题 →模型量化为什么能够发挥作用?