← 返回全部题目← 上一题21 / 23下一题 →题库/模型基础与推理/Q-3618vLLM 的 PagedAttention 如何工作?知识专题:推理优化与模型压缩题目类型:原理机制技术难度:进阶相关面经:2 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经2 篇阿里巴巴大模型算法工程师2026-07-17查看原面经 →vLLM原理快手2026-05-09面经合集查看原面经 →介绍一下vLLM中PagedAttention的原理相关题目4 题0274Decoder-only 的 KV Cache 为什么缓存 K、V 而通常不缓存 Q?同一知识专题题目类型:原理机制技术难度:进阶相关面经:1 篇0277FlashAttention 为什么能节省显存并提速,是否改变注意力结果?同一知识专题题目类型:原理机制技术难度:进阶相关面经:2 篇0502有哪些大模型推理加速技术?同一知识专题题目类型:方案设计技术难度:进阶相关面经:2 篇0503模型剪枝、GPTQ 与 AWQ 量化方法。同一知识专题题目类型:比较选型技术难度:进阶相关面经:2 篇← 上一题已到最后一题← 上一题SGLang 与 vLLM 的机制有何不同,如何比较推理延迟?下一题 →如何降低多头注意力的计算开销?