← 返回全部题目← 上一题20 / 23下一题 →题库/模型基础与推理/Q-3534SGLang 与 vLLM 的机制有何不同,如何比较推理延迟?知识专题:推理优化与模型压缩题目类型:比较选型技术难度:进阶相关面经:1 篇收录题集:1 份暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经收录题集相关题目相关面经1 篇字节跳动大模型应用算法工程师2026-05-06实习查看原面经 →追问SGLang相比vLLM的PagedAttention在推理延迟上有哪些优势?收录题集1 份大模型工程面试题小林 Coding · 个人整理 · 收录 1 道查看题集 →大模型部署有哪些主流方案?vLLM、TGI、llama.cpp、SGLang 实际项目里怎么选?相关题目4 题0274Decoder-only 的 KV Cache 为什么缓存 K、V 而通常不缓存 Q?同一知识专题题目类型:原理机制技术难度:进阶相关面经:1 篇0277FlashAttention 为什么能节省显存并提速,是否改变注意力结果?同一知识专题题目类型:原理机制技术难度:进阶相关面经:2 篇0502有哪些大模型推理加速技术?同一知识专题题目类型:方案设计技术难度:进阶相关面经:2 篇0503模型剪枝、GPTQ 与 AWQ 量化方法。同一知识专题题目类型:比较选型技术难度:进阶相关面经:2 篇← 上一题已到最后一题← 上一题了解哪些大模型推理框架?下一题 →vLLM 的 PagedAttention 如何工作?