推理优化与模型压缩

8 个专题 · 179 道题

已筛选

23 道题

排序:

2718
KV Cache 缓存什么,怎样影响推理速度和显存?
模型基础与推理推理优化与模型压缩
原理机制
进阶
0277
FlashAttention 为什么能节省显存并提速,是否改变注意力结果?
模型基础与推理推理优化与模型压缩
原理机制
进阶
0502
有哪些大模型推理加速技术?
模型基础与推理推理优化与模型压缩
方案设计
进阶
0503
模型剪枝、GPTQ 与 AWQ 量化方法。
模型基础与推理推理优化与模型压缩
比较选型
进阶
0505
如何优化长文本生成中的显存占用?
模型基础与推理推理优化与模型压缩
方案设计
进阶
0641
主流模型的上下文长度分别是多少?
模型基础与推理推理优化与模型压缩
比较选型
基础
0982
因果模型中第 40 个 token 的 KV Cache 缺失或失效后,应从哪里重新计算?
模型基础与推理推理优化与模型压缩
原理机制
进阶
2176
模型的 Prompt Cache 如何工作?
模型基础与推理推理优化与模型压缩
原理机制
进阶
0274
Decoder-only 的 KV Cache 为什么缓存 K、V 而通常不缓存 Q?
模型基础与推理推理优化与模型压缩
原理机制
进阶
0516
模型如何实现超长上下文能力?
模型基础与推理推理优化与模型压缩
原理机制
进阶