← 返回全部题目← 上一题6 / 23下一题 →题库/模型基础与推理/Q-0516模型如何实现超长上下文能力?知识专题:推理优化与模型压缩题目类型:原理机制技术难度:进阶相关面经:1 篇收录题集:1 份暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经收录题集相关题目相关面经1 篇百度Agent 算法工程师2026-03-11实习查看原面经 →超长上下文是怎么实现的,比如 Kimi 这类模型收录题集1 份Agent开发面试题(附链接版摸鱼酱mio · 个人整理 · 收录 1 道查看题集 →如何优化长上下文推理性能?相关题目4 题0274Decoder-only 的 KV Cache 为什么缓存 K、V 而通常不缓存 Q?同一知识专题题目类型:原理机制技术难度:进阶相关面经:1 篇0277FlashAttention 为什么能节省显存并提速,是否改变注意力结果?同一知识专题题目类型:原理机制技术难度:进阶相关面经:2 篇0502有哪些大模型推理加速技术?同一知识专题题目类型:方案设计技术难度:进阶相关面经:2 篇0503模型剪枝、GPTQ 与 AWQ 量化方法。同一知识专题题目类型:比较选型技术难度:进阶相关面经:2 篇← 上一题已到最后一题← 上一题如何优化长文本生成中的显存占用?下一题 →模型推理时 Batch Size 如何设置?