模型基础与推理

8 个专题 · 179 道题

已筛选

179 道题

排序:

0277
FlashAttention 为什么能节省显存并提速,是否改变注意力结果?
模型基础与推理推理优化与模型压缩
原理机制
进阶
0485
项目为什么选择本地部署模型或调用 API?
模型基础与推理模型选型与能力边界
比较选型
进阶
0502
有哪些大模型推理加速技术?
模型基础与推理推理优化与模型压缩
方案设计
进阶
0503
模型剪枝、GPTQ 与 AWQ 量化方法。
模型基础与推理推理优化与模型压缩
比较选型
进阶
0505
如何优化长文本生成中的显存占用?
模型基础与推理推理优化与模型压缩
方案设计
进阶
0508
位置编码的原理。
模型基础与推理Tokenizer 与位置编码
原理机制
进阶
0571
Qwen3 与 BGE 编码模型原理是什么,Qwen3 编码模型如何训练?
模型基础与推理模型架构与表示
原理机制
进阶
0572
Self-Attention 为什么需要 Scaling?
模型基础与推理Transformer 与注意力
原理机制
进阶
0575
手写 Multi-Head Attention。
模型基础与推理Transformer 与注意力
代码题
进阶
0641
主流模型的上下文长度分别是多少?
模型基础与推理推理优化与模型压缩
比较选型
基础