Transformer 与注意力

8 个专题 · 179 道题

已筛选

21 道题

排序:

0036
Transformer 中的 Attention 如何计算?
模型基础与推理Transformer 与注意力
原理机制
进阶
0625
Transformer 的整体原理是什么?
模型基础与推理Transformer 与注意力
原理机制
进阶
0572
Self-Attention 为什么需要 Scaling?
模型基础与推理Transformer 与注意力
原理机制
进阶
0575
手写 Multi-Head Attention。
模型基础与推理Transformer 与注意力
代码题
进阶
0268
Self-Attention 为何利于并行训练,与 RNN 相比有哪些局限?
模型基础与推理Transformer 与注意力
比较选型
进阶
0666
Transformer 有哪些优劣势,与其他架构相比如何?
模型基础与推理Transformer 与注意力
比较选型
进阶
1748
Cross-Attention 中 Q、K、V 分别来自哪里?
模型基础与推理Transformer 与注意力
原理机制
基础
2467
交叉注意力如何工作?
模型基础与推理Transformer 与注意力
原理机制
进阶
3656
Self-Attention 的时间复杂度是多少,如何推导?
模型基础与推理Transformer 与注意力
原理机制
进阶
3657
GQA 的原理是什么,如何在效果、速度和显存之间折中?
模型基础与推理Transformer 与注意力
原理机制
进阶