Transformer 与注意力

8 个专题 · 179 道题

已筛选

21 道题

排序:

2781
多头注意力机制如何工作?
模型基础与推理Transformer 与注意力
原理机制
进阶
2898
多轮 Agent 对话中 Attention 有哪些局限?
模型基础与推理Transformer 与注意力
原理机制
进阶
2964
Transformer Decoder 的结构和机制是什么?
模型基础与推理Transformer 与注意力
原理机制
进阶
2965
为什么使用多头注意力而不换成单头?
模型基础与推理Transformer 与注意力
比较选型
基础
3646
Attention 的 Q、K、V 如何由输入变换得到?
模型基础与推理Transformer 与注意力
原理机制
基础
3647
Attention 为什么除以根号 d_k,不这样缩放还有什么替代方案?
模型基础与推理Transformer 与注意力
原理机制
进阶
3701
Transformer 编码器与解码器中的注意力机制有什么区别?
模型基础与推理Transformer 与注意力
比较选型
基础
3702
Decoder 自注意力为什么需要因果掩码,具体如何实现?
模型基础与推理Transformer 与注意力
原理机制
进阶
3703
多头注意力为什么要降低每个 Head 的维度?
模型基础与推理Transformer 与注意力
原理机制
进阶
3704
交叉注意力与自注意力有什么区别?
模型基础与推理Transformer 与注意力
比较选型
基础