← 返回全部题目← 上一题18 / 21下一题 →题库/模型基础与推理/Q-3702Decoder 自注意力为什么需要因果掩码,具体如何实现?知识专题:Transformer 与注意力题目类型:原理机制技术难度:进阶收录题集:1 份暂无参考答案未标记未标记待复习已掌握收藏本题目录收录题集相关题目收录题集1 份八股集锦(高频问题)小熊饼干_ · 个人整理 · 收录 2 道查看题集 →为什么要Decoder自注意力要进行Mask?Transformer掩码注意力机制具体是怎么做的?相关题目4 题0036Transformer 中的 Attention 如何计算?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0268Self-Attention 为何利于并行训练,与 RNN 相比有哪些局限?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇0572Self-Attention 为什么需要 Scaling?同一知识专题题目类型:原理机制技术难度:进阶相关面经:2 篇0575手写 Multi-Head Attention。同一知识专题题目类型:代码题技术难度:进阶相关面经:2 篇← 上一题已到最后一题← 上一题Transformer 编码器与解码器中的注意力机制有什么区别?下一题 →多头注意力为什么要降低每个 Head 的维度?