← 返回全部题目← 上一题13 / 21下一题 →题库/模型基础与推理/Q-3646Attention 的 Q、K、V 如何由输入变换得到?知识专题:Transformer 与注意力题目类型:原理机制技术难度:基础相关面经:1 篇收录题集:1 份暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经收录题集相关题目相关面经1 篇快手2026-05-09面经合集查看原面经 →Attention 机制中的 Q、K、V 矩阵具体是如何通过输入变换得到的?收录题集1 份八股集锦(高频问题)小熊饼干_ · 个人整理 · 收录 2 道查看题集 →介绍一下Transformer QKV的计算?(追问)为什么要分成QKV,怎么计算的?同一个token向量是一样的吗?相关题目4 题0036Transformer 中的 Attention 如何计算?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0268Self-Attention 为何利于并行训练,与 RNN 相比有哪些局限?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇0572Self-Attention 为什么需要 Scaling?同一知识专题题目类型:原理机制技术难度:进阶相关面经:2 篇0575手写 Multi-Head Attention。同一知识专题题目类型:代码题技术难度:进阶相关面经:2 篇← 上一题已到最后一题← 上一题为什么使用多头注意力而不换成单头?下一题 →Attention 为什么除以根号 d_k,不这样缩放还有什么替代方案?