← 返回全部题目← 上一题4 / 21下一题 →题库/模型基础与推理/Q-0575手写 Multi-Head Attention。知识专题:Transformer 与注意力题目类型:代码题技术难度:进阶相关面经:2 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经2 篇百度端到端决策规划控制算法工程师2026-09-03一面查看原面经 →a MHA查看该问上下文 →追问追问:用torch写下查看该问上下文 →阿里巴巴Agent 开发工程师2026-02-12一面查看原面经 →手撕 MHA相关题目4 题0036Transformer 中的 Attention 如何计算?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0268Self-Attention 为何利于并行训练,与 RNN 相比有哪些局限?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇0572Self-Attention 为什么需要 Scaling?同一知识专题题目类型:原理机制技术难度:进阶相关面经:2 篇0625Transformer 的整体原理是什么?同一知识专题题目类型:原理机制技术难度:进阶相关面经:4 篇← 上一题已到最后一题← 上一题Self-Attention 为什么需要 Scaling?下一题 →Transformer 的整体原理是什么?