← 返回全部题目← 上一题2 / 21下一题 →题库/模型基础与推理/Q-0268Self-Attention 为何利于并行训练,与 RNN 相比有哪些局限?知识专题:Transformer 与注意力题目类型:比较选型技术难度:进阶相关面经:1 篇收录题集:1 份暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经收录题集相关题目相关面经1 篇米哈游Agent 开发工程师2026-07-16一面查看原面经 →为什么 Self-Attention 比 RNN 更适合大规模并行训练,但不意味着它在所有场景都更优?收录题集1 份八股集锦(高频问题)小熊饼干_ · 个人整理 · 收录 1 道查看题集 →Transformer的并行化体现在哪些地方?Decoder端可以做并行化吗?相关题目4 题0036Transformer 中的 Attention 如何计算?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0572Self-Attention 为什么需要 Scaling?同一知识专题题目类型:原理机制技术难度:进阶相关面经:2 篇0575手写 Multi-Head Attention。同一知识专题题目类型:代码题技术难度:进阶相关面经:2 篇0625Transformer 的整体原理是什么?同一知识专题题目类型:原理机制技术难度:进阶相关面经:4 篇← 上一题已到最后一题← 上一题Transformer 中的 Attention 如何计算?下一题 →Self-Attention 为什么需要 Scaling?