← 返回全部题目← 上一题3 / 21下一题 →题库/模型基础与推理/Q-0572Self-Attention 为什么需要 Scaling?知识专题:Transformer 与注意力题目类型:原理机制技术难度:进阶相关面经:2 篇暂无参考答案未标记未标记待复习已掌握收藏本题目录相关面经相关题目相关面经2 篇顺丰大模型应用开发工程师(RAG 方向)2026-03-17实习查看原面经 →为什么要scaling顺丰大模型应用开发工程师(RAG 方向)2025-10-08查看原面经 →为什么要scaling相关题目4 题0036Transformer 中的 Attention 如何计算?同一知识专题题目类型:原理机制技术难度:进阶相关面经:6 篇0268Self-Attention 为何利于并行训练,与 RNN 相比有哪些局限?同一知识专题题目类型:比较选型技术难度:进阶相关面经:1 篇0575手写 Multi-Head Attention。同一知识专题题目类型:代码题技术难度:进阶相关面经:2 篇0625Transformer 的整体原理是什么?同一知识专题题目类型:原理机制技术难度:进阶相关面经:4 篇← 上一题已到最后一题← 上一题Self-Attention 为何利于并行训练,与 RNN 相比有哪些局限?下一题 →手写 Multi-Head Attention。