八股集锦(高频问题)

整理者 小熊饼干_查看原题集 ↗

题目目录

92 道原题
  1. Transformer的并行化体现在哪些地方?Decoder端可以做并行化吗?

    原题
  2. Transformer中Attention的本质是什么?

    原题
  3. 自注意力的计算方式和复杂度?

    原题
  4. 为什么自注意力计算要除$$\sqrt{d_k} $$

    原题
  5. 介绍一下Transformer QKV的计算?

    原题
  6. (追问)为什么要分成QKV,怎么计算的?同一个token向量是一样的吗?

    原题
  7. 自注意力中多头的好处?

    原题
  8. 为什么在进行多头注意力的时候需要对每个head进行降维

    原题
  9. 交叉注意力你如何理解,与自注意力有什么区别。

    原题
  10. 什么是MoE模型?与Dense模型有什么区别?

    原题