八股集锦(高频问题)

整理者 小熊饼干_查看原题集 ↗

题目目录

92 道原题
  1. 大模型主要基于什么架构?有哪些部分组成

    原题
  2. 为什么大模型大多是decoder-only的架构?

    原题
  3. 大模型是如何训练/获取知识的?

    原题
  4. 什么是Transformer

    原题
  5. Transformer的优缺点是什么?

    原题
  6. 什么是Transformer的编码器和解码器?分别有什么用

    原题
  7. Decoder-only模型在训练阶段和推理阶段的输入格式有什么不同?

    原题
  8. Transformer的Decoder阶段的多头自注意力和Encoder的多头自注意力有什么区别?

    原题
  9. 为什么要Decoder自注意力要进行Mask?

    原题
  10. Transformer掩码注意力机制具体是怎么做的?

    原题