Self-Attention 为何利于并行训练,与 RNN 相比有哪些局限?

暂无参考答案

未标记

本题目录

相关面经

1

米哈游

Agent 开发工程师
一面
查看原面经 →
为什么 Self-Attention 比 RNN 更适合大规模并行训练,但不意味着它在所有场景都更优?

收录题集

1

八股集锦(高频问题)

小熊饼干_ · 个人整理 · 收录 1 道

查看题集 →

Transformer的并行化体现在哪些地方?Decoder端可以做并行化吗?

相关题目

4