多模态模型如何对齐图像与文本 Embedding,除 ViT 外有哪些网络选择?

暂无参考答案

未标记

本题目录

相关面经

1

快手

面经合集
查看原面经 →
多模态大模型中用什么网络对齐图像和文字的embedding?除了ViT还有什么?

相关题目

4