#谷歌# 研究人员提出弱监督的简单视觉语言模型预训练#SimVLM# ,SimVLM在大量对齐性不佳的图像-文本对上进行端到端的训练,其目的与语言建模相当。SimVLM的易用性允许在如此大的数据集上进行高效训练,使模型能够在六个视觉语言基准测试中实现绝佳性能。论文:https://arxiv.org/pdf/2108.10904.pdf
222
社区成员
261
社区内容
加载中
试试用AI创作助手写篇文章吧