ViT 模型的核心思想是将图像切成小块,对每个小块进行线性映射和展平操作,得到一个一维向量。这样每个小块就相当于文本数据中的一个单词,进而使用多层 Transformer 编码器对图像信息进行编码。对于给定的原始图像 I,通过图像切块、线性映射和展平操作,可以得到图像块序列 I={i_cls,i_1,…,i_m},其中 m 表示原始图像切块后的图像块数量,i_cls 表示分类头向量。对于一个 224×224 的 3 通道图像,以 16×16 块大小对图像进行切块,即可得到图像块序列 I,其中 m 为 196,每个小图像块向量维度为 768,即 16×16×3。将图像块序列 I 输入到 ViT 编码器中,将 ViT 编码器输出的隐藏层向量作为图像特征表示,具体流程可以参考图 2-6 所示的 ViT 模型网络架构。与 BERT 模型类似,取隐藏层向量中的分类头向量,通过单层的线性映射层和 ReLU 激活函数,得到最终的图像特征表示 Image。具体计算过程如式 (3-3) 和 (3-4) 所示:

ViT 模型详解:将图像视为文本,用 Transformer 进行编码

原文地址: https://www.cveoy.top/t/topic/mHWT 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录