视觉Transformer
视觉Transformer(Vision Transformer,简称ViT)是一种基于Transformer架构的视觉深度学习模型。其核心思想是将输入图像分割为固定大小的图像块(Patch),并将其展平为序列,通过引入位置编码并输入标准的Transformer编码器进行处理,从而实现对图像的建模。该模型利用自注意力机制捕捉图像中的长距离全局依赖关系,打破了卷积神经网络(CNN)长期主导计算机视觉领域的格局。自2020年提出以来,ViT及其变体(如Swin Transform
