20.10 ViT

1 min

Transformer 出现 3 年后,视觉领域也迎来了独属于它的 Transformer,这次又是谷歌

核心思想:图像切块转成特征向量,像文本 embedding 一样丢进 Transformer,就这么简单

由于 ViT 没有 inductive bias,所以在训练数据较少时,性能比不过 ResNet,但提高数据量后,性能和效率双双超过 ResNet,表现出了更高的上限

此后,各种各样的变种模型涌现,其中,TimeSformer 走向了视频建模