20.10 ViT
1 min
Transformer 出现 3 年后,视觉领域也迎来了独属于它的 Transformer,这次又是谷歌
核心思想:图像切块转成特征向量,像文本 embedding 一样丢进 Transformer,就这么简单
由于 ViT 没有 inductive bias,所以在训练数据较少时,性能比不过 ResNet,但提高数据量后,性能和效率双双超过 ResNet,表现出了更高的上限
此后,各种各样的变种模型涌现,其中,TimeSformer 走向了视频建模
Transformer 出现 3 年后,视觉领域也迎来了独属于它的 Transformer,这次又是谷歌
核心思想:图像切块转成特征向量,像文本 embedding 一样丢进 Transformer,就这么简单
由于 ViT 没有 inductive bias,所以在训练数据较少时,性能比不过 ResNet,但提高数据量后,性能和效率双双超过 ResNet,表现出了更高的上限
此后,各种各样的变种模型涌现,其中,TimeSformer 走向了视频建模