《End-to-End Object Detection with Transformers》:Facebook 将 Transformer 应用于目标检测任务;
《Generative Pretraining from Pixels》:OpenAI 用 GPT-2 做图像分类的尝试;
《LAMBDANETWORKS: MODELING LONG-RANGE INTERACTIONS WITHOUT ATTENTION》:匿名论文,提出 LambdaNetworks,无需注意力机制进行视觉任务,由其衍生出的 LambdaResNets,极大地改善了图像分类模型的速度与准确性权衡;
《AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE》:匿名论文,提出 Vision Transformer,将 Transformer 应用于图像识别。
《Learning Texture Transformer Network for Image Super-Resolution》:来自上海交大的微软研究院实习生发表的超分辨率领域的图像,使用 Transformer 来解决超分辨率的问题。
《Feature Pyramid Transformer》:南理、南洋理工等联合发表的论文,提出特征金字塔 Transformer(FPT),用于视觉识别任务。

论文链接:https://arxiv.org/pdf/2005.12872v1.pdf
项目地址:https://github.com/facebookresearch/detr




论文链接:https://cdn.openai.com/papers/Generative_Pretraining_from_Pixels_V2.pdf
项目地址:https://github.com/openai/image-gpt
方法 1:linear probe,即使用训练好的模型从下游数据集图像中提取特征,然后将 logistic 回归与标签进行拟合;
方法 2:微调,基于下游数据集微调整个模型。


论文链接:https://openreview.net/pdf?id=xTJEN-ggl1b
GitHub 链接:https://github.com/lucidrains/lambda-networks


和一个位置函数
。函数是通过加和 context 得到的:
,得到 lambda 层的输出为:
输出。这个过程用来捕捉密集的内容和基于位置的远距离互动,而不产生 Attention Map。






论文链接:https://arxiv.org/pdf/2007.09451.pdf
项目地址:https://github.com/ZHANGDONG-NJUST/FPT

Powered by Froala Editor
本文网址:




