Facial Expression Recognition (FER) in the wild is extremely challenging due to occlusions, variant head poses, face deformation and motion blur under unconstrained conditions. Although substantial progresses have been made in automatic FER in the past few decades, previous studies are mainly designed for lab-controlled FER. Real-world occlusions, variant head poses and other issues definitely increase the difficulty of FER on account of these information-deficient regions and complex backgrounds. Different from previous pure CNNs based methods, we argue that it is feasible and practical to translate facial images into sequences of visual words and perform expression recognition from a global perspective. Therefore, we propose Convolutional Visual Transformers to tackle FER in the wild by two main steps. First, we propose an attentional selective fusion (ASF) for leveraging the feature maps generated by two-branch CNNs. The ASF captures discriminative information by fusing multiple features with global-local attention. The fused feature maps are then flattened and projected into sequences of visual words. Second, inspired by the success of Transformers in natural language processing, we propose to model relationships between these visual words with global self-attention. The proposed method are evaluated on three public in-the-wild facial expression datasets (RAF-DB, FERPlus and AffectNet). Under the same settings, extensive experiments demonstrate that our method shows superior performance over other methods, setting new state of the art on RAF-DB with 88.14%, FERPlus with 88.81% and AffectNet with 61.85%. We also conduct cross-dataset evaluation on CK+ show the generalization capability of the proposed method.


翻译:野外的偏差表现度识别(FER) 极为困难, 原因是网络封闭性、 变异头部、 脸部变形和运动在不受限制的条件下模糊不清。 尽管在过去几十年里自动FER系统取得了显著进展, 但先前的研究主要是为实验室控制的FER设计的。 现实世界排斥性、 变异头部和其他问题无疑增加了FER的难度, 因为这些信息缺乏的地区和复杂的背景。 不同于以前纯的CNN方法, 我们争辩说, 将面部图像转换成视觉文字序列, 从全球角度来进行表达表达。 因此, 我们建议CVRC变异性变异变变变换器在野外用两个主要步骤处理FERF 。 首先, 我们建议有选择性的选择性融合(ASFF) 利用由两处的CNNW生成的地貌图图图。 ASFSD通过使用多种特性捕捉到歧视性信息。 然后, 混凝固的地图地图被粉碎化, 以直观文字排列为顺序。 第二, 受自然语言处理过程中的变换器成功启发, 我们提议, 高级视觉变异变形变换的ALVLVA- RDFLA 3 方法显示这些视觉方法之下的自我显示这些视觉方法 。

0
下载
关闭预览

相关内容

最新《Transformers模型》教程,64页ppt
专知会员服务
298+阅读 · 2020年11月26日
【深度学习视频分析/多模态学习资源大列表】
专知会员服务
91+阅读 · 2019年10月16日
Keras François Chollet 《Deep Learning with Python 》, 386页pdf
专知会员服务
149+阅读 · 2019年10月12日
[综述]深度学习下的场景文本检测与识别
专知会员服务
77+阅读 · 2019年10月10日
【文本匹配】Question Answering论文
深度学习自然语言处理
8+阅读 · 2020年4月20日
A Technical Overview of AI & ML in 2018 & Trends for 2019
待字闺中
16+阅读 · 2018年12月24日
【NIPS2018】接收论文列表
专知
5+阅读 · 2018年9月10日
计算机视觉近一年进展综述
机器学习研究会
9+阅读 · 2017年11月25日
gan生成图像at 1024² 的 代码 论文
CreateAMind
4+阅读 · 2017年10月31日
【今日新增】IEEE Trans.专刊截稿信息8条
Call4Papers
7+阅读 · 2017年6月29日
Arxiv
19+阅读 · 2020年12月23日
Deep Face Recognition: A Survey
Arxiv
17+阅读 · 2019年2月12日
Arxiv
6+阅读 · 2018年2月8日
Arxiv
5+阅读 · 2017年9月8日
VIP会员
相关论文
Arxiv
19+阅读 · 2020年12月23日
Deep Face Recognition: A Survey
Arxiv
17+阅读 · 2019年2月12日
Arxiv
6+阅读 · 2018年2月8日
Arxiv
5+阅读 · 2017年9月8日
Top
微信扫码咨询专知VIP会员