本篇分享论文《基于感知卷积神经网络的面部表情识别方法》(原英文标题《A Perception CNN for Facial Expression Recognition》),聚焦于当前面部表情识别(FER)任务中,传统卷积神经网络易忽略面部分割作用、在遮挡和姿态变化等复杂场景下鲁棒性不足的关键问题,由哈尔滨工业大学、西北工业大学、郑州轻工业大学、香港中文大学(深圳)等高校学者联合提出 PCNN 模型:通过面部语义信息提取模块同步学习全局与局部情绪特征,结合多域交互机制实现特征配准融合,并设计双阶段损失函数保障模型性能,为实验室、真实场景及复杂场景下的高精度面部表情识别提供了有效技术方案。

论文标题: A Perception CNN for Facial Expression Recognition
作者: Chunwei Tian, Jingyuan Xie, Lingjun Li, Wangmeng Zuo, Yanning Zhang and David Zhang
作者:田春伟,谢静远,李玲君,左旺孟,张艳宁,张大鹏
机构: 哈尔滨工业大学、西北工业大学、郑州轻工业大学、香港中文大学(深圳)
论文地址: https://ieeexplore.ieee.org/document/11278538
论文地址:https://arxiv.org/abs/2512.06422
代码仓库: https://github.com/hellloxiaotian/PCNN
卷积神经网络(CNNs)能够自动学习数据模式,对人脸图像进行表征以用于面部表情识别(FER)。然而,它们可能忽略面部分割在 FER 中的作用。本文提出一种用于 FER 的感知卷积神经网络(PCNN)。
首先,PCNN 采用五个并行子网,基于眼睛、脸颊和嘴巴等区域同步学习局部人脸特征,实现对 FER 中细微变化的灵敏捕捉。
其次,通过多域交互机制对局部感官特征与全局面部结构特征进行配准和融合,从而更好地对人脸图像进行表征以服务于 FER 任务。
最后,设计双阶段损失函数,对所获感官信息和重建人脸图像的准确性进行约束,确保 PCNN 在 FER 中的性能。
实验结果表明,该 PCNN 在多个实验室及真实场景 FER 基准数据集(CK+、JAFFE、FER2013、FERPlus、RAF-DB 以及遮挡与姿态变化数据集)上均取得了优异性能。
在面部表情识别(FER)任务中,遮挡、姿态变化等现实因素常导致特征提取不充分,影响识别效果。近期提出的感知卷积神经网络(PCNN),通过融合局部感官信息与全局面部结构特征,为该问题提供了有效解决方案。
利用基于五官的人脸语义信息引导深度网络,提取更显著的人脸表情识别的细节信息。
一个跨域交换机制能更好地融合基于五官和原始图像获得重构人脸图像,更好地表示变化的面部表情肌肉,提高人脸表情识别的效果。
面部语义损失能更好地保证获得的局部表情信息的准确性,提高模型的人脸表情识别精准性。

该模型在多场景主流 FER 数据集上完成验证:
实验室场景:CK + 数据集准确率达 100%,JAFFE 数据集准确率 96.49%,展现出优异的基础识别能力;

真实场景:RAF-DB(89.31%)、FERPlus(85.59%)、FER2013(72.80%)数据集上,均取得与现有先进方法相当的性能;


复杂场景:在遮挡、姿态变化数据集(Occlusion-RAFDB、Pose-FERPlus 等)中,准确率维持在 84.63%-89.74%,表现出较强的抗干扰能力。


本文提出一种感知卷积神经网络(PCNN),该网络利用基于感官器官信息的面部分割与面部信息实现面部表情识别。
首先,通过面部语义信息提取模块分别学习全局面部信息与局部情绪信息;其次,采用多域交互机制对所获全局面部信息与局部情绪信息进行配准和融合,以提升 PCNN 的面部表情识别效果;最后,设计面部语义损失函数,保障全局面部信息与局部情绪信息的交互有效性,并验证所提 PCNN 的性能。
实验结果表明,该 PCNN 在不同场景的面部表情识别(FER)任务中均具有良好效果。
引用
C. Tian, J. Xie, L. Li, W. Zuo, Y. Zhang and D. Zhang, "A Perception CNN for Facial Expression Recognition," in IEEE Transactions on Image Processing, doi: 10.1109/TIP.2025.3637715.