news 2026/9/6 9:51:09

Attention Isn‘t All You Need for Emotion RecognitionDomain Features Outperform Transformers on the E

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Attention Isn‘t All You Need for Emotion RecognitionDomain Features Outperform Transformers on the E

Attention Isn’t All You Need for Emotion Recognition:Domain Features Outperform Transformers on the EAV Dataset

Authors:Anmol Guragain

Deep-Dive Summary:

论文总结:注意力并非情感识别的全部:领域特征在 EAV 数据集上优于 Transformer

摘要 (Abstract)

本研究对使用 EAV 数据集的多模态情感识别进行了系统性研究,探讨了复杂的注意力机制是否能提升小规模数据集上的性能。研究实现了三类模型:基准 Transformer (M1)、新型分解注意力机制 (M2) 以及改进的 CNN 基准 (M3)。实验结果表明,复杂的注意力机制在小数据集上始终表现不佳,M2 模型由于过拟合和对预训练特征的破坏,其准确率比基准模型低 5 到 13 个百分点。

相比之下,简单且符合领域特征的修改证明是有效的:在音频 CNN 中加入 Delta MFCC 将准确率从61.9 % 61.9\%61.9%提升至65.56 % 65.56\%65.56%(+3.66pp);为 EEG 引入频域特征实现了67.62 % 67.62\%67.62%的准确率(比论文基准提升 7.62pp)。我们的视觉 Transformer 基准 (M1) 通过特定领域的预训练达到了75.30 % 75.30\%75.30%,超过了原论文中 ViViT 的结果 (74.5 % 74.5\%74.5%)。这些发现证明,对于小规模情感识别,领域知识和正确的实现比架构复杂性更重要。

2. 相关工作与数据集 (Related Work & Dataset)

EAV 数据集通过同步记录 42 名参与者在活跃对话中的 EEG、音频和视频信号,弥补了传统数据集的不足。EEG 信号采样率为 500 Hz(30 通道),音频为 16 kHz,视频为 30 fps。由于训练数据有限(约 280 个样本),必须限制模型的复杂性。

研究参考了 Davidson 的额叶不对称模型(F3 与 F4 通道的差异与情绪正负价相关),这为 M2 的 EEG 架构和 M3 的频带功率特征提供了理论基础。

4. 实验结果与分析 (Results & Analysis)

4.1 主要发现

如表 1 所示,主要结论如下:

  1. M2 分解注意力失败: 所有 M2 模型均低于基准。复杂的架构在 280 个训练样本下无法有效学习,导致严重的过拟合。
  2. M3 简单修改获胜: 领域特征显著提升了性能。EEG 频带功率达到了67.62 % 67.62\%67.62%
  3. 预训练领域至关重要: 视觉模型中,在情感数据上预训练的 M1 表现优于在 ImageNet 上预训练的 M3 CNN。

表 1:各模型结果对比(绿色表示超过原论文基准)

类别模型EEG音频视觉
原论文基准CNN / Transformer60.00% / 53.50%61.90% / 62.70%71.40% / 74.50%
M1: 基准Transformer52.68%58.06%75.30%
M2: 分解注意力各种 M2 变体48.00% - 58.47%49.46%69.54%
M3: CNN 改进频带功率/Delta/Bug修复67.62%65.56%72.68%

图 2:M3 改进架构图。展示了 EEG 频带功率特征、修复后的视觉 CNN 和加入 Delta 特征的音频 CNN。

4.2 失败与成功原因分析

  • M2 失败原因: (1) 额外的注意力层破坏了预训练模型(AST/ViT)提取的高质量特征;(2) 参数量远超数据量(过拟合);(3) 复杂的归纳偏置需要大数据量支撑。
  • M3 成功原因: (1)领域知识优于学习特征:频带功率和额叶不对称性是数十年的神经科学研究结晶,有效地过滤了 EEG 中的噪声(约 80% 为噪声);(2)Bug 修复:解决了冗余 Softmax 和无效 SE 比例等实现错误。

附录:理论背景 (Theoretical Background)

A.1 情感模型

EAV 数据集基于离散情感理论,涉及 5 种类别,对应 Russell 的环形情感模型(效价 Valence 与唤醒度 Arousal):
Happiness → ( + Valence , + Arousal ) \text{Happiness} \rightarrow (+\text{Valence}, +\text{Arousal})Happiness(+Valence,+Arousal)
Sadness → ( − Valence , − Arousal ) \text{Sadness} \rightarrow (-\text{Valence}, -\text{Arousal})Sadness(Valence,Arousal)

A.2 EEG 处理与额叶不对称性

额叶不对称指数 (FAI) 计算公式为:
F A I = ln ⁡ ( P F 4 α ) − ln ⁡ ( P F 3 α ) \mathrm{FAI} = \ln (P_{F4}^{\alpha}) - \ln (P_{F3}^{\alpha})FAI=ln(PF4α)ln(PF3α)
其中P α P^{\alpha}Pα代表 Alpha 频带功率。正值 FAI 通常表示正向情绪。

A.3 音频 MFCC 提取

音频特征提取涉及预加重、分帧加窗、短时傅里叶变换 (STFT) 以及梅尔滤波器组。Delta 特征捕捉动态变化:
Δ c t = ∑ n = 1 N n ( c t + n − c t − n ) 2 ∑ n = 1 N n 2 \Delta c_{t} = \frac{\sum_{n = 1}^{N}n(c_{t + n} - c_{t - n})}{2\sum_{n = 1}^{N}n^{2}}Δct=2n=1Nn2n=1Nn(ct+nctn)

A.4 视觉 FACS

人脸动作编码系统 (FACS) 将表情分解为动作单元 (AU),例如:

  • 幸福: AU6 (脸颊提升) + AU12 (唇角拉紧)
  • 愤怒: AU4 (皱眉) + AU5 (上睑提升) + AU7 (睑收紧)

Original Abstract:We present a systematic study of multimodal emotion recognition using the EAV dataset, investigating whether complex attention mechanisms improve performance on small datasets. We implement three model categories: baseline transformers (M1), novel factorized attention mechanisms (M2), and improved CNN baselines (M3). Our experiments show that sophisticated attention mechanisms consistently underperform on small datasets. M2 models achieved 5 to 13 percentage points below baselines due to overfitting and destruction of pretrained features. In contrast, simple domain-appropriate modifications proved effective: adding delta MFCCs to the audio CNN improved accuracy from 61.9% to \textbf{65.56%} (+3.66pp), while frequency-domain features for EEG achieved \textbf{67.62%} (+7.62pp over the paper baseline). Our vision transformer baseline (M1) reached \textbf{75.30%}, exceeding the paper’s ViViT result (74.5%) through domain-specific pretraining, and vision delta features achieved \textbf{72.68%} (+1.28pp over the paper CNN). These findings demonstrate that for small-scale emotion recognition, domain knowledge and proper implementation outperform architectural complexity.

PDF Link:2601.22161v1

部分平台可能图片显示异常,请以我的博客内容为准

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/5 16:00:18

纺织设备远程监控运维管理平台方案

在纺织行业蓬勃发展的今天,纺织机械作为生产线的核心装备,其稳定运行直接关系到生产效率和产品质量。然而,随着纺织企业规模的扩大和设备的多样化,传统运维方式已难以满足现代纺织生产的需求。该平台通过高度兼容的技术架构&#…

作者头像 李华
网站建设 2026/8/22 21:30:06

DeepSeek-R1一周年回顾与MODEL1新模型技术前瞻

文章回顾了DeepSeek-R1发布一周年的意义,并分析了代码库中出现的MODEL1可能代表的新一代推理模型(R2或全新产品线)。文章探讨了R1如何通过开源策略改变AI推理生态,使模型从"黑箱"变为"白盒",从结果导向转向过程导向。MOD…

作者头像 李华
网站建设 2026/9/4 8:54:12

<span class=“js_title_inner“>智筑安全防线慧享畅行民生——公安交管部门以科技创新书写新时代答卷</span>

从云端的数据之眼到路面的智慧之治,从指尖的便民服务到城市交通的“绿波”畅行,科技的力量正以前所未有的深度和广度,重塑着道路交通管理的方方面面。近年来,全国公安交通管理部门坚持以人民为中心的发展思想,深入实施…

作者头像 李华