注意力机制是啥?有哪些分类?从我个人角度来说,觉得先了解其诞生与发展之后再总结下。
1 诞生与发展
1.1 思想萌芽期(1990s):视觉与认知的“硬注意力”
核心领域:计算机视觉 (CV)
本质:模拟人类视觉的选择性聚焦,属于硬注意力(Hard Attention)。
里程碑事件:
1998年 Itti 模型:基于颜色、亮度等低层特征计算视觉显著性(Saliency Map),这是注意力思想在计算模型中的最早落地。
2014年 RAM:使用 RNN + 强化学习预测下一个“注视点”,是硬注意力在深度学习中的典型代表。
特点:规则驱动、不可微分、训练困难,主要用于解决“看哪里”的问题。
1.2 技术成熟期(2014-2016):NLP 的“软注意力”
核心领域:自然语言处理 (NLP)
本质:解决序列建模的信息瓶颈,属于软注意力(Soft Attention)。
里程碑事件:
2014年 Bahdanau Attention:首次在 Encoder-Decoder 框架中引入可微分的对齐机制,让解码器动态关注编码器的不同部分。
2015年 Luong Attention:优化了计算方式(如 Dot-Product),确立了软注意力作为标准组件的地位。
特点:数据驱动、可微分、端到端学习,解决了“如何加权”的问题。
1.3 范式革命期(2017-至今):Transformer 与“自注意力”
核心领域:NLP → CV(反哺)
本质:抛弃归纳偏置,实现全局关系建模,核心是自注意力(Self-Attention)。
里程碑事件:
2017年 Transformer:提出 Multi-Head Self-Attention,证明无需 RNN/CNN 即可处理长程依赖,统一了软/自注意力机制。
2020年 Vision Transformer (ViT):将图像切分为 Patch 序列,首次将纯 Transformer 应用于 CV 并达到 SOTA,完成从 NLP 到 CV 的范式迁移。
特点:并行计算、全局感受野、架构大一统。
2 总结
注意力机制始于 CV 的视觉模拟(硬注意力),成于 NLP 的序列对齐(软注意力),最终通过 Transformer 的自注意力实现跨模态统一。
从硬注意力机制开始探索,到软注意力机制,再到如今的自注意力机制。可知道人类科技文明就是这样众多人类探索者前赴后继的探索,推动了整个科技文明的前进,这是不以你我的意志为转移的发展规律。
2.1 注意力机制是一种思想
不局限于特定模型。transformer只是这种思想中分支——自注意力机制——的实现之一。
2.2 仿人学
说白了,就是把人的注意力机制让神经网络实现。这就是仿人学呀!!
2.3 分类
硬注意力机制:个人理解,类似于权重,分配非0即1,该抛弃的彻底抛弃,很硬!也叫局部注意力机制。
软注意力机制:也叫全局注意力机制。不再是硬注意力的非0即1,而是全部都有,权重0-1之间。
自注意力机制:输入各项内部推举各个的重要性的机制。
这里人类的行为方式之一就是注意力,你行走看景都会锁定一点,老师上课时常说“注意力集中”,就是这样,AI的研究又会回归到人类大脑的研究。
每个人都有自己的关注点,都是自己从小到大形成的自己的规则——“做自己”说的就是不会因外物影响自己的一套规则——一套关注点规则。
另外,人类的注意力是实时变化的。
而且个人有个人的关注点,都是长年累月形成的。