期刊:Medical Image Analysis
年份:2024
英文题目:Semi-supervised medical image classification via distance correlation minimization and graph attention regularization
中文译为:基于距离相关性最小化与图注意力正则化的半监督医学图像分类
一、摘要
医学影像深度学习通常需要大量由临床专家标注的数据,但医学影像标注存在下面的系列问题:
- 成本高;
- 耗时长;
- 需要专业医生;
- 数据隐私与伦理限制;
现实情况通常是:少量 labeled data+大量 unlabeled data
因此作者提出一种新的:Semi-Supervised Learning,半监督学习方法。
论文的核心有两个部分。
第一:Distance Correlation Minimization
对于同一张未标注医学图像,作者首先做两种不同的数据增强,然后分别送入两个相互独立、不共享参数的深度神经网络:,得到两套特征,随后计算,距离相关性,并将其最小化。
目的不是强迫两套特征一样,而恰恰相反,是减少两个特征空间之间的redundant information,即冗余信息。让两个网络从同一张图像中学习:
不同但互补的医学影像特征。
第二:Graph-Attention Regularization
作者进一步认为:
一张医学图像不能只单独看,它和其他患者影像之间本身存在潜在关系。
例如:
- 相似病理;
- 相似组织结构;
- 相似影像表现;
- 相似异常模式。
因此作者把一个batch中的未标注样本构造成:Graph
同一个图像经过两种增强以后,会形成两套图结构: Rf和: Rg
作者要求: Rf≈Rg
也就是说:
即使同一批医学图像经过不同增强,样本之间的内在关系应该基本保持一致。
从而进一步利用未标注数据。
最终实验覆盖:
- X-ray;
- dermoscopy;
- CT;
- MRI;
四种医学影像场景,并且在多个标注预算下,与多种半监督方法相比取得了较有竞争力的结果。
二、创新点
创新点一:首次将距离相关性最小化用于医学影像半监督分类
已有很多半监督方法采用:Prediction Consistency
例如:
同一张图经过不同增强以后,分类结果应该一致。
或者采用:Pseudo Label,利用模型预测结果作为未标注数据的标签。
但这些方法都有问题。
例如伪标签容易出现:Confirmation Bias
即:
模型一开始预测错了,错误标签又继续拿来训练模型,导致错误越来越强化。
Mean Teacher等方法又可能因为Teacher和Student参数高度耦合,导致:
两个网络缺乏足够的功能多样性。
因此作者没有强迫两个网络: Prediction A=Prediction B
而是在:Feature Space上做文章。
作者提出:
让同一张图不同增强视图产生的两个特征空间尽可能减少统计依赖。
距离相关性的优势在于:
不仅能够检测线性关系,也能够检测非线性关系。
这一点非常适合DNN,因为深度网络本身就是: Nonlinear Transformation
创新点二:提出基于图注意力的未标注样本关系正则化
作者认为仅仅做特征去相关还不够。未标注医学图像之间实际上具有:Relational Information
例如两个膝关节MRI可能都存在:
- ACL异常;
- 半月板异常;
- 相似骨结构;
- 类似组织信号。
这些相似性本身也是非常有价值的信息。
因此作者建立:图,每个节点对应一个未标注样本。
作者不提前人为定义:
“哪两张图片应该连接”。
而是:所有节点先连接
再通过:GAT(Graph Attention Network)
自动学习: Attention(i,j)
即:
第 i 个样本应该多大程度关注第 j 个样本。
然后要求同一批图像在两个不同增强视图下: Rf和: Rg的样本关系保持一致。
因此它学习的是: Instance−to−instance relation,而不是简单利用单个图像。
创新点三:不依赖伪标签,也不需要Teacher–Student参数耦合
这也是论文和很多SSL方法的重要区别。它没有:Pseudo Label,所以避免了严重的:confirmation bias。
同时两个网络: f(⋅)和: g(⋅)参数是: θ和: ϕ两套独立参数。
不是: Teacher=EMA(Student)
因此作者把它称为:non-coupled DNN architectures
即:
两个网络结构可以相同,也可以不同,而且参数独立更新。
这样理论上能够保持更强的:representation diversity即表示多样性。
三、方法
这篇论文的方法可以看成三个Loss:
分别对应:
- 有标签数据分类监督;
- 未标注数据特征去相关;
- 未标注数据图关系一致性。
作者对未标注数据生成两个不同视图,论文主要采用:RandAugment
包括:
- Brightness;
- AutoContrast;
- Equalize;
- Invert;
- Rotate;
- Posterize;
- Solarize;
- Contrast;
- Sharpness;
- Shear;
- Translate;
之后将增强的图像和标签图像一起送入两个分支,对有标签数据的分类预测,对未标注样本的进行距离相关性和图正则化约束。
3.1 Distance Correlation
对于未标注样本,两个网络得到:X和: Z。
作者计算不同样本之间的特征距离:
然后经过双中心化得到:和
进一步计算:Distance Covariance
然后归一化得到:
其范围: 0≤≤1。
其中:≈1
说明两个特征空间:
高度相关、包含大量重复信息。
而:≈0
说明:
两个特征空间之间依赖较小。
所以训练目标是: min
为什么这里是“最小化相关性”而不是“最大化一致性”?
这是这篇论文最容易让人疑惑的地方。通常SSL会说:
同一张图不同增强应该得到相似表示。
但是本文认为:
如果两个网络最后学习到完全相同的东西,就产生了大量冗余信息。
例如两个网络都只学:
- 灰度强弱;
- 某个固定组织纹理;
但忽略其他信息。
作者希望:
网络A可能更加关注:Texture
网络B可能更加关注: Structure或者: Pathological Pattern
因此: X和: Z之间不应该完全重复。
所以这里的思想更接近:Feature Decorrelation / Redundancy Reduction
而不是传统的consistency。
3.2 构建未标注样本图
然后作者把X看作一个图,把: Z看作另外一个图
。
每个:或者:
就是一个节点。
所有节点先全部连接: Fully Connected Graph。
因此不需要事先知道:
哪两个病人是同一类。
分别使用Graph Attention Network学习样本关系和:
- 对于节点i和 j
- 计算注意力:
- 再经过Softmax得到:
。
- 这个值表示:
样本 i 和样本 j 在当前特征空间中有多强的关系。 - 最终形成:
和
两张注意力关系矩阵。
虽然作者希望X和 Z本身不要太冗余,
但它们对于:“哪些患者彼此相似”的判断应该保持稳定。
例如同一batch中:
- Patient A和Patient C非常相似;
- Patient B和Patient D比较相似;
这种关系不应该因为图像亮度或旋转发生变化。
因此作者要求:。利用Cross-Entropy定义:
3.3 总损失
最终:
其中论文实验设置λ=0.4。
所以三部分分别承担:
- Lcls学习:疾病类别。
- Ldc减少:两个网络特征的冗余。
- Lgr保持:未标注样本之间的关系一致。
所以最终形成一种很有意思的组合:Feature Representation不同,但Data Relationship:一致
可以把它理解成:
两个网络可以从不同角度理解同一批患者,但对“哪些患者彼此相似”的认识应该一致。
训练的时候需要:
- 两个DNN;
- 两个GAT;
- Distance Correlation;
- Graph regularization。
但是测试的时候:全部不需要。
训练结束后,作者只选择:validation表现最好的那个DNN backbone用于最终分类。
因此:Training:2DNN+2GAT
但是: Inference:1DNN
所以GAT不会给测试阶段增加额外计算开销。
四、试验
4.1 数据集
| 数据集 | 模态 | 任务 |
|---|---|---|
| NIH-14 | X-ray | 14种胸部疾病多标签分类 |
| ISIC 2018 | Dermoscopy | 皮肤病变7分类 |
| COV19-CT | CT | COVID阳性/阴性 |
| Knee MRNet | MRI | 膝关节异常分类 |
标注比例:
| 数据集 | 模态 | 任务 |
|---|---|---|
| NIH-14 | X-ray | 14种胸部疾病多标签分类 |
| ISIC 2018 | Dermoscopy | 皮肤病变7分类 |
| COV19-CT | CT | COVID阳性/阴性 |
| Knee MRNet | MRI | 膝关节异常分类 |
4.2 结果
当标注只有5%本文:75.77
明显高于监督训练: 66.26
7.5%标注本文: 79.38也是最佳。
但是当标注提高到: 15%,25%以后:NoTeacher反而超过本文。
所以作者明确指出:
SSL-DcGaR最大的优势主要体现在极少标签条件。
五、总结
本文提出SSL-DcGaR半监督医学图像分类方法,通过两个独立DNN对同一未标注图像的不同增强视图进行编码,利用距离相关性最小化减少两个特征空间中的冗余信息,同时将未标注样本构造成全连接图,并通过图注意力学习样本间关系,约束不同视图下的关系结构保持一致;最终将监督分类、特征去相关和图关系正则化联合优化,从而在仅有少量人工标注的情况下提升医学影像分类性能