news 2026/8/11 3:54:22

医学论文解读:iSegFormer: Interactive Segmentation via Transformers with Application to 3D Knee MR Images

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
医学论文解读:iSegFormer: Interactive Segmentation via Transformers with Application to 3D Knee MR Images

会议:MICCAI

年份:2022

英文名字:iSegFormer: Interactive Segmentation via Transformers with Application to 3D Knee MR Images

中文译为:iSegFormer: Interactive Segmentation via Transformers with Application to 3D Knee MR Images

一、摘要

医学图像分割通常需要大量体素级人工标注,而 3D MRI 的逐层、逐像素标注尤其耗时,因此交互式分割是一种降低医学图像标注成本的重要方法。

然而,以往医学图像交互式分割方法基本采用 CNN。作者认为 CNN 的局部感受野限制了其建模长距离依赖和全局语义信息的能力,因此尝试将 Transformer 引入这一任务。

但 Transformer 用于 3D 医学图像交互分割存在两个主要困难:

  1. Transformer 计算和显存开销大;
  2. 3D 医学影像的人工标注数据非常有限。

为此,作者提出iSegFormer

  • 使用Swin Transformer作为编码器;
  • 使用轻量级MLP Decoder
  • 使用用户点击作为交互信息;
  • 通过预训练缓解医学标注不足的问题;
  • 最后结合视频目标分割模型STCN,将少量已分割 2D MRI 切片的结果传播至整个 3D MRI。

在 OAI-ZIB 膝关节 MRI 数据集上,iSegFormer 的 2D 交互分割性能优于 CNN 方法。当仅使用5 张已交互分割的切片进行 3D 传播时,股骨软骨最终达到82.2% Dice

二、创新点

1 首次将 Transformer 用于交互式医学图像分割

以往交互式医学分割基本都是 CNN,例如:

  • MIDeepSeg;
  • MONAI Label;
  • RITM 等。

作者提出:

利用 Transformer 的自注意力机制建模较远距离像素之间的关系,从而改善交互式分割。

论文认为这是首个基于 Transformer 的交互式医学图像分割方法


2 提出轻量化交互式 Transformer——iSegFormer

直接采用传统 Transformer 会面临很大的显存和计算开销。

作者因此将:Swin Transformer EncoderLightweight MLP Decoder结合起来。

这样既利用了 Transformer 的长距离建模能力,又避免使用复杂的 Transformer Decoder。

整个结构可以简单理解为:

Image+User Clicks→Swin Transformer→MLP Decoder→Segmentation

从而兼顾:

  • 分割性能;
  • 推理速度;
  • GPU 显存占用。

3 将“视频目标传播”思想迁移到 3D MRI 分割

这是这篇论文比较有意思的一个设计。

作者发现:

视频连续帧与 MRI 连续切片具有一定相似性。

视频中,一个物体从第 t 帧到第 t+1 帧通常变化不大。

同理:MRI 的第 z 张切片和第 z+1 张切片中的软骨结构也具有连续性。

因此作者直接使用视频目标分割中的STCN: 已标注MRI切片→STCN→其他MRI切片,实现从少量 2D 分割结果生成完整 3D 分割。

值得注意的是:

STCN 并没有在医学图像上重新训练。

即使如此,仍然取得了不错的结果。

三、方法

整套方法实际上可以分成两个大的模块:2D交互式分割+3D切片传播​

所提出的iSegFormer是一种基于Transformer的交互式2D图像分割方法,它将Swin Transformer与轻量级MLP解码器相结合如图1所示,通过将其与分割传播模块(即STCN[14])相结合,可以很容易地将其扩展为3D交互式分割方法。

这种3D交互式分割方法由一个iSegFormer和一个分割传播模块组成,iSegFormor用于从用户交互中获得2D分割,分割传播模块将分割的切片重新划分为未分割的切片,从而得到3D分割。如果传播的分割结果不理想,用户可以通过进一步的交互对其进行改进,并在必要时开始新一轮的传播。

3.1 iSegFormer 网络结构

首先完成单张 MRI 切片的交互式分割。

输入包括两部分:MRI Image原始膝关节 MRI 切片和Click Encoding

MRI Image:由于 MRI 通常只有一个灰度通道,而预训练 Swin Transformer 使用 RGB 三通道输入,因此作者简单地将:Gray→RGB,即将灰度图重复三次。

Click Encoding:用户在图像上点击一些位置,告诉模型:

  • 这个地方应该属于软骨;
  • 这个地方不应该属于软骨。

分别对应:

  • Positive Click
  • Negative Click

点击信息编码为一个: H×W×2的特征图。

因此整体相当于: MRI Image+Click Map共同输入模型。


3.2 自动模拟用户点击

训练阶段不可能真的让医生不停地点击,因此作者通过 Ground Truth 自动生成模拟点击。

具体来说:

  • 如果模型存在漏分区域: GT=1,Prediction=0,则在False Negative 区域中心生成一个 Positive Click。
  • 如果存在误分区域: GT=0,Prediction=1,则在False Positive 区域中心生成一个 Negative Click。

然后模型重新分割。

于是形成: Prediction→Error→New Click→Prediction→...这样的迭代交互过程。

训练时还会给点击位置加入随机扰动,以增强模型对真实用户点击位置变化的鲁棒性。

3.3 3D Segmentation Propagation

完成部分切片交互式分割之后,作者进一步实现完整的 3D MRI 分割。

例如,假设一个 MRI volume 有:160 slices医生不需要逐张处理 160 张图像。

只需要选择少量切片,比如: 5 slices使用 iSegFormer 进行交互式分割。

然后: 5张已分割切片→STCN→其余155张切片,从而得到完整 3D 软骨 segmentation。

如果传播后的某一张结果不好:

用户可以重新点击修正该切片,然后再次进行传播。

因此构成一个: 交互→传播→检查→修正→再次传播 的闭环。

四、实验

4.1 数据集

主要采用:

OAI-ZIB Knee MRI Dataset

一共有:507 3D MRIs

每个 MRI: 160 slices

单张大小: 384×384

原始数据包含:

  • Femur;
  • Tibia;
  • Femoral cartilage;
  • Tibial cartilage。

但本文只研究:

股骨软骨 + 胫骨软骨分割。

4.2 结果

作者与 CNN 交互分割方法RITM比较。

CNN Backbone:

  • UNet;
  • HRNet32。

Transformer:

  • Swin-B;
  • Swin-L。

结果中比较典型的是NoC@85

也就是说:

CNN 可能需要约:14−15次点击,才能达到 85% IoU。

而 iSegFormer 大约: 11−12次点击就可以达到相同水平。

因此用户需要进行更少的人机交互。

五、结论

作者提出了基于 Transformer 的医学图像交互式分割模型:

iSegFormer​其主要由: Swin Transformer+Lightweight MLP Decoder组成。

相比 CNN 交互式方法,iSegFormer 在膝关节软骨 2D 交互分割上能够:

  • 使用更少的点击;
  • 获得更好的分割结果;
  • 同时保持接近 CNN 的计算效率。

此外,作者进一步将 iSegFormer 与视频目标传播模型STCN结合:

iSegFormer→少量2D切片→STCN→完整3D分割

只使用5 张已分割切片,就能够在股骨软骨 3D 分割上获得: 82.2% Dice​

而且 STCN 完全没有针对医学影像进行微调。作者因此认为,将视频中的时序传播思想迁移到 3D 医学图像切片传播是一个很有潜力的研究方向。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/11 3:54:18

PowerShell实现Windows右下角Toast通知:从NotifyIcon到BurntToast实战

在 Windows 自动化运维或日常脚本开发中,我们经常需要向用户发送一些非阻塞的、轻量级的通知,比如任务完成提醒、状态更新或简单的警告。传统的弹窗(如msgbox)会强制用户交互,中断工作流,体验并不友好。而系…

作者头像 李华
网站建设 2026/8/11 3:52:46

开源设计工具Open Design:可视化生成React/Vue代码,提升前端开发效率

1. 项目概述:从“求人”到“自主”的设计能力跃迁最近在技术社区和产品经理圈子里,一个话题的热度居高不下:如何快速、低成本地获得高质量的UI/UX设计产出,尤其是当团队里没有专职设计师,或者前端开发资源紧张的时候。…

作者头像 李华
网站建设 2026/8/11 3:52:04

OpenClaw自动化任务定时执行:从Cron表达式到生产部署全指南

1. 从“手动触发”到“无人值守”的进化做自动化工具,最爽的时刻是什么?不是第一次成功运行,而是你把它配置好,然后彻底忘了它,过段时间一看,它已经默默帮你处理了一堆任务。这就是“无人值守”的魅力。Ope…

作者头像 李华
网站建设 2026/8/11 3:48:41

QGroundControl 5.0 安卓开发环境搭建实战:从零编译到成功运行

最近准备把地面站项目升级到 QGroundControl 5.0,于是重新搭建了一套 Android 开发环境。原本以为和 QGC 4.x 差不多,结果一上来就连续踩坑:Qt版本不匹配Android Kit不显示NDK版本错误Gradle构建失败折腾了几个小时后终于成功编译并运行在安卓…

作者头像 李华
网站建设 2026/8/11 3:47:30

大气层系统深度技术指南:从源码结构到高级配置的完全解析

大气层系统深度技术指南:从源码结构到高级配置的完全解析 【免费下载链接】Atmosphere-stable 大气层整合包系统稳定版 项目地址: https://gitcode.com/gh_mirrors/at/Atmosphere-stable 大气层系统(Atmosphere)是一个为Nintendo Swit…

作者头像 李华
网站建设 2026/8/11 3:44:35

脑机设备进入多校区后,怎样保证教学交付不走样?

脑机设备进入多校区后,怎样保证教学交付不走样? 直接答案:大型教育机构引入脑机设备后,真正要复制的不是机器数量,而是一套可检查的教学质量标准。至少要统一学生测评、训练内容、设备操作、出舱检测、复现记录、教师认…

作者头像 李华