一、制造认知缺口:低光下,传统ISP的第一步就在制造问题
安防监控的黑光全彩场景面临一个被反复低估的技术挑战:不是"噪声太多",而是"噪声被Demosaic(去马赛克)放大了之后,再去降噪已经晚了"。
理解这个问题需要回到CMOS传感器的物理结构。Bayer阵列的传感器在每个像素位置只安装一种颜色的滤光片——R(红)、G(绿)或B(蓝)。这意味着传感器的原始输出不是"不完整的三通道彩色图像",而是一个单通道、马赛克状的灰度阵列。将这份数据转换为人类和机器可以理解的RGB彩色图像,必须经过Demosaic——根据周围像素的信息,插值出每个像素缺失的另外两个通道。
问题在于:Demosaic是一个基于空间相关性假设的插值操作。 它假设相邻像素的颜色值是平滑变化的,因此可以用邻域像素的已知颜色值来推测缺失值。在信噪比充足时,这个假设基本成立。但在黑光场景中——信噪比低于10dB甚至更低——噪声已经篡改了每个像素的原始读数。此时Demosaic不仅会把错误的像素值插值到邻域,更致命的是,插值过程本身会创造出全新的、在原始数据中根本不存在的噪声模式:一个噪点像素被Demosaic后,变成了三个通道上各有不同噪声偏差的彩色噪点。这些"二次污染"的噪声与原始噪声在统计分布上完全不同,后续的降噪模块面对的是一个比原始问题更复杂的问题。
这正是传统ISP"先Demosaic、再降噪"路线的结构性缺陷。另一种选择——"先降噪、再Demosaic"——同样困难:在Bayer域降噪时,每个像素只有一个通道,降噪算法没有其他通道的信息来交叉验证异常值到底是噪声还是真实边缘。
二、核心洞见:联合优化——让一个网络同时理解噪声和马赛克
2018至2019年,以色列理工学院(Technion)的Eli Schwartz、Raja Giryes和Alex M. Bronstein在IEEE TIP上发表了DeepISP,首次系统性地回答了这个问题:去噪和去马赛克不应该分步做,应该让一个神经网络联合学习两项任务。联合优化的PSNR显著高于任何分步串联组合。
这一洞见背后是一个深刻的认知迁移。传统ISP的分步架构源于人类工程师的模块化思维——把一个大问题拆成小问题,逐个解决。但"拆"这个动作本身就切断了任务之间的信息交互。去噪需要理解马赛克模式(知道哪些波动是Bayer采样导致的固有不均匀),去马赛克需要理解噪声分布(知道哪些梯度是噪声引起的虚假梯度),这两个任务在信息层面是共生的,将它们分配给两个互不通信的模块,本质上是在强迫每个模块在不完整信息下做决策。
DeepISP的架构体现了"联合优化"思想的完整落地。它不是简单地把两个任务的损失函数加在一起,而是在网络结构层面实现了信息共享。
第一阶段:Low-level阶段——局部修复与隐式联合。输入是经过Bilinear插值预处理(简单Demosaic)的低光照Bayer Raw图像。这一阶段由20个残差块堆叠而成,每个残差块输出64个特征通道。其中3个通道映射为RGB残差图像,并与当前块的输入RGB估计相加;剩余61个通道作为"特征记忆"向前传递。这种每层都显式输出RGB估计并允许后续层修正的设计,让网络可以在20个深度层次上逐步精修联合去噪+去马赛克的结果——浅层处理粗粒度的噪声和插值,深层处理细粒度的伪影。更重要的是,所有低层共享同一个特征表示,去噪子网络和去马赛克子网络不需要"猜测"对方的状态——它们就是在同一段特征代码上共同决策的。
消融实验提供了令人信服的证据:去除残差连接(skip connections)的版本在5000个epoch后损失仍然比完整版本高两个数量级——联合优化需要深网络,而深网络的稳定训练依赖残差连接。
第二阶段:High-level阶段——全局参数化校正。第一阶段输出的图像已经完成了去噪和去马赛克联合处理,但低照度下的全局属性——色温偏移、整体偏暗——仍需修正。第二阶段的处理方式极具工程智慧:将第一阶段传过来的61个特征通道通过逐层下采样(stride 2)和全局平均池化压缩为一个全局特征向量,再通过全连接层输出一个3×10的变换矩阵W。这个矩阵定义了一个像素级的二次色彩变换函数:
输出_RGB = W · triu([R G B 1]^T ⊗ [R G B 1])
其中triu取外积的上三角部分(包含R、G、B的一次项、二次项和交互项)。这种"image-to-parameter"的思路意味着第二阶段只有几千个参数却可以实现全局白平衡、曝光校正和色彩映射,比逐像素深度学习高效得多。
损失函数同样体现了"联合"的思想:在Lab色彩空间上同时施加L1损失(所有通道,保证全局色彩准确)和MS-SSIM损失(仅L通道,保证局部纹理保真)。MS-SSIM对亮度的微小偏移不敏感,而L1对色彩偏差很敏感——两个互补的损失函数联合优化,远比单一损失的泛化效果好。
三、验证洞见:数据驱动的联合优化优势
DeepISP在MSR demosaicing benchmark上进行了联合去噪+去马赛克任务的定量评估:
Panasonic测试集(线性空间):PSNR较此前SOTA方法SEM提升0.38dB,较另一深度学习方法提升0.71dB;
Panasonic测试集(sRGB空间):较SEM提升0.72dB,较深度学习方法提升1.05dB;
Canon测试集(线性空间):较SEM提升0.61dB;
Canon测试集(sRGB空间):较SEM提升1.28dB。
Cross-sensor泛化(在Panasonic数据上训练、在Canon数据上测试)取得了正向结果,证明联合优化的优势不是数据特异的——网络学到的是"噪声模式与马赛克模式的交互规律",而非特定传感器的统计特征。
在S7 ISP数据集上的全Pipeline评估中,DeepISP输出的低光照图像在人类主观评分(MOS)上达到4.02(满分5分),超过三星S7原生ISP的3.74,仅比正常光照下的高质量参考图像(MOS 4.05)低0.7%。这意味着DeepISP的输出在主观上已经接近"人眼在充足光照下看到的画面"——而这完全是在没有补光灯辅助的条件下实现的。DeepIQA(基于深度学习的图像质量评估模型)的评分同样确认了这一结果(DeepISP 3.92 vs 三星ISP 3.72)。
最关键的发现是消融实验中的一个对比:切断Low-level阶段与High-level阶段之间的特征连接,让两个阶段独立运行、各自分配相同参数预算——图像质量显著下降。这直接证明了共享特征(即联合优化)本身就在提升性能,而不是因为参数更多或网络更深。
四、推开一扇窗:Pico-G1在Bayer Raw域的"联合优化"实践
DeepISP给工程界留下的最大遗产不是"用端到端网络替代整个ISP流水线"这个激进主张,而是一个更务实的方法论:在任务交互最紧密的节点做联合优化,而不是在任务独立的地方强行合并。
对于黑光全彩场景,"任务交互最紧密的节点"首先是Bayer Raw域的降噪。这正是ShiMeta Pico-G1的AI_NR模块的战略定位。
Pico-G1基于GK7206芯片,NPU总算力1.0T。AI_NR消耗0.5T在Bayer Raw域做深度学习降噪,支持4M@15fps实时处理。这个"在Raw域降噪"的选择,直接继承了DeepISP的核心发现——联合优化优于分步优化。
Pico-G1采用"大模型蒸馏+小模型微调",云端通用降噪大模型提供先验,端侧0.5T轻量模型实时推理,避免端侧从头训练的算力天花板。最终效果:无需红外补光灯,暗光全彩输出。AOV低功耗模式下整机42mW@2Mp/1fps,电池供电的黑光全彩监控从理论走向现实。
DeepISP 2018年的结论在Pico-G1上得到了工程验证:不需要用AI替代整条ISP,只需要在信息损失最快的那个节点,让AI深度介入一次。
-----
本文是对原论文的解读与发散,原作者和所属机构未参与本文撰写,亦无任何利益关联。
原论文:DeepISP: Towards Learning an End-to-End Image Processing Pipeline,Eli Schwartz, Raja Giryes, Alex M. Bronstein,IEEE Transactions on Image Processing, 2019. 论文地址:https://arxiv.org/abs/1801.06724