DeepLens 理解优先复现路线 · 执行笔记
承接上篇:《DeepLens 论文精读 · 复现笔记》(完整复现口径,P0–P4 + L1–L3 成本账)
定位转变:目的是深入理解论文,不是复刻论文数字——预训练类环节一律跳过
关键资产:仓库自带镜头 JSON(零训练)、Zenodo checkpoint(EDoF 网络)、早期训练动力学
整理日期:2026-10-06
目录
- 摘要
- 一、定位:理解优先,不是模仿复刻
- 二、现成资产盘点:哪些"权重"可以直接用
- 三、E1–E4 实验设计:每个实验回答一个具体问题
- E1 评价体系(免费,半天)
- E2 课程动力学(约 ¥2–5)
- E3 微型消融(约 ¥5–10)
- E4 端到端梯度流(约 ¥3–5)
- 四、预算与排期
- 五、与上篇路线的关系
- 六、结论
- 附录 A:执行清单
- 附录 B:关键资产路径速查
摘要
以理解为导向重构 DeepLens 复现方案:跳过 NAFNet 从零训练与收敛级长时程优化,直接采用仓库镜头 JSON 与 Zenodo checkpoint,将算力集中于课程切换动力学、微型消融与端到端梯度流四个实验,总预算约 10–20 元,一天半完成。
一、定位:理解优先,不是模仿复刻
完整复现的大头成本烧在"跑到收敛"上,而论文里最有信息量的现象在训练早期就分化了。预训练类环节(标准重建网络从零训练、20 种子统计、长时程优化到论文数字)属于"没意义的重复"——它们服务于投稿,不服务于理解。
由此得出裁剪原则:
- 复刻 15.74 μm 不产生理解,趋势对了就行;
- 统计稳健性是投稿需求,砍到 1–2 种子;
- 但三机制的早期动力学、课程切换行为、端到端梯度流必须亲手跑——论文核心思想全在这里,无法通过读代码或加载权重获得。
二、现成资产盘点:哪些"权重"可以直接用
光学设计的"权重"就是镜头参数 JSON 本身,另有 EDoF 重建网络 checkpoint:
| 资产 | 位置 | 用途 |
|---|---|---|
| 手机镜头 JSON | datasets/lenses/cellphone/cellphone80deg.json、cellphone68deg.json | 大概率为论文设计产出,直接加载分析 |
| 真实镜头专利结构 | datasets/lenses/camera/(EF/RF/适马/永诺等 11 个) | 对比基准 |
| Cooke triplet | datasets/lenses/cooke.json(含劣化版cooke40_inferior.json) | 经典结构教学案例 |
| 初始结构模板 | 3P_blank.json | 课程设计的近平板起点 |
| EDoF checkpoint + 测试集 | Zenodo record 8358592(4.5 GB zip) | NAFNet 权重,免训练直接评估 |
| 神经网络权重 | doe/doe_psf1.pth | 衍射元件 PSF |
| 传感器参数 | datasets/sensors/(Canon/FLIR) | 配合镜头做图像仿真 |
| 材料库 | deeplens/material/*.json | 玻璃折射率选型 |
三、E1–E4 实验设计:每个实验回答一个具体问题
E1 评价体系(免费,半天)
加载cellphone80deg.json,跑 spot diagram / PSF / MTF / 畸变分析,配合传感器 JSON 做一次图像仿真。
回答:光学设计到底在优化什么?顺带熟悉 DeepLens API,为后续实验铺路。
E2 课程动力学(约 ¥2–5)
完整课程设计跑起来但不用跑完——重点盯每次规格切换(FoV/F# 收紧)前后 100 iter 的损失曲线和镜头剖面变化。
回答:从 47.5° 到 80.8°,结构是怎么"长"出来的?对应论文 Fig.1 演化图,课程切换时刻的行为是"由易到难为什么有效"的唯一第一手证据。
E3 微型消融(约 ¥5–10)
三开关(课程 / 正则 / 掩码)各跑 2000 iter × 1 种子。摘掉正则的 run 在几百 iter 内就会自交——论文 Table 1 的"100% vs 0% 无自交比例"结论,早期就能亲眼看到。
回答:三大机制各自挡住了哪种病态?不需要 5000 iter 收敛,病态结构的出现远早于收敛。
E4 端到端梯度流(约 ¥3–5)
Checkpoint 加载 NAFNet → 推理复现论文 PSNR 量级(验证管线)→ 只放开光学参数做几百 iter 联合微调,观察混合面奇次多项式系数变化如何同步改变 PSF 与重建损失。
回答:"梯度穿过光学器件"到底意味着什么?这是 deep optics 范式的命门,也是与"模块缝合"方法论最直接的连接点。
四、预算与排期
| 实验 | 费用 | 耗时 | 产出 |
|---|---|---|---|
| E1 评价体系 | ¥0 | 半天 | 全套分析图 + 仿真图 |
| E2 课程动力学 | ¥2–5 | 半天 | 课程切换演化图(笔记核心素材) |
| E3 微型消融 | ¥5–10 | 半天 | 早期自交对比图 |
| E4 端到端梯度流 | ¥3–5 | 半天 | 梯度流行为记录 |
| 合计 | ¥10–20 | 约 1.5 天 | — |
比完整复现方案(¥700–2800)省一个数量级。省钱要点沿用上篇:无卡模式调环境、3090 开训、checkpoint 续跑、跑完关机。
五、与上篇路线的关系
上篇 P0–P4 / L1–L3 是"完整复现"口径,保留作参考基准(万一后续要发文章或做严谨对比);实际执行以本篇 E1–E4 为主。映射关系:
- E1 ≈ P0(环境复检 + 评价体系熟悉);
- E2 ≈ P1 的短程版(不看终态看过程);
- E3 ≈ P2 的缩水版(种子 20→1,迭代 5000→2000);
- E4 ≈ P3 的免训练版(checkpoint 代替联合训练,只看梯度流);
- P4(延伸选题)不变,ray-wave 分支仍是首选衔接方向。
六、结论
理解型复现的最优策略是把算力花在动力学上,把结论留在自己脑子里:预训练环节用现成资产替代,收敛环节用早期趋势替代,统计环节用单种子对比替代。四个实验全部围绕"论文的每个主张是否见过第一手证据"设计——这才是读透一篇 Nature Communications 的正确姿势。
附录 A:执行清单
- E1:加载 cellphone80deg.json,输出 spot/PSF/MTF/畸变四图
- E1:加载传感器 JSON 做一次图像仿真
- E2:记录每次课程切换前后 100 iter 的损失与剖面
- E3:三开关消融各 2000 iter,截图自交时刻
- E4:下载 Zenodo 8358592,加载 NAFNet checkpoint 复现 PSNR 量级
- E4:放开光学参数 500 iter,记录混合面系数与 PSF 的联动
- 全程固定种子,每次实验前记录 commit hash
附录 B:关键资产路径速查
datasets/lenses/cellphone/cellphone80deg.json # 论文级手机镜头 datasets/lenses/cellphone/3P_blank.json # 课程设计初始模板 datasets/lenses/cooke.json # 经典 triplet datasets/sensors/canon/canon_r6.json # 传感器参数 deeplens/material/materials_data.json # 玻璃材料库 Zenodo 8358592 # EDoF checkpoint + 测试集(4.5 GB) AI4Optics/AutoLens # 自动设计活跃维护仓库