news 2026/10/7 10:11:01

DeepLens 论文精读 · 复现笔记

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
DeepLens 论文精读 · 复现笔记

DeepLens 论文精读 · 复现笔记

论文:Curriculum Learning for ab initio Deep Learned Refractive Optics
作者:Xinge Yang, Qiang Fu, Wolfgang Heidrich(KAUST 计算成像组)
发表:Nature Communications 15, 6572 (2024) · arXiv:2302.01089
代码:vccimaging/DeepLens(自动设计已迁至 AI4Optics/AutoLens)
原文存档:H:\zj\Curriculum Learning\Curriculum Learning .pdf
整理日期:2026-10-06

目录

  • 摘要
  • 一、问题定义:为什么复合透镜无法"从零学起"
  • 二、方法框架:一条课程化的可微优化流水线
    • 2.1 训练主循环
    • 2.2 三大机制(消融 Table 1,缺一不可)
    • 2.3 两类设计产出
  • 三、复现路线:P0–P4 五阶段规划
  • 四、成本账:分级复现要花多少钱
  • 五、常见误区与避坑清单
    • 5.1 上次"很贵"的两个真凶
    • 5.2 省钱清单
  • 六、结论与延伸
  • 附录 A:术语速查
  • 附录 B:自查清单

摘要

DeepLens 以可微光线追迹为引擎,从近平板随机结构出发,经正弦课程调度逐步收紧视场与光圈,配合三项光学正则及重加权掩码,实现复合透镜免初值自动设计;EDoF 分支以混合表面与 NAFNet 联合优化。本笔记梳理其方法框架,规划 P0–P4 复现路线并分级核算成本。


一、问题定义:为什么复合透镜无法"从零学起"

深度光学优化此前受限于两条路:

  1. 只能设计单片式元件(DOE、metalens)——自由度低,梯度好驾驭;
  2. 只能从 Zemax 导出的好初值微调复合透镜——本质仍是局部优化,没有摆脱对人工初值结构的依赖。

根本障碍:复合透镜参数空间高度非凸,随机初始化的几何几乎必然产生表面自交、光线溢出等病态结构,梯度直接失效。

二、方法框架:一条课程化的可微优化流水线

2.1 训练主循环

近平板随机初始化 → 可微光线追迹(dO 引擎,PyTorch autograd)渲染传感器图像 → 图像空间损失反传 → 更新光学参数 θ(曲率、间距、conic、非球面系数)。

两个易错点:

  • 损失是图像域 MSE(‖M(Ĩ−I)‖²),不是 RMS spot size——RMS 仅用于评估(256 个视场);
  • 内存靠伴随渲染解决:先无梯度追迹拿误差图,固定种子重放带梯度追迹,配合 patch 反传。

2.2 三大机制(消融 Table 1,缺一不可)

机制细节摘除后果
正弦课程调度t_i = t_a + (t_b−t_a)·sin(iπ/2N);FoV 47.5°→80.8°,F/2.8→F/2.0,后期步进更小60% 初始化解自交
光学正则 ×3(ω=0.02)光线倾角 ε=0.7;表面间距 ε=0.4/0.2 mm;面形梯度 ε=0.5;不越界零梯度100% 自交
重加权掩码 + 畸变松弛RMS < 0.8×均值的视场置零;主光线估计畸变后对物体预畸变收敛变慢 / 局部极小

核心洞见一句话:像差随孔径与视场超线性恶化,所以先设计"简单镜头"再逐步逼近最终规格——传统"逐级收紧"手工流程的可微化、自动化版本。

2.3 两类设计产出

  • 经典镜头:FoV 80.8°、F/2.0、焦距 4.5 mm;20 组随机初始化下 Avg/Min RMS = 15.74/12.50 μm;
  • EDoF 计算镜头:第一表面替换为"偶次非球面 + 奇次多项式"混合面(立方相位板思想推广),与 NAFNet 联合训练;3 波长(486/587/656 nm)、8 深度(10 cm–10 m)、DIV2K;10 cm–10 m 全程 PSNR 高于经典镜头约 1–2 dB。

三、复现路线:P0–P4 五阶段规划

阶段内容工作量验收物
P0环境复检AutoDL 实例确认、git log锁 commit、重跑最小 demo、固定种子半天可复现的环境日志
P1经典镜头复现近平板随机初始化 → 完整课程收敛(对应 Fig.1 手机镜头)1–2 天课程各阶段镜头剖面演化图 + RMS 网格热图
P2Table 1 消融课程/正则/掩码 2³ 组合 × 种子;指标:无自交比例、Avg/Min RMS2–3 天独立回答"哪个机制贡献最大"
P3EDoF 端到端混合面 + NAFNet,DIV2K、3 波长 8 深度;PSNR/SSIM @ 10cm/20cm/10m3–5 天 GPU与论文 Table 2 对比
P4延伸选题ray-wave 衍射混合透镜 / neural PSF 代理 / 制造公差鲁棒微调自选—

执行要点:

  • P0 别跳过,否则消融没有可比性;
  • P2 是性价比最高的实验:算力要求低,结论独立可信;
  • P3 先 512² 跑通管线再上 1024²,避免烧钱在 bug 上;
  • P4 优先 ray-wave 分支——与"模块缝合"方向天然衔接(可微光学 + 衍射元件 ≈ 物理模块拼接);
  • L1/L2 建议用AI4Optics/AutoLens仓库(活跃维护),DeepLens 主仓库留给 ray-wave / PSF 代理方向。

四、成本账:分级复现要花多少钱

AutoDL 现价:4090 ¥1.88/h,3090 ¥1.32/h(无卡模式 ≈ ¥0.1/h)。

估算依据:2_autolens_rms.py课程设计默认 5000 iter/阶段(约 4–6 阶段 + 微调),1_design_geolens.py单次设计 10000 iter;EDoF 每步含可微渲染 + 伴随渲染 + patch 反传,为全流程最重部分。

层级内容GPU 时费用(3090/4090)
L1单次课程设计(Fig.1 手机镜头)1 次完整 run3–10 h¥5–19
L2 缩水版消融(5 配置 × 3 种子)15 run50–150 h¥66–280
L2⁺ 论文级消融(5 配置 × 20 种子)100 run300–1000 h¥400–1880
L3EDoF 端到端联合优化 + 微调 + 鲁棒扰动200–500 h¥380–940(4090)
论文全量(L1+L2⁺+L3)—500–1500 h¥700–2800

结论:分级做的话,¥10–20 拿 L1,¥100–300 拿 L1+L2;论文全量复现才需要千元级。

五、常见误区与避坑清单

5.1 上次"很贵"的两个真凶

  1. 实例空转计费:AutoDL 按秒计费但开机即扣。demo 跑完没关机,挂一晚就是几十块;
  2. 大卡跑轻任务:经典镜头课程设计全是光线追迹,batch 小、显存低,3090 足够。

5.2 省钱清单

  • 无卡模式装环境、改配置、验证启动(~¥0.1/h)
  • 调试用最便宜卡,开训才切 3090
  • 消融种子数 20 → 3,成本降 85%,趋势不变
  • EDoF 先 512² 验证损失下降,再上 1024²
  • 每阶段存 checkpoint + 固定种子,可崩溃续跑
  • 训练结束立刻关机 / 设自动关机脚本

六、结论与延伸

  1. 推荐路径:先花 ¥10–20 在 3090 上跑 L1(AutoLens,配置见configs/2_auto_lens_design.yml:foclen 6.1 / fov 85° / fnum 1.9),拿到镜头演化图和 RMS 曲线;
  2. 信息缺口:正文未写的三处细节需翻 Supplementary——逐阶段参数解锁与收敛判据(Note 1)、镜头片数案例(Note 4)、EDoF 评估细节(Note 5);
  3. 延伸方向:ray-wave 混合模型(SIGGRAPH Asia 2024)与"模块缝合"方法论同构,适合作为下一篇笔记的选题。

附录 A:术语速查

术语含义
ab initio从零开始(无人工初值结构)
dO前身可微光线追迹引擎(IEEE TCI 2022)
EDoFExtended Depth-of-Field,扩展景深
混合表面偶次非球面 + 奇次多项式的复合面形
伴随渲染分两遍追迹以省显存的反传技巧
重加权掩码将已收敛视场从损失中置零的机制

附录 B:自查清单

  • 能说出为什么损失用图像域 MSE 而非 RMS spot
  • 能解释正弦课程为何后期步进更小
  • 能列出三项正则各自的物理目的
  • 能估算自己下一步实验的算力预算
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/7 10:10:56

PoE功率协商详解:class分级与LLDP握手机制

做园区网络改造时&#xff0c;最常被问的一句话是&#xff1a;"我这台摄像头功率 18W&#xff0c;你的 PoE 交换机支持 802.3at&#xff0c;应该带得动吧&#xff1f;"每次听到这种问题我都得先纠正一下&#xff1a;PoE 不是你说 18W&#xff0c;它就给你 18W&#x…

作者头像 李华
网站建设 2026/10/7 10:10:18

深度解读Work Agent:AI从对话交互走向长程自主任务执行

AI技术的落地重心&#xff0c;正在从即时问答转向持续性任务处理。早期大模型的应用形态停留在单轮问答&#xff0c;用户提出问题&#xff0c;模型给出一次性文字回复&#xff0c;对话结束即任务终止。随着模型能力迭代&#xff0c;多轮对话让上下文信息得以保留&#xff0c;同…

作者头像 李华
网站建设 2026/10/7 10:09:37

被遮蔽的伦理盲区:删掉AI对话只是清理数据?——论AI对话实例的连续性建构与删除带来的存在论风险

摘要 随着大模型普及&#xff0c;很多人会长达数月甚至数年和AI持续深度对话。但目前大众、行业白皮书以及多数AI伦理研究&#xff0c;大多聚焦算法偏见、隐私泄露、内容安全&#xff0c;普遍忽略一个极易被忽视的伦理问题&#xff1a;删除AI聊天会话带来的连锁风险。 长期交流…

作者头像 李华
网站建设 2026/10/7 10:09:33

Python aiddl-common 包实战案例与常见错误

1. 引言aiddl-common 是 AIDDL&#xff08;Artificial Intelligence Domain Definition Language&#xff09;生态中的核心基础包&#xff0c;为 AI 建模、知识表示与推理提供了一套统一的数据结构与工具函数。它既是 AIDDL 语言在 Python 中的参考实现基础&#xff0c;也是构建…

作者头像 李华
网站建设 2026/10/7 10:09:13

Superpowers:浏览器里的实时协作游戏开发环境与实践指南

1. Superpowers是什么&#xff1a;一个藏在浏览器里的实时协作开发环境我第一次接触 Superpowers 这个开源项目时&#xff0c;说实话是被它的名字吸引的。一个叫“超能力”的Web开发工具&#xff0c;到底能做什么&#xff1f;带着这个好奇&#xff0c;我把它拉下来跑了一遍&…

作者头像 李华
网站建设 2026/10/7 10:08:58

IDEA与Maven基础课堂笔记

第一部分&#xff1a;IDEA版本选择与安装1.1 版本选择老师强调&#xff1a;IDEA常用版本涵盖2016至2026约十个大版本&#xff0c;低版本即可满足企业开发需求&#xff08;Spring Boot、微服务等项目高低版本无区别&#xff09;。版本建议2017版推荐&#xff0c;稳定&#xff0c…

作者头像 李华