尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
DRSformer·论文蒸馏笔记:可学习 Top-k 稀疏注意力去雨网络
DRSformer·论文蒸馏笔记可学习 Top-k 稀疏注意力去雨网络蒸馏对象Xiang Chen, Hao Li, Mingqiang Li, Jinshan Pan.《Learning A Sparse Transformer Network for Effective Image Deraining》CVPR 2023, pp. 5896–5905arXiv:2303.11950DOI 10.1109/CVPR52729.2023.00571作者机构南京理工大学陈翔/李昊/潘金山 中国电科信息科学研究院官方代码github.com/cschenxiang/DRSformer含预训练权重蒸馏日期2026-10-10 · 蒸馏方法DeepLens / 去雨系列同款正文 目录 封面流程谱系定位TPAMI 2025 统一评测综述独立训练赛道冠军一作陈翔即该综述一作——这篇是先有方法、后有评分规则的典型样本摘要本笔记蒸馏 CVPR 2023 去雨 Transformer DRSformer针对稠密自注意力聚合无关特征、抹平高频细节的缺陷提出可学习 top-k 稀疏注意力TKSA仅保留最关键通道相似度参与特征聚合辅以混合尺度前馈网络与混合专家特征补偿器五大基准全面刷新 SOTA独立训练赛道至今仍是冠军基线。目录摘要一、导读这篇论文在你的谱系里是什么位置二、动机稠密自注意力的三宗罪三、总体架构不换骨架只换器官四、TKSA可学习 Top-k 稀疏注意力核心创新4.1 计算流程4.2 关键细节k 不是超参数是可学习区间4.3 与两个近亲的区别论文 4.4 节4.4 消融证据五、MSFN混合尺度前馈网络六、MEFC混合专家特征补偿器七、实验五基准全 SOTA 与训练配方7.1 主结果Table 1PSNR/SSIMY 通道7.2 训练配方复现照抄用八、与你的复现/项目谱系的关系8.1 AutoDL 复现成本账3090 口径8.2 对张娟 MG-TSKD 的三个接口8.3 对 E0-E3 增量计划附录 A术语速查附录 B本地材料索引一、导读这篇论文在你的谱系里是什么位置先给结论链RestormerCVPR22通道转置注意力 │ 遗留问题softmax 稠密聚合无关 token 也掺和 ▼ DRSformerCVPR23陈翔/潘金山 ←── 本篇 │ top-k 稀疏化 混合尺度 FFN MoE 补偿器 ▼ TPAMI 2025 统一评测综述同一作者团队 │ 独立训练赛道冠军22 方法Table V ▼ HQ-RAIN / RE-RAIN合成冠军、真实域泛化弱 → 综述核心发现三个值得记住的点它至今仍是独立训练赛道的榜首方法TPAMI 2025 综述 Table V 平均分第一不是过气基线它是注意力手术刀式创新——不换骨架还是 U 形编解码 转置注意力只动注意力计算方式这种改动粒度最适合作为缝合素材论文自述的最大局限是效率33.7M 参数 / 242.9G FLOPs作者明确说未来要做剪枝/蒸馏——这正好是张娟 MG-TSKD 蒸馏项目可以对接的口子详见第八节。二、动机稠密自注意力的三宗罪论文的出发点是对标准自注意力的批判逻辑链条很干净无关 token 掺与聚合标准 Transformer 把所有 query-key 对的相似度都拿来做特征聚合。但 key 里的 token 并不总与 query 相关——不相关的相似度照样参与 softmax 加权噪声被硬塞进输出特征小权重被放大softmax 的稠密计算模式会放大幅度较小的相似度权重使特征交互过程对隐式噪声敏感论文引 explicit sparse transformer、NeurIPS 2021 稀疏化探索佐证高频信息被抹平注意 softmax(QK^T/λ) 矩阵每行非负且和为 1——拿它去乘 V 本质是对 V 做加权平均高频细节天然被平均掉输出趋于过平滑。与视觉证据一致论文 Fig. 1Uformer / Restormer / IDT 在细节与纹理恢复上都有缺口IDT 还引入边界伪影——纯 Transformer 去雨的共性问题。蒸馏注解第 3 条其实解释了为什么合成强、真实弱——过平滑的先验在合成数据上被 PSNR 奖励合成 GT 本身就偏干净到真实复杂纹理上就露馅。这与 TPAMI 综述的 RE-RAIN 发现是同一枚硬币的两面。三、总体架构不换骨架只换器官DRSformer 是层级化 U 形编解码器Restormer 同款骨架输入端3×3 卷积重叠 patch embedding下采样/上采样pixel-unshuffle / pixel-shuffle主干单元每层堆叠 Nᵢ 个稀疏 Transformer 块STB配置 {N₀, N₁, N₂, N₃, N₄} {4, 4, 6, 6, 8}四层注意力头数 {1, 2, 4, 8}初始通道 C48膨胀比 2STB 内部TKSA注意力 MSFN前馈Pre-LN 残差结构X′ₗ Xₗ₋₁ TKSA(LN(Xₗ₋₁))Xₗ X′ₗ MSFN(LN(X′ₗ))首尾两级各挂 N₀ 个MEFC混合专家特征补偿器做协同精修输出端全局残差 I_derain F(I_rain) I_rain训练损失只有纯 L1。蒸馏观点纯 L1 全局残差 U 形骨架说明性能增益几乎全部来自三个新器官TKSA / MSFN / MEFC消融归因干净——这是审稿人喜欢、复现者省心的设计。四、TKSA可学习 Top-k 稀疏注意力核心创新4.1 计算流程沿用 Restormer 的通道维转置注意力在 Ĉ×Ĉ 通道相似度矩阵上做注意力而非空间维复杂度从 O(HW)² 降到 O(C²)但插入一步关键手术SparseAtt ( Q , K , V ) softmax ( T k ( Q K ⊤ / λ ) ) V \text{SparseAtt}(Q,K,V) \text{softmax}\big(T_k(QK^\top/\lambda)\big)VSparseAtt(Q,K,V)softmax(Tk​(QK⊤/λ))V其中 top-k 选择算子[ T k ( S ) ] i j { S i j , S i j ∈ top-k(row j ) 0 , otherwise [T_k(S)]_{ij} \begin{cases} S_{ij}, S_{ij} \in \text{top-k(row } j) \\ 0, \text{otherwise} \end{cases}[Tk​(S)]ij​{Sij​,0,​Sij​∈top-k(rowj)otherwise​即对相似度矩阵每一行只保留 top-k 个分数进 softmax其余 scatter 置 0。不是 dropout 式随机丢弃而是按贡献度自适应筛选。4.2 关键细节k 不是超参数是可学习区间k 以适当分数的加权平均动态确定取值被约束在区间[Δ₁, Δ₂] [1/2, 4/5]内消融实测Rain200Hk [1/2, 4/5] 时 32.18 dB 最优k 太小 → 全局信息聚合不足性能断崖式下跌k 太大 → 无关无用特征混入性能缓降固定单值 k如 1/2对取值敏感区间化 可学习最稳。4.3 与两个近亲的区别论文 4.4 节方法稀疏维度k 的性质代价KiTCVPR 2022空间维k-NN 局部注意力固定局部敏感哈希复杂全局交互不足KVTECCV 2022空间维 top-k token固定空间维开销大DRSformer通道维top-k可学习区间通道注意力本身 O(C²)top-k 几乎白送分类学上KiT/KVT 一类属于数据驱动稀疏data-basedDRSformer 属于内容驱动稀疏content-based——每个 query 按相似度内容自适应选 key。4.4 消融证据去掉 top-k退化为标准转置注意力各基准 PSNR 全线下降Fig. 6高通滤波HPF可视化Fig. 8带 top-k 的特征图高频细节明显更完整——佐证第二节加权平均抹高频的诊断机制解释邻近像素天然相似top-k 剔除的正是长程依赖中的低相似度交互等于给注意力加了一个近邻偏置但不损失全局挖掘能力。五、MSFN混合尺度前馈网络动机Uformer/Restormer/IDT 的前馈网络只用单尺度深度卷积补局部性忽略多尺度雨纹的相关性MSPFN 早就证明多尺度对去雨有效。结构纯并行双分支 交叉拼接X → LN → 1×1conv 升维膨胀比 r2.66 ├─ 3×3 DWConv ──┐ │ [拼接] → 3×3 DWConv ──┐ └─ 5×5 DWConv ──┘ [拼接] → 1×1conv 残差 └────────5×5 DWConv ──────┘两条分支各跑两轮第二轮时交换拼接对方的输出3×3 分支吃 [3×3 输出, 5×5 输出]5×5 分支吃 [5×5 输出, 3×3 输出]实现跨尺度信息流动。消融Rain200HTable 3前馈网络PSNR / SSIMFN普通 MLP31.84 / 0.9275DFN单尺度 DWConv31.88 / 0.9279GDFNRestormer 门控双流31.97 / 0.9286MSFN本文32.18 / 0.9330对 GDFN 的增益 0.21 dB——零新算子全是 DWConv 和拼接纯结构设计换来这是模块缝合性价比最高的一类素材。六、MEFC混合专家特征补偿器动机雨分布揭示退化位置与程度数据稀疏性STB 只挖掘了内容稀疏——MEFC 来补数据稀疏实现数据 × 内容双重稀疏协同。设计与经典 MoE 的两点不同专家池8 个异构专家——平均池化3×3 感受野、可分离卷积1×1/3×3/5×5/7×7、膨胀卷积3×3/5×5/7×7感受野和算子类型都不同不同于同构专家堆叠无外部门控网络用自注意力充当专家切换器——通道平均池化得描述子 z_c经 W₁/W₂ 生成各专家系数加权融合 8 个专家输出各自 zero-pad 对齐尺寸后 1×1 卷积 残差。消融Rain200HTable 4基线 32.03 → MEFC-1 → 32.07 → MEFC-2 8 专家 →32.18。单专家32.06明显弱于多专家——异构感受野的多样性是增益来源。工程注意Rain200L 和 SPA-Data 训练时不挂 MEFC——雨纹简单时 MEFC 反而多余。复现时照抄这个配置。七、实验五基准全 SOTA 与训练配方7.1 主结果Table 1PSNR/SSIMY 通道数据集RestormerIDTDRSformerRain200L40.99 / 0.989040.74 / 0.988441.23 / 0.9894Rain200H32.00 / 0.932932.10 / 0.934432.18 / 0.9330DID-Data35.29 / 0.964134.89 / 0.962335.38 / 0.9647DDN-Data34.20 / 0.957133.84 / 0.954934.36 / 0.9590SPA-Data真实47.98 / 0.992147.35 / 0.993048.53 / 0.9924平均领先同期 IDT 约0.4 dB对 CNN 系MPRNet/SPDNet/RCDNet优势更大真实数据 SPA-Data 与无 GT 的 Internet-DataNIQE 4.095 / BRISQUE 22.730 双最低也拿第一——注意这是论文自己测的TPAMI 综述统一口径重测后 RE-RAIN 泛化并不占优两份证据合起来读才完整。7.2 训练配方复现照抄用项配置优化器AdamWbatch / patch8 / 128×128迭代300K前 92K 恒定 lr余下 cosine 退火学习率1×10⁻⁴ → 1×10⁻⁶增强随机水平 垂直翻转硬件4× RTX 3090端到端无预训练MEFCRain200L / SPA-Data 不用其余数据集用指标Y 通道 YCbCr与本篇 TPAMI 综述统一后的口径一致八、与你的复现/项目谱系的关系8.1 AutoDL 复现成本账3090 口径方案内容预估成本L0 推理复现官方预训练权重直接测五基准¥2-5几小时L1 单卡全量复训1×3090batch 8显存约 20G 内可容300K iter 约为论文 4 卡时长 ×3-4 → 12-18 天¥300-500L2 砍迭代复训150K iter batch 4经验损失 ≤0.1 dB¥120-200L3 仅 Rain200H 验证单数据集复训做 TKSA 消融复现¥40-80建议路线先 L0 验证环境与权重再按需上 L2——与 VDMamba 的先推理后训练套路一致。8.2 对zj MG-TSKD 的三个接口教师候选DRSformer 是独立赛道冠军且官方有权重比 MPRNet 教师更强论文 Limitations 原文写着will apply the pruning or distillation scheme——作者自己点名要做蒸馏你们等于替他把这条路走掉TKSA 直接可摘top-k 算子是即插即用的注意力替换件加到学生网络不增算子类型k 区间 [1/2, 4/5] 可直接沿用MSFN 当缝合素材对 GDFN 0.21 dB、零新算子是学生网络前馈层的低成本升级件。8.3 对 E0-E3 增量计划E0 跨域矩阵若把 DRSformer 权重拉进来三权重之外加一个可直接复现 TPAMI 综述 Table VI 的合成冠军 vs 真实泛化分歧在你自己机器上的表现——DRSformer 正是那张表里的关键样本。附录 A术语速查术语含义STBSparse Transformer BlockTKSA MSFN 的基础单元TKSATop-k Sparse Attention通道维转置注意力 可学习 top-k 筛选MSFNMixed-Scale Feed-forward Network3×3/5×5 双分支交叉拼接前馈MEFCMixture of Experts Feature Compensator8 异构专家 自注意力门控[Δ₁, Δ₂][1/2, 4/5]top-k 保留比例的可学习区间转置注意力Restormer 技巧在通道维C×C而非空间维做注意力复杂度 O(C²)content-based sparsity按内容相似度动态稀疏vs>附录 B本地材料索引论文 PDFH:\zj\视频去雨综述论文\DRSformer_CVPR2023.pdfarXiv:2303.11950v110 页全文抽取drsformer_extracted.txt本工作区47k 字符官方代码github.com/cschenxiang/DRSformerbasicsr 框架含 pretrained_models / train.sh / test.py姊妹篇笔记单幅图像去雨综述_论文蒸馏笔记.md本工作区DRSformer 在其中 Table V/VI 的榜单位置
RELATED

相关推荐

08.【网络】Linux进程组、会话、作业控制与守护进程核心知识点 - 进程在终端中到底是怎样组织的

08.【网络】Linux进程组、会话、作业控制与守护进程核心知识点 - 进程在终端中到底是怎样组织的

目录1. 进程组1.1 进程组概念1.2 组长进程2. 会话2.1 什么是会话2.2 如何创建会话(setsid函数)2.3 会话ID(SID)3. 控制终端3.1 概念 先说一下什么是控制终端?3.2 会话、进程组及控制终端之间的联系4. 作业 & 作业控制4.1 什么是作业(job)…

📅 2026/10/12 6:38:57
GD32C231+CS43198音频项目踩坑全记录:I2C从机SCL卡死、音量逻辑混淆、HID指令适配全套解决方案

GD32C231+CS43198音频项目踩坑全记录:I2C从机SCL卡死、音量逻辑混淆、HID指令适配全套解决方案

近期自研一款USB音频声卡,主控GD32C231,DAC采用CS43198,配套三大核心功能:USB HID上位机调试、I2C从机接收外部控制面板音量、统一DAC音量管理函数。开发过程踩了大量典型底层坑,包含I2C从机时钟永久拉低卡死、音量与增…

📅 2026/10/12 6:38:56
精灵永恒正版官方客户端下载指引,忆往游戏正规安全渠道指南

精灵永恒正版官方客户端下载指引,忆往游戏正规安全渠道指南

《精灵永恒》由安徽游昕网络科技有限公司联合忆往游戏平台负责运营,是经过正版授权打造的经典魔幻怀旧手游。现阶段游戏依托专属官方主站面向全网正式开放,高度复刻精灵端游原版内容,坚持公平长久的运营模式,还原端游时期经典核心…

📅 2026/10/11 4:45:39
MORE NEWS

更多资讯

📰

第39天打卡复盘:习惯半成品期如何稳住不崩

2026年3月2日,Day39。早上六点半,我在打卡表上划下第39个勾,顺手把昨晚写好的一篇短文归档。窗外天亮得比一个月前早了不少,能明显感觉到春天在靠近。这个时刻其实挺微妙的——既不是刚刚开始那种打鸡血的第7天,也不是…

📰

大模型权重开源上线前自查清单:六项关键检查与实操指南

1. 权重上线前为什么需要一份自查清单模型权重开源这件事,看起来只是把文件打包上传,实际上它更像是一次面向全世界的"交付"。你交出去的不只是几十上百GB的参数文件,还有一整套隐含的契约:别人下载之后能不能顺利加载、…

📰

企业级智能客服系统实战:Spring AI下RAG、工具调用与流式输出架构全复盘

做了十期企业智能客服项目,终于到收官篇了。回头数数,这个系统从最初只能接一条问答,到后来能翻知识库、查订单、记上下文、逐字打字,再到各种异常情况下的兜底策略,每一步拆出来都值得单独聊聊。这十期里我最大的感受…

📰

OpenClaw 提示词全集:把 Prompt Collection 改到 TaoToken 的配置清单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

HarmonyOS 6从零开发简易计数器

HarmonyOS 6 的开发者生态起来之后,我身边不少转鸿蒙开发的朋友都在问同一个问题:该从哪个项目下手最合适?我的建议通常很简单——先做一个简易计数器。别小看这个项目,它几乎覆盖了 ArkTS 状态管理的基础玩法、ArkUI 声明式写法的…

📰

DB2 V11.1下载安装避坑指南:老版本为何仍是运维必选项

简介:DB2 V11.1 是 IBM 推出的企业级关系型数据库管理系统,这份 Linux 版安装压缩包专为需要稳定、安全数据存储环境的中大型企业及系统管理员、DBA 设计,可用于生产或测试环境的快速部署。包内共 405 个文件,包含 174 个 cat 消息…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬