iSE 实验室在预训练编码器后门防御方面取得新进展

发布日期:2026-07-10 浏览次数:

近年来,自监督学习( Self-Supervised Learning, SSL )因其无需标注数据即可预训练编码器而日益受到关注,基于预训练编码器构建的下游任务往往能取得接近最优的性能。然而已有研究表明,这类编码器极易受到后门攻击的威胁:攻击者通过数据投毒或模型投毒,在预训练阶段向编码器植入后门,平时潜伏不发,一旦输入中出现特定触发器,基于该编码器的下游分类器便会将其误判为攻击者指定的目标类别。更棘手的是,现有的后门缓解技术大多针对带标签的下游任务模型而设计,一旦迁移到预训练编码器上,由于预训练阶段缺乏标签信息,其有效性便大打折扣。如何在不依赖下游任务、不损害模型性能的前提下,清除预训练编码器中潜藏的后门,已成为保障人工智能模型可信与安全的关键问题。


图 1针对预训练编码器的后门攻击示意图


针对这一难题,南京大学 iSE 实验室韩廷旭博士生提出了一种基于互信息引导的预训练编码器后门缓解方法 MIMIC( Mutual Information guided backdoor MItigation for pre-trained enCoders ),旨在面向任意下游任务、在保持编码器性能的同时确保其安全。MIMIC 将可能带有后门的编码器作为 " 教师网络 " ,通过知识蒸馏从中提炼出一个干净的 " 学生编码器 " 。与已有蒸馏方法不同,MIMIC 让学生网络从随机权重开始训练,从而从源头上避免继承教师网络中的后门;同时引入互信息来度量每一层网络与所提取特征之间的关联,精准定位教师网络中良性知识的所在,再据此将干净特征蒸馏迁移到学生网络中。


图 2 MIMIC框架示意图


具体而言,MIMIC 将 " 解毒 " 过程拆分为两个步骤:第一步是互信息引导的良性知识定位,借助互信息识别带后门编码器中真正承载有用知识的部分;第二步是蒸馏训练,通过精心设计的蒸馏损失,将良性功能迁移到空白的学生网络中,同时抑制后门行为。该蒸馏损失由克隆损失与注意力损失两部分构成,前者负责缓解后门,后者负责维持编码器性能,二者协同实现 " 既去毒、又保能力 " 。值得强调的是,整个过程仅需使用防御者可获取的、不超过 5% 的干净预训练数据即可完成。


在两类自监督后门攻击上的评测表明,MIMIC 全面超越了七种最先进的后门缓解技术。在 BadEncoder 攻击下,MIMIC 在几乎不损失干净准确率的同时,将攻击成功率( ASR )降低了超过 89.53%;以构建在受攻击 CIFAR10 编码器之上的 GTSRB 分类器为例,未防御时其攻击成功率高达 99.09%,MIMIC 将其压低至 1.36%,而已有最优技术仅能降到 5.77%。在攻击形态不同的 BASSL 攻击下,MIMIC 同样取得了最大的攻击成功率降幅,平均将其从 50.68% 降至 9.84%。多个数据集与下游任务上的实验一致表明,MIMIC 始终保持着最低的攻击成功率,展现出稳健而出色的后门清除能力。


图 3不同防御方法的后门清除效果对比


这项工作表明,借助互信息对良性知识的精准定位与蒸馏,可以在不依赖下游任务、不牺牲模型性能的前提下,为预训练编码器提供一道有效的安全防线,契合边端智能、第三方模型复用等现实场景对模型安全与可信的迫切需求。相关研究成果《 Mutual Information Guided Backdoor Mitigation for Pre-trained Encoders 》已被信息安全领域顶级国际期刊 IEEE Transactions on Information Forensics and Security( TIFS,CCF-A 类期刊 )正式录用并发表,iSE实验室博士毕业生、南洋理工大学博士后孙伟松为通讯作者,南京大学为第一单位,配套源代码已开源(https://github.com/wssun/MIMIC)。


韩廷旭同学由房春荣副教授和陈振宇教授共同指导,主要研究方向为可信人工智能与模型安全,多次在 ICSE、TOSEM、TIFS 等软件工程和信息安全顶级学术期刊和会议上以第一作者身份发表长篇论文,将在接下来的工作中致力于推动大模型与智能体在软件工程及产业应用中的可靠落地,实现面向任务、可控可靠的智能软件系统建设。更多研究详情请参阅:https://mp.weixin.qq.com/s/UNHNy8VvOuc--h7MHb0BSg