多模态图像融合旨在将来自不同成像模态的互补信息整合为一幅综合图像,以实现更全面的场景感知与分析。红外图像擅长捕捉热辐射信息,能够在低光照条件下揭示被遮挡的目标细节;可见光图像则提供高分辨率的颜色和纹理信息,但在弱光或遮挡环境下获取信息的能力有限。因此,将两种模态的互补优势进行有效融合,对于安防监控、自动驾驶、遥感观测等实际应用具有重要意义。然而,传统深度学习融合方法高度依赖大量标注数据进行训练,难以泛化到新场景和新模态;同时,标准自注意力机制的二次计算复杂度也限制了其在高分辨率图像上的实时应用能力。
近日,信息学院(人工智能学院)许福教授团队在IEEE Transactions on Circuits and Systems for Video Technology(中科院一区Top, IF:11.1)发表了题为“FPZNet: Fuzzy Perception Zero-Shot Learning for Infrared and Visible Image Fusion”的研究论文,受人类模糊感知决策能力的启发,提出了一种基于Transformer架构的零样本多模态图像融合网络,通过稀疏注意力和低秩近似机制,在无需任何预训练数据的条件下实现了高质量的红外与可见光图像融合。
研究团队提出了模糊感知零样本网络(Fuzzy Perception Zero-Shot Network, FPZNet),其核心设计模仿了人类视觉系统在复杂不确定环境中进行近似决策的能力。整体框架包含跨域融合策略、自适应加权机制、交叉角度成对采样以及基于3D Transformer的融合网络四个关键模块,实现了从数据预处理到图像融合的全流程处理。

图 1 FPZNet方法整体框架图
在网络架构设计上,FPZNet采用了由统一信息模块(UII-Block)、双交互编码器(DI-Encoder)和统一交叉交互解码器(UCI-Decoder)组成的3D Transformer结构,能够有效捕捉输入数据的体积依赖关系,确保跨模态特征的鲁棒整合。为提升特征区分性并抑制无关跨模态连接产生的噪声,研究团队引入了稀疏性约束,使网络仅选择性地保留15%–20%最显著的跨模态交互,有效过滤冗余信息。同时,通过低秩近似技术将注意力机制的计算复杂度从二次降低至线性,仅使用128维的投影维度即可捕获超过95%的跨模态信息,在保证融合质量的前提下大幅提升了计算效率。

图 2 FPZNet网络架构图
研究团队在RoadScene、MSRS、LLVIP等多个公开基准数据集上与多种先进融合方法进行了全面对比实验。结果表明,FPZNet在多个数据集上均取得了优异表现:在MSRS数据集上实现了65.904 dB的峰值信噪比和0.026的最低均方误差,分别较现有最优方法提升了2.182 dB和显著降低了信息损失。在LLVIP数据集的夜间监控等具有挑战性的低光照场景中,该方法在保持红外热特征的同时有效维持了自然光照梯度,展现出优越的融合鲁棒性。

图 3夜间监控场景下不同融合方法的效果对比
此外,研究团队还在涵盖工业热成像、烟雾退化、航空视角、自动驾驶等8个基准数据集上进行了广泛的跨域迁移实验,评估了方法的泛化能力。结果显示,FPZNet在56个评测指标中有43个取得最佳性能。在下游任务验证中,基于FPZNet融合图像的YOLOv8目标检测在LLVIP数据集上mAP@0.5达到89.7%,较次优方法提升2.1%;DeepLabV3+语义分割在MFNet数据集上mIoU达到58.9%,较仅使用可见光图像提升10.7%,验证了融合图像对实际视觉任务的显著增益。

图 4 跨域迁移评估框架总览图
上述研究提出了一种模仿人类模糊感知决策的零样本红外与可见光图像融合方法,无需特定数据集的预训练即可实现高质量融合。该方法通过稀疏注意力和低秩近似大幅降低了计算开销,为数据匮乏和资源受限环境下的多模态图像融合提供了一种高效、可泛化的解决方案。
信息学院(人工智能学院)的王升老师、2023级博士生韩柏迅、杨林哲和2024级硕士陈可心为论文共同一作, 通讯作者为许福教授和孙国栋副教授,该研究受到国家重点研发计划项目(2022YFF1302700)、国家林草局揭榜挂帅项目(202303)、中央高校优秀青年团队项目(QNTD202308)的资助。