
CVPR 2026 Fusion in Your Way 信息整理标题Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization | 按你所愿的融合基于直接偏好优化的图像融合异构需求对齐作者Weijian Su, Songqian Zhang, Yuqi Han*, Jian Zhuang, Yongdong Huang, Qiang Zhang*单位大连理工大学 计算机科学与技术学院社会计算与认知智能教育部重点实验室大连理工大学北方民族大学 图像处理与理解研究所代码https://github.com/suweijian1996/DPOFusion下载https://arxiv.org/abs/2605.06049摘要与创新**摘要**红外与可见光图像融合IVIF作为多模态处理的关键技术在整合互补光谱信息以增强视觉感知和支持下游视觉任务中发挥着重要作用。然而现有方法难以灵活适应异构需求——即同时满足来自人类视觉和机器视觉的多样化偏好仍是一个开放性挑战。为此本文提出 DPOFusion一个基于直接偏好优化DPO的融合框架集成了属性对齐潜在扩散模型PALDM 与偏好可控潜在扩散模型PCLDM实现了任务引导、偏好自适应的红外可见光图像融合可同时服务于人类视觉与机器视觉。其中PALDM 利用潜在融合先验和联合条件损失生成具有多种属性的候选融合结果PCLDM 则通过实例级直接偏好优化IDPO 进行微调能够根据异构偏好信号直接调控最终融合结果。实验表明该框架不仅在人类、视觉语言模型和任务驱动网络三类评估者之间实现了精确的偏好对齐还在自适应融合质量和任务迁移性上树立了新基准。创新点1️⃣ 首次将 DPO 引入图像融合领域将直接偏好优化机制从大语言模型/文生图领域迁移到红外可见光图像融合任务实现统一框架下对人类、VLM、下游任务等异构偏好的对齐。 2️⃣ 提出属性对齐潜在扩散模型PALDM通过潜在融合先验 联合条件去噪损失 潜在空间插值策略使模型能够根据文本提示生成红外/可见光信息比例可控的多样化候选融合结果为后续偏好微调提供高质量候选池。 3️⃣ 提出实例级直接偏好优化IDPO区别于全局 DPOIDPO 仅在掩码区域内施加偏好对齐损失在掩码外强制像素级一致性约束实现局部偏好适配与全局视觉一致性的精确平衡。 4️⃣ 构建异构偏好数据采集机制设计了覆盖人类反馈RLHF、视觉语言模型反馈RLVF、目标检测反馈RLDF-OD、语义分割反馈RLDF-Seg四类异构偏好的数据采集流程支持区域级与全局级两种偏好标注模式。一句话总结DPOFusion 首次将直接偏好优化引入红外可见光图像融合通过先生成多样化候选、再按偏好微调的两阶段扩散框架让一个统一模型能够灵活满足人类、视觉语言模型以及检测、分割等下游任务的多样化融合需求——真正实现融合由你定义。Preference heterogeneity in IVIF核心方法DPOFusionDPOFusion 整体采用三阶段架构① PALDM 生成多样化候选 → ② 异构偏好数据采集 → ③ PCLDM 偏好微调最终实现统一框架下的偏好自适应融合。3.1 属性对齐潜在扩散模型PALDMPALDM 的目标是生成一批属性可控、覆盖多样偏好需求的高质量候选融合结果为后续偏好微调提供素材。① 先验潜在融合模型首先训练一个先验融合网络 采用 Restormer 架构。给定红外图像 和可见光图像 通过预训练 VAE 编码器将其投影到潜在空间得到 、,拼接后输入网络得到先验融合潜在 。该模型由强度与梯度联合损失 监督作为后续 PALDM 训练的监督锚点。② 潜在空间插值策略为了让候选结果覆盖全红外 → 全可见光的连续过渡作者设计了潜在插值机制定义 个离散级别采样系数 在源潜在与先验融合潜在之间进行线性插值通过控制 模型可输出不同模态信息比例的融合结果。③ 联合条件去噪损失PALDM 同时学习两类去噪任务(i) 在通用提示 下还原标准潜在 (ii) 在属性提示 如mostly infrared, little visible下还原插值潜在 该损失使 PALDM 既能产出高质量基准融合结果又能根据文本提示灵活调整模态比例生成丰富的候选池。3.2 异构偏好数据采集PCLDM 的训练依赖偏好数据集 其中 为偏好样本、 为拒绝样本、 为偏好区域掩码。数据采集分为两种模式区域级采集Region-specific提供精确的局部掩码 用于细粒度局部对齐。适用于人类主观偏好RLHF和语义分割任务RLDF-Seg。全局级采集Global难以获取精确掩码时通过样本筛选管线选定偏好/拒绝对掩码 覆盖整个图像或目标区块。适用于VLM 反馈RLVF和目标检测任务RLDF-OD。四类反馈来源具体为① 人类标注者借助 SAM 生成掩码② QWEN3-Omni-Think 视觉语言模型评分排序③ SegFormer 基于 mIoU 类别准确率筛选④ YOLOv11 基于 mAP 检测准确率筛选。3.3 偏好可控潜在扩散模型PCLDMPCLDM 在冻结的 PALDM 基础上微调实现对融合结果的偏好驱动调控。① 可控架构设计冻结 PALDM 作为参考分支 接收通用提示 复制一份作为可训练分支 接收偏好提示 。两分支通过零初始化 卷积层连接并相加零初始化的关键作用是训练初期不会引入随机噪声扰乱已学好的融合先验从而保证微调的稳定性。② 实例级直接偏好优化IDPO传统 DPO 的偏好监督作用于整张图像容易扰动非偏好区域的视觉一致性。IDPO 的核心思想是将偏好监督限定在掩码区域内掩码外强制保持与参考模型一致。定义掩码内的 DPO 项偏好样本与拒绝样本相对参考模型的预测误差差异定义掩码外的像素级一致性约束 、要求 输出在非偏好区域与 严格对齐。最终 IDPO 损失为偏好区域对齐其他区域一致性约束其中 控制偏好对齐强度RLHF/RLVF/RLDF-Seg 设为 10RLDF-OD 设为 500 平衡两类损失。通过这一设计IDPO 实现了局部偏好适配与全局视觉一致性的精确平衡——这是 DPOFusion 区别于传统 DPO 方法的核心创新。实验结果定性实验定量实验下游任务消融实验数据标注补充材料问题定义与总结 一、问题定义红外与可见光图像融合IVIF旨在整合两种模态的互补信息但不同用户和任务对融合结果的需求是异构的人类关注视觉质量与自然度VLM 关注信号级保真度下游任务检测、分割关注目标可分辨性。现有方法多为单一目标定制难以统一适配多样需求。此外将 DPO 引入无监督融合还面临两大挑战① 缺乏真值监督导致解空间过大② 局部偏好对齐易扰动全局一致性。核心问题如何构建统一框架使融合结果能根据人类、VLM、下游任务等异构偏好进行精确、可控、互不干扰的自适应对齐二、全文总结本文提出 DPOFusion——首个将直接偏好优化引入红外可见光图像融合的统一框架。PALDM 通过潜在融合先验与联合条件损失生成属性可控的多样化候选PCLDM 借助实例级直接偏好优化IDPO 在掩码内对齐偏好、掩码外保持一致性实现局部适配与全局保真的精确平衡。实验表明DPOFusion 在 RLHF / RLVF / RLDF-OD / RLDF-Seg 四类反馈下均实现精确偏好对齐融合质量与下游任务性能全面超越 SOTA真正做到 “融合由你定义”。往期推荐