学习日记41:UniRefiner

发布时间:2026/7/22 14:04:03
学习日记41:UniRefiner 摘要基于ViTs 的表示学习发展迅速然而大规模模型在空间敏感任务中的效用受到伪影的阻碍。以前减轻这种影响的努力是有限的通常将这些伪影狭义地定义为高范数异常值。 作者任务这一定义是不充分的对于稠密预测任务任何不能编码位置对齐语义的令牌都应该被视为伪影之后作者系统地分类和刻画了破坏空间表征的三种基本类型的伪影并提出UniRefiner--一个通用的精化框架教导预训练的ViTs对这些伪影进行自处理。介绍尽管大量的ViTs模型被广泛使用但是大多数需要密集空间理解的任务如分割仍需要专门的只有视觉的骨干网络。原因就是许多视觉语言的大规模ViTs的特征图在空间上是不一致的被伪影 - -与其对应的空间位置不对齐的特征嵌入所污染。这些伪影严重降低了密集预测任务所需的表示质量之前的研究也仅仅将伪影视为简单的高范数异常值。文章将伪影分为3类 固定模式( Fp )token在完全不相关的图片中该 token 的特征几乎保持不变全局代理( Gp) token不编码对应像素位置的局部细节而是存储整张图片的全局场景信息注意劫持( Ah )token在自注意力计算中会被信息更丰富的相邻 token 覆盖、主导自身语义。基于这个诊断文章提出了UniRefiner利用寄存器token将其添加到令牌序列中并丢弃后向传播。但在大的ViT中杂散信号的体量很大这意味着无约束寄存器很容易被淹没。于是要设计一个对比寄存器。而不是被动地希望寄存器吸收这些伪影明确地教导模型保留什么和丢弃什么。方法首先是筛选出三类异常tokenFp的筛选是选取一张无关图像与原图像通过vit之后原图像的某些token与无关图像的token相似度很高大于阈值即判定为Fp。Gp要做的就是首先将原图像与一张无关图像进行一个拼接然后输入vit中得到token,同时无关图像也经过相同处理。如果原图像上的token与拼接上的无关图像相似度高但与未拼接的无关图像相似度低就判定为Gp。Ah的判定就是使用多个注意力层的各个token的注意力矩阵A计算token的注意力流出平均值小于某个阈值即判定为Ah。蒸馏学习之后要进行蒸馏学习首先阐明表征不变性原理同一个物体 / 图像局部区域不管怎么裁剪、缩放、平移它的真实干净语义特征不应该发生大变化。所以目标为这个前面的是学生模型目标模型后面的是教师模型源模型公式的含义是目标模型对于一个token的结果应该尽可能与原模型处理这个token的各种变换后得到的期望一致。首先拿出原图与参考图拼接起来为给教师模型提取所有patch特征。 筛选掉所有坏token拿出好的在上边进行多种变换取平均值这个平均值视为这个token的标准答案然后训练学生模型让学生模型在原图上的对于token往这个标准答案上靠。Contrastive Register图像正常 token → 对齐保留真实语义所有噪声 token → 全部挤到寄存器区域吸收不改网络结构只是在输入图片四周填充高斯噪声补丁作为寄存器。 输入带噪声边框的图片进学生模型得到两类特征设计三种损失函数总体流程训练几轮后噪声全部迁移到寄存器寄存器变成噪声特征库 后续每一轮过滤除了原有 3 类检测规则额外增加一步 —— 和寄存器特征比对相似则判定为噪声 更多坏块被筛除蒸馏只用更纯粹的正常 token模型空间表征进一步提升。实验纯视觉视觉-语言生成模型消融