当你搜“这件衬衫,但要粉色的“,AI是怎么听懂你的?

发布时间:2026/9/1 23:00:22
当你搜“这件衬衫,但要粉色的“,AI是怎么听懂你的? 你有没有试过在购物软件里搜过这样一句话找一件像这样的衬衫但换成粉色这句话背后其实藏着三层意思。第一你想保留衬衫这个东西本身,它的版型、剪裁、面料质感都得对得上。第二你想改变颜色,从原来的颜色变成粉色。第三你根本不在乎背景是什么、光线怎么样、模特是谁,这些都是无关信息系统应该自动忽略。一句简单的话压缩了保留、修改、忽略三种完全不同的指令。人类说这句话毫不费力但让AI准确理解并执行其实是个大难题。腾讯元宝团队联合香港科技大学广州的研究者们最近发布的一篇论文正是盯着这个问题下的功夫。他们提出的方法叫EviRank试图从根本上重新定义AI应该如何理解这类复合查询。现在的AI搜索,要么装糊涂要么瞎联想先说说现在的图像检索系统是怎么处理这类查询的。大体上分两条路子。第一条路子叫做表征型方法。**embedding嵌入向量**把一段文字或一张图片压缩成一串数字组成的向量向量之间的距离代表语义上的相似程度。从最早的DeVise模型到现在很多基于大语言模型的检索系统,它们的核心思路都是一样的把你的查询和候选图片都变成一个向量然后比一比这两个向量离得有多近。这套方法的问题在于它把保留衬衫版型改变颜色为粉色忽略背景这三件事全都压扁进了同一个向量里。你没法追问这个向量到底是根据什么判断这张图和我的查询相关的它答不出来因为所有信息已经被搅拌均匀无法拆分。第二条路子叫推理型方法也就是让大模型用**思维链Chain-of-Thought简称CoT**让AI像人一样一步一步写出推理过程而不是直接给答案。的方式一边思考一边判断相关性。这听起来聪明多了AI会写出类似这件衬衫版型相符颜色需要从红色改为粉色这样的文字。但问题也随之而来。论文里指出了三个具体的失败模式。第一种是遗漏。当用户说找这件衬衫换成粉色时AI的思维链往往只顾着讨论颜色变化却悄悄把保留原来的剪裁和图案这条隐含要求给漏掉了。第二种是幻觉。AI会煞有介事地描述一些它其实根本没有验证过的视觉细节凭空捏造出并不存在的特征。第三种是覆盖不一致。同样的问题AI这次分析了颜色和版型下次可能只分析了颜色漏了版型,每次思考的深度和角度都不固定没法保证系统性。这三个问题说到底是同一个根源:自由式的思维链是没有骨架的。它想到哪写到哪没有一个强制性的清单逼着它把所有该检查的维度都检查一遍。这就好比让一个新员工去做质量检验你只告诉他仔细检查一下这个产品而不给他一张具体的检查清单。他可能这次检查了外观和尺寸却忘了检查功能下次换个人来检查标准又完全不一样。如果不给清单检验结果永远是碰运气你没法保证任何一次检验的完整性和一致性。而如果有了固定清单,不管换谁来检查流程和覆盖范围都是一致的即使检查员的经验和状态不同结果的可比性和可追溯性也大大提高了。论文作者们由此得出一个判断多模态图像重排序本质上不是一个相似度匹配问题而是一个语义约束满足问题。这句话听起来有点抽象翻译成人话就是判断一张图片跟不跟你的查询匹配不该问这两个东西像不像而该问这张图片满足了我提出的哪些具体条件又违反了哪些。把查询拆解成一张证据清单基于这个判断研究者们设计了EviRank的核心机制把每一条查询都解析成一个结构化的证据包。这个证据包里包含六个语义槽位实体、属性、动作、关系、场景、关键细节。每个槽位下面又分成三类陈述:必须满足的required、绝对不能出现的forbidden、可以忽略不计的ignorable。这三个标签其实对应着语言学里三种经典的语义关系:蕴含、矛盾、无关。举个例子会更直观。还是那个这件衬衫换成粉色的查询经过EviRank处理后会被拆解成这样的结构在实体槽位里必须满足这是一件衬衫、颜色是粉色、还要保留原来那种俏皮的版型绝对不能是深红色或者版型差异太大压根不像同一件衣服至于背景、光线、拍摄姿势、图片排版统统可以忽略不影响判断。这里有个设计细节特别值得说一说。所有forbidden禁止的陈述都必须用肯定句的形式来写而不是否定句。比如不能写颜色不应该是深红色而要写颜色是深红色。这样写的原因是什么?因为只有肯定句式的陈述,才能用同一套匹配算子去跟候选图片做比对得到一致方向的分数。如果一半陈述是肯定句、一半是否定句匹配得分的正负号就会乱套整个打分系统就崩了。这是个很工程化的细节但恰恰是这类细节决定了系统能不能稳定运转。**MLLM多模态大语言模型**能同时理解图片和文字的大型AI模型比如Gemini这类既能看图又能读懂文字指令的系统。这套六槽位的证据框架有一个很关键的性质它不管你的查询是纯文字、纯图片、还是图文混合最后都会被转换成同一套结构。纯文字查询转化时必要条件反映用户明确说出来的内容可忽略条件负责吸收那些没说清楚的模糊地带。纯图片查询先生成一段描述性文字再把图片里显著的内容转成必要条件。图文混合查询比如这件衣服换成蓝色,则要把参考图片里该保留的部分版型、图案当作必要条件把修改文字里提到的变化颜色也变成必要条件同时把原来的颜色标记为禁止项。这就好比不管你说中文、英文还是打手语翻译系统内部都统一先转换成一种标准的中间语言再进行处理和输出。转换这一步很关键,如果没有这个统一转换每种查询形式都要单独设计一套处理逻辑系统会变得又臃肿又难维护而且不同形式之间的处理效果很难保持一致。论文还提到这六个语义槽位彼此之间的重合度非常低,研究者用句子嵌入模型算了一下一万条查询里这六个槽位两两之间的平均相似度只有0.18说明它们各自捕捉的是完全不同的语义维度不是同一件事说了六遍。有了证据清单之后,怎么给候选图片打分光有证据清单还不够接下来要解决的是怎么用这份清单去判断每一张候选图片到底符不符合要求。EviRank在这一步用了两套机制配合一套叫确定性规则打分一套叫基于证据的列表式比较。先说规则打分。对每个语义槽位系统会计算两个数值:一个是匹配率衡量候选图片满足了多少条必要陈述;一个是违反率衡量候选图片踩中了多少条禁止陈述。最终的分数把这两个数值加权汇总违反禁止条件会被扣分扣分力度由一个叫β的参数控制论文里设为0.75。这套打分逻辑其实很朴素,满足的加分违反的扣分,是不是有点像学校里的评分细则?老师批改作文会有一份评分标准用了比喻手法加两分,出现病句扣一分,字数不够扣一分。这种做法的好处是透明、可解释、每一分都能说出理由。如果没有这套明确规则全凭老师整体感觉打分两个老师看同一篇作文可能给出天差地别的分数,这就是隐式打分的风险所在,不透明、不稳定、无法复现。但规则打分也有它的局限。它是一条一条独立评估候选图片的没法把多张图片放在一起做横向对比遇到几张图片都差不多符合要求、只是细节上有微妙差别的情况规则打分就有点力不从心了。这时候第二套机制登场了,基于证据的列表式比较。具体做法是把查询、必要条件、禁止条件连同所有候选图片一起交给大模型让它给出一个排序。这个排序过程里符合必要条件的候选图片会被明显地往前排明显违反禁止条件的候选图片会被狠狠往后压。有意思的是可以忽略这类条件根本不会展示给这个列表式排序环节,它们只在前面的规则打分阶段起作用,起到过滤噪音的功能。这样设计的好处是让大模型不用去费心思考那些无关紧要的细节聚焦精力处理真正有区分度的信息同时也让提示词更简短、调用成本更低。为了控制成本EviRank采用了一个很实际的策略,先用规则打分把候选图片按分数排好序然后只让大模型去核实排名靠前的少数几张默认前5张并对它们做局部微调重排。这个设计背后的考量是:规则打分虽然速度快、成本低但精细度有限大模型虽然精细但每调用一次都要花钱花时间。用规则打分先做粗筛把最有希望的候选圈出来再让大模型精雕细琢等于是花小钱办大事。如果候选池特别大超过8个系统还会用一种分治合并的策略把候选图片分成小组每组内部先各自排好序然后像归并排序那样两两合并成更大的有序列表直到所有候选都排完。这个策略让总的调用次数和候选数量呈线性关系而排序所需要的轮次则是对数级增长,也就是候选图片数量翻倍排序所需的步骤只增加一点点而不是成倍暴涨。这份证据清单还能拿来教小模型这篇论文还有一个巧妙的设计,证据清单不仅能用来做重排序还能拿来当作训练数据,去培养一个更小、更便宜的学生模型。这里要理解一个背景。前面提到的用大模型比如Gemini做证据挖掘和列表排序的方案效果虽好但每次查询都要调用大模型这在实际部署时成本不低、速度也慢。研究者们想了个办法能不能训练一个小模型让它把这套评委的判断逻辑学会之后自己单独干活不再依赖大模型这就是知识蒸馏的思路。**知识蒸馏Knowledge Distillation**让一个体积小、运行快的模型学生去模仿一个体积大、能力强的模型教师的判断结果从而在保留大部分能力的同时大幅降低运行成本。传统的知识蒸馏往往是让学生模型模仿老师模型写出来的一整段自由文字推理逐字逐句地学。但EviRank的做法不一样因为它的教师模型每次判断都会产出高度结构化的信息,包括每个候选图片的槽位满足情况、绝对相关性分数、老师自己对判断的信心程度、还有一份最容易混淆的候选图片对清单。这些信息都有固定的格式和明确的语义角色学生模型可以针对性地去学每一部分而不是笼统地模仿一大段话。具体来说训练学生模型用了三个损失函数,可以理解成三种不同的考核标准。第一种叫分数蒸馏让学生给出的排序分布尽量贴近老师的排序分布。第二种叫难例对监督专门针对那些老师觉得很难分辨谁更相关的候选图片对,给学生加一个额外的惩罚逼它把这些容易混淆的图片对分出高低。这里有个细节越是分数接近、越难区分的图片对权重越高这样可以把训练的重点放在最考验模型能力的地方,好比考试的时候老师批卷子不会平均用力那些一半对一半错的模糊题目才最能反映学生真实水平值得多花精力核对。第三种是可选的槽位监督让学生模型内部生成一个额外的小判断头去预测每个候选图片在各个语义槽位上是否满足要求。这一步的目的是让学生模型不光记住这张图排第几还要理解为什么排第几也就是把判断背后的原因也内化进去。训练结束后这个额外的判断头就被扔掉了不影响最终部署时的运行速度。三种损失函数最后按照老师模型给出的置信度加权汇总,老师自己都拿不准的判断给学生的影响力也相应减小。值得一提的是学生模型部署上线后输入只有原始查询和候选图片完全不需要老师模型、不需要证据生成器跑起来就是个普通的打分模型成本和速度跟一个轻量级模型没有区别。论文里选用的学生模型是Qwen3-VL-2B-Thinking用两万条查询蒸馏训练而成测试结果显示它能保留老师九成以上的能力。五个跑分场景,数字说话理论讲了不少实际效果到底怎么样论文在五个基准测试集上做了验证涵盖三种检索场景:文字找图、图片找图、图文混合找图。在Flickr30k这个经典的图文检索数据集上用BLIP-2作为底层检索器时最强版本的EviRank配合Gemini-3-pro拿到了95.61%的**R1Top-1召回率即排名第一的结果就是正确答案的比例**比此前最好的方法CoTMR高出6.32个百分点。更值得注意的是就连完全不调用大模型、只靠规则打分的EviRank-mini版本都超过了此前所有对比方法。这意味着光靠那套结构化的证据打分逻辑,不需要额外的大模型推理成本,就已经能打赢过去依赖复杂思维链推理的方案了。在COCO数据集上用CLIP-ViT-L/14做底层检索时最强版本达到69.53%的R1比CoTRR高出将近10个百分点。在图片找图的场景里Stanford Online Products和CUB-200鸟类数据集最强版本分别拿到91.46%和86.89%的R1比之前的LoCoRE方法高出7到8个多百分点。在图文混合检索的FashionIQ数据集上涨幅同样明显Shirt类目上的R10提升幅度最高达到8.27个百分点。这里还有个对比值得单独说一说。研究团队专门找了几个2025到2026年间发布的、专注于优化表征本身的新方法做对比,包括ReMatch、UniME-v2这些。这些方法已经把向量表示这条路走到了很高的水平ReMatch在Flickr30k和COCO上分别拿到85.6%和62.8%的R1是这类方法里最强的。而EviRank最强版本依然把它们甩开了将近10个百分点。这说明差距不是来自更好的底层检索器而是来自证据条件式验证这套全新的判断逻辑本身。拆开来看每个部件到底有没有用光看整体成绩单还不够说服人研究者们做了详细的消融实验,把系统的各个部件一个个拿掉看看性能会掉多少。去掉查询理解这一步也就是不做那个把图片转成文字描述的环节对图片找图任务的影响最大,在SoP数据集上跌了将近6个百分点。这很好理解图片找图的场景里没有文字锚点全靠这一步在图片和语言之间搭桥桥断了自然影响大。去掉六槽位拆解,直接用一段笼统的描述代替各个任务都受影响图文混合检索的Toptee类目下降超过5个百分点。这证明了把语义拆成六个独立槽位确实比笼统描述更系统、更全面不是多此一举的花架子。在三种约束类型必要、禁止、忽略里必要条件对正向匹配的贡献最大,COCO数据集去掉必要条件后掉了将近3个百分点;禁止条件对区分细粒度候选图片最关键,CUB鸟类数据集去掉禁止条件后掉了将近2个百分点;忽略条件负责过滤掉那些不该影响判断的干扰信息,去掉后在图文混合检索里也有大约1个百分点的下滑。研究者还专门对比了规则打分和列表式比较各自单独使用、以及两者结合使用的效果。结果显示两者结合永远是最好的其中图文混合检索的提升幅度最大,在FashionIQ上比单独用列表式比较高出5.6个百分点。这说明这两套机制各有分工,规则打分擅长处理明确写出来的约束条件,列表式比较擅长通过视觉联合对比捕捉那些没有明说但能看出来的细微线索,两者不是重复劳动而是互补配合。这套系统会不会一提问方式变了就翻车一个方法再好如果换个提问方式结果就大不一样那这个方法的可靠性就要打个问号了。研究团队专门做了稳定性测试。他们从三个角度检验了这套结构化证据抽取的稳定性:重复调用同样的输入十次、对提示词做各种改写(换个说法、打乱顺序、加点错别字)、换用不同的教师模型(Gemini、GPT、Claude系列)。结果显示在所有这些扰动下肯德尔相关系数一种衡量排序一致性的指标都保持在0.89以上Top-1的判断一致率保持在91%以上R10的波动标准差控制在1.3以内。有一个发现特别有意思:把强大的Gemini-3-pro换成便宜很多的Gemini-3-flash检索效果确实下降了R10从42.9掉到38.3但抽取出来的证据结构本身却依然稳定一致性指标几乎没变。这说明什么说明模型排序能力强不强和模型抽取出来的证据结构稳不稳是两件不完全相关的事,便宜模型排序排得没那么准但它理解这个查询需要检查哪些维度这件事上判断依然是靠谱的。这背后的原因研究者认为是那套固定的六槽位框架加上必要/禁止/忽略这三种严格类型化的标签把模型输出的可能性空间从无限的自由文字压缩成了一个狭窄的、可以用JSON格式校验的结构。不管换哪个模型来填这张表格表格的格式和检查项都是固定的这就从根本上限制了输出的随意性。研究团队还专门验证了这些提升到底是来自结构化证据本身还是仅仅来自给了更多提示词信息这种表面功夫。他们设计了几组对照实验:只用原始查询、加一段自由式的补充描述、只用生成的图片描述、只用结构化证据、结构化证据加图片描述一起用。结果显示自由式的文字补充带来的提升很有限COCO上只提高了0.5个百分点而结构化证据贡献了绝大部分的提升提高了6.5个百分点。同时不管怎么改写提示词模板效果波动都很小标准差不到0.7。这两组数据放在一起看结论就很清楚了:效果提升靠的是把查询拆解成类型化的证据清单这个核心设计不是靠碰运气写出了一段特别好的提示词。部署起来到底贵不贵、快不快最后聊聊实际落地的成本问题。蒸馏出来的学生模型在Flickr30k上处理一次查询大概需要800毫秒比起单纯用CLIP做粗排检索的382毫秒确实慢了一些但换来的是大约10个百分点的准确率提升,而且CLIP粗排本来就是所有重排序方案都要用到的基础步骤这部分延迟是固定成本不是可以省掉的额外开销。如果是用大模型在线判断EviRank-plus和EviRank-pro两个版本默认配置下每次查询只需要两次大模型调用:一次用来抽取证据把生成描述、查询扩写、证据挖掘这几步打包成一次结构化请求一次用来做列表式排序。这个成本是固定的不会随着候选图片数量的增加而线性暴涨因为候选图片较多时会启动分治合并策略把总调用次数控制在候选组数的线性范围内。写在后面读完这篇论文我最触动的一点是那个forbidden约束必须用肯定句表达的细节。这是个非常容易被忽略的工程决定但它揭示了一个更普遍的道理:结构化系统的稳定性往往不是来自宏大的架构设计而是来自这种看似琐碎的格式一致性。如果forbidden条件写成否定句匹配算子出来的分数正负号就会紊乱整套打分逻辑瞬间失效。这提醒我很多看起来很聪明的系统设计翻到底层其实是靠一堆朴素到近乎笨拙的格式约定撑起来的。另一个让我意外的地方是规则打分和大模型列表排序结合后的效果在图文混合检索任务上提升最明显。这说明composed image retrieval复合图像检索这个任务恰恰是既需要检查明说的条件又需要捕捉没说的细微差异的场景,规则打分和大模型排序分别对应着这两种能力的两端。一个还没被回答的问题是:这套六槽位框架是不是普适的论文里承认这个schema是默认值而非硬性要求但六个槽位真的能覆盖所有类型的视觉查询吗如果换成医学影像检索或者卫星图像分析这套实体、属性、动作、关系、场景、关键细节的分类框架还够用吗QAQ1EviRank是什么AEviRank是腾讯元宝团队联合香港科技大学广州等机构提出的多模态图像重排序方法核心思路是把任何查询文字、图片或图文混合拆解成结构化的证据清单,按必要、禁止、忽略三类标注在六个语义维度上再用这份清单去核实候选图片是否满足要求而不是依赖模糊的相似度打分或自由式思维链推理。Q2EviRank和之前的思维链重排序方法有什么区别A之前的思维链方法让AI用自由文字一步步推理相关性容易漏掉隐含约束、编造没验证过的细节而且每次推理覆盖的维度不固定。EviRank强制把查询拆成固定的六个语义槽位每个槽位下明确列出必须满足、绝对禁止、可以忽略的条件让判断过程变得透明、可核查、覆盖范围一致。Q3EviRank训练出来的小模型好用吗A论文用大模型产出的结构化判断结果包括排序分数、置信度、易混淆候选对等去蒸馏训练了一个轻量级学生模型Qwen3-VL-2B-Thinking测试显示这个小模型能保留教师模型九成以上的能力同时部署时不再需要调用大模型运行成本大幅降低。

相关新闻