[CV]《Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models》S Alshehri, Z Yang, H Zhang, M Savvides [CMU] (2026)
在视觉语言模型(VLM)领域,逻辑约束推理(如否定、析取)是一个悬而未决的难题。过去的方法受困于“概念袋”效应,本质原因是双编码器架构的标量相似度接口仅能执行简单的证据累加(类似均值池化),导致模型在处理“有伞但无人”等查询时,无法在排序层级真正执行逻辑操作。
本文的核心洞见是:把逻辑推理从特征对齐中剥离,重新看作一种“分解推理”过程。由此,LCSE(逻辑约束分数编辑)这一关键操作使问题得以解开:它利用冻结编码器提取原子概念得分,在外部执行布尔逻辑运算,并以加性修正项的形式作用于原始相似度,从而在不重训模型的前提下强制执行真值语义。
这项工作真正留下的遗产是证明了双编码器模型的瓶颈在于“接口聚合机制”而非“表征能力”。它为后来者打开的新门是无需微调即可赋予模型精确的结构化查询能力,在保持检索性能的同时大幅提升逻辑准确率(如 NegBench 准确率从 27% 升至 65%),但尚未跨过的门槛是该方法仍高度依赖文本解析的质量,且对于计数、关系等更复杂的组合语义尚待验证。
arxiv.org/abs/2607.23052 机器学习 人工智能 论文 AI创造营








