众力资讯网

图都改了,latent 推理还在答原来的

图改了,正确答案在八成多的样本里跟着变,LVR 的预测却只变了 5.66% 到 13.09%。杯子换个颜色、球拿走、左右对调,它照旧答原来那个。

LVR(latent visual reasoning)是让多模态模型先生成几个连续向量当草稿,再出答案。这段 latent 看不见,GRPO 也只对文本 token 算梯度,里面存了什么没人管。作者量了原图和改图的 latent 余弦距离,不到 0.0005,跟没看图差不多。

ReaLVR 做了两件事。拿 ROI 区域的视觉特征当正例、别的图当负例,把 latent 往证据上拉;再把正确答案和模型自己答错的答案分别接在同一段 latent 后面,正确答案多看了哪几个位置,那里的监督就加重。梯度穿过 latent 的生成过程,推理流程不动。

改完距离到了 0.13 到 0.34。Qwen2.5-VL-7B 五项平均 63.7,比 ILVR 高 0.8,235B 也训了。

涨点一般吧。诊断那部分我更想抄,手上有隐式推理的模型,我会先改几张图看它答案动不动。

论文:https://arxiv.org/pdf/2609.34563

#人工智能 #论文 #多模态 #大模型 #深度学习