[CL]《The JEPA Paradox in Language: The Geometry of Linguistic Alternatives》A T D Dinh, K N H Vo [VinUniversity & Mohamed bin Zayed University of Artificial Intelligence] (2026)
在自监督学习领域,JEPA(联合嵌入预测架构)在图像和音频等连续模态上表现卓越,但在处理文本时却始终无法成为主流。过去的方法试图直接将图像领域的确定性潜变量预测迁移至文本,但本质原因是文本具有极高的“条件不确定性”:同一个上下文可以对应多个逻辑自洽的词汇选择,这与图像局部的空间连续性存在根本冲突。
本文的核心洞见是:将文本预测中的失败重新看作一种“质心退化(Centroid Degeneracy)”现象。由于文本目标在潜变量空间中不是单点集中的,平方误差损失函数会强迫模型去预测多个合法候选词的几何平均值(质心),而非任何一个真实的语义点。这种认知跳跃解释了为何 T-JEPA 会陷入表征坍缩:模型为了降低无法消除的预测方差,被迫抹除词汇间的差异,导致表征维度退化并失去下游迁移价值。
这项工作真正留下的遗产是确立了“条件集中度(Conditional Concentration)”作为潜变量预测任务成败的判别标准,并给出了文本 JEPA 失效的完整病理报告(信息饱和→方差悬浮→秩坍缩)。它为后来者打开的新门是明确了文本潜变量模型必须从“点预测”转向“分布预测”或“多假设预测”,但尚未跨过的门槛是如何在不依赖判别式掩码语言模型(MLM)的前提下,构建出既能处理离散歧义又能保持几何结构稳定的纯潜变量目标函数。
arxiv.org/abs/2607.23531 机器学习 人工智能 论文 AI创造营








