众力资讯网

[CV]《Twins: Learn to Predict Unified Rep

[CV]《Twins: Learn to Predict Unified Representations with Focal Loss》K Gong, X Cai, B Lin, H Wang… [The Chinese University of Hong Kong & Tencent, Hunyuan] (2026)

在多模态大模型领域,构建一个兼顾“语义理解”与“图像生成”的统一连续表征空间是一个难题。过去的方法受困于表征失配,本质原因是语义特征(如 ViT)倾向于丢弃像素细节,而生成特征(如 VAE)缺乏语义抽象,导致系统必须在两套独立的潜空间中反复转换。

本文的核心洞见是:把视觉 Token 重新看作语义与几何特征的通道级级联。由此,一种针对流匹配任务设计的局灶回归损失这一关键操作使问题得以解开。它通过动态调高 VAE 维度的权重,强制模型去关注那些高频、高复杂度的细节特征,从而解决了模型因频谱偏差而只学简单语义、忽略精细纹理的优化失衡问题。

这项工作真正留下的遗产是证明了无需增加序列长度即可实现理解与生成的表征统一。它为后来者打开的新门是利用局灶校准技术平衡异构特征空间的优化节奏,但尚未跨过的门槛是目前仍高度依赖预训练的外部编码器,尚未实现端到端的视觉表征自进化。

rxiv.org/abs/2607.22531 机器学习 人工智能 论文 AI创造营