众力资讯网

VLA 训练 loss 很低,为什么任务成功率还是 为什么 VLA 训练时 ac

VLA 训练 loss 很低,为什么任务成功率还是
为什么 VLA 训练时 action loss 已经很低了,但实际 rollout 成功率还是不高?可能是 action 的低频动作拟合的较好,但是高频部分拟合的差。具体现象是 action chunk 沿时间做 DCT ,可以把动作拆成低频和高频。而 loss 往往被低频动作主导。

Hierarchical Policy Learning via Spectral Decomposition【1】 发现低频更多对应整体轨迹和 coarse motion;高频更多对应 timing、alignment 和 contact 前后的 refinement。论文声称通常 30% 的频率系数就能覆盖 90% 的频谱能量。所以用MSE loss 的话,模型只要把低频动作拟合好,整体 loss 就已经很低;但幅度更小的高频误差仍然能直接影响任务成功。

FreqPolicy 【2】说明不同阶段的频率结构不一样,平滑时低频更显著,而复杂动作阶段,高频变化会更重要。

Spectral Analysis of Diffusion Models 【3】从频域分析生成模型。它说明不同 spectral component 在生成过程中不是完全等价的,大幅值和小幅值成分会呈现不同的误差和演化规律。

所以对 action loss 贡献最大的部分,不一定对 task success 最重要,反而对 loss 贡献较小的高频动作非常关键。

【1】Hierarchical Policy Learning via Spectral Decomposition. arXiv:2606.29570, 2026.

【2】FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency. NeurIPS 2025.

【3】 Spectral Analysis of Diffusion Models with Application to Schedule Design. arXiv:2502.00180, 2025.

人工智能 具身智能 扩散模型 论文阅读 生成模型 vla 文献