VLA 训练 loss 很低,为什么任务成功率还是
为什么 VLA 训练时 action loss 已经很低了,但实际 rollout 成功率还是不高?可能是 action 的低频动作拟合的较好,但是高频部分拟合的差。具体现象是 action chunk 沿时间做 DCT ,可以把动作拆成低频和高频。而 loss 往往被低频动作主导。
Hierarchical Policy Learning via Spectral Decomposition【1】 发现低频更多对应整体轨迹和 coarse motion;高频更多对应 timing、alignment 和 contact 前后的 refinement。论文声称通常 30% 的频率系数就能覆盖 90% 的频谱能量。所以用MSE loss 的话,模型只要把低频动作拟合好,整体 loss 就已经很低;但幅度更小的高频误差仍然能直接影响任务成功。
FreqPolicy 【2】说明不同阶段的频率结构不一样,平滑时低频更显著,而复杂动作阶段,高频变化会更重要。
Spectral Analysis of Diffusion Models 【3】从频域分析生成模型。它说明不同 spectral component 在生成过程中不是完全等价的,大幅值和小幅值成分会呈现不同的误差和演化规律。
所以对 action loss 贡献最大的部分,不一定对 task success 最重要,反而对 loss 贡献较小的高频动作非常关键。
【1】Hierarchical Policy Learning via Spectral Decomposition. arXiv:2606.29570, 2026.
【2】FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency. NeurIPS 2025.
【3】 Spectral Analysis of Diffusion Models with Application to Schedule Design. arXiv:2502.00180, 2025.
人工智能 具身智能 扩散模型 论文阅读 生成模型 vla 文献
