众力资讯网

老马会怎么想?

以前提到特斯拉 FSD,大家总以为这是马斯克用百亿算力和海量私有数据筑起的绝对壁垒。
但最近,开发者 JP Schroeder 发布了一项引发轰动的开源研究:用现成的开源大模型积木,竟然低成本重构出了端到端 FSD 原型!
这到底是技术奇迹,还是纯粹的噱头?现实中它到底能不能用?
首先,这套开源方案的来源到底靠不靠谱?
该项目并非空穴来风,而是站在了一众顶尖开源成果的肩膀上:
- 视觉底座:直接复用了 HuggingFace 完全开源的 SigLIP / ViT 视觉时空编码器;
- 架构蓝本:借鉴了 Stanford 等机构的 OpenVLA(视觉-动作大模型)与自动驾驶世界模型理念;
- 数据来源:基于 nuScenes 等公开自动驾驶数据集与 comma.ai 行车轨迹进行行为克隆(Behavioral Cloning)。
多路摄像头输入直接进大模型,底盘转向与速度控制直接输出,确实完整跑通了 V12 风格的端到端。
那它在现实中到底能不能直接用?我们必须客观拆解:
1. 仿真器与低速机器人:完全堪用!
在 CARLA 模拟环境、低速巡航或园区配送车上,它的表现极其惊艳。对于高校课题组和初创团队来说,它省去了上千万的从零研发成本,是个极佳的实验底座。
2. 真实开放道路商业化:目前绝不能平替 FSD!
想要实车上路跑商用,它面临三大致命短板:
- 车载端侧延迟:多模态大模型体量巨大,在低功耗车规级芯片上极难做到稳定的 30FPS 实时推理;
- 极端长尾幻觉:大模型存在不可控的幻觉黑盒,遇到暴雨逆光或异形障碍物容易误判;
- 数据飞轮差距:特斯拉真正的护城河是全球数百万辆车每天上传的极端工况数据,这是开源模型无法逾越的鸿沟。
总结来说:它不能明天替你开车,但它彻底打破了端到端自动驾驶的技术垄断。
算法正在开源平权,未来的胜负手,早已从“谁的模型更神秘”,变成了“谁能在真实物理世界拿到更多长尾数据”。

#自动驾驶
#自动驾驶技术
#FSD