7 月 28 日,地瓜机器人的算法团队宣布开源了一个叫 X-Lens 的深度估计模型。参数很小,4000 万,但有些设计不太一样。
第一个不一样:它能同时吃鱼眼和针孔相机的画面,不用为每种相机换模型。扫地机器人上面通常是一圈鱼眼,前脸再补一颗针孔——以前这种混搭只能分两路处理,X-Lens 把它们统一了。
做法是把每个像素翻译成三维空间里的一条光线方向,在「光线空间」里做推理。针孔也好、鱼眼也好、甚至 360° 全景,进来都变成同样格式的光线。这个思路比模型参数本身更值得留意。换相机不用重训网络,只换输入——对机器人厂商来说,省掉的是一整条模型适配流水线。
第二个不一样:它输出的是绝对深度。比如「那面墙离 2.352 米」,不是「A 比 B 近」。这一点对机器人执行操作特别关键。机械臂去抓一个东西,需要知道它精确在哪,不是"大概比桌面远一点"。
第三个不一样:它已经在地瓜自家的旭日 S600 芯片上跑起来了。单目鱼眼 41 FPS,六目混合同步 20+ FPS。机械臂产品 VODP+ 已经用它提供深度特征,适配 VA 模型时效果优于 VGGT。这不是一篇只有 benchmark 的论文。
训练数据也有意思。地瓜自己造了一套 OmniScene 数据集,26.6 万帧,虚拟六目相机架:四颗 180° 鱼眼环绕、前后各一颗针孔。六路严格同步,每帧带像素级精确深度真值。数据集全量开源在 HuggingFace。
X-Lens 在 OmniScene 六目混合测试上,深度误差比最强对手低了 25.4%,参数量只有对手的约三十分之一。
说回它到底意味着什么。机器人深度估计这个方向,长期以来是两套方案:大模型精度高但跑不动端侧,小模型能跑但只认针孔或只认鱼眼、不能混用。X-Lens 在这两根线中间找了一个点——40M 参数、混合相机、绝对深度、端侧实时——四个条件同时满足,而且已经在实际产品里跑了。
当然,OmniScene 是仿真数据。从仿真到真机,中间还有环境光照、反光、透明物体这些真实世界的坑。论文也提了,下一步是人形机器人动态操控和 SLAM 定位。现在还吃不到那些场景,先看它从机械臂走进更多机器人平台的效果。
地瓜机器人具身智能开源








