7月16日,小米正式发布了具身基座模型Xiaomi-Robotics-1。简单来说,这是给机器人装了一个“通用大脑”,能让它听懂人话、自己干活。
这个“大脑”的特别之处在于:它用10万小时的真实世界操作数据训练出来的。不同于网上随便扒的数据,这些数据是通过UMI设备采集的真实抓取、放置、操作轨迹,覆盖家庭、办公室、工厂等各种场景。团队还搞了一套自动化标注流程,两周就把10万小时的数据全标完了。
训练上走的是“预训练+后训练”两阶段路线:先学通用的动作生成能力,再用约1万小时的跨本体数据做“对齐”,让模型能直接听懂自然语言指令,在不同类型的机器人上都能“开箱即用”。
效果怎么样?在RoboCasa365、RoboDojo、VLABench等多个全球权威评测基准上都登顶第一,在RoboDojo上直接“断档式”领跑,大幅刷新了行业纪录。
更重要的是,小米这次验证了机器人领域也存在Scaling Law:数据越多、模型越大,能力就越强。随着UMI数据从2500小时扩展到20000小时,模型参数从2B提升到10B,动作预测精度持续提升。
回顾一下小米最近三天:7月14日亮出人形机器人工厂“实习成绩”(装配成功率98%),7月15日发布具身生成模型U0,7月16日推出基座模型Xiaomi-Robotics-1。三天三步,硬件本体、数据生成、模型大脑全齐了。具身智能走进现实,或许比我们想的要快。