RoboDojo刚刚发布了GPT-6 Astra的机器人评测报告。
在42项仿真任务、2100次试验中,Astra拿到28.97分,平均成功率为22.48%,超过报告引用的全部40个公开机器人策略。
没有接入经过训练的VLA策略,Astra直接读取头部与腕部相机画面、机器人自身状态和任务指令,判断末端执行器应该往哪里移动。动作执行后,它再观察结果,决定下一步怎么做。
整个过程中没有预设抓取、放置等技能,Astra也拿不到物体的真实位姿。使用相同的控制接口,GPT-5.5平均成功率只有0.88%,Astra达到它的约25.5倍。
但把结果拆开看,Astra的能力并不均衡
最能拉开差距的是开放指令任务,Astra做到了31%,排名第一。到了精密操作,成功率只有4%,落到第19;长程任务也只有8.25%,排名第15。
42项任务中,有10项的成功率达到50%以上,也有16项在本轮测试中没有一次成功。Astra能把语言要求、空间关系和运动目标联系起来,可一到精确接触和连续执行,困难就出现了。
这个问题到了真机上更加突出。
报告称,Astra在测试中多次发出不合理或不安全的动作,部分事件造成设备损坏,最终真机评测被提前叫停。保留的样本覆盖12项任务、33次试验,其中只有1次完全成功,不能与完整的18项真机测试直接比较。
示范也没有补上这块短板。零样本成功率为22.9%,加入图像与末端示范后降至17.9%,文本示范只有12.9%。报告认为,Astra缺的是操作精度和接触技能,示范反而可能干扰其判断。
不过,Astra表现出了一定的调整能力。能够比较预期运动与实际结果,并调整后续动作。虽然这组实验的样本量不大,但至少说明,它可以从交互反馈中调整观察与动作的对应关系。
这份报告的结果与此前多个实验室的观察一致:GPT-6 Astra这类通用模型已经具备较强的语义理解、空间推理和在线调整能力,但遇到精确接触、连续操作和快速闭环,短板依然明显。
#具身智能 #机器人 #chatgpt #gpt6 #机器人仿真 #真机测试 #AI大模型 #机器人控制 #科技前沿

