众力资讯网

机器人 agent 改成写代码,调用少了一半

我一直以为机器人 agent 的 token 主要烧在图片上,每动一步回传三张相机图。读完改主意了,大头在调用次数。

做法挺朴素。把机器人包成一个 Python 对象 robo,模型一次写一段代码:移过去,抓,查一下抓没抓住,不行就重试,整段跑完才交回控制权。图片只在代码里调了 robo.show 才返回。对照组同一套原语、同一个 GPT-6 Astra,只换接口。

700 个仿真任务,成功率从 63.1% 到 71.7%。两边都做成的任务里,平均调用从 17.0 次降到 8.7 次,输入 token 从 788k 降到 276k。有个对照我挺在意:只让基线改成按需回图,LIBERO-PRO 上成功率反而从 83.0% 掉到 68.5%,token 也没省下来。

65% 这个数主要是 LIBERO-PRO 的长 episode 拉上去的,RoboCasa365 atomic 只省 1.5 倍。每个实例只跑了一次,只有代码版做成的 96 个里,作者也承认有些是 VLA 这次成那次不成。而且全在仿真里。

我手上的 agent 也是一步一个 tool call,打算把几个总连着调的工具包成函数,让它自己写循环,看调用次数能掉多少。

论文:https://arxiv.org/pdf/2610.01939
代码:https://github.com/DAGroup-PKU/PyRUA-Lean

#人工智能 #大模型 #论文 #AI