让 AI 自己点网页,一直有两个毛病:慢、还容易点错。
browser-use 团队开源的 jev-ultrafast 换了个思路,不让 AI 看截图,而是先把页面上能点的元素读成一张带编号的表格。
表格里每行写着元素类型、名字和当前值,比如按钮"更改票种"、输入框"出发地"。
AI 只需要从这张表里挑一个操作和对应的编号,操作一共八种:点击、输入文字、下拉选择、上滚、下滚、等待、完成、受阻。
只有真正要写文字时,才叫一个小的语言模型来生成内容,其余决策都不产生文本。
因为操作和目标一次请求就算完,实测在谷歌航班上搜"苏黎世飞伦敦"只花了七点零七秒,这还包含了模型调用、打字和页面加载等待。
官方给了对比数据:同一任务中位耗时从九点四五秒降到九点零九秒,少了约四分之一;浏览器协议调用次数从一千零九十二次降到一百零一次。
安装需要 Python 环境,用 uv sync 装依赖,再配两个密钥,其中一个用 OpenRouter 的小模型负责写文字。
跑起来后本地 8766 端口有个检查面板,能看到每个元素的点击概率和实际执行的动作,方便调试。
目前还有边界:网页内嵌框架、画布、文件上传、弹窗暂不支持,完成状态也仍需外部再验证一次结果。
github jev AI jev
