昨天没忍住又把之前AI玩植物大战僵尸的项目捡起来,只不过这次目标是纯视觉方案,而不是像之前那样通过读内存的方式直接把游戏转成文本。当然也有测GLM-5.3-Flash的性能和成本的因素在里面。
测试是拿本地部署的Qwen3.8-27B-NVFP4-LOW测的,单张图像的Token预算一路从最低推荐的1024涨到4096,还试了据说是打框精度更高的Qwen3-VL-8B指令。结果P1测中国象棋就出问题了,AI识别象棋的棋子确实是准确的,但是可能会点到同样的棋子上,包括但不限于自家同样的棋子和对家同样的棋子。其次是就算艰难选中棋子了,落子也落不对。猜测是棋盘上落子的区域长得都差不多模型没认出来。
其实之前做AI玩植物大战僵尸的时候就有试过纯视觉方案,那会也是点不准。但我当时模型的视觉预算给的太低了只有576,万一这次拉高之后会好点呢。又或者是PC这边的操作模型没怎么训练过,玩安卓模拟器上的游戏就会好点呢。还不知道,都得一个个去试。
说真的看着本地只有30t/s跑着的模型、又臭又长的思维链、慢的要死的响应,心态真的有点爆炸。也许是技术路线有问题,得再翻翻有名的开源项目。
#ai #大模型 #我在小红书做游戏 #vlm #视觉多模态 #agent #智能体
