最近刷到了一篇Forbes的文章,作者叫Lutz Finger,Cornell的驻校数据科学家,之前在Google、LinkedIn、Snap都做过产品,还自己创业退出过两次。
他今年四月在Forbes发了一篇关于AI工作流的文章,同一时期也上了一期叫Build AI的播客,聊了差不多同样的话题。我花了点时间把文章和播客对照着看了一遍,发现他反复在讲同一件事:AI在企业里效果不好,问题根本不在模型,而在于大家只想换个工具,不想动流程。
其实我自己这两年观察到的现象也是这样的。很多团队拿到AI之后的第一反应,就是把现有的操作手册拆成一串提示词,丢给大模型跑一遍,跑通一个Demo就觉得成了。但真正上线之后,问题会从各个角落冒出来。
作者在文章里引用了两组数据。Deloitte今年的调查发现,只有6%的企业能在一年内看到AI投资回报,大部分要等两到四年。PwC那边的数据也差不多,真正把AI实验推到大规模生产的企业只有20%。
也就是说,绝大多数公司花了钱、投了人、搞了试点,然后就卡在那了。
所以,问题到底出在哪?我顺着他的思路,加上自己的理解,大概拆成了下面几层。
1️⃣ 第一层:旧流程里藏着大量隐性知识,AI根本看不见
他举了一个1987年丹佛国际机场的例子,机场上了一套全自动的行李分拣系统,结果立刻出了问题。不是技术故障,是因为设计者直接把人工操作的流程照搬了过来。他们没意识到,人类工人每天都在无意识地补大量的漏洞。比如行李从传送带上掉了,工人随手捡起来扔回去,这个动作根本没写在任何手册里,所有人都觉得天经地义。但机器不知道,行李一掉,整条线就堵死了。
这个例子特别精准。我来做个延伸:你去观察任何一家公司的客服流程,纸面上的SOP可能写着遇到投诉先道歉再转主管。
但实际操作中,老员工会根据客户的语气判断这个人是真生气还是在试探,会根据历史记录决定要不要直接给补偿,甚至会根据当天的工单量决定要不要跳过某些步骤。这些全是隐性知识,从来没有人写下来过。你把SOP丢给AI,AI只能读到纸面上那层,底下那些真正让流程跑得通的东西,它完全碰不到。
2️⃣ 第二层:给AI加上下文,没有听起来那么简单这时候你可能会想,那我把这些隐性知识也写进提示词不就行了?理论上是的。但Lutz Finger在文章里指出了一个很实际的矛盾:上下文越多,幻觉概率越高,处理成本越贵,响应延迟越长。
这一点在播客里他聊得更透,他用邮件agent举了个例子。他说我们都试过把一封邮件丢给大模型让它帮忙回复,出来的结果通常是能用但不像你写的。这个能用但不像你写的,对用户来说其实非常烦。
要解决这个问题,你需要让agent在后台读取你所有的历史邮件,建立一个关于你的沟通风格、对不同人的回复习惯的模型,然后基于这个模型去生成。但你没法把上百万封邮件一股脑塞进上下文窗口,你必须先做提炼、结构化、分层索引。
光是把这一步做好,就已经远远超出了随便用用的范畴。
他在播客里讲了一个自己的经历,他问ChatGPT关于面试辅助工具的问题,ChatGPT不但批评了他,还把这个查询存进了记忆。后面每次对话,模型都记得他曾经想过用AI辅助面试,他不得不手动去清除。
一个人的情况还好办,他接着说,想想如果Morgan Stanley这样的机构,把多年的研究报告全灌进AI系统,那些报告里的判断、偏见、过时结论都变成了模型的记忆基底,谁来决定该记什么该忘什么?目前没有好的方案。
3️⃣ 第三层:规则越多,攻击面越大这是很多人会忽略的一点。上下文多了,规则多了,代码就复杂了,安全漏洞也跟着来了。
他引用了Georgetown CSET的研究,五个主流模型生成的代码样本里,86%存在跨站脚本漏洞。Agent越多、生成越快,暴露面不是缩小了,是成倍扩大了。
播客里他还提到了Chipotle的那个菜单agent被人用提示词注入的方式骗去写Python代码的案例。这种事情之所以会发生,本质上就是因为agent的输入控制没有做到位。而当你让AI自动写输入校验的代码,它大概率会用最老套的关键词匹配方式来做,因为那是训练数据里最常见的做法。能看出这个方案不够用,能判断什么场景需要什么级别的防护,这就是他说的AI替代不了的那部分能力。
4️⃣ 第四层:工具链还没准备好他的判断是目前的工具生态类似于早期互联网的阶段,那时候建个网站得手写HTML,一直到Wix这类产品出现才真正平民化,中间花了大约15年。
现在AI工作流的工具面临的情况是:大型云平台的安全和权限体系很完善,但配置一个agent之前可能要先搞定企业身份认证,光这一步就很重。
传统自动化平台的架构偏线性,处理不好步骤之间的状态和失败重试。开发者框架最灵活但门槛也最高,很多团队现在是把LangGraph叠在Temporal上面跑,两套系统拼在一起才能凑出一个完整方案。
而他认为整个链条里最缺的一环,是自动化测试。现在验证一个AI工作流,基本就是手动跑一遍然后肉眼看结果。
没有任何工具能让你定义预期输入输出、批量跑测试集、自动报告失败在哪里。这意味着工作流的质量控制,在当下还完全依赖人的经验和耐心。
把这些层面放在一起看,我觉得贯穿始终的其实就一个判断:AI项目的成败,在你决定怎么设计流程的那一刻就已经定了。
Lutz Finger在播客最后做了一个快问快答,主持人问他给AI创业者的一条建议,他说:不要低估商业价值。
真正决定AI能不能在业务里活下来的,是你有没有从头到尾想清楚每一步的输入输出、权限边界、出错了谁负责、什么时候该喊人。

