众力资讯网

刚看到一个挺新鲜的模型 Jev,这是一个专门帮程序做选择题的 AI。 比如一个 AI Agent 刚帮你处理完一封退款邮件,程序接下来有四个选择: 退款 拒绝退款 再问用户一个问题 转给人工 GPT、Claude 这种模型,一般会读完邮件,然后生成一段文字告诉你「我认为应该退款,因为……」。 Jev

刚看到一个挺新鲜的模型 Jev,这是一个专门帮程序做选择题的 AI。
比如一个 AI Agent 刚帮你处理完一封退款邮件,程序接下来有四个选择:
退款
拒绝退款
再问用户一个问题
转给人工
GPT、Claude 这种模型,一般会读完邮件,然后生成一段文字告诉你「我认为应该退款,因为……」。
Jev 不写这段话。
你直接把这四个选项丢给它,它返回:
退款 82%
拒绝 3%
继续询问 10%
转人工 5%
程序看到结果,直接执行下一步。
所以可以把 Jev 理解成一个给软件和 Agent 用的超级分类器 / 判断器。它不擅长陪你聊天,也不是拿来写文章、写代码的。它专门处理那种答案范围已经确定,只需要 AI 快速判断「选哪个」的问题。
这类问题其实在 Agent 里特别多。
任务做完没有?
这个结果合不合格?
下一步调用哪个工具?
需不需要重试?
有没有触发风险规则?
该不该交给人工?
现在很多 Agent 都是每遇到一次这种问题,就喊 GPT、Claude 出来跑一遍。哪怕最后只需要一个 YES / NO,大模型还是要走完整套生成流程。
Jev 就专门把这部分拿出来做。
做它的 TypeSafe AI 创始人 Diogo Almeida 以前在 OpenAI,参与过 InstructGPT 和 RLHF,后来这套东西一路变成了 ChatGPT。TypeSafe 做了两年刚出 stealth,同时拿了 4000 万美元 seed。
他们给 Jev 的定位也很明确:大量、重复、结构化的 AI 判断。
所以它追求的东西和 GPT-6、Claude 完全不同,核心就是快和便宜。
TypeSafe 自己公布的数据是,在适合 Jev 的工作流里,速度可以快 20–200 倍,成本低 40–400 倍,100 万输入 token 只要 0.042 美元。
第三方 Every 也测了一轮。
他们让 Jev 和 Fable 5.1 检查文章问题。Jev 单篇中位耗时 0.35 秒,Fable 是 8.83 秒,差不多快 25 倍。另一个测试里,Jev 在 0.7 秒内给 37 篇文章分别做了 21 项判断,一共 777 个判断,成本只有大概四分之一美分。
准确率会有交换。一次测试里,Fable 找出了 7 个问题,Jev 找到了 6 个。
我觉得 Jev 真正值得看的就是这里。
现在大家做 Agent,经常默认每一个需要“智能”的地方都塞一个大语言模型进去。以后可能会拆得越来越细。
真正需要理解复杂问题、规划、写代码的地方,用 GPT、Claude。
中间那些成千上万次「对不对」「选哪个」「要不要继续」的判断,交给 Jev 这种模型。
如果未来 Agent 真开始一天替人跑几百上千个任务,这种模型可能会变得很重要。