过去几年,主流AI发布遵循着更大模型、更强推理及更长上下文的既定剧本。然而,初创公司TypeSafe AI反其道而行之。该公司由前OpenAI指令跟随研究(RLHF)成员Diogo Almeida创立,在隐身模式运作两年后,近期完成4000万美元融资。

TypeSafe推出的首款模型“Jev”与GPT等聊天机器人截然不同:它没有聊天窗口,不撰写邮件,也不进行自我解释。Jev专注于在约0.1秒内以几分之一美分的成本做出快速决策。Almeida认为,聊天并非自动化的合适工具。

软件交互的困境

大型语言模型的核心机制是逐个标记生成文本,这在人机交互中表现优异。但随着AI智能体接管任务,软件间的交互占比日益增加,这种逐字输出的方式显得极不匹配。软件需要的是布尔值、数字或类别,而非段落。

当前开发者集成AI时,常需等待大模型逐字输出答案,再进行解析和验证。由于输出令牌成本远高于输入,每个生成的单词都在增加开支。相比之下,Jev放弃了写作能力以换取速度。例如在处理发票欺诈检测时,传统大模型需耗时8秒以上生成结论,而Jev仅需0.1秒即可输出欺诈风险、安全概率及审核建议三个数值。

Jev的工作机制

Jev接收的不是提示词,而是情境“状态”和预定义问题。状态可包括支持工单、用户历史记录或游戏快照。问题类型分为三类:

  • 选择(Choice):从最多255个选项中选取一项。
  • 评分(Score):对事物进行等级评分。
  • Noul:TypeSafe定义的“是/否”回答。

所有问题在一次并行处理中同时评估,每个答案附带概率。TypeSafe声称其响应时间为70至500毫秒,远快于前沿大模型的3秒至几分钟。定价方面,每百万输入令牌收费0.042美元,因无文本输出,故输出端免费。

工程师Paarangat Rai将Jev称为“AI原生的if语句”。传统代码依赖硬编码阈值(如交易额超1万美元即审查),而使用Jev后,规则可调整为:若可疑行为置信度超过95%,则转交人工。置信度分数取代了固定阈值,成为决定人工介入的关键依据。

速度重塑AI能力

日常应用中的AI多为无形的决策层,如垃圾邮件过滤、欺诈标记和内容审核。这些场景需要数百万次快速判断,而非长篇大论。速度提升也增强了AI智能体的能力。在TypeSafe的演示中,Jev以每秒10次的决策速度游玩《毁灭战士》(Doom),每小时成本约7美元。在第三方快棋比赛中,Jev凭借速度优势,在严重劣势下击败了因思考超时耗尽时间的Anthropic Fable 5.1。尽管OpenAI GPT-6 Astra在18步内将死Jev,但这主要体现了延迟测试中的速度红利。

此外,低廉的成本使得全面验证成为可能。开发人员可在较大模型的输出触发动作前,利用Jev进行快速检查,这种监督机制此前因高昂成本和缓慢速度而难以全面实施。

一致性与责任

在一项经典“电车难题”测试中,Jev对100次询问均给出拉动杠杆的选择,置信度均为99%。这凸显了其核心卖点:一致性。同一问题询问聊天机器人两次可能得到不同答案,而Jev能从给定选项中稳定选择。但这也意味着,设计选项菜单并设定置信度阈值的人,才是真正的决策者。

局限性与争议

Jev在Hacker News上引发热议,质疑声主要集中在以下几点:

“不能幻觉”的狭义性:Jev无法返回给定列表外的答案,但仍可能自信地选错选项。

基准测试独立性不足:TypeSafe跳过公共排行榜,自行进行测试。其工作流测试显示,Jev整体一致率为67.8%,低于GPT-5.6 Sol的74.1%;在客户服务领域接近(76%对78.3%),但在发票处理上落后较多(61.8%对79.1%)。宣传中提到的193.6倍速度和444.6倍成本优势基于这些测试,TypeSafe承认这些数据处于现实收益的高位。

早期实测表现:一项独立测试显示,Jev在不到0.7秒内对作家档案进行777次判断,成本约0.25美分。在发现植入写作缺陷的任务中,Jev检出6/7个,Fable 5.1检出7/7个,但Jev速度快25倍,成本低580倍。这是质量与效率的权衡。

其他限制:当前早期访问版本仅支持文本和结构化数据,不支持图像,且TypeSafe尚未发布架构论文或参数量细节。

杰文斯悖论赌注

Jev之名源自经济学家威廉·斯坦利·杰文斯的观察:更高效的蒸汽机并未减少煤炭使用,反而因成本降低导致消耗量飙升。TypeSafe赌定,AI决策成本每降低一个数量级,解锁的应用场景将远超节省的成本。

Jev的目标并非人类用户,而是软件每天做出的数十亿次琐碎决策。正如2017年Transformer通过并行注意力机制推动聊天机器人发展一样,Jev放弃写作能力以换取速度,可能预示着未来AI架构的转变:一个用于复杂问题的慢速深思模型,周围环绕着用于其他事务的快速廉价决策者。