AI领域正热议一种新型架构:非自回归、不生成文本,能对结构化模式提供极速概率预测。针对这一趋势,开发者发布了完全开源的横向System 1决策模型家族——Laya

早在2025年3月,相关研究者便已着手此类架构探索,通过强化学习构建非自回归决策框架,并公开了论文、模型权重及数据集。2026年9月,由OpenAI ChatGPT共同发明人Diogo Almeida创立的TypeSafe AI推出了Jev。尽管Jev提出的非自回归决策概念引发关注,但其采用封闭专有模式,未开源技术细节。相比之下,Laya旨在修复旧有架构局限,提供完全开放的替代方案。

核心洞察:用System 1思维重塑决策

现代AI流水线常误用生成式大语言模型(LLM)处理简单反射性决策,如工单路由、垃圾邮件识别或提示词安全检测。调用8B至70B参数的生成式LLM不仅耗时(500-2000毫秒)、成本高,且易产生幻觉,其输出的置信度往往缺乏数学校准依据。

Laya模拟人类大脑的System 1机制,在商用硬件上仅需32.8毫秒即可做出即时决策,并提供诚实、校准的概率。它通过单次前向传播评估状态,依赖三种原语:

  • choice(选择):从标准字典中选择选项,返回概率分布及校准置信度。
  • score(评分):将状态映射至序数量表,返回期望级别及排名分布。
  • noul:针对布尔值问题,输出0.0至1.0之间校准的概率。

由于输出空间仅限概率和数字,模型从根本上杜绝了文本生成幻觉及格式错误。

多检查点与智能路由架构

为解决单一模型在多语言和任务上的局限,Laya发布了三个专用检查点,并整合至Hugging Face单一仓库中:

检查点主干编码器参数量主要优势
layaModernBERT-large421M英语文本分类、护栏、邮件分拣
laya-multilingualmmBERT-base322M支持100+种语言,速度快2.2倍
laya-typed-decisionsModernBERT-large421M智能体可观测性、客户服务、安全警报

借助Hugging Face的allow_patterns功能,Laya SDK支持选择性下载特定子文件夹,避免下载全部2.5GB权重。

研究显示,英语模型在处理非拉丁脚本(如高棉语、印地语)时,即便准确率极低,置信度仍可能虚高。为此,Laya内置亚毫秒级纯Python路由器,通过Unicode脚本检测和停用词分析,自动匹配最佳模型。路由开销仅为0.09至0.73毫秒,占总延迟不到2%,且支持预加载以消除冷启动惩罚。

Laya vs TypeSafe Jev:性能全面领先

基准测试显示,Laya在多项指标上优于TypeSafe Jev 1.13.0:

指标TypeSafe JevLaya (已路由)优势
typed-decisions准确率0.7270.766提升3.9%
校准误差 (ECE)0.2460.081校准效果好3倍
P50延迟 (单问)236–276 ms32.8 ms速度快7.8倍
P50延迟 (10问批处理)~1,500 ms72.3 ms速度快20倍
成本$0.042/百万token$0.00 (自托管)100%免费
开源状态封闭专有Apache 2.0开源支持本地部署

在真实工作流中,Laya在电子邮件垃圾过滤(准确率0.993)、网络钓鱼检测(准确率0.980)及LLM护栏(准确率0.755–0.762)等场景均表现出生产就绪的质量。

局限性与适用边界

Laya并非全能,存在以下限制:

  1. 选项数量限制:当分类选项超过20个时,性能显著下降。在Banking77(77个标签)测试中,Laya得分为0.425,低于Jev的0.870。建议将选择模式保持在20个选项以内,或采用层级结构。
  2. 需微调适配:基础模型在特定基准测试中得分接近随机水平,0.766的高分源于对训练集的微调。用户需针对自身领域数据进行专业化微调。
  3. 温度校准:需针对特定领域分布拟合标量温度,以将校准误差从0.466降至0.081。

快速入门

Laya已通过PyPI发布,支持pip安装。开发者可通过内置Router实现自动语言路由和多问题并行评估,单次前向传播即可同时获取队列分配、紧急程度评分及流失风险概率。

从2025年初的探索到如今的成熟发布,Laya证明了一个核心观点:并非所有AI问题都需要自回归聊天机器人。对于大规模分类、路由和安全检测, sub-35毫秒的双向决策模型提供了更快、更诚实且完全开源的解决方案。