
AI领域正热议一种新型架构:非自回归、不生成文本,能对结构化模式提供极速概率预测。针对这一趋势,开发者发布了完全开源的横向System 1决策模型家族——Laya。
早在2025年3月,相关研究者便已着手此类架构探索,通过强化学习构建非自回归决策框架,并公开了论文、模型权重及数据集。2026年9月,由OpenAI ChatGPT共同发明人Diogo Almeida创立的TypeSafe AI推出了Jev。尽管Jev提出的非自回归决策概念引发关注,但其采用封闭专有模式,未开源技术细节。相比之下,Laya旨在修复旧有架构局限,提供完全开放的替代方案。
核心洞察:用System 1思维重塑决策
现代AI流水线常误用生成式大语言模型(LLM)处理简单反射性决策,如工单路由、垃圾邮件识别或提示词安全检测。调用8B至70B参数的生成式LLM不仅耗时(500-2000毫秒)、成本高,且易产生幻觉,其输出的置信度往往缺乏数学校准依据。
Laya模拟人类大脑的System 1机制,在商用硬件上仅需32.8毫秒即可做出即时决策,并提供诚实、校准的概率。它通过单次前向传播评估状态,依赖三种原语:
- choice(选择):从标准字典中选择选项,返回概率分布及校准置信度。
- score(评分):将状态映射至序数量表,返回期望级别及排名分布。
- noul:针对布尔值问题,输出0.0至1.0之间校准的概率。
由于输出空间仅限概率和数字,模型从根本上杜绝了文本生成幻觉及格式错误。
多检查点与智能路由架构
为解决单一模型在多语言和任务上的局限,Laya发布了三个专用检查点,并整合至Hugging Face单一仓库中:
| 检查点 | 主干编码器 | 参数量 | 主要优势 |
|---|---|---|---|
| laya | ModernBERT-large | 421M | 英语文本分类、护栏、邮件分拣 |
| laya-multilingual | mmBERT-base | 322M | 支持100+种语言,速度快2.2倍 |
| laya-typed-decisions | ModernBERT-large | 421M | 智能体可观测性、客户服务、安全警报 |
借助Hugging Face的allow_patterns功能,Laya SDK支持选择性下载特定子文件夹,避免下载全部2.5GB权重。
研究显示,英语模型在处理非拉丁脚本(如高棉语、印地语)时,即便准确率极低,置信度仍可能虚高。为此,Laya内置亚毫秒级纯Python路由器,通过Unicode脚本检测和停用词分析,自动匹配最佳模型。路由开销仅为0.09至0.73毫秒,占总延迟不到2%,且支持预加载以消除冷启动惩罚。
Laya vs TypeSafe Jev:性能全面领先
基准测试显示,Laya在多项指标上优于TypeSafe Jev 1.13.0:
| 指标 | TypeSafe Jev | Laya (已路由) | 优势 |
|---|---|---|---|
| typed-decisions准确率 | 0.727 | 0.766 | 提升3.9% |
| 校准误差 (ECE) | 0.246 | 0.081 | 校准效果好3倍 |
| P50延迟 (单问) | 236–276 ms | 32.8 ms | 速度快7.8倍 |
| P50延迟 (10问批处理) | ~1,500 ms | 72.3 ms | 速度快20倍 |
| 成本 | $0.042/百万token | $0.00 (自托管) | 100%免费 |
| 开源状态 | 封闭专有 | Apache 2.0开源 | 支持本地部署 |
在真实工作流中,Laya在电子邮件垃圾过滤(准确率0.993)、网络钓鱼检测(准确率0.980)及LLM护栏(准确率0.755–0.762)等场景均表现出生产就绪的质量。
局限性与适用边界
Laya并非全能,存在以下限制:
- 选项数量限制:当分类选项超过20个时,性能显著下降。在Banking77(77个标签)测试中,Laya得分为0.425,低于Jev的0.870。建议将选择模式保持在20个选项以内,或采用层级结构。
- 需微调适配:基础模型在特定基准测试中得分接近随机水平,0.766的高分源于对训练集的微调。用户需针对自身领域数据进行专业化微调。
- 温度校准:需针对特定领域分布拟合标量温度,以将校准误差从0.466降至0.081。
快速入门
Laya已通过PyPI发布,支持pip安装。开发者可通过内置Router实现自动语言路由和多问题并行评估,单次前向传播即可同时获取队列分配、紧急程度评分及流失风险概率。
从2025年初的探索到如今的成熟发布,Laya证明了一个核心观点:并非所有AI问题都需要自回归聊天机器人。对于大规模分类、路由和安全检测, sub-35毫秒的双向决策模型提供了更快、更诚实且完全开源的解决方案。