AI初创公司PrismML正试图证明,高性能的大型推理语言模型(LLM)无需“庞大”体积。这家由加州理工学院研究人员创立的公司,致力于开发可在个人电脑和智能手机上本地运行的轻量级推理模型。

周四,PrismML发布了其模型家族的最新成员Bonsai 2 27B。该模型基于阿里巴巴开源的Qwen3.8 27B构建,通过压缩技术将其体积缩小至5.9 GB,内存占用较原始模型降低9到10倍,足以适配PC甚至高端智能手机。在性能方面,Bonsai 2保留了原始模型98%的综合基准得分,优于初代Bonsai的95%。据悉,初代模型下载量已超1100万次,新版模型额外获得260万次下载。

PrismML的核心技术在于“三进制”权重压缩。传统模型权重通常需16位数据,而PrismML将其简化为+1、-1或0三个值,从而大幅降低存储空间。创始人Babak Hassibi指出,尽管压缩可能带来轻微性能损耗,但在实际应用中,2%的基准差距并不显著,且软件框架对准确性的影响同样关键。

该公司背景深厚,由加州理工教授Hassibi领导,顾问阵容包括Databricks联合创始人及伯克利大学Sky Computing Lab主任Ion Stoica。PrismML已获得Khosla Ventures、Cerberus Capital及加州理工学院支持的2225万美元种子轮融资。知情人士透露,公司正与苹果公司进行洽谈,但Hassibi拒绝对此置评。

展望未来,PrismML计划在数月内发布参数量达数千亿级别的压缩模型。Hassibi认为,随着模型规模扩大,在保持智能水平的同时进行压缩将更为容易,实现100%性能对等的可能性也将增加。Stoica对此表示乐观,他认为该技术能让先进模型在用户设备上免费、私密地运行,真正实现“指尖上的智能”。