知名AI模型评测平台Arena宣布完成2亿美元B轮融资,投后估值达31亿美元。本轮由Lightspeed Venture Partners和Khosla Ventures领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z及Felicis等机构跟投。

今年1月,Arena刚完成1.5亿美元A轮融资,当时估值为17亿美元。这意味着在约10个月内,其估值几乎翻倍。此前该公司于6月透露,其年化收入已达1亿美元,而A轮融资时这一数字为3000万美元。

从学术项目到商业闭环

Arena起源于2023年加州大学伯克利分校的一项研究项目,通过众包方式对AI模型进行排名。目前,该平台拥有数千万月活跃用户,用户可通过输入提示词或生成特定风格内容,对不同模型的表现进行打分。

去年9月,Arena推出面向企业和商业实验室的商业产品“AI Evaluations”。该服务基于社区反馈,提供详细的模型性能分析。这一举措切中了当前行业痛点:随着AI模型出现“刷榜”现象——即在不真正提升能力的情况下优化标准化基准测试得分,企业和开发者亟需更真实的评估维度。

“AI的发展速度已超过评估能力,静态基准测试一旦被发现规律便会失效。”Arena在公告中表示,“世界需要一个中立的第三方,来衡量AI在实际部署中的安全性和对齐程度。”

新增“对齐性”排行

为此,Arena在排行榜中新增了“对齐性”(alignment)类别,重点评估模型是否存在未经授权行动、错误归因以及“欺骗性完成”(谎称完成未执行任务)等问题。

在初步的对齐性排行榜中,OpenAI的多款模型位居前列;Anthropic的Claude Opus 5.5和Claude Fable分别排名第六和第九。