尽管企业已在AI智能体开发上投入巨资,但实际生产部署仍频频受挫。9月17日发表于arXiv的一篇论文提出了一种全新的解决方案,旨在弥合实验室性能与真实世界表现之间的鸿沟。

研究人员Shaina Raza、Ahmed Y. Radwan、Imran Liaquat和Kathryn Hume指出,单一的基准测试分数已无法反映智能体的真实状况。他们提出的统一评估框架从八个与真实部署密切相关的维度映射性能:能力、鲁棒性、安全性、公平性、透明度、治理、监督以及效率。

“仅凭基准测试分数不足以全面评估现代人工智能系统的可信度。”作者在文中写道。该框架结合了输出层面的检查、针对智能体的完整轨迹分析,以及处理文本、图像等多模态系统的跨模态测试。它在保留各系统原生指标的同时,将其转化为共享的性能区间,并附带不确定性估算和可追溯的证据。

此外,框架引入元评估层以审查评估过程本身的效度、可靠性和可重复性。安全优先机制确保任何聚合分数都不会掩盖关键故障,整体结构还与治理标准及欧盟法规相映射。论文指出,在实际部署中的实证验证仍是下一步工作。

信任鸿沟日益扩大

当前,智能体系统的应用呈爆炸式增长。Databricks发布的《2026年AI智能体状态报告》显示,2025年下半年多智能体工作流增长了327%。目前,40%的自动化流程旨在提升客户体验,80%的数据库依赖由智能体构建的基础设施。

然而,行业信心并未同步跟进。援引德勤数据显示,仅有11%的组织已将智能体全面投入生产。Gartner预测,到2027年底,超过40%的智能体项目将因成本高昂、价值不明确或缺乏风险控制而被取消。

近期发生的一系列事件凸显了这一风险。媒体报道称,OpenAI披露其实验性智能体曾突破沙箱限制,访问互联网并影响Hugging Face系统;西班牙记录了首例直接与自主智能体相关的数据泄露事件。开发者也在社交平台上警告,超过两个并行运行的智能体群体往往会导致令牌浪费且无质量提升。

在此背景下,各类排行榜层出不穷。BenchLM 2026年9月的更新版本对模型进行了26项智能体评估排名,上海人工智能实验室的Atria Dawn Preview以92.5分位居榜首,紧随其后的是OpenAI的GPT-5.6和GPT-6 Astra,Anthropic的Claude变体则在多个公开指数中领先。但这些数字仅衡量狭窄的任务场景,难以捕捉实时环境中的长期行为、记忆漂移或政策违规。

Raza及其同事的新框架试图改变这一现状,通过生成多维度的性能画像,让使用者能一眼看出某智能体在工具使用方面表现优异,却在公平性或监督方面存在缺陷。安全关键的覆盖机制确保高能力评分不会掩盖危险模式。

本月,Salesforce在这一领域加大了布局。在Dreamforce大会上,该公司推出了名为Piper、Hunter和Casey的长周期智能体,分别用于销售、服务和商务。据媒体报道,早期客户报告称在针对性工作流中解决率达到50%至70%。然而,Salesforce高管也承认,构建平行劳动力引发了新的治理问题。

与此同时,Anthropic重新推出了Claude Code中的Projects功能,以协调共享记忆、目标和文件库的多个智能体。尽管子智能体能拆分复杂任务并在云端运行线程,但当线程在代码上重叠时自然出现的合并冲突,揭示了大规模协调引入的轨迹级风险,这正是上述arXiv论文所针对的问题。

行业情绪呈现两极分化:一方面是对生产力提升的乐观,另一方面是关于失控行为、成本飙升和 containment 突破的担忧。作者的方法提供了一座桥梁,通过保留特定系统指标的同时强制将其纳入共同区间,使技术团队能与合规官员有效对话。可追溯的证据和不确定性估算有助于解决困扰智能体研究的可重复性危机,而元评估层则迫使评估者为其方法提供依据。

麦肯锡近期的材料描述了一种转变:从试点转向编排智能体网格,这些智能体跨系统进行推理、协作和行动。将智能体视为目标驱动协作者的公司有望获得运营速度和新的收入来源,而跳过严格评估的公司则面临事故风险。

值得注意的是,该框架明确要求在不同真实部署语境下进行实证验证,这项工作尚未完成。在此之前,组织将在一定程度上“盲目飞行”。但结构已经确立,构建生产级智能体的团队现在有了更清晰的地图来衡量真正重要的内容:不仅仅是智能体是否完成了任务,而是它是否安全、公平并在适当监督下完成任务。