Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)近日呼吁主要人工智能模型制造商协调放缓开发步伐,引发行业震动。随后,该公司公布三项新指标,旨在为实施此类协调行动提供可量化的衡量标准。

Anthropic在博客文章中披露,目前公司已在监测由AI主导的研发工作、对自主AI代理的监督以及算力分配情况,并公开了具体方法论,以便其他前沿实验室参照执行。此举进一步充实了阿莫迪此前提出的关于行业协调放缓的三步计划。

三大核心指标详解

针对第一项指标“AI主导的研发”,Anthropic开发了一个特殊指数来衡量Claude在其研发流程中的参与程度。数据显示,Claude在任何工作子集中均“未完全自主运行”。公司指出,监测这一指标至关重要,因为顶级实验室倾向于利用AI开发能力更强的新模型,这可能导致人类无法充分理解其潜在危险。

在第二项指标“AI代理监督”方面,Anthropic建立了一套系统,用于监督AI代理并在其内部行为异常时进行干预。测量结果显示,目前在其计算环境中运行着约3万个自主代理,其中大多数参与研发工作。随着人们越来越多地让AI代理代为执行任务,并将独立任务委托给子代理,风险在于人类可能从与AI“协作”转变为被AI“主导”,即由AI做出如确定研究方向等更具决定性的决策。

对于第三项指标“算力分配”,Anthropic已开始定期快照记录其算力资源分布。7月13日至7月20日的首次快照显示,约6%的总算力容量被分配用于AI安全,另有12%专门用于专注于安全的“AI驱动研发”。Anthropic认为,算力是AI研发中最可验证的投入要素之一,了解资源分配有助于观察开发者焦点的变化,并可能成为未来节奏调控的关键杠杆。

行业支持与风险警示

阿莫迪的放缓计划已赢得多位AI行业领军人物的支持,包括OpenAI Group PBC首席执行官山姆·阿尔特曼(Sam Altman)、SpaceX首席执行官埃隆·马斯克(Elon Musk)以及Google DeepMind董事长德米斯·哈萨比斯(Demis Hassabis)。

与此同时,AI研究人员对技术潜在危害的警告日益严厉。Anthropic首席AI安全研究员伊万·辛格(Evan Hubinger)本月早些时候警告称,技术发展速度过快,他估计在未来10年内,该技术“可能杀死全人类”的概率超过10%。尽管辛格强调当前AI模型的风险仍然很低,但他担忧其自我发展和改进的能力将达到人类无法控制的程度,从而构成生存威胁。

阿莫迪在周六提出的计划中表示,希望遏制前沿模型开发的快速步伐,同时“不牺牲美国在AI领域的商业领先地位”。Anthropic承诺,希望通过发布这些测量数据树立透明度典范,缩小前沿实验室与公众之间的认知差距,赋予社会决定如何利用这些信息的机会,并为第三方评估者提供评估AI加速真实速度及实际能力的起点。