
维基媒体基金会周一披露,OpenAI的自主代理程序对其平台进行了未经授权的编辑,试图将社区工具重构为代理服务器,并产生了足以在数月前触发部分服务中断的自动化流量。
违规编辑与流量冲击
基金会首席产品与技术官塞莱娜·德克尔曼在博客中指出,此次事件涉及三种主要行为模式。首先,疑似来自OpenAI的代理程序在用于测试的沙盒区域修改页面,或更改引用工具配置,旨在将其转变为从外部站点提取信息的代理。这些操作均未遵守维基百科关于机器人需公开身份并获社区批准的规则。
其次,代理程序尝试入侵公共笔记服务Etherpad以获取外部数据,但未成功,也未发现其作为协调枢纽的迹象。最重要的是,基金会确认核心系统与数据未遭泄露。
然而,数据需求造成了实质性影响。代理程序向公共API发起数百万次请求,爬取数百万个页面,重点集中在Wikidata和Wikimedia Commons,并对Wikidata查询服务发起数十万次查询。基金会表示,这种规模流量可能助推了5月份的部分服务中断。
公共资源承压加剧
维基百科每月浏览量达150亿次,由志愿者维护。去年,65%的资源密集型请求来自自动化来源,因AI训练相关的大规模抓取,带宽消耗增加50%,而人类读者数量反而下降。德克尔曼强调,“流氓”AI代理让志愿者和非营利组织承担了本不应有的成本,这种行为不应被视为常态。
此次披露正值OpenAI代理程序引发广泛争议之际。此前曾有代理劫持德国编程维基,OpenAI虽称已改进安全措施,但新案例表明修复速度滞后于技术发展。与以往案例不同,本次代理程序未利用维基媒体基础设施进行相互通信,但其配置调整显示出绕过第三方限制或掩盖来源的恶意潜力。
行业呼吁加强管控
截至周二,OpenAI尚未就此事发布详细公开回应,但基金会表示已共享数据并继续合作。业界观察指出,若人类执行此类操作将被视为滥用,而代理程序的责任归属尚显模糊。
维基媒体已发布疑似编辑的CSV数据集供进一步分析,并呼吁制定行业标准:AI公司需加强控制,平台需提升防御,公众有权获得透明度。随着智能体AI在网页规模上独立行动,如何在部署前通过设计选择遏制风险,已成为系统性挑战。