
随着摇杆转动与按键按下,即便是新手玩家也能在三维游戏中完成复杂操作。一家英国初创公司正押注于这一现象:这些简单的操作序列中蕴含着海量信息,足以成为训练新型人工智能的关键燃料。
业界逐渐达成共识,大型语言模型(LLM)因仅基于文本训练,缺乏对物理世界的感知能力,难以胜任自动驾驶或机械臂操控等需要精细动作的任务。为弥补这一缺陷,包括李飞飞和Yann LeCun在内的顶尖研究人员正转向研发能理解物理规律的“世界模型”(World Models)。
破解数据瓶颈:从游戏副产品到AI养料
训练世界模型需要结合视觉与动作数据,例如物体抓取的力度与扭矩。然而,相较于LLM拥有的浩瀚文本库,世界模型领域极度缺乏现成的高质量数据集。南安普敦大学AI副教授Xiatian Zhu指出:“世界模型需要因果关系数据,而这在互联网上非常匮乏。”
由LeCun担任顾问的英国初创公司Worldmodeldata旨在解决这一痛点。该公司定位为数据经纪人,将视频游戏工作室产生的控制器输入等“副产品”打包成训练数据集。此举帮助实验室免去了与众多游戏方逐一谈判的繁琐流程。目前,General Intuition和Niantic等公司也已开始利用自有平台的游戏数据构建模型。
Worldmodeldata首席执行官Rhea Loucas表示:“全球数百万款游戏日益接近真实世界,为何不利用其中丰富、多样的体验来教导AI?”尽管该假设尚待验证,但研究人员普遍相信,世界模型的性能将随训练数据规模的扩大而提升,数据短缺已成为最大瓶颈。
此前,部分实验室尝试通过传感器手动收集人类或机器人数据,但这种方法不仅产量有限,更难以覆盖现实世界中复杂的“边缘情况”(Corner Cases)。Khosla Ventures合伙人Nicole Fraenkel指出,单纯的重复演示无法捕捉现实世界固有的混乱无序,而游戏数据因其充足的数量和多样性,能有效覆盖这些关键场景。
据透露,Worldmodeldata已从多款热门游戏背后的工作室获得近百万小时的数据授权,并计划未来向个人玩家提供补偿渠道。Loucas坚信,游戏数据将成为世界模型训练的主力,进而引发该领域的“GPT时刻”。
行业分歧:物理拟真度的争议
并非所有巨头都对此持乐观态度。英伟达更倾向于使用专为模拟现实物理规律定制的引擎来构建世界模型。英伟达世界模型开发负责人Ming-Yu Liu对游戏数据持保守态度,他认为游戏物理引擎往往为了营造逼真假象而“走捷径”,忽略了如手指防止苹果滑落所需的细微压力等细节。
“在处理需要精细运动控制的任务时,基于游戏输入的模型表现可能不佳,”Liu表示,这类数据更适合用于生成超写实视频或3D环境,而非精密操控。Zhu也表达了类似担忧,称游戏本质上是“粗糙且近似”的模拟器。
在世界模型迎来其突破性时刻之前,技术路径仍存争议。Fraenkel总结道:“通往成功的路径有很多,究竟哪条最有效,目前尚无定论。”