
Axiom的AI工程师Aditya Ramabadran、Simon Mahns和Tobias Gessler近期进行了一项大胆实验:他们坐在湾区一家餐厅附近的2024款丰田卡罗拉内,通过连接挡风玻璃摄像头和电动转向系统的服务器,让OpenAI的GPT-6 Astra模型接管方向盘。在一名安全驾驶员随时准备踩刹车的监控下,这款通常用于生成文本和代码的AI模型,缓慢但稳定地驾驶车辆驶向In-N-Out汉堡店的取餐窗口。
“也许AGI(通用人工智能)真的来了。”其中一名工程师评论道。与传统由专用算法驱动的自动驾驶不同,这次操作由旨在输出文本的通用模型即时完成,未经过预先专门训练。这一实验及其他类似尝试表明,基于语言的AI模型正开始建立对物理世界基础但实用的理解。
高风险的物理世界探索
尽管此次午餐行程未发生意外,但团队承认,让通用模型控制高速移动的车辆是一项高风险任务。随着AI物理理解能力的提升,其介入现实世界的方式可能既令人印象深刻,也潜藏危险。
当前顶尖AI模型虽擅长处理虚拟任务,但在面对现实世界时往往显得笨拙。AI行业普遍认为,物理推理仍是尚未被完全征服的前沿领域。为此,一些研究人员离开大厂,创立专注于解决物理推理问题的初创公司。Elorian AI首席执行官Andrew Dai指出,更强的视觉推理能力将赋能家庭机器人等新应用,是机器人技术的关键基石。
涌现能力与基准测试
为衡量模型理解物理场景的能力,Elorian AI与Scale AI近期推出了名为“人类的第六感”的新基准。Scale AI研究科学家Xingang Guo表示,该基准旨在探究模型像人类一样直觉性理解场景所需的努力。
Axiom团队的In-N-Out项目灵感源于周末外出,他们好奇模型构建3D模拟的能力能否转化为现实导航技能。在测试中,SpaceX AI的Grok等模型起初拒绝控车,但在精心提示后进行了尝试。工程师们推测,驾驶能力并非专门训练结果,而是多模态训练(图像、视频、3D模型)中涌现出的空间推理能力。
然而,团队新推出的车辆基准测试DrivingBench显示,模型距离通过驾驶考试仍有很长路要走。在停车场简单路线测试中,仅Astra完成了全程,但速度极慢;Claude Fable 5.1完成45%,Grok仅完成11%。Ramabadran指出,最新模型展现出根据错误实时调整控制的上下文学习能力,这标志着其在物理操控上的潜在进步。