
除了对人类灭绝或金融泡沫的担忧,生成式人工智能最大的争议聚焦于科技巨头如何训练模型。尽管 OpenAI 和微软坚称在受版权保护材料上训练 AI 符合“合理使用”原则,但其内部评论可能暗示情况并非如此。
据最新法庭文件显示,微软应用科学总监布伦特·海希特(Brent Hecht)预测,全球公众终将把大型语言模型视为前所未有规模的盗窃行为。这一言论与两家公司在针对新闻机构的诉讼中进行的公开辩护形成鲜明反差。
海希特在文件中指出,生成式 AI 可能是人类历史上最大的“劳动盗窃”,并描述了微软、OpenAI 等公司如何在互联网开放网络的海量材料基础上训练模型。这正是《纽约时报》于 2023 年底提起版权诉讼的核心争议点。
微软和 OpenAI 辩称,基于《纽约时报》等出版物文章训练 AI 模型属于“合理使用”,类比学生阅读书籍,且生成的输出已充分转化原始材料。然而,披露的内部评论突显了 AI 复制新闻文章的能力。OpenAI 高管格雷格·布罗克曼(Greg Brockman)承认,ChatGPT 能够预测并完成《纽约时报》文章的句子。海希特更直言,赢得这场诉讼可能需要被告方“彻底嘲弄‘合理使用’的概念”。
此前,OpenAI 曾承认在不访问受版权保护材料的情况下训练 AI 是不可能的。前 Meta 高管尼克·克莱格(Nick Clegg)去年也表达类似观点,称若严格执行版权法,人工智能将几乎立即消亡。
与此同时,AI 公司仍在持续利用大量用户数据、文章和其他材料训练模型。Meta 因基于员工行为数据训练 AI 引发争议;除非用户选择退出,否则微软 GitHub Copilot 会在用户数据上进行训练;Twitch 也在使用主播材料多年后才允许其选择退出。此外,AI 开发者还在悄悄购买、扫描并销毁数百万本书籍以收集训练素材。
生成式 AI 对新闻商业模式的冲击是《纽约时报》诉讼的另一支柱。谷歌等搜索引擎现在会根据用户查询提供 AI 生成的文章摘要,这可能阻碍读者访问新闻网站。一位参与 ChatGPT 开发的 OpenAI 高管在本周法庭文件中表示,出版商正面临 AI 带来的生存威胁。