帮助训练OpenAI模型的外包人员,竟因在工作中使用AI工具而遭解雇。这一颇具讽刺意味的事件,揭示了人工智能训练背后对人类判断力的严苛依赖。

据媒体披露,多名受雇审查并优化OpenAI模型生成结果的外包人员,因违规使用AI辅助工作,已被从项目中移除或解聘。此举看似严苛,实则逻辑自洽:这些岗位的核心价值在于提供真实的人类判断,若由ChatGPT等工具代劳,数据质量将大打折扣。

严禁“AI代劳”

AI模型的进化并非仅靠抓取海量文本,人类反馈在规范模型行为、对齐用户偏好方面起着关键作用。OpenAI承认,标注人员的主观倾向会直接影响模型表现,因此反馈源的真实性至关重要。

涉事外包人员参与了多个大规模项目,职责包括阅读、评分及筛选AI回复。然而,内部文件显示,审核员被明确禁止将判断权“外包”给AI。操作指南点名禁止使用Grammarly、AI翻译等工具撰写反馈。负责招聘的AI培训公司Mercor也向媒体确认,合同明文禁止工作人员利用大型语言模型完成任务。

有外包人员透露,同事因频繁使用AI被定期清理出项目。一份解聘通知书指出,涉事员工的工作成果存在“真实性”问题。

弃用AI检测器

令人意外的是,抓包过程并未依赖AI检测软件。内部指令指出,GPTZero等检测工具被认为不可靠,审核员不得将其用于筛查。

相反,审核员被要求通过人工评估内容模式来识别作弊线索,如重复用词、异常快的完成速度、特定的写作习惯甚至过度使用破折号。此外,审核员被指示不得向被怀疑者透露具体疑点,以防对方改进隐藏手段。

这一流程凸显了当前的悖论:负责检查人类是否秘密使用AI的人员,被明确告知不能信任AI检测软件。

人类反馈的不可替代性

尽管OpenAI在训练中大量使用合成数据以填补空白,但这与“用AI冒充人类反馈”有本质区别。若评估环节由AI代劳,雇佣人类评估者的意义便不复存在。

目前并无证据表明此类违规行为对OpenAI模型造成了可衡量的损害。但这一事件折射出AI热潮下的现实:即便是构建最先进AI系统的公司,仍需依赖真实人类来界定什么是“正确”的回答。