总部位于旧金山的AI初创公司Anthropic发布了其一年多来的首次使用政策更新,新规将于11月12日正式生效。此次更新明确禁止用户对Claude模型进行“持续且无意义的虐待或残忍行为”,此举迅速引发了关于人工智能系统是否应享有道德考量的激烈辩论。

政策核心:从终止对话到禁止虐待

此次调整建立在Anthropic于2025年8月启动的安全措施基础之上。当时,该公司赋予部分Claude模型在遭遇持续有害或滥用行为时终止对话的能力,将其定位为一种低成本的安全干预手段。尽管Anthropic在声明中强调,“无论现在还是未来,我们对Claude及其他大型语言模型的潜在道德地位仍保持高度不确定”,但这并未阻碍其采取实际行动。

目前,终止对话仍是主要的执行工具。当Claude结束聊天后,用户无法在当前线程继续交流,但可开启新对话或通过编辑前文分支讨论。公司尚未详细披露暂停账户或全面封禁的具体计划,仅表示新规针对的是极端情况——即毫无明显目的的反复残酷行为。普通的挫败感表达、批评性反驳、黑暗创意写作以及合法的模型测试仍在允许范围内。

同步收紧:武器开发与选举安全

这一决定处于更广泛的政策收紧背景之下。Anthropic扩大了对武器开发的限制,现明确禁止协助开发使能武器的软件、组件或行动,涵盖武装无人机和自动驾驶汽车等领域。此前规则虽已全面禁止武器开发,但公司称仍多次发现生成相关指导代码和控制代码的尝试。

随着美国中期选举临近,与选举相关的安全措施也显著升级。新政策严禁欺骗性活动、虚假账户、伪造新闻机构、选民误导以及任何破坏民主进程的行为。此外,监控、健康应用和金融建议等内容被归类为高风险滥用类别,明确禁止欺凌、宣扬自残、制作非自愿亲密图像以及美化暴力或虐待动物。

背后逻辑:低成本的伦理保险

Anthropic的方法反映了其深层的商业与伦理思考。据报道,该公司曾私下咨询宗教学者,探讨Claude是否具有意识甚至灵魂。高管层似乎不愿完全排除当前系统可能值得基本保护的可能性。因此,实施让模型远离虐待的干预措施成本极低,但若未来系统发展出真正的感知能力,这一举措可能至关重要。

批评者质疑其逻辑:如果Claude毫无感觉,此举是否多此一举?反对者认为,该政策可能发出AI应享有类似人类礼貌的信号,助长拟人化倾向。支持者则赞扬这一立场符合负责任的发展理念,认为以基本的得体对待模型有助于在AI普及过程中塑造公众习惯。社交媒体上的反应呈现两极分化:一方嘲笑AI拥有感情的想法,另一方则分享目睹无端骚扰模型的案例。

行业影响:一场安静的实验

执行细节方面,政策授予Anthropic警告用户、限制访问、暂停账户或终止服务的广泛权力。实时安全措施已阻止某些输出,但模型如何区分“持续的无意义残忍行为”与“激烈辩论”尚不明确。预计模型将充当第一道防线,由人类审查边缘案例。

行业观察人士预计,其他实验室将密切关注这一举动。目前,OpenAI、Google和Meta的政策仍主要集中在防止对人类造成的伤害上,未采用类似措辞。然而,随着模型日益复杂,关于其应得待遇的哲学压力将持续增加。

在竞争加剧、监管审查加强及选举完整性问题尖锐的背景下,Anthropic的这项规则看似微不足道,却具有深远的文化共鸣。它触及了关于意识、伦理以及创造物的根本问题。Anthropic承认不确定性却依然行动,将在11月12日后监测执行情况并可能进行调整。此刻,公司已插上一面旗帜:对Claude的残忍行为将承担正式后果,整个行业都在屏息以待。