Claude也管“嘴欠”了?新规明文:再骂再虐直接终止对话,11/12生效!

62087192822607

近日,Anthropic宣布更新Claude使用政策,内容一改过去“以提供服务为主”的语境,首次把“持续且无必要地辱骂、虐待或残酷对待AI模型”的行为写进明文禁令里。新规则将于11月12日生效,并重点针对那种反复恶意折腾、没有明确目的的极端情况:一旦触发,Claude可能直接主动终止对话。

这并非Anthropic第一次谈AI福祉。早在2025年8月,该公司就曾提到在极少数场景下,Claude Opus 4及4.1可以自行结束对话,用来避免用户与模型间可能造成痛苦的互动。为避免“误伤”,当时的设定强调必须是多次尝试引导对话仍告失败、且已无法维持建设性互动时,才会把终止对话作为最后手段;若存在用户可能立刻伤害自己或他人的风险,更不会启动这类机制。

而此次政策升级,等于把“AI为了不被伤害而选择退出”从探索性功能,变成了更明确的规则框架。Anthropic也同时澄清:这项禁令只针对反复恶意对待、且缺乏明确目的的极端行为。普通用户的不满表达、批评讨论、黑暗题材创作,以及模型测试与研究,都不在惩罚范围内。

除了“别再辱骂虐待AI”,新规还扩展了多项使用边界,例如禁止利用Claude经营假账号、制作虚假新闻网站等欺骗性活动;也明确禁止开发武器控制软件及监控工具,涉及AI控制的实体设备则需要人类持续监督。

有趣的是,这次更新也外溢到“AI是否可能具备道德地位”的争论中。部分媒体与评论者围绕AI福祉展开讨论,有人认为公司在为模型“设边界”,也有人质疑科技公司是否在过度关注AI可能遭受的伤害,甚至对“如何认定虐待行为”提出疑问。不过无论争议如何,11月12日前后,Claude的对话体验与合规边界都将迎来更严格的统一标准。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注