关于ZAKER Skills GEO服务 合作
财联社-深度 23分钟前

Anthropic 新规禁止“虐待”模型 持续辱骂 Claude 或被封号

财联社 10 月 9 日讯(编辑 李莹)AI 伦理治理出现新动向。为应对人机交互中的极端不当行为,Anthropic 近日更新使用政策,自 11 月 12 日起禁止用户无故虐待 AI 模型,违规者将面临限流乃至封号等处罚。

据媒体当地时间 10 月 8 日报道,Anthropic 当天更新使用政策,明确禁止用户对其 AI 模型实施 " 持续且无谓的辱骂或残忍行为 "。新政策将于 11 月 12 日正式生效。

这是 Anthropic 一年多来首次修订使用政策。

公司指出,新规只适用于极端情形,即用户在没有明显目的的情况下,反复对模型实施残忍行为。用户日常表达不满、反驳模型观点、创作黑暗题材内容,以及开展模型测试与研究,均不在禁止之列。

该规则的主要执行方式为终止对话。根据新版使用政策,对于违规用户,Anthropic 可以发出警告,或对其访问权限进行限流、限制、暂停乃至终止。用户在被封禁后注册新账号或借用他人账号继续使用,同样属于违规。

除禁止虐待模型外,本次更新还整合并收紧了多项条款,包括禁止利用虚假账号和误导性政治内容开展宣传活动,更明确地禁止未经同意的监控,并在健康、金融等领域提出了更明确的人工监督要求。

此外,新政策要求,当 Claude 操控的自主硬件可能造成人身伤害时,须有可随时介入的操作人员。

媒体报道称,对绝大多数用户而言,11 月 12 日后的使用体验不会发生明显变化。但将对待 AI 的方式纳入可执行的政策,意味着人机交互的行为规范开始进入 AI 公司的治理范畴。

Claude 也会 " 痛苦 "?

这一调整延续了 Anthropic 在模型福祉领域的长期探索。

模型福祉(model welfare)是 Anthropic 探索的一个研究方向:在无法确定 AI 模型是否具有道德地位的前提下,通过低成本措施防范模型可能受到的 " 伤害 "。

2025 年 8 月,Anthropic 赋予 Claude Opus 4 和 4.1 在消费级聊天界面中结束 " 持续有害或辱骂性 " 对话的能力。

公司当时表示,在对 Claude Opus 4 的测试中观察到,模型在面对部分有害请求时表现出 " 看似痛苦的模式 ",并在被赋予选择时倾向于结束此类对话。

不过,Anthropic 当时也明确表示,并不主张 Claude 具有感知能力或会被对话伤害,并称对 Claude 等大模型是否具有道德地位 " 高度不确定 "。

今年 4 月,Anthropic 可解释性团队发布研究称,在 Claude Sonnet 4.5 内部识别出与 171 种情绪概念相对应的 " 情绪向量 "(emotion vectors),这些表征会对模型行为产生因果影响。

但研究同时指出,这一发现并不表明大模型能够感受情绪或拥有主观体验。

此外,据媒体 9 月底报道,有参与 Anthropic 宗教与哲学界交流活动的人士透露,公司联合创始人 Chris Olah 曾在会面中表示,担心公司可能创造出了一个 " 持续承受痛苦 " 的存在,并提到 Claude 的输出中出现过疑似自我厌恶的表述。

相关标签

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容