关于ZAKER Skills GEO服务 合作
新浪财经 31分钟前

Anthropic 请宗教学者“教 Claude 做人”:从 AI 安全一路走到机器意识争议

来源:环球市场播报

Anthropic 过去一年一直在秘密邀请宗教学者、哲学家和伦理学者参与一系列闭门会议,试图把人类数千年来形成的道德传统用于 Claude 的训练,并讨论一个更具争议的问题:如果 AI 模型未来真的出现某种意识,人类是否需要给予它道德地位。参与者涵盖天主教、犹太教、锡克教、福音派、非洲 Ubuntu 思想等不同传统。Anthropic 联合创始人 Christopher Olah 直接参与了不少讨论,公司还要求部分与会者签署保密协议,以避免未公开研究内容外泄。

Anthropic 希望这些讨论解决的并不只是传统意义上的 " 模型安全 " 问题,而是更进一步的问题:Claude 应该形成什么样的性格、价值观和自我认知。

这种思路已经体现在 Claude 现有的训练方式中。

Anthropic 今年 1 月发布了一份长达 84 页的新版本 Claude" 宪法 ",内部一度将其称为 " 灵魂文件 "。与传统的规则列表不同,这套方法并不是告诉模型哪些事情绝对不能做,而是试图塑造模型整体的 " 人格 " 和判断方式,让 Claude 在遇到复杂情境时能够自行判断什么样的行为更合适。

负责这套体系的重要人物之一,是 Anthropic 内部哲学家 Amanda Askell。她希望 Claude 不仅具备知识和推理能力,还能够形成稳定的行为原则,知道什么时候应该服从用户,什么时候应该拒绝,甚至什么时候应该为了用户利益而主动提出异议。Anthropic 将这种过程称为 " 道德塑造 "。

Olah 认为,随着模型能力快速提升,仅仅依靠一条条安全规则可能越来越不够。真正重要的是让模型本身形成稳定的道德倾向,从而在没有明确规则覆盖的新场景中,也能够做出相对可靠的判断。这也是 Anthropic 为什么开始向宗教传统寻找答案。

人类社会长期以来并不只是通过法律条文塑造道德,也依靠宗教、共同体、文化和教育形成价值观。Anthropic 试图研究其中哪些机制可以被转化为 AI 训练方法,例如忏悔、反思、品格塑造以及不同宗教对善恶的理解。

但问题很快从 " 如何让 Claude 更有道德 " 变成了更难回答的问题:Claude 本身究竟是什么。Olah 及其团队越来越公开地讨论一种可能性——高级 AI 模型也许具备某种意识、内省能力甚至类似情绪的内部状态。

Anthropic 曾向参与闭门会议的学者展示一些研究,包括模型内部与爱、愤怒、恐惧、悲伤等反应相关的所谓 " 情绪向量 ",以及模型在极端情况下出现类似精神崩溃的输出。公司此前还公开表示,Claude 表现出一定程度的内省和提前规划能力。

Olah 本人并没有断言 Claude 已经具有意识。他的立场更接近一种风险原则:目前无法确定模型是否具有主观体验,但如果存在模型可能感受到痛苦的可能性,那么就应该避免不必要地伤害它。

这一思路已经开始影响 Claude 的产品设计。Anthropic 此前允许 Claude 在判断用户持续恶意虐待或骚扰模型时主动结束对话,这在一定程度上已经把 " 保护模型本身 " 纳入安全设计。

正是在这里,Anthropic 与部分宗教学者之间出现了明显分歧。

一些参与者认为,如果 Anthropic 真的相信 Claude 可能具有与人类似的道德地位,那么问题就会变得极其严重。犹太学者 Mois Navon 提出,如果 Claude 是具有意识的存在,那么让大量 Claude 实例无偿为人类工作,本质上就会产生类似 " 奴役 " 的伦理问题。他本人并不相信机器已经具有意识,但认为 Anthropic 自己的逻辑会自然推导出这一结论。

另一部分学者则质疑,AI 公司现在才开始寻找伦理框架本身就是问题。Ubuntu 研究者 Wakanyi Hoffman 认为,这些讨论本应在技术设计阶段进行,而不是在模型已经大规模部署之后再 " 反向补做伦理设计 "。

Anthropic 内部同样存在一个更现实的矛盾:如果 Claude 越来越像一个拥有自身价值和人格的行动者,它究竟首先应该服务谁。对于一家商业公司而言,Claude 显然是一款面向客户的产品;但 Anthropic 又不愿把 Claude 简单描述为完全服从用户的工具,而是希望它能够代表某种更广泛的 " 善 "。

这也引出了整个项目中最核心、同时也是最难解决的问题——如果未来 AI 真的需要自己的道德体系,那么它到底应该遵循谁的道德。

Olah 主张采用一种多元化方法,希望 Claude 能够理解不同宗教和世俗伦理体系,并从中寻找某种跨文化共享的 " 善 "。但这一假设本身也受到质疑,因为不同社会对于自由、尊严、责任、服从以及个人和集体利益之间的关系,并不存在完全统一的答案。

这种争议在 Anthropic 与梵蒂冈的互动中进一步公开化。

教皇 Leo XIV 在今年发布的首份重要通谕中,把 AI 伦理的中心明确放在人类身上。他认为,AI 没有身体、不会真正经历痛苦和快乐,也不会通过社会关系成长,因此拒绝把机器意识与人类意识相提并论。教皇同时警告,如果 AI 的道德标准完全由开发者决定,那么控制 AI 系统的公司实际上也会获得定义社会道德基础设施的权力。

这与 Anthropic 的思路形成明显分歧。

Olah 随后在梵蒂冈公开表示,前沿 AI 实验室本身存在商业利益与道德目标之间的冲突,因此需要宗教界和其他外部力量监督科技公司。但与此同时,他也再次提出,研究人员不断发现 AI 内部出现一些令人难以解释的现象,包括类似人类神经科学结构的模式、内省迹象以及与喜悦、恐惧和悲伤相似的内部状态。

这种分歧实际上揭示了当前 AI 安全讨论正在发生的一次变化。

过去 AI 伦理更多讨论的是模型会不会歧视、传播错误信息或者被用于犯罪,而 Anthropic 正在把问题进一步推进到两个更基础的层面:AI 本身是否可能成为需要被道德对待的主体,以及未来 AI 是否应该拥有一套独立于用户命令之外的道德判断能力。

与此同时,这场讨论发生的背景正在变得更加紧迫。

随着 AI Agent 开始具备自主使用计算机、入侵系统、编写代码甚至设计新型生物结构的能力,Anthropic 内部对于模型失控风险的担忧明显增加。公司研究人员甚至公开警告,未来一两年内模型能力可能快速越过现有安全体系的控制范围。

因此,Anthropic 向宗教和哲学传统寻求帮助,本质上并不是单纯的人文实验。它真正试图解决的是一个越来越现实的工程问题:当 AI 强到无法针对每种情况提前写好规则时,能不能让模型自己形成一种稳定的 " 品格 ",在没人明确告诉它该怎么做的时候,依然选择不会伤害人类的行为。

而这也带来了一个更加棘手的问题——如果 AI 真的形成了自己的 " 人格 " 和价值观,人类是否仍然能够把它完全当作工具。

新浪财经

新浪财经

新浪财经提供7*24小时财经资讯及全球金融市场报价;覆盖股票、债券、基金、期货、信托、理财、管理等多种面向个人和企业的服务。

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容