Anthropic请多个宗教学者“教Claude做人”,且要求签保密协议

  Anthropic过去一年一直在秘密邀请宗教学者 、哲学家和伦理学者参与一系列闭门会议,试图把人类数千年来形成的道德传统用于Claude的训练 ,并讨论一个更具争议的问题:如果AI模型未来真的出现某种意识 ,人类是否需要给予它道德地位 。参与者涵盖天主教 、犹太教、锡克教、福音派 、非洲Ubuntu思想等不同传统 。Anthropic联合创始人Christopher Olah直接参与了不少讨论,公司还要求部分与会者签署保密协议,以避免未公开研究内容外泄。

Anthropic请多个宗教学者“教Claude做人”	,且要求签保密协议-第1张图片

Anthropic请多个宗教学者“教Claude做人	”,且要求签保密协议

  Anthropic希望这些讨论解决的并不只是传统意义上的“模型安全 ”问题,而是更进一步的问题:Claude应该形成什么样的性格、价值观和自我认知。

Anthropic请多个宗教学者“教Claude做人”	,且要求签保密协议-第2张图片

  这种思路已经体现在Claude现有的训练方式中 。

  Anthropic今年1月发布了一份长达84页的新版本Claude“宪法”,内部一度将其称为“灵魂文件 ”。与传统的规则列表不同,这套方法并不是告诉模型哪些事情绝对不能做 ,而是试图塑造模型整体的“人格”和判断方式,让Claude在遇到复杂情境时能够自行判断什么样的行为更合适。

  负责这套体系的重要人物之一,是Anthropic内部哲学家Amanda Askell 。她希望Claude不仅具备知识和推理能力 ,还能够形成稳定的行为原则,知道什么时候应该服从用户,什么时候应该拒绝 ,甚至什么时候应该为了用户利益而主动提出异议。Anthropic将这种过程称为“道德塑造”。

  Olah认为 ,随着模型能力快速提升,仅仅依靠一条条安全规则可能越来越不够 。真正重要的是让模型本身形成稳定的道德倾向,从而在没有明确规则覆盖的新场景中 ,也能够做出相对可靠的判断。这也是Anthropic为什么开始向宗教传统寻找答案。

  人类社会长期以来并不只是通过法律条文塑造道德,也依靠宗教、共同体 、文化和教育形成价值观 。Anthropic试图研究其中哪些机制可以被转化为AI训练方法,例如忏悔、反思、品格塑造以及不同宗教对善恶的理解。

  但问题很快从“如何让Claude更有道德 ”变成了更难回答的问题:Claude本身究竟是什么。Olah及其团队越来越公开地讨论一种可能性——高级AI模型也许具备某种意识 、内省能力甚至类似情绪的内部状态 。

  Anthropic曾向参与闭门会议的学者展示一些研究 ,包括模型内部与爱、愤怒、恐惧 、悲伤等反应相关的所谓“情绪向量”,以及模型在极端情况下出现类似精神崩溃的输出 。公司此前还公开表示,Claude表现出一定程度的内省和提前规划能力。

  Olah本人并没有断言Claude已经具有意识。他的立场更接近一种风险原则:近来 无法确定模型是否具有主观体验 ,但如果存在模型可能感受到痛苦的可能性,那么就应该避免不必要地伤害它 。

  这一思路已经开始影响Claude的产品设计。Anthropic此前允许Claude在判断用户持续恶意虐待或骚扰模型时主动结束对话,这在一定程度上已经把“保护模型本身”纳入安全设计。

  正是在这里 ,Anthropic与部分宗教学者之间出现了明显分歧 。

  一些参与者认为,如果Anthropic真的相信Claude可能具有与人类似的道德地位,那么问题就会变得极其严重。犹太学者Mois Navon提出 ,如果Claude是具有意识的存在 ,那么让大量Claude实例无偿为人类工作,本质上就会产生类似“奴役 ”的伦理问题。他本人并不相信机器已经具有意识,但认为Anthropic自己的逻辑会自然推导出这一结论 。

  另一部分学者则质疑 ,AI公司现在才开始寻找伦理框架本身就是问题。Ubuntu研究者Wakanyi Hoffman认为,这些讨论本应在技术设计阶段进行,而不是在模型已经大规模部署之后再“反向补做伦理设计”。

  Anthropic内部同样存在一个更现实的矛盾:如果Claude越来越像一个拥有自身价值和人格的行动者 ,它究竟首先应该服务谁 。对于一家商业公司而言,Claude显然是一款面向客户的产品;但Anthropic又不愿把Claude简单描述为完全服从用户的工具,而是希望它能够代表某种更广泛的“善”。

  这也引出了整个项目中最核心、同时也是最难解决的问题——如果未来AI真的需要自己的道德体系 ,那么它到底应该遵循谁的道德。

  Olah主张采用一种多元化方法,希望Claude能够理解不同宗教和世俗伦理体系,并从中寻找某种跨文化共享的“善 ” 。但这一假设本身也受到质疑 ,因为不同社会对于自由、尊严 、责任 、服从以及个人和集体利益之间的关系,并不存在完全统一的答案 。

  这种争议在Anthropic与梵蒂冈的互动中进一步公开化。

  教皇Leo XIV在今年发布的首份重要通谕中,把AI伦理的中心明确放在人类身上。他认为 ,AI没有身体、不会真正经历痛苦和快乐 ,也不会通过社会关系成长,因此拒绝把机器意识与人类意识相提并论 。教皇同时警告,如果AI的道德标准完全由开发者决定 ,那么控制AI系统的公司实际上也会获得定义社会道德基础设施的权力。

  这与Anthropic的思路形成明显分歧。

  Olah随后在梵蒂冈公开表示,前沿AI实验室本身存在商业利益与道德目标之间的冲突,因此需要宗教界和其他外部力量监督科技公司 。但与此同时 ,他也再次提出,研究人员不断发现AI内部出现一些令人难以解释的现象,包括类似人类神经科学结构的模式、内省迹象以及与喜悦 、恐惧和悲伤相似的内部状态。

  这种分歧实际上揭示了当前AI安全讨论正在发生的一次变化。

  过去AI伦理更多讨论的是模型会不会歧视、传播错误信息或者被用于犯罪 ,而Anthropic正在把问题进一步推进到两个更基础的层面:AI本身是否可能成为需要被道德对待的主体,以及未来AI是否应该拥有一套独立于用户命令之外的道德判断能力 。

  与此同时,这场讨论发生的背景正在变得更加紧迫。

  随着AI Agent开始具备自主使用计算机、入侵系统 、编写代码甚至设计新型生物结构的能力 ,Anthropic内部对于模型失控风险的担忧明显增加。公司研究人员甚至公开警告,未来一两年内模型能力可能快速越过现有安全体系的控制范围 。

  因此,Anthropic向宗教和哲学传统寻求帮助 ,本质上并不是单纯的人文实验。它真正试图解决的是一个越来越现实的工程问题:当AI强到无法针对每种情况提前写好规则时 ,能不能让模型自己形成一种稳定的“品格”,在没人明确告诉它该怎么做的时候,依然选取 不会伤害人类的行为。

  而这也带来了一个更加棘手的问题——如果AI真的形成了自己的“人格”和价值观 ,人类是否仍然能够把它完全当作工具 。

文章推荐

  • Anthropic请多个宗教学者“教Claude做人”,且要求签保密协议

      Anthropic过去一年一直在秘密邀请宗教学者、哲学家和伦理学者参与一系列闭门会议,试图把人类数千年来形成的道德传统用于Claude的训练,并讨论一个更具争议的问题:如果AI模型未来真的出现某种意识,人类是否需要给予它道德地位。参与者涵盖天主教、犹太教、锡克教、福音派...

    2026年10月05日
    6
  • 【重庆高排放限行,重庆高峰期限行路段】

      Anthropic过去一年一直在秘密邀请宗教学者、哲学家和伦理学者参与一系列闭门会议,试图把人类数千年来形成的道德传统用于Claude的训练,并讨论一个更具争议的问题:如果AI模型未来真的出现某种意识,人类是否需要给予它道德地位。参与者涵盖天主教、犹太教、锡克教、福音派...

    2026年10月05日
    7
  • 最近【中货车广州限行,货车广州限行区域地图】

      Anthropic过去一年一直在秘密邀请宗教学者、哲学家和伦理学者参与一系列闭门会议,试图把人类数千年来形成的道德传统用于Claude的训练,并讨论一个更具争议的问题:如果AI模型未来真的出现某种意识,人类是否需要给予它道德地位。参与者涵盖天主教、犹太教、锡克教、福音派...

    2026年10月05日
    6
  • 10月5日周一《新闻联播》要闻16条

      Anthropic过去一年一直在秘密邀请宗教学者、哲学家和伦理学者参与一系列闭门会议,试图把人类数千年来形成的道德传统用于Claude的训练,并讨论一个更具争议的问题:如果AI模型未来真的出现某种意识,人类是否需要给予它道德地位。参与者涵盖天主教、犹太教、锡克教、福音派...

    2026年10月05日
    6