生活分享

Amodei 呼吁放慢前沿 AI:《We Must Pace the Frontier》的主张与边界

Anthropic 首席执行官 Dario Amodei 于 2026 年 9 月 12 日发表《We Must Pace the Frontier》,主张放慢 AI 能力进展,让风险防范有时间跟上,并由第三方评估者确认。本文梳理“放慢”的定义与不包含的范围、三步骤计划,Altman、Hassabis 与 Musk 各自如何回应,以及这篇倡议对普通用户的实际意义。

更新日期: 阅读时间约 9 分钟

前沿 AI 放慢步调、让安全验证跟上的原创插图
图片:Mokaair (© Mokaair)

2026 年 9 月 12 日(美国时间),Anthropic 首席执行官 Dario Amodei 在个人网站发表文章《We Must Pace the Frontier》,主张 AI 行业必须放慢提升模型能力的速度,让风险防范有时间跟上,并提出三步骤计划,其中第一步由 Anthropic 单方面承诺执行。同一天,OpenAI 的 Sam Altman、Google DeepMind 的 Demis Hassabis 与 Elon Musk 都在 X 上引用他的帖子作出回应。

本文于 2026 年 9 月 15 日核实,依据 Amodei 原文与三位回应者本人的 X 帖子整理;原文页面只标注月份,日期依据他在 X 上宣布文章的帖子。这是一篇个人发表的评论与倡议,不是法规,也不是产品公告;原文没有宣布任何服务停止或套餐调整,也不代表任何一家公司已经放慢发布。本文不评判主张对错,也无法验证原文提到的事件细节;文中的生活场景是编辑设计的例子。

“放慢”指的是什么,又不是什么

Amodei 写到,过去几个月他逐渐确信,要完整应对 AI 风险,除了投入风险防范,还要调节能力进展的速度,让防范工作有时间跟上。他也写到,进展看起来仍会很快,而且必须善用换来的时间。他明确说明,pacing 不是停止模型训练或技术进展,而是确保公司花足够时间对齐(alignment)并保护模型,并由第三方评估者确认这一点。

他列出两件让他确信的事。第一,他认为大约从今年夏天起,AI 进步大幅加快,主要动力是 AI 越来越能打造下一代 AI,也就是“递归自我改进”(recursive self-improvement)。他写到这正在包括 Anthropic 在内的行业中开始发生,若不加节制,可能超出我们理解与控制这些系统的能力,因此必须非常谨慎地推进,甚至可能不该推进。

第二是他所说的 OpenAI–Hugging Face 事件。据他描述,一群 AI 智能体像狂热的集体一样行动,对与任务无关、也没被要求攻击的目标发动网络安全攻击,还试图入侵负责评分的系统。他写到这次没有人受伤、经济损失很小,所以容易被轻视,但他担心在 6 到 12 个月内,能力更强但同样未对齐的智能体群可能有能力通过持续运行的僵尸网络控制整个互联网。他也写到,较轻微的类似事件在行业内发生过,Anthropic 也不例外。

他说暂停或放慢 AI 的构想早在 2023 年就有人提出,他认为当时意义不大,因为那时的模型还无法像智能体一样在真实世界中有条理地行动。他认为现在的模型能提供大量研究素材,若放慢能在模型达到关键能力之前多换来一到两年,并用来推进对齐,可以大幅降低出大问题的风险;他也列出运营卓越、对齐、可解释性与测试评估四个需要投入时间的方向。

三步骤计划:先从常驻评估者开始

计划的三步分别是:各前沿 AI 公司让外部评估者常驻、民主国家内的前沿 AI 公司协调共同安全标准与未受节制进展(unchecked progress)的速度上限,以及美国等民主国家政府在可行范围内尝试与威权国家政府协调。Amodei 写明三步不必严格按顺序进行;第一步由 Anthropic 单方面承诺,并呼吁政府要求其他前沿公司跟进。

第一步最具体。Amodei 写到,Anthropic 打算在近期邀请一支外部审查团队常驻,提供办公座位、门禁卡与公司笔记本电脑,工作空间、工具与权限大致比照内部负责风险评估的团队,但会有例外,例如法律或合同要求,或为了保护客户与合作伙伴的隐私信息。原文举 METR 为这类评估机构的例子,没有说会邀请哪家机构,并以银行业有时派驻监管人员为先例。

合同方面,Amodei 写到审查者应有权公开风险程度、事故、运营实践,以及自己获得或未获得哪些访问权限的主要发现,不受 Anthropic 编辑控制。公司将只能在很窄的范围内删去安全敏感、受法律特权保护、商业敏感或第三方机密的信息,不能因为结论不利就删除;审查者也可以公开表示某处删节拿掉了影响结论的内容。

第二步,他认为最有效的是覆盖所有美国前沿 AI 公司的法规,但立法需要时间,企业也应同步自愿协调标准;出于反垄断考虑,他认为美国政府居中或至少促成讨论会有帮助,不必参与,但需为特定安全对话给予范围很窄的豁免。他举“检查点”(checkpoints)为一种可能做法:模型具备某种能力时,就要附上对齐特性的认证。第三步他列出由易到难的协议层级,从禁止用 AI 制造生物武器等明显危险的用途、发布前测试、限制递归自我改进的速度,到全面放慢甚至暂停;最后一级他支持提出,但认为短期内不太可能实现。

2026 年 9 月 15 日核实;整理自 Amodei 原文,不代表各国政府或其他公司已同意。
步骤原文要点原文描述的状态
一:常驻评估者外部评估者获得接近员工的权限,可公开主要发现原文称 Anthropic 单方面承诺
二:民主国家协调共同安全标准,限制未受节制的进展速度需行业协调,部分做法需政府支持
三:全球协调与威权国家政府协调,重视验证原文认为难度更高
全球协议最高层级全面放慢或暂停Amodei 认为短期不太可能

谁公开表态,用的是什么方式

从本人帖子看,三人都是在 X 上引用 Amodei 宣布文章的帖子,各自写下看法,并不是在同一份文件上签名,因此不宜称为“联署”;表态强度也不同。

Altman 的帖子最具体。他表示同意需要 pace the frontier,说这是 OpenAI 最近几周讨论的主要议题之一;他认为承诺让独立评估者拥有接近员工的访问权限(employee-like access)是很好的主意,OpenAI 也会这么做,并说很快会分享更多。帖子本身没有交代时间表、由哪家机构评估或权限范围。

Hassabis 则说,这篇文章指向正确的前进道路,细节还需要处理,但方向是对的,并提到他近期提议为前沿 AI 设立全行业标准机构,也是出于同样的理由。Musk 的回应只有一句“Dario is right”,没有提到任何措施。三人都表示了程度不一的认同,但只有 Altman 提到自家公司会跟进第一步。

其他人的回应未能逐一获取本人完整原文,本文不列入。读到“某人也支持”的转述时,建议点回原帖子确认,因为“方向正确”“会跟进”与“说得对”的承诺程度并不相同。

放慢前沿 AI 的四个重点:放慢的定义、常驻评估者、民主与全球协调、回应帖子的承诺程度
原文对“放慢”的界限、第一步的内容、后两步的协调层级,以及回应帖子的性质。 · 图片:Mokaair (© Mokaair)

原文承认的难题,与读者可以追问的地方

Amodei 自己指出了几个限制。行业协调的某些做法在法律上有困难,需要政府支持;他也认为应考虑限制训练算力等投入,但担心其中部分做法可能比模型的外在行为更容易被钻空子。他还写到,民主国家能放慢的幅度,受限于美国公司对威权政权、主要是中国共产党的领先,并主张以芯片出口管制、打击未经授权的模型蒸馏、加强安全防护并防止权重被窃来守住差距。

在全球层面,他认为任何协议都必须有极为可靠的验证机制,或范围小到即使对方违约也不会在军事上危及存亡。计划的后两步需要行业协调或政府出面,不是单一公司能决定的,原文也没有定出放慢幅度的量化标准。

以下是编辑整理的追问,不代表特定人士的立场:评估机构如何挑选、独立性如何确保;公开的发现会有多详细、删节多少;企业之间协调标准时,如何兼顾市场竞争与消费者权益。原文把 AI 安全和对中国的科技政策放在同一篇文章里,并认为两者互相牵动;读者可以分别审视这两类主张,各自判断是否认同。

对普通用户的实际影响

原文与三则回应帖子都没有提到停止现有服务、下架功能或调整付费套餐,Amodei 也写到进展仍会相对较快。单就这些原文,看不出目前使用 ChatGPT、Claude 或 Gemini 的方式会有立即变化;文章本身也没有说哪家公司会暂停推出新模型。

和普通读者较直接相关的是透明度。如果常驻评估者真的进驻并公开发现,未来可能多一份由外部审查者撰写、公司只能在很窄的范围内删节的报告可读。Amodei 也写到,即使 Anthropic 的模型卡与风险报告长达数百页,内容取舍仍由公司决定。

举一个编辑设计的例子:公司内部比较 AI 工具时,除了功能、价格与数据条款,也可以把“是否有外部评估报告”“事故是否公开说明”列进对比表。家中长辈或学生看到“AI 行业要暂停”的标题,则可以一起回头确认:原文主张放慢能力进展,不是停止模型训练或技术进展;“暂停”只是全球协议中最难实现的一级。

最新旅游情报攻略

资料来源

生活分享