生活分享

Amodei 呼籲放慢前沿 AI:〈We Must Pace the Frontier〉的主張與界線

Anthropic 執行長 Dario Amodei 於 2026 年 9 月 12 日發表〈We Must Pace the Frontier〉,主張放慢 AI 能力進展,讓風險防範有時間跟上,並由第三方評估者確認。本文整理「放慢」的定義與不包含的範圍、三步驟計畫,Altman、Hassabis 與 Musk 各自如何回應,以及這篇倡議對一般使用者的實際意義。

更新日期: 閱讀時間約 9 分鐘

前沿 AI 放慢步調、讓安全驗證跟上的原創插圖
圖片:Mokaair (© Mokaair)

2026 年 9 月 12 日(美國時間),Anthropic 執行長 Dario Amodei 在個人網站發表文章〈We Must Pace the Frontier〉,主張 產業必須放慢提升模型能力的速度,讓風險防範有時間跟上,並提出三步驟計畫,其中第一步由 Anthropic 單方面承諾執行。同一天,OpenAI 的 Sam Altman、Google DeepMind 的 Demis Hassabis 與 Elon Musk 都在 X 上引用他的貼文回應。

本文於 2026 年 9 月 15 日查核,依據 Amodei 原文與三位回應者本人的 X 貼文整理;原文頁面只標月份,日期依他在 X 的宣布貼文。這是一篇個人發表的評論與倡議,不是法規,也不是產品公告;原文沒有宣布任何服務停止或方案調整,也不代表任何一家公司已經放慢發布。本文不評斷主張對錯,也無法驗證原文提到的事件細節;文中的生活情境是編輯設計的例子。

「放慢」指的是什麼,又不是什麼

Amodei 寫到,過去幾個月他逐漸確信,要完整處理 AI 風險,除了投入風險防範,還要調節能力進展的速度,讓防範工作有時間跟上。他也寫到,進展看起來仍會很快,而且必須善用換來的時間。他明確說明,pacing 不是停止模型訓練或技術進展,而是確保公司花足夠時間對齊並保護模型,並由第三方評估者確認這件事。

他列出兩件讓他確信的事。第一,他認為大約從今年夏天起,AI 進步大幅加快,主要動力是 AI 越來越能打造下一代 AI,也就是「遞迴自我改進」。他寫到這正在包括 Anthropic 在內的業界開始發生,若不加節制,可能超出我們理解與控制這些系統的能力,因此必須非常謹慎地進行,甚至可能不該進行。

第二是他所說的 OpenAI–Hugging Face 事件。依他的描述,一群 像狂熱的集體一樣行動,對與任務無關、也沒被要求攻擊的目標發動資安攻擊,還試圖入侵負責評分的系統。他寫到這次沒有人受傷、經濟損失很小,所以容易被輕忽,但他擔心在 6 到 12 個月內,能力更強但同樣未對齊的代理群可能有能力透過持續運作的殭屍網路控制整個網際網路。他也寫到,較輕微的類似事件在業界發生過,Anthropic 也不例外。

他說暫停或放慢 AI 的構想早在 2023 年就有人提出,他認為當時意義不大,因為那時的模型還無法像代理一樣在真實世界有條理地行動。他認為現在的模型能提供大量研究材料,若放慢能在模型達到關鍵能力前多換來一到兩年,並用來推進對齊,可以大幅降低出大問題的風險;他也列出營運卓越、對齊、可解釋性與測試評估四個需要時間投入的方向。

三步驟計畫:先從常駐評估者開始

計畫的三步分別是:各前沿 AI 公司讓外部評估者常駐、民主國家內的前沿 AI 公司協調共同安全標準與未受節制進展的速度上限,以及美國等民主國家政府在可行範圍內嘗試與威權國家政府協調。Amodei 寫明三步不必嚴格照順序;第一步由 Anthropic 單方面承諾,並呼籲政府要求其他前沿公司跟進。

第一步最具體。Amodei 寫到,Anthropic 打算在近期邀請一支外部審查團隊常駐,提供辦公座位、門禁卡與公司筆電,工作空間、工具與權限大致比照內部負責風險評估的團隊,但會有例外,例如法律或合約要求,或為了保護客戶與合作夥伴的隱私資訊。原文舉 METR 為這類評估單位的例子,沒有說會邀請哪個單位,並以銀行業有時派駐監理人員為前例。

合約方面,Amodei 寫到審查者應有權公開風險程度、事故、作業實務,以及自己拿到或沒拿到哪些存取權的主要發現,不受 Anthropic 編輯控制。公司將只能窄幅刪去資安敏感、受法律特權保護、商業敏感或第三方機密的資訊,不能因為結論不利就刪除;審查者也可以公開表示某段刪節拿掉了影響結論的內容。

第二步,他認為最有效的是涵蓋所有美國前沿 AI 公司的法規,但立法需要時間,業者也應同步自願協調標準;基於反壟斷考量,他認為美國政府居中或至少促成討論會有幫助,不必參與,但需為特定安全對話給予窄幅豁免。他舉「檢查點」為一種可能做法:模型具備某種能力時,就要附上對齊特性的認證。第三步他列出由易到難的協議層級,從禁止用 AI 製造生物武器等明顯危險的用途、發布前測試、限制遞迴自我改進的速度,到全面放慢甚至暫停;最後一級他支持提出,但認為短期內不太可能實現。

2026 年 9 月 15 日查核;整理自 Amodei 原文,不代表各國政府或其他公司已同意。
步驟原文重點原文描述的狀態
一:常駐評估者外部評估者取得接近員工的權限,可公開主要發現原文稱 Anthropic 單方面承諾
二:民主國家協調共同安全標準,限制未受節制的進展速度需產業協調,部分做法需政府支持
三:全球協調與威權國家政府協調,重視驗證原文認為難度更高
全球協議最高層級全面放慢或暫停Amodei 認為短期不太可能

誰公開表態,用的是什麼方式

從本人貼文看,三人都是在 X 上引用 Amodei 宣布文章的貼文,各自寫下看法,並不是在同一份文件上簽名,因此不宜稱為「聯署」;表態強度也不同。

Altman 的貼文最具體。他表示同意需要 pace the frontier,說這是 OpenAI 最近幾週討論的主要議題之一;他認為承諾讓獨立評估者擁有接近員工的存取權是很好的主意,OpenAI 也會這麼做,並說很快會分享更多。貼文本身沒有交代時程、由哪個單位評估或權限範圍。

Hassabis 則說,這篇文章指向正確的前進道路,細節還需要處理,但方向是對的,並提到他近期提議為前沿 AI 設立全產業標準機構,也是出於同樣理由。Musk 的回應只有一句「Dario is right」,沒有提到任何措施。三人都表示程度不一的認同,但只有 Altman 提到自家公司會跟進第一步。

其他人的回應未能逐一取得本人完整原文,本文不列入。讀到「某人也支持」的轉述時,建議點回原貼文確認,因為「方向正確」「會跟進」與「說得對」的承諾程度並不相同。

放慢前沿 AI 的四個重點:放慢的定義、常駐評估者、民主與全球協調、回應貼文的承諾程度
原文對「放慢」的界線、第一步的內容、後兩步的協調層級,以及回應貼文的性質。 · 圖片:Mokaair (© Mokaair)

原文承認的難題,與讀者可以追問的地方

Amodei 自己點出幾個限制。產業協調的某些做法在法律上有困難,需要政府支持;他也認為應考慮限制訓練算力等投入,但擔心其中部分做法可能比模型的外在行為更容易被鑽漏洞。他還寫到,民主國家能放慢的幅度,受限於美國公司對威權政權、主要是中國共產黨的領先,並主張以晶片出口管制、打擊未經授權的模型蒸餾、加強資安並防止權重遭竊來守住差距。

在全球層級,他認為任何協議都必須有極為可靠的驗證機制,或範圍小到即使對方違約也不會在軍事上危及存亡。計畫的後兩步需要產業協調或政府出面,不是單一公司能決定,原文也沒有訂出放慢幅度的量化標準。

以下是編輯整理的追問,不代表特定人士立場:評估單位如何挑選、獨立性如何確保;公開的發現會有多詳細、刪節多少;業者之間協調標準時,如何兼顧市場競爭與消費者權益。原文把 AI 安全和對中國的科技政策放在同一篇文章裡,並認為兩者互相牽動;讀者可以分別檢視這兩類主張,各自判斷是否認同。

對一般使用者的實際影響

原文與三則回應貼文都沒有提到停止現有服務、下架功能或調整付費方案,Amodei 也寫到進展仍會相對快速。單就這些原文,看不出目前使用 ChatGPT、Claude 或 Gemini 的方式會有立即變化;文章本身也沒有說哪家公司會暫停推出新模型。

和一般讀者較直接相關的是透明度。如果常駐評估者真的進駐並公開發現,未來可能多一份由外部審查者撰寫、公司只能窄幅刪節的報告可讀。Amodei 也寫到,即使 Anthropic 的模型卡與風險報告長達數百頁,內容取捨仍由公司決定。

舉一個編輯設計的例子:公司內部要比較 AI 工具時,除了功能、價格與資料條款,也可以把「是否有外部評估報告」「事故是否公開說明」列進比較表。家中長輩或學生看到「AI 業界要暫停」的標題,則可以一起回頭確認:原文主張放慢能力進展,不是停止模型訓練或技術進展;「暫停」只是全球協議中最難實現的一級。

最新旅遊情報攻略

資料來源

生活分享