ライフスタイル

Anthropic、フロンティアAIの指標を3つ公表:26%は「主導」であって「自律」ではない

2026年9月17日、AnthropicはフロンティアAI研究所内部の進捗を外部が追えるようにする三つの指標——研究開発の自動化度合い、AIエージェントの監督体制、安全性に充てる計算資源の割合——を公表しました。本稿はAnthropic公式ページをもとに2026年9月18日に確認しており、26%の「主導」がなぜ完全自動を意味しないのか、0.002%という遮断率になぜもう一つの注意書きが添えられているのか、そしてこれらの数値が今のところAnthropic自身による測定で範囲が限られ、外部評価者の体制は構築中であることを説明します。

読了目安 19 分

オリジナルイラスト:3つのゲージが並び、それぞれの針が異なる目盛りで止まっている。ゲージの上には幾何学的な疑問符の輪郭が浮かび、これらの目盛りがまだ外部の検証を待っていることを表す
画像:Mokaair (© Mokaair)

2026年9月17日、Anthropicは公式サイトで三つの指標を公表しました。AI研究開発のうちどれだけをAI自身が行っているか、AIエージェントの行動がどのように監督されているか、そして計算資源がどのように配分されているかを、フロンティアAI研究所の内部の様子として外部にも見えるようにする試みです。Anthropicはこれを、CEOのDario Amodei氏が少し前に発表したフロンティアAIの減速を求める文章と結び付け、各研究所が足並みをそろえて速度を落とせば、これらの数値も変わっていくはずだと書いています。

本稿は2026年9月18日に、Anthropic公式サイトの三つのページ——この三指標を公表した記事本文、ニュース一覧ページ、そして政策の背景を説明する政策ページ——を読んで確認しました。当サイトは実地の検証を行っておらず、この三つの指標は現時点ではいずれもAnthropicが自ら測定し自ら公表した数値です。本稿はAnthropic自身が示した限界と、まだ検証されていない部分を一つずつ説明します。

Anthropicは何を、何のために公表したのか

Anthropic公式のニュース一覧ページがこの記事につけた要約は、今のところ世界はAI研究所の内部で何が起きているか見ることができず、AnthropicはフロンティアAI開発を一般の人々にも見えるようにする新しい指標を提案する、というものです。記事本文自体はこれをAmodei氏の呼びかけと結び付けていますが、氏の文章にリンクを張るだけで主張の内容を繰り返してはいません。Anthropicが書いているのは、これらの提案された測定と政策を合わせたものが、研究所の外からAI開発の速度を監視するための出発点になる、ということです。

この記事本文には公開日が記載されていません——2026年9月18日まで確認した限り、ページ上に署名日、「公開日」といった表記、対応するメタデータの項目は見当たりません。9月17日は、Anthropic公式のニュース一覧ページの注目記事欄がこの記事に付けている日付で、本稿はこれを出来事の日付として採用しています。原文には時刻がいっさい記載されていないため、本稿も公開の正確な時刻は書きません。Anthropicはこの指標群を試作版と呼び、これによって透明性を示したい、今後も続けるとしていますが、公表の頻度を固定する約束はしていません。

三つの指標:研究開発の自動化、エージェントの監督、安全性への計算資源

一つ目は「Anthropic研究開発自動化指数(Anthropic R&D Automation Index)」で、Epoch AIが開発した自動化レベル(Automation Level、AL)という尺度で評価し、AL0からAL5(完全自律、人間の介在なし)まであります。AL3「協働(Collaborative)」は、AIが人間の綿密な指示のもとで多くの作業を担えることを指し、AL4「主導(Leading)」は、AIが高レベルの指示から作業の大部分を最初から最後まで完了でき、人間はそれを監督する立場にとどまることを指します。2026年8月時点で、AnthropicはClaudeが測定対象のどのAI研究開発作業においても完全自律では動作していないと書いており、「主導」は26%、「協働」以上の割合は合計90%を超えています。

二つ目はエージェントの監督で、Anthropicはカバレッジ(coverage)、レビュー遅延(review latency)、エスカレーション率(escalation rate)という三つの観点を選んでいます。それぞれ、行動のうちどれだけが監視を通過するか、行動とレビューの間にどれだけ時間が空くか、行動のうちどれだけが遮断または要審査としてフラグを立てられるかに対応します。2026年8月時点で、社内で最も多く使われている一つのプラットフォーム上で、同時に約3万のエージェントが研究・エンジニアリング業務にあたっており、これらの数値はこのプラットフォームのみを対象としています。これらの行動は100%が実行前にオンライン監視(online monitoring)を通過し、通常は数秒以内に完了します。事後にも100%がオフライン監視(offline monitoring)に回され、オフライン監視は毎週およそ10万件の対話記録にフラグを立て、その大半は分類器(classifier)によって処理されます。優先度が最も高いおよそ50件が人によるレビューに回されます。

Anthropicは、2026年8月の10億件を超える判断を分析した結果、0.002%(およそ47,000件に1件)がオンライン監視によって遮断されたと書いています。Anthropicはこの節の冒頭で、これまでの監視データを見る限り個々のエージェントが問題行動を起こすことはまれだが、経済全体で数百万、数十億のエージェントが動いている状況では、まれな出来事も日常的に起こり得ると先に注意を促しています。三つ目は計算資源のスナップショットです。Anthropicは2026年7月13日から20日までの1週間について、自社の計算資源の使われ方全体を調べ、AI研究開発向けの計算資源のうち約6%、「AI主導のAI研究開発」向けの計算資源のうち約12%が安全性の作業に配分されていたとしています。二つの数値は分母が異なるため、本稿では両者を足し合わせたり比較したりしません。

Anthropicが2026年9月17日に公表した三つの指標を整理したもの。確認日は2026年9月18日。表中の数値はすべてAnthropic自身による測定です。
指標期間公式の数値公式が示す限界
研究開発自動化指数2026年8月「主導」26%、「協働」以上が90%超ClaudeがClaudeを採点、外部監査ではない
エージェント監督:カバレッジ2026年8月行動の100%が事前にオンライン監視、事後にオフライン監視を通過社内で最も多く使われる1プラットフォームのみが対象
エージェント監督:遮断率2026年8月10億件超の判断のうち0.002%を遮断(約47,000件に1件)経済規模が大きくなればまれな出来事も日常的に起こり得るとAnthropicは説明
安全性への計算資源の割合2026年7月13日〜20日AI研究開発の計算資源の約6%、AI主導の研究開発では約12%を安全性に配分意図的に保守的な単週スナップショットとAnthropicは説明

これらの数値がまだ検証済みとは言えない理由

Anthropicは、研究所間の比較を妨げる二つの障害を自ら挙げています。第一に、共通の測定方法がないこと。第二に、Anthropicは自社のClaudeを使って自社のシステムを評価しているという点です。研究用のClaudeエージェントがまず証拠を集め、次に別のClaudeが評価役を務めます。ある月の自動化度合いを評価する際、評価を行うエージェントはその月かそれ以前の証拠しか見ることができません。言い換えれば、Anthropic自身が、評価役を務めるモデルが評価対象のモデルと同じ種類の誤りを犯す可能性があると書いているのです。

監督に関する数値にも限界があります。Anthropicが書いているのは、複数の組織から独立した第三者評価者を常駐させ、社内のリスク評価チームに近いアクセス権を与える計画であり、監督についての節では現在外部評価者の体制を構築中だとも書いています。どちらの文も、すでに誰かが検証したことを意味しません。本文にはMETRが過去にAnthropicのオフライン監視プラットフォームを独立してレッドチーム方式でテストしたことがあると出てきますが、これは過去のことであり、テストの対象は監視プラットフォームであって、この記事が公表している百分率の数値そのものではありません。確認当日に読めた内容を基準にすると、本稿は上記の数値を外部機関が検証した形跡を確認できませんでした。

計算資源の割合についても、Anthropicは控えめな算出方法だと説明しています。挙げられている例では、あるトークンが能力向上への貢献と安全性への貢献が同じくらいだった場合、そのトークンは安全性側にはカウントしないとしています。また二つの数値には、安全対策用の分類器のために使われるもう一つのまとまった規模の計算資源は含まれていません。Anthropicは、安全性研究は最先端のトレーニングに比べて、計算資源そのものよりも研究者の時間に頼る傾向があると述べており、そのため計算資源の割合は不完全な代替指標にすぎず、その意味は開発者間・時系列で同種のものを比較できる点にあり、この二つの百分率そのものの絶対的な大きさにあるわけではないとしています。

4コマの図解:誰が研究開発を行っているか、エージェントはどう監督されているか、計算資源は誰に配分されているか、誰が検証するのか
Anthropicが2026年9月17日に公表した三つの指標の整理:研究開発の自動化、エージェントの監督、安全性への計算資源の割合。確認日は2026年9月18日。 · 画像:Mokaair (© Mokaair)

誤読されやすい二つの数値

一つ目に誤読されやすいのは「主導」です。26%は「作業の4分の1をAIが完全に自分だけで行い、人は管理していない」とそのまま理解されがちですが、Anthropicが定義するAL4「主導」は、AIが高レベルの指示から作業の大部分を最初から最後まで完了できる一方、人間はなお監督している状態を指します。AL5「完全自律、人間の介在なし」は、脚注で「私たちがまだ到達していない段階」と説明されています。より近い言い方は、「AIがタスクを引き受け、ほとんどの手順を自分でこなすが、そばで誰かが見ていて、いつでも介入できる」であって、「AIが扉を閉めた中で完結させ、誰も何が起きたか分からない」ではありません。

二つ目に誤読されやすいのは0.002%という遮断率です。数字だけを見ると、「エージェントはほとんど問題行動を起こさず、システムは安全だ」と読みたくなりますが、Anthropicは同じ節の中で、経済全体で数百万、数十億のエージェントが動いているときは、一つひとつの出来事の確率は低くても、まれな出来事は日常的に起こり得ると書いています。しかも0.002%は、あくまで1か月間、社内の1プラットフォーム上でオンライン監視が遮断した割合にすぎず、オフライン監視は別途、対話記録のおよそ1,000件に1件から2件をさらなる審査のためにフラグ付けしており、原文はこの二つを表の別々のマスに分けて記載し、合算はしていません。

この記事に書かれていない部分、そしてフロンティアの減速との関係

2026年9月18日までに確認した内容を基準にすると、この記事本文はどの国や市場も名指ししておらず、製品の変化やユーザーの目に見える機能の調整にも触れていません。これはAnthropicが自社の内部の研究開発プロセスをどう測定しているかを説明する記事であって、製品発表ではなく、台湾のユーザーが今Claudeを使う方法がこれによって変わることはありません。記事はAnthropic自身の数値だけを公表しており、他社の自動化比率、監督のカバレッジ、安全性への計算資源の割合は書かれていません。Anthropicの原文が書いているのは「どのフロンティア開発者でも」同様の指標を公表できるということであり、すでに他社がそうしているという意味ではありません。

この記事本文は付録で、自ら「安全性に関わる作業」の定義を示しています。AIシステムをより安全に、より理解しやすく、あるいはセキュリティ面でより堅牢にすることを主目的とする作業、というものです。Anthropicは同時に、これは数ある合理的な選択肢の一つにすぎず、別の開発者や規制当局であれば線引きが違う場所になるかもしれないと述べたうえで、各者が事前に共通の定義について話し合っておくことにはメリットがあるとの考えを示しています。Anthropicの別の政策ページでは、自社のAdvanced AI Frameworkに触れており、透明性や独立評価から、必要な場合に危険な展開を阻止・抑止する政府の権限までを扱うとしています。このページには、このフレームワークは主に米国連邦政府を念頭に書かれた提案であり、すでに発効している規定ではないと明記されています。

この記事本文と、Amodei氏が少し前に発表した「We Must Pace the Frontier」は、同じ一連の流れをなす二つの文章です。この記事本文は、これらの数値がAmodei氏によるフロンティア減速の協調の呼びかけに呼応するものだと書いてリンクを張るだけで、その文章の内容を繰り返してはいません。3段階の計画と「第1段階は外部評価者の常駐」という部分は、当サイトの別の記事によるまとめから来ており、本稿が引用しているページには含まれていません。ここで公表されている三つの指標は、「本当に減速が起きているかどうか」を並べて見られる数値に変えようとするAnthropicの試みです。その3段階について知るには、本稿末尾の2つ目のリンクをご覧ください。

よくある質問

26%は研究開発作業の4分の1がすでに完全にAI任せになっていることを意味しますか。

いいえ。Anthropicの定義では、26%は自動化レベルAL4「主導」に対応しており、AIが高レベルの指示から作業の大部分を最初から最後まで完了できることを意味しますが、人間はなお監督しています。人間の介在なしに完全自律で動くAL5は、脚注で「私たちがまだ到達していない段階」と説明されており、本文でも2026年8月時点で、測定対象となっているどのAI研究開発作業も完全自律では動作していないと書かれています。

0.002%という遮断率は、この監督システムが安全であることを示していますか。

Anthropicはそのようには主張していません。この数値は2026年8月にオンライン監視が10億件を超える判断のうち遮断した割合であり、Anthropicは同じ節の冒頭で、これまでの監視データを見る限り個々のエージェントが問題行動を起こすことはまれだが、経済全体で数百万、数十億のエージェントが動いている状況では、一つひとつの出来事の確率が低くても、まれな出来事は日常的に起こり得ると先に書いています。オフライン監視は別途、対話記録のおよそ1,000件に1件から2件にフラグを立てており、これは別の数値で、原文はこの遮断率と合算していません。

この三つの指標は外部機関の検証を経ていますか。

本稿が2026年9月18日までに確認した内容を基準にすると、これらの数値そのものを外部機関が検証した形跡は見当たりません。Anthropicが書いているのは、独立した第三者評価者を常駐させ、社内のリスク評価チームに近いアクセス権を与える計画であり、別の箇所では現在外部評価者の体制を構築中だとも書いています。本文にはMETRが過去にAnthropicのオフライン監視プラットフォームを独立してレッドチーム方式でテストしたことがあると出てきますが、これは過去のことであり、テストの対象は監視プラットフォームであって、これらの百分率ではありません。

これは台湾のClaudeユーザーと関係がありますか。

本稿が確認した内容を基準にすると、この記事本文はどの国や市場も名指ししておらず、製品の変化やユーザーの目に見える機能の調整にも触れていません。これはAnthropicが自社の内部の研究開発プロセスをどう測定しているかを説明する記事であって、製品発表ではなく、台湾のユーザーが今Claudeを使う方法がこれによって変わることはありません。

これらの指標は今後、決まった頻度で公表されますか。

Anthropicは公表頻度を固定する約束をしていません。記事はこれによって透明性を示したい、今後も続けたいとしており、どのフロンティア開発者でも公開された方法を使ってこの種の指標を定期的に公表できるとも書いています。本稿が確認したページを基準にすると、次回公表の日付は書かれておらず、今後も同じ方法を使い続けるという約束もありません。Anthropicは付録で、タスクの一覧を定期的に作り直し、必要に応じて公表済みの自動化数値のバージョンを改めて振り直す計画だとも書いています。

この記事は、Amodei氏が少し前に発表したフロンティアAIの減速を求める文章とどう関係していますか。

Anthropicのこの記事本文は、これらの数値がAmodei氏によるフロンティア減速の協調の呼びかけに呼応するものだと書いて、氏の文章にリンクを張っていますが、その内容を繰り返してはいません。3段階の計画と「第1段階は外部評価者の常駐」という部分は、当サイトの別の記事によるまとめから来ており、本稿が引用しているページには含まれていません。ここで公表されている三つの指標は、「本当に減速が起きているかどうか」を並べて見られる数値に変えようとするAnthropicの試みです。その3段階について知りたい読者は、本稿末尾の2つ目のリンクからさらに読み進めることができます。

  • ライフスタイル

    Amodei氏、フロンティアAIの減速を呼びかけ:「We Must Pace the Frontier」の主張と線引き

    AnthropicのCEOであるDario Amodei氏は2026年9月12日に「We Must Pace the Frontier」を発表し、AIの能力向上を減速させてリスク対策が追いつく時間を確保し、それを第三者の評価者が確認することを主張しました。本稿では「減速」の定義と含まれない範囲、3段階の計画、Altman氏、Hassabis氏、Musk氏がそれぞれどう反応したか、そしてこの提言が一般ユーザーにとって実際に何を意味するのかを整理します。

  • ライフスタイル

    OpenAIがミスアライメント通報フレームワークを公開:6件の報告はすべて訓練段階から

    OpenAI公式ページに記載されている公開日は米国時間で2026年9月16日ですが、台北時間に換算するとすでに9月17日です。同じ日に具体的な事例報告6件も公開されました。本記事はフレームワークの発表文、alignment.openai.comの一覧ページ、事例報告2件を確認し、この6件の報告がどの段階でどのモデルを対象として示されているか、通報がどのような手続きを経るか、そして公式が公表した2つの比率がそれぞれ何を測っているかを説明します。

  • ライフスタイル

    Anthropicの9月版脅威インテリジェンスレポート:7種類のAI悪用と狙われるAPIキー

    Anthropicは2026年9月10日に脅威インテリジェンスレポートを公開し、2025年12月から2026年8月までに阻止した7種類のAI悪用をまとめました。本稿では、レポートに書かれていることと書かれていないことを整理し、一般の人がAIを使った詐欺を防ぎ、アカウントとAPIキーを守り、AIエージェントの権限を絞り、不審な利用を報告する方法を解説します。

  • ライフスタイル

    NVIDIA、DGX Spark 64GB版を発表:10月23日発売、価格は4,999ドルから、2台接続で128GBに

    NVIDIAは2026年10月2日、パーソナルAIコンピューター「DGX Spark」に、より手頃な64GBメモリ版を追加すると発表した。10月23日からAcer、ASUSなど6社が供給し、主な対象は自分のマシンでAIモデルを実行したい開発者や研究者。NVIDIAが公表した仕様、2台接続に関する説明、一般読者にとっての意味を整理する。

最新の旅の情報・ガイド

出典

ライフスタイル