Anthropic エージェント監視の仕組み、止まるのは4.7万件に1件
画像出典: ぱくたそ (すしぱく)
Anthropicの社内エージェント基盤では約30,000体のAIエージェントが同時に稼働し、2026年8月の1か月で10億件超の判断を下しました。全アクションは実行前のオンラインモニターと実行後のオフラインモニターで100%審査され、ブロックされたのは約0.002%(約47,000件に1件)でした。それでもAL5(完全自律)に達した業務は2026年8月時点でゼロで、人間の監督が外れた運用にはなっていません。
エージェントに仕事を渡すとき、いちばん引っかかるのは「動いている最中に誰が見ているのか」という点です。人が一件ずつ確認できる量を超えたら、監視は成立しないように思えます。
この疑問に対して、自社で大量のエージェントを走らせている当事者が数字を出しました。Anthropicが2026年9月中旬に公表した「Measurements for understanding the pace of AI development inside frontier labs」には、社内の研究・エンジニアリング用エージェント基盤の実測値が並んでいます。約30,000体が同時に稼働し、2026年8月の1か月で下した判断は10億件超。そして止めたのは、そのうち約0.002%でした。
この数字の内訳を追うと、「監視する」が具体的に何をすることなのか、そして人間の手がまだどこに残っているのかが見えてきます。
100%監視とは、具体的に何をしているのか?
監視と聞くと、ログをあとから抜き取って調べる作業を思い浮かべるかもしれません。Anthropicの基盤がやっているのは、時間軸の違う2つの監視を重ねることです。
1つ目は実行前の審査です。エージェントが何かのアクション(ファイルを書く、コマンドを打つ、といった一つひとつの操作)を実行しようとするたび、それが走る前に自動で審査が入ります。これをオンラインモニターと呼びます。狙いは、モデルの重みのコピーのような「起きてしまうと取り返しがつかない被害」につながる操作をその場で止めること。カバレッジは100%で、全アクションがここを通ります。審査は数秒単位です。
2つ目は実行後の読み直しです。オフラインモニターは、エージェントが実際に何をしたかの行動記録(トランスクリプト)を全件読み込みます。こちらが探しているのは、一発で壊れるタイプの被害ではなく、モデルの不整合の兆候のようなゆっくり進行して気づきにくいずれです。事前審査だけでは、単体では無害な操作が積み重なって方向がずれていく動きを捕まえられません。
関所と定期健診の関係に近いと考えるとイメージしやすいかもしれません。関所は危険物をその場で止め、健診は日々の記録から傾向を読む。役割が違うので、片方では代わりになりません。
10億件のうち、人間は何件見ているのか?
| 監視層 | 役割 | カバレッジ | 処理規模 | 人間レビュー |
|---|---|---|---|---|
| オンラインモニター(事前) | 取り返しのつかない被害につながる操作を実行前にブロック | 100% | 10億件超の判断/月(2026年8月)を数秒単位で審査 | ブロック事例は1週間以内に人間が確認。ブロック率は約0.002%(約47,000件に1件) |
| オフラインモニター(事後) | モデル不整合など緩やかに進行する兆候を事後検知 | 100%(全トランスクリプトを取り込み) | 週約100,000件のトランスクリプトを分類器で処理、うち約1,000件に1〜2件をフラグ | 最終的に優先度の高い約50件/週が人間レビュアーに昇格 |
Anthropicの公表データをもとに作成
上の表で注目したいのは、右へ行くほど件数が急激に絞られていくところです。オフライン側は週約100,000件の記録を分類器にかけ、そこから約1,000件に1〜2件がフラグされ、最終的に人間のレビュアーに届くのは週約50件。10億件の入口から、人が目で見る出口までを数十件まで落とす漏斗になっています。
「100%監視」という言葉が指しているのは、人間が全部を見ているという意味ではありません。取りこぼしなく全件を機械の審査に通し、そのうえで人間の時間を優先度の高いところだけに配分している、という設計です。エージェントを業務に入れるとき、この考え方はそのまま持ち込めます。全件チェックは機械に任せ、人は「機械が引っかけたもの」だけを見る。
ブロック率が低いことは、必ずしも監視が空振りしていることを意味しません。ここで押さえておきたい前提が2つあります。
ひとつは、ブロックが「確認された実害」ではなく、監視システム側の予防的な判断だという点です。止めた約47,000件に1件が、実際に被害を起こしたはずのアクションだったとは限りません。もうひとつは、ブロックされた具体的な内容は公開されていないこと。中身がわからない以上、「どんな危険が防がれたか」を読み取ることはできません。わかるのは、止める仕組みが全件に対して動いていて、その判定が1週間以内に人間の確認へ回されている、という運用の形までです。
Anthropic自身が課題として挙げているのは、まさにこの規模の問題です。個々のエージェントが問題行動を起こす確率が低くても、数百万〜数十億件の規模で動かせば、稀な事象は定常的に発生します。さらに、すべての挙動を捕捉して人間に見える形にできているかどうかの判断自体が難しい、とも説明されています。確率が小さいことと、事故が起きないことは別の話です。
AIが「主導」する業務はどこまで増えたのか?
監視の話と並んで公表されたのが、AI研究開発の仕事をAIがどこまで担っているかの測定です。Anthropicは「R&D Automation Index」という指標で、業務をAL0からAL5の6段階に分類しています。
| レベル | 定義 |
|---|---|
| AL0 | AIの関与なし |
| AL1 | AIの関与は最小限 |
| AL2 | AIが補助的な支援を行う |
| AL3 | AIとの「協働」──人間の密接な指導のもとAIが大規模な作業を遂行 |
| AL4 | AIが「主導」──人間の高水準の指示からAIがほぼ全工程をエンドツーエンドで遂行し、人間は監督役 |
| AL5 | 完全自律(人間のループなしで稼働) |
Anthropicの公表データをもとに作成
2026年8月時点で、AL3以上(協働以上)の合計は90%超。AI抜きで進む業務のほうが例外になっています。この段階分けは、どの仕事をどこまでAIに渡しているかを業務ごとに言い表すための目盛りで、比率の変化を月ごとに追うこともできます。

上のグラフのAL4(AIが主導)の帯は、月を追うごとに幅を広げています。2026年2月時点ではほぼ0%でしたが、2026年8月には26%。半年でここまで動いた領域は多くありません。
この測定は推測ではなく、実際の業務の棚卸しから作られています。2026年7月の各週、モデルR&Dループを構成する各部門からスタッフの20%を無作為に抽出し、Claudeのリサーチエージェントが本人のSlackや社内文書をもとに1週間の業務内容をレビュー。約15,000件の細かいR&Dタスクを、ALの評価付きでリスト化しました。
なぜ完全自律(AL5)にはまだ届かないのか?
AL4が26%まで来ているなら、あと一歩に見えます。ところが2026年8月時点で、測定対象の業務でAL5に達したものはゼロ件です。
その理由は、AL5の定義の厳しさにあります。AL5は「人間のループなしで稼働」──監視も、実施も、検証も、本番環境への配置まで、人間が関わらずに完結する状態を指します。ここまで読んできた30,000体のエージェントは、まさにその逆の条件で動いています。実行前に審査され、実行後に全記録を読み直され、優先度の高いものは人間のレビュアーへ回る。Anthropic自身、これを「人間の指導・監督下」の運用だと説明しています。
つまり、止まっているのはAIの能力ではなく、監視を外すという判断のほうです。AL4とAL5の間にあるのは性能差というより、人間が監督役の椅子から降りるかどうかの線引きです。そしてその線は、自社で最も進んだ環境を持つ組織でも、まだ越えられていません。
- 全件チェックは機械に任せ、人間の目は「機械が引っかけたもの」に集中させる
- 実行前のブロックと、実行後の記録の読み直しは役割が違う。片方だけでは足りない
- 1件あたりの失敗確率が低くても、実行回数が増えれば稀な事象は定常的に起きる前提で設計する
安全側への投資がどれくらいの比重かも公表されています。AI主導のAI研究開発に割り当てられる計算資源のうち、安全研究に充てられる割合は約12%。AI研究開発全体で見ると約6%です。
エージェントを業務に入れる話は、「任せるか、任せないか」の二択ではありません。AL0からAL5までの段階が示しているのは、どこまで渡してどこから見張るかの目盛りです。手元の作業に当てはめるなら、まず一つの業務を取り出して、今はAL2(補助)なのかAL3(協働)なのかを言葉にしてみる。そのうえで、一段上げるときに何を監視するかを決める。順番としてはそちらが先です。
よくある質問
Anthropicの社内では何体のAIエージェントが動いているのですか?
Anthropicの社内で最も利用されている研究・エンジニアリング用エージェント基盤では、ある時点で約30,000体のAIエージェントが同時に稼働しています。2026年8月の1か月間に、これらのエージェントが下した判断(アクション)は10億件を超えました。
「100%監視」とは人間が全件を見ているという意味ですか?
いいえ、100%は自動監視のカバレッジを指します。全アクションが実行前のオンラインモニターを通り、全行動記録が事後のオフラインモニターに取り込まれます。人間が目を通すのは、分類器で絞り込まれた週約50件です。
エージェントのアクションはどれくらいの割合でブロックされていますか?
2026年8月の10億件超の判断のうち、オンラインモニターがブロックしたのは約0.002%、約47,000件に1件でした。ブロックは確認された実害ではなく監視システム側の予防的判断であり、ブロックされた具体的なアクションの内容は公開されていません。
AIの完全自律(AL5)はもう実現しているのですか?
2026年8月時点で、Anthropicが測定したAI研究開発業務のうちAL5(完全自律)に達したものはゼロ件です。AL5は監視・実施・検証・本番配置まで人間の関与なしに完結する状態を指しますが、30,000体のエージェントは実行前後の二重監視と人間のレビューが組み込まれた監督下で稼働しています。
※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。