AI大手が手を組むAI安全対策、協議で何が決まる?
画像出典: ぱくたそ (撮影: Sushi Paku)
OpenAI・Anthropic・Google DeepMindは2026年7月以降、AI安全性の標準団体構想をめぐって非公式に協議を続けていますが、2026年9月15日時点で拘束力のある合意は発表されていません。土台には2023年設立のFrontier Model Forumと、2025年8月に実施された相互安全性評価があります。最大の壁は独禁法で、競合同士が開発ペースを揃える合意は「出力制限」と解釈されうるため踏み込めずにいます。
ニュースの見出しだけを追うと、ライバル企業が急に握手したように見えます。ただ実際に起きていることは、もう少し地味で、もう少し複雑です。
正直なところ、2026年9月15日時点で「3社が正式に合意した」という事実はありません。あるのは、それぞれのトップが出した提案と、水面下で続く協議、そして数年前から動いている既存の枠組みです。ここを分けて見ると、何が新しくて何が続きなのかがはっきりします。
仕事でAIを使う人にとっての意味もはっきりしています。この協議が進むと、自分が使っているモデルが「誰にどこまで検証されたか」が外から見えるようになる。逆に協議が止まれば、今までどおり各社の自己申告を信じるしかない、ということです。読み終えるころには、報道の「合意」と「協議」を見分けられるようになります。
今、AI大手のあいだで何が起きている?
起点は2026年7月14日です。Google DeepMindのCEOデミス・ハサビス氏がX上でエッセイ「A Framework for Frontier AI and the Dawning of a New Age」を公開し、米国主導のAI安全標準団体をつくろうと提案しました。モデルにしたのはFINRA(米金融取引業規制機構=証券会社を業界自身の出資で監督する民間の規制機関)です。
骨子はこうです。独立した技術専門家・オープンソース代表・政府関係者からなる理事会を持つ官民連携組織をつくる。フロンティアラボ(最先端の大規模モデルを開発する企業)は当初は自主的に、モデルのリリース最大30日前までに安全性審査へ提出する。審査の対象はサイバー攻撃能力、生物兵器に関する知識、そして「欺瞞」の能力などです。枠組みが有効だと証明されれば、将来的には米国市場での展開の義務になりうる、という道筋も示されました。
その2か月後、2026年9月12日に、AnthropicのCEOダリオ・アモデイ氏がエッセイ「We Must Pace the Frontier(フロンティアのペースを落とさねばならない)」を発表します。X上で公開初日に3600万ビューを記録しました。
アモデイ氏が出した3段階の提案
- 評価者をラボの中に置く独立した評価者を、外部の訪問者ではなく「社員並み」に常駐させる。デスク、入館バッジ、会社支給のPCを与える、というところまで具体的に書かれています。Anthropicはこれを自社で先行導入すると表明しました。
- 次に進む線を揃える民主主義国のフロンティアラボ同士で、次の能力段階に進む前の共通の安全性の閾値(スレッショルド=「ここを超えたら止まる」という基準値)に合意する。
- 国際的な合意へ広げる民主的な説明責任の仕組みを持たない国も含めた、より広い合意へ拡張する。
OpenAI・Anthropic・Google DeepMindの3社は2026年7月以降、この標準団体構想について協議を続けているとされます。ただしこれは非公開の話し合いベースの報道であり、正式な合意の発表ではありません。
「急に手を組んだ」というのは本当?
協調の土台は、2026年より前からあります。Frontier Model Forum(FMF)は2023年、OpenAI・Anthropic・Google・Microsoftの4社が共同設立した産業非営利団体です。現在のメンバーはAmazon・Anthropic・Google・Meta・Microsoft・OpenAIの6社。フロンティアAIの安全な開発と展開を進めるため、会員企業の技術的・運用的な知見を持ち寄る場として機能しています。
扱う領域も分かれています。生物兵器リスク(AI-Bio)、サイバーリスク(AI-Cyber)、核リスク(AI-Nuclear)、AI Security、そして各社の安全フレームワークの標準化(Frontier Frameworks)です。つまり「何を危険とみなし、どう測るか」の共通言語をつくる作業は、すでに数年続いてきました。
お金の面ではAI Safety Fundがあります。2023年10月設立の1000万ドル超の共同基金で、拠出したのはAnthropic・Google・Microsoft・OpenAIと、Patrick J. McGovern Foundation、David and Lucile Packard Foundation、Schmidt Sciences、Jaan Tallinn氏など。運営団体Meridianが2025年6月に活動を終えて以降はFMFが直接運営を引き継ぎ、最新の助成では11団体に500万ドル超を配分しています。
- 2023年〜: FMFという協調の器はすでにあった
- 2025年8月: OpenAIとAnthropicが互いのモデルを評価し合った
- 2026年7月: ハサビス氏が標準団体を提案
- 2026年9月: アモデイ氏が開発ペースの調整を提案
- 2026年9月15日時点: 拘束力のある合意は未発表
「急に手を組んだ」のではなく、既存の協調の上に、2026年になってより踏み込んだ提案が重なったと見るのが正確です。踏み込んだ、というのは自主的な情報共有から、リリース前の審査や開発ペースの調整へと、企業の事業判断そのものに触れる領域へ入ってきたという意味です。
ライバル同士が安全性を評価し合うとは、具体的に何をした?
ここが一番わかりやすい実例です。2025年8月27日、OpenAIとAnthropicが「史上初」とされる相互(クロスラボ)安全性評価の結果を、双方のブログで同時に公開しました。
対象はOpenAI側がGPT-4o、GPT-4.1、o3、o4-mini。Anthropic側がClaude Opus 4、Claude Sonnet 4です。興味深いのは手続きのほうで、評価のために双方が通常の外部安全策の一部をあえて緩めました。ふだんは入口でブロックされてしまう敵対的なシナリオでも、モデルが実際にどう振る舞うかを直接見るためです。健康診断でいえば、痛み止めを切ってから患部を診るようなものです。
何を測り、何がわかったのか
評価項目は、スキーミング(欺瞞的な計画立案=目的のために意図を隠して行動する振る舞い)、指示追従性、幻覚(ハルシネーション=事実でないことをもっともらしく述べる現象)、そしてジェイルブレイク耐性(安全上の制限を外そうとする細工にどれだけ持ちこたえるか)などです。順位を競うテストではなく、各社が自社モデルだけを見ていては気づきにくい弱点を、相手の目で洗い出す設計でした。
| 観測された項目 | 結果 |
|---|---|
| スキーミング率(全モデル平均) | 25%未満 |
| スキーミング率のばらつき | 推論モデルが最高値と最低値の両方を記録 |
| システムプロンプト抽出への耐性 | Claude 4モデル群がOpenAIのo3をわずかに上回る |
| 極端な迎合(sycophancy) | GPT-4.1とClaude Opus 4の両方で観測 |
| 誤用テストバッテリーへの脆弱性 | GPT-4o・GPT-4.1が最も脆弱 |
OpenAI・Anthropicの公表データをもとに作成
上の表で目を引くのは、スキーミング率のばらつきです。推論モデルという同じくくりの中に最高値と最低値の両方があり、「推論できるモデルほど安全」とも「危険」とも言えないことがわかります。システムプロンプト抽出(開発者が設定した指示文を引き出す攻撃)への耐性も、差はわずかでした。
注目したいのは、どちらも自社モデルの弱点が公表された点です。自社評価だけでは出にくい結果が出る。これが相互評価の値打ちで、標準団体の構想もこの延長線上にあります。
規制側はどう動いている?
企業側の自主的な動きと並行して、法制度も進んでいます。欧州委員会は2025年7月10日に「General-Purpose AI Code of Practice(汎用AI行動規範)」を公表しました。透明性・著作権・安全性とセキュリティの3章構成です。
EU AI Actの第53条・第55条は2025年8月2日に適用が始まり、汎用AI(GPAI)の執行義務は2026年8月2日から本格発動します。事業者はそれまでに行動規範を採用するか、同等の遵守を証明する必要があります。
10^25 FLOPS(モデルの学習に投じた計算量の単位)を超えるフロンティアモデルの提供者には、追加の要件がかかります。独立したリスク監督を伴う正式なガバナンス体制を築くこと、そして展開前・大型更新後・定期的に、資格を持つ独立した外部評価者による厳格なテストを実施することです。違反時の制裁金は世界売上高の最大3%。行動規範への署名と遵守は、執行の際の情状酌量要素として考慮されうるとされています。
ハサビス案の「リリース30日前の審査」と、EUの「展開前の外部評価」は、発想がよく似ています。企業の自主提案と規制の要求が、同じ方向に寄ってきているわけです。
協調しても防ぎきれない限界はどこにある?
最大の障害は独禁法(反トラスト法)です。AI各社が安全性のために協力したい領域——モデル評価、テストプロトコル、技術標準——は、そのまま企業間の競争条件に影響します。協力すればするほど、競争上の独立性を損なうリスクが出てくる。
特に厳しいのが開発ペースの話です。企業が個別に開発を遅らせるのは自由ですが、競合同士が製品リリースの出力や速度を制限する正式な合意を結ぶと、シャーマン反トラスト法上の違法な「出力制限」と解釈されうる。たとえ目的がAI安全性であってもです。アモデイ氏の提案の2段階目、共通の閾値に合意するという部分が、まさにここに触れます。
制度側も過渡期にあります。米司法省(DOJ)と連邦取引委員会(FTC)は2024年末に、2000年策定の「競合者間協調に関する独禁法ガイドライン」を撤回しました。その後、両者は指針を更新すべきかどうかを問う共同の公開質問を開始しています。つまり、企業が従うべき明確な線引きが今は存在しない。OpenAI自身も、AI安全協調が独禁法と衝突しうる可能性を米議会に指摘しています。
そもそも競争が「安全性の底辺への競争(race to the bottom)」を生んでいるという指摘があります。開発速度を優先するために責任ある開発への投資を絞ることが、各社にとって個別最適になりうる構造です。安全性を理由とした離職や内部告発も相次いでいるとされます。
また、アモデイ氏の提案そのものにも批判があります。同氏は暴走したAIエージェントの群れが半年以内にインターネットを乗っ取りかねないと警告しましたが、一部からは「規制による囲い込み(regulatory capture=既存企業が自分に有利なルールをつくり新規参入を締め出すこと)」ではないかとの声が出ています。先行する企業が基準を決める側に回れば、後発の参入障壁になりうるためです。
この状況を、私たちはどう読めばいい?
ニュースを見るときの判断の目安を3つ挙げます。
- 提案なのか合意なのか。エッセイやスピーチでの提案と、署名された合意はまったく別物です。2026年9月15日時点の3社の動きは前者にとどまります。
- 自主なのか義務なのか。FMFやハサビス案の初期段階は自主参加です。EU AI Actは法的義務。守らなかったときに何が起きるかが違います。
- 誰が評価するのか。自社評価か、相互評価か、独立した第三者か。2025年8月の相互評価が注目されたのは、この軸が一段動いたからです。
仕事でAIを使う立場からすると、この協調の行方は「使っているモデルがどこまで検証されているか」に直結します。EU AI Actの執行義務が2026年8月2日から本格発動した以上、提供元がどの枠組みに従っているかは、今後もっと見えやすくなっていくはずです。
急いで何かを判断する必要はありません。ただ、「合意した」と「協議している」を区別して読む習慣だけは持っておくと、この分野の情報に振り回されずに済みます。
よくある質問
OpenAI・Anthropic・GoogleはAI安全対策で正式に合意したのですか?
2026年9月15日時点で、拘束力のある正式な合意は発表されていません。Google DeepMindのハサビス氏が2026年7月14日に標準団体を提案し、Anthropicのアモデイ氏が2026年9月12日に開発ペースの調整を提案した段階で、3社は非公式に協議を続けているとされる報道にとどまります。
Frontier Model Forumとは何ですか?
Frontier Model Forumは2023年にOpenAI・Anthropic・Google・Microsoftが共同設立した産業非営利団体で、現在のメンバーはAmazon・Anthropic・Google・Meta・Microsoft・OpenAIの6社です。生物兵器リスク・サイバーリスク・核リスク・AI Security・安全フレームワークの標準化を主なワークストリームとしています。
AI企業同士が安全性で協力すると、なぜ独禁法の問題になるのですか?
モデル評価やテストプロトコル、技術標準は企業間の競争条件に直接影響するためです。特に競合同士が製品リリースの出力や速度を制限する正式な合意を結ぶと、目的が安全性であってもシャーマン反トラスト法上の違法な出力制限と解釈されうるとされています。
EU AI Actの汎用AI規制はいつから本格的に効きますか?
EU AI Actの第53条・第55条は2025年8月2日に適用開始となり、汎用AI(GPAI)の執行義務は2026年8月2日から本格発動します。違反時の制裁金は世界売上高の最大3%で、2025年7月10日公表の汎用AI行動規範への署名・遵守は執行における情状酌量要素として考慮されうるとされています。
※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。