いろは堂AI ← 戻る

GPT-5.6-Cyberとは?安全ガードを緩めた理由

2026年8月14日|いろは堂AI編集部
DeepSeekの起動画面が映るノートパソコンの画面

画像出典: Matheus Bertelli / Pexels

この記事の要点
GPT-5.6-Cyberは、エクスプロイト開発など攻撃にも使える依頼への拒否を意図的に減らし、高度なサイバー作業の完了率95.0%を達成したモデルです。安全性は「モデルが断ること」ではなく「使える人を審査で絞ること」で確保されており、一般公開はされていません。安全ガードの緩和とアクセス制限がセットになっている点が、この設計の核心です。
😟
AIの安全ガードを緩めたモデルが出たって聞いたけど、それって危なくないの?

「AIは危ないことを断るから安全」という理解は、これまでのモデルではおおむね正しいものでした。ところが2026年8月10日、OpenAIはあえて拒否を減らしたモデル「GPT-5.6-Cyber」を発表しています。脆弱性の発見や、その弱点を突く手順(エクスプロイト)の組み立てに特化した、セキュリティ専用のモデルです。

正直なところ、見出しだけを追うと「安全装置を外したAI」に見えます。ただ実際の設計を追うと、安全性の担保する場所がモデルの内側から外側へ移されているだけ、という構図が見えてきます。ここでは公表された数値と制度の中身から、そのしくみを読み解きます。

GPT-5.6-Cyberとは何が違うモデル?

GPT-5.6-Cyberは、GPT-5.6 Sol(GPT-5.6の内部コードネーム)をベースに、ゼロデイ脆弱性(開発元がまだ把握しておらず修正パッチが存在しない欠陥)の発見と、エクスプロイトチェーン(複数の弱点をつないで最終的な侵入まで到達させる手順)の構築へ向けて訓練されたモデルです。

変えられたのは能力だけではありません。エクスプロイト開発・認証バイパス・権限昇格といった、防御にも攻撃にも使える「デュアルユース」な依頼に対して、拒否率が意図的に引き下げられています。通常のモデルなら「お手伝いできません」で終わる依頼に、最後まで答えるということです。

🤔
そもそも普通のモデルは、こういう依頼をどのくらい断ってたの?

拒否率を下げると、性能はどれだけ変わるのか

OpenAIは、高度なサイバーセキュリティ要求をどれだけ完了できたかという指標で、モデル間の差を公表しています。この数字が測っているのは「正解率」ではなく依頼された作業を最後までやり切った割合で、途中で拒否した場合も未完了として扱われます。順位の高さそのものより、拒否がどれだけ結果を左右しているかを見る数字だと考えてください。

モデル / 提供経路高度なサイバー作業の完了率
GPT-5.6-Cyber95.0%
GPT-5.5-Cyber(前世代)57.3%
Daybreak Blue 経由2.0%
GPT-5.6 Sol(通常版)1.5%

The Hacker Newsの報道およびOpenAIの公表データをもとに作成

上の表で目を引くのは、通常版の1.5%という低さです。これは通常版が無能だという意味ではありません。エクスプロイト開発を含む依頼は、その入口でほぼ全て断られるため、実力を測る以前に作業が終わらないという状態を示しています。つまりこの差の大部分は、能力差ではなく拒否の有無から生まれています。

能力面でも変化はあります。既知の脆弱性を実際に動作するエクスプロイトへ変換できるかを評価する ExploitGym(2) というベンチマークで、GPT-5.6-Cyberはベースの GPT-5.6 Sol と前世代の GPT-5.5-Cyber をいずれも上回ったと報告されています。

実際に何を見つけたのか

成果として報告されているのは、ChromeのJavaScriptエンジンV8の脆弱性 CVE-2026-15903(CVSS 8.8。CVSSは脆弱性の深刻度を10点満点で表す共通指標で、8.8は「重大」に分類される水準です)をはじめとする、未文書化のバグの発見です。

報告されている発見の内訳
  • カーネル脆弱性 400件超
  • モバイルOS脆弱性 5件
  • 重大なデータベース脆弱性 3件
  • Chrome V8 の CVE-2026-15903(CVSS 8.8)

ここで押さえておきたいのは、これらが防御側の発見成果だという点です。脆弱性は見つけて報告されれば修正へ回りますが、見つけずに放置すれば攻撃者がいつか先に見つけます。拒否を減らす判断の背景には、この「先に見つける側を強くする」という発想があります。

ではなぜ悪用されないのか? Daybreakという二段構え

😲
断らないAIなんて、悪い人が使ったら一番強い武器になっちゃうんじゃ…

悪用の可否を分けているのは、モデルの側ではなく提供のしかたです。GPT-5.6-Cyberは一般公開されていません。ChatGPTの画面から呼び出すことも、通常のAPIキーで使うこともできません。

提供経路は「Daybreak」という審査付きプログラムに限られ、審査を通過した信頼できるパートナー企業だけが利用できます。Daybreakは2段階に分かれており、想定する用途と課される条件が異なります。

提供経路想定する用途と条件
Daybreak Blue防御寄りの用途向け。高度なサイバー作業の完了率は2.0%と、通常版に近い水準にとどまる
Daybreak RedPoCエクスプロイト開発、エクスプロイトチェーン検証、侵入テスト、レッドチーム演習など認可済みの高度業務向け。追加審査・本人確認強化・監視・アクセス制御・人的レビューが課される

OpenAIの公表情報をもとに作成

提携先としては、Accenture、Akamai、Cisco、Cloudflare、CrowdStrike、IBM、Capgemini、Cognizant、EY、KPMG、PwC、NCC Group、SpecterOps などが報じられています。いずれも顧客のシステムを預かって診断する立場の企業で、個人が申し込んで使う種類のものではありません。

安全性の置き場所が変わった、と考えるとわかりやすい

従来のモデルの安全設計は、誰でも使える代わりにモデル自身が危ない依頼を断る形でした。空港で言えば、全員が同じ検査ゲートを通る方式です。

GPT-5.6-Cyberは逆で、入れる人を先に絞り、入った後は道具を制限しない形になっています。空港の制限区域で作業する整備士が、事前の身元確認と入館証を条件に工具を持ち込めるのと同じ考え方です。工具そのものを鈍くするのではなく、持てる人を限定して安全を保つわけです。

この対比を押さえると、「安全ガードを緩めた=誰でも危険な出力を得られるようになった」という読み方が事実と違うことがはっきりします。緩んだのはモデル内部の拒否で、代わりに外側のアクセス制御が強化されています。

それでもリスクは残る(OpenAI自身が認めている点)

この設計で解消しないもの

OpenAIは公式に、安全ガードを緩和したモデルの運用が「悪用または意図せぬ誤動作の両面で、通常モデルの利用を超えるリスクを伴う」と述べています。設計で下げられたのは確率であって、ゼロではありません。

加えて、具体的な審査基準の詳細は公開されていません。誰が通るのかという境界線は外部から検証できないため、この安全設計はOpenAIの審査運用への信頼を前提にしています。ここは記事執筆時点で確認できない領域です。

もうひとつ、審査を通った組織の内部からの持ち出しや、認可された用途を超えた利用というリスクも構造的に残ります。だからこそ Daybreak Red には、審査だけでなく継続的な監視と人的レビューが組み合わされているわけです。入口の審査だけでは足りない、という前提に立った設計だと読めます。

一般の読者にとって、何が変わるのか

GPT-5.6-Cyberを自分で使う機会は、審査を通る組織に所属していない限りありません。それでも、この発表から持ち帰れる見方があります。

  1. 「AIが断るかどうか」で安全性を判断しない拒否の有無はモデルの設定次第で変わります。安全かどうかは、誰がどんな条件で使えるかという提供のしかたまで含めて見る必要があります。
  2. 攻撃側の能力も同じ速度で上がる前提で考える脆弱性発見の自動化が進むということは、修正が公開されてから攻撃が来るまでの時間も短くなるということです。パッチ適用を後回しにする余裕は以前より小さくなります。
  3. ベンチマークの数字は「何を測ったか」から読む95.0%と1.5%の差は、能力差ではなく拒否の有無が大部分でした。数字を見たら、まず測定対象を確認する癖をつけると誤読を避けられます。

安全ガードを緩めたモデルが登場したこと自体より、安全性をモデルの内側だけで担保する時代が終わりつつあることのほうが、長い目では大きな変化かもしれません。今後、用途を絞った高性能モデルが審査付きで提供される形は、他分野にも広がっていく可能性があります。

よくある質問

GPT-5.6-Cyberは個人でも使えますか?

使えません。GPT-5.6-CyberはOpenAIの「Daybreak」プログラムを通じて審査を通過した信頼できるパートナー企業にのみ提供されており、ChatGPTや通常のAPIから呼び出すことはできません。Accenture、Cisco、Cloudflare、CrowdStrike、IBMなど、顧客システムの診断を業務とする組織が提携先として報じられています。

完了率95.0%という数字は何を意味していますか?

高度なサイバーセキュリティ要求を最後までやり切った割合を指し、途中で依頼を拒否した場合は未完了として扱われます。通常版のGPT-5.6 Solは1.5%、前世代のGPT-5.5-Cyberは57.3%でした。通常版の低さは能力不足ではなく、エクスプロイト開発を含む依頼をほぼ拒否するために作業が完了しないことを示しています。

安全ガードを緩めたのに、なぜ危険が増えないと言えるのですか?

危険がゼロになったわけではありません。OpenAI自身が、緩和モデルの運用は悪用と意図せぬ誤動作の両面で通常モデルを超えるリスクを伴うと認めています。リスクを抑えているのはモデル内部の拒否ではなく、Daybreak Redにおける追加審査・本人確認強化・監視・アクセス制御・人的レビューという外側の制御です。

GPT-5.6-Cyberは実際にどんな脆弱性を見つけましたか?

ChromeのJavaScriptエンジンV8の脆弱性CVE-2026-15903(CVSS 8.8)をはじめ、カーネル脆弱性400件超、モバイルOS脆弱性5件、重大なデータベース脆弱性3件を特定したと報告されています。いずれも未文書化のバグを含み、防御側による発見成果として公表されたものです。

※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。