いろは堂AI ← 戻る

GPT-5.5のハルシネーションとは?ゼロにできない理由

2026年5月13日|いろは堂AI編集部
スマートフォンでChatGPTアプリを操作している様子

画像出典: 写真: Jernej Furman from Slovenia(CC BY 2.0 / Wikimedia Commons)

この記事の要点
2026年5月5日、ChatGPTのデフォルトモデルがGPT-5.5 Instantに切り替わり、ハルシネーション(AIが事実でないことを事実のように書く現象)の低減がうたわれました。ただし公表された改善は「頻度が下がった」という話で、OpenAI自身の研究論文は、現在の学習と評価のしくみが続くかぎり誤りの断言は数学的に避けられないと結論づけています。減らす技術はあっても、ゼロにする技術は2026年5月時点で存在しません。
😟
新しいモデルで「ハルシネーションが減った」って見たけど、結局なにがどう減ったの?もう嘘つかないってこと?

AIが事実でないことを、まるで事実のように言い切ってしまう現象をハルシネーションと呼びます。存在しない書籍名を挙げる、実在しない条文を引用する、URLをそれらしく作ってしまう——使ったことがある人なら、一度は出くわしているはずです。

新しいモデルが出るたびに「ハルシネーションが減りました」という言葉が並びます。正直なところ、この言葉はかなり曖昧です。何を測って、どの条件で、どれだけ減ったのか——そこを見ないと、読者にとって意味のある改善なのか判断できません。

そして、もっと大事な話があります。減らす方法はあっても、ゼロにする方法は今のところ見つかっていません。それは技術者の手抜きではなく、AIの学習のしかたそのものから来ています。

GPT-5.5 Instantとは?何が変わったのか

GPT-5.5 Instantは、2026年5月5日にOpenAIがリリースしたChatGPTの新しいデフォルトモデルです。それまでデフォルトだったGPT-5.3 Instantを置き換える形で導入されました。開発者向けにはAPIで「chat-latest」として提供され、有料ユーザーはGPT-5.3を今後3か月間はオプションとして選べます。

提供の順番は、まずPlus/Proユーザーのweb版から。モバイルは追って展開、Free/Go/Business/Enterprise向けにも順次広がる予定と発表されています。

OpenAIの発表では「smarter, clearer, and more personalized(より賢く、より明確に、より個別化された)」と表現され、より温かく自然なトーンで、より簡潔な回答を返す方向に調整されたとしています。過去の会話・ファイル・Gmailを参照して個別化した回答を返す機能も加わりました。

数字で示された変化は次のとおりです。

ベンチマークGPT-5.3 InstantGPT-5.5 Instant
AIME 2025(数学)65.4点81.2点
MMMU-Pro(画像も含む推論)69.2点76点

TechCrunchの報道をもとに作成

数学とマルチモーダル推論(文章だけでなく画像なども合わせて考える力)の点数は、はっきり上がっています。ここは素直に進歩です。問題は、話題をさらった「ハルシネーション低減」のほうです。

「ハルシネーション◯%減」は何を測った数字なのか

😲
半分くらい減ったって見出しで読んだ気がする

報道の見出しでは「医療・法律・金融など高リスク分野のプロンプトで、GPT-5.3 Instant比52.5%少ないハルシネーション主張」という数値が広く引用されました。ただし独立検証を行ったWire Blogの記事によると、OpenAI自身のシステムカードには、そうした見出し向けの大きな削減率は載っていません

システムカードが実際に開示している指標は、次の2つです。

システムカードが示した2つの数値
  • 過去モデルでユーザーが「事実誤りを含む」とフラグを立てた匿名化ChatGPT会話を再評価したところ、個々の主張(claim)が事実として正しい割合が23%向上
  • 同じ会話群で、応答全体に事実誤りが含まれる割合が3%減少

この2つは、まったく別のものを数えています。1つ目は「文の中の一つひとつの言い分」を単位にした改善で、2つ目は「回答まるごと1本に誤りが1つでも混じっているか」を単位にした改善です。細かい主張の正確さは上がっても、回答1本を丸ごと信用できる確率はほとんど動いていない——同じデータが、そう読めるということです。

逆方向の報告もあります。引用(citation)の正確性に着目した独自ベンチマークでは、GPT-5.5が主要フラッグシップモデルの中で最悪の結果だったとするSubstackの検証記事があります。同記事はまた、ハルシネーションを罰する設計のAA-Omniscienceというベンチマークで、GPT-5.5(xhigh設定)の「誤答のうち、わからないと答えずに事実をでっち上げた割合」が86%に達したとも報告しています。これは全体の誤り率ではなく、間違えたときに黙るか言い切るかの内訳である点に注意してください。

見出し数値の読み方で気をつけたいこと

「ハルシネーション◯%減」は、どの分野のプロンプト集合を使ったか、主張単位で数えたか応答単位で数えたかによって、まったく違う数字になります。同じモデルについて「23%向上」「3%減少」「52.5%減」が並び立つのはそのためです。数値そのものより、何を測ったかを先に見るのが確実です。

なぜAIは「わかりません」と言わずに断言するのか

ここからが本題です。ハルシネーションは、コードのバグでも学習不足でもありません。OpenAIのAdam Tauman Kalai、Edwin Zhang、Ofir Nachumと、ジョージア工科大学のSantosh S. Vempalaによる論文「Why Language Models Hallucinate」(2025年9月4日公開)は、現在の標準的な学習・評価のやり方そのものが誤りの断言を生むと結論づけました。実装の不具合ではなく、数学的に避けられない現象だという主張です。

理由は大きく2段階に分かれます。

1段階目:事前学習は「真偽」を学んでいない

大規模言語モデルの事前学習は、大量の文章を読み込んで「次に来る言葉」を当てられるようにする作業です。目的は、学習データの分布をどれだけ正確に再現できるか(尤度の最大化)であって、書かれていることが真実かどうかの検証ではありません。

つまりモデルが身につけているのは、真実らしさではなく「もっともらしさ」です。「〇〇法第12条によれば」という言い回しが世の中に大量にあれば、モデルは第12条の中身を確かめずにその形の文を作れてしまいます。文章として自然であることと、内容が正しいことは、学習の目的の中で区別されていないのです。

2段階目:採点方法が「言い切ったほうが得」にしている

🤔
わからないときは黙るように教えればいいだけでは?

「わからないときは黙る」という振る舞いを阻んでいるのが、モデルを評価する採点方法です。多くのベンチマークでは、「わからない」と答えても不正解と同じ0点になります。すると当てずっぽうでも言い切ったほうが期待できる点数は高くなる。試験で空欄にするより、とりあえず何か書いたほうが得になる構図と同じです。

論文によれば、GPQA、MMLU-Pro、SWE-benchなど主要10種のベンチマークのうち9種が、正直に「わからない」と認めるより自信満々な誤答を評価上優遇していました。常に言い切ることが、モデルにとっての最適戦略になってしまっているわけです。

この論文はさらに、生成時の誤り率が、対応する二値分類問題(その文が本物か偽物かを見分けるタスク)の誤分類率の少なくとも2倍から補正項を引いた値以上になることを証明しています。噛みくだくと、「本物か偽物かの判別が難しい領域ほど、文章生成でのでっち上げも原理的に増える」ということです。判別できないものを、生成だけ正確にすることはできません。

なぜゼロにできないのか

論文は、ハルシネーションを生む数学的な要因を3つ挙げています。

  1. 認識論的不確実性学習データに稀にしか出てこない事実ほど誤りやすい。マイナーな人名・地名・条文番号が危ないのはこのためです。
  2. アーキテクチャ的な限界モデルの構造そのものから来る制約で、データを増やしても消えません。
  3. 計算量的に困難な問題暗号論的に解読困難な問題のように、原理的に解けない問いが存在します。

興味深いのは、難しい専門知識だけの話ではないという点です。論文の関連報道では、「DEEPSEEKという単語にDは何個あるか」という単純な問いに対し、DeepSeek-V3が10回の試行で「2」「3」から最大「6」「7」まで答えをばらつかせた例が紹介されています。文字を数えるだけの作業でも、自信満々に違う答えを返す——これがもっともらしさで動く仕組みの正体です。

参考までに、2025年時点の評価では、OpenAIのo1推論モデルのハルシネーション率は16%、o3モデルは33%、o4-miniモデルは48%と報じられています(いずれも当時の過去モデルの数値で、GPT-5.5 Instantのものではありません)。推論を重ねるモデルなら安全、という単純な話でもないことがわかります。

論文が示す緩和策と、その重さ

ではどうするか。論文が提案するのは、事後学習(post-training)の採点基準を変えることです。「わからない」を0点(中立)、誤った断言をマイナス点として明示的に評価すれば、モデルは断言せずに保留する振る舞いを学習できます。

ただし論文は、良い評価指標を1つ追加するだけでは効果が薄いとも指摘しています。既存の数百に及ぶ精度重視の評価基準——正直な「わからない」より自信満々な誤答を高く評価してしまうもの——を、全面的に置き換える必要があるからです。業界全体の採点表を書き換える話なので、一社の努力で片づく規模ではありません。

ここまでを踏まえると、GPT-5.5 Instantのような新モデルの「ハルシネーション低減」が何をしたのかも見えてきます。事前学習・事後学習・評価基準のどこかを改善して頻度を下げているのであって、未知の事実について断言してしまう可能性そのものを消す技術は、2026年5月時点で存在しません。

この原理を知ったうえで、どう使えばいいのか

「ゼロにならない」は、使うなという意味ではありません。誤りが出やすい条件がはっきりしている以上、そこだけ手当てすれば実用上は十分に付き合えます。

誤りが出やすいのはこういう質問
  • 固有名詞の細部を聞くとき(条文番号、判例名、書籍のページ、論文のタイトル)
  • ネットにほとんど情報がない事柄(社内制度、地方の小さな店、マイナーな型番)
  • URLや出典を「挙げて」と頼んだとき(形式だけ整った偽物が生まれやすい)
  • 数字を数えさせるとき(件数、文字数、集計)

逆に、文章の言い換え・要約・構成の相談・下書きづくりのように、正解が外部世界にない仕事では、この種の誤りはほとんど問題になりません。ハルシネーションは「事実を取り出させたとき」に出る現象だからです。

実際の質問のしかたも、少し変えるだけで効きます。

  1. 断言させない聞き方にする「わからない場合はわからないと答えてください」と一文添える。採点基準の問題を、その場のプロンプトで少しだけ打ち消す形です。
  2. 出典はAIに作らせず、自分で当たる「その情報が載っている資料の探し方」を聞き、実際のURLや条文は公式サイトで確認する。
  3. 数える作業は道具に渡す件数や文字数はエクセルやエディタの機能で数える。AIには「どう数えるか」を相談する。
  4. 同じ問いを2回聞く答えがぶれるなら、モデルがその事実を持っていないサインです。DEEPSEEKのDの個数がばらついた例と同じ見分け方が使えます。
それでも向いていない使い方があります

医療・法律・税務など、誤りがそのまま損害になる領域で、AIの回答を最終判断の根拠にするのは避けたほうが確実です。GPT-5.5 Instantの改善が高リスク分野を対象に語られたのは、裏を返せばその領域がいまも弱点だからです。下調べや論点の整理に使い、結論は一次資料か専門家で裏を取る——この線引きは、モデルが新しくなっても当面変わりません。

ハルシネーションを「AIの欠陥」と捉えると、次のモデルを待つしかなくなります。「もっともらしさを学んだ仕組みの、当然の帰結」と捉えれば、どこで信じてどこで確かめるかを自分で決められます。原理を知ることが、そのまま使いこなしになるタイプの話です。

よくある質問

GPT-5.5 Instantとは何ですか?

GPT-5.5 Instantは、2026年5月5日にOpenAIがリリースしたChatGPTの新しいデフォルトモデルです。それまでのGPT-5.3 Instantを置き換える形で導入され、開発者向けにはAPIで「chat-latest」として提供されています。AIME 2025(数学)で81.2点、MMMU-Pro(マルチモーダル推論)で76点と、旧モデルの65.4点・69.2点から向上しました。

ハルシネーションとは何ですか?

ハルシネーションとは、AIが事実でないことを事実であるかのように出力する現象です。存在しない書籍や条文を挙げる、それらしいURLを作ってしまうといった形で現れます。AIは文章の「もっともらしさ」を学習しており、内容が真実かどうかを検証する仕組みを内蔵していないために起こります。

AIのハルシネーションはいつかゼロになりますか?

2026年5月時点で、ハルシネーションをゼロにする技術は存在しません。OpenAIの論文「Why Language Models Hallucinate」(2025年9月公開)は、現在の学習方法と評価方法が続くかぎり誤りの断言は数学的に避けられないと結論づけています。新モデルの「ハルシネーション低減」は頻度を下げる改善であり、可能性そのものを消すものではありません。

AIが嘘をついているかどうかを見分ける方法はありますか?

同じ質問を2回して答えがぶれるかを確かめる方法が有効です。モデルがその事実を持っていない場合、回答が試行ごとにばらつきます。加えて、固有名詞の細部・URL・出典・数の集計はAIの回答をそのまま信じず、公式サイトなどの一次資料で確認するのが確実です。

※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。