いろは堂AI ← 戻る

マルチモーダルAIとは?画像も音声も扱える仕組み

2026年7月12日|いろは堂AI編集部
室内の机でノートPCの楽譜画面とオーディオ機器を操作する人物の手元写真

画像出典: https://kaboompics.com/ / Pexels

この記事の要点
マルチモーダルAIは、テキスト・画像・音声・動画といった異なる種類のデータを1つのモデルで処理できるAIです。中核にあるのは、それぞれの情報を専用のエンコーダで特徴量に変換し、モダリティの違いを超えた共通の表現(ベクトル)空間へ配置するという設計です。2021年にOpenAIが発表したCLIPは、画像とテキストを同じ埋め込み空間に置くことで、あらかじめ決めたカテゴリに縛られない認識を可能にしました。
🤔
写真を貼っても、声で話しかけても、同じAIがちゃんと答えてくれる。あれって内部で3つのAIが動いてるんですか?

写真を読むAI、音声を聞くAI、文章を書くAIが横並びで待機していて、入力に応じて切り替わっている——最初はそんな絵を思い浮かべる方が多いところです。実際の作りは少し違っていて、切り替えるのではなく、入ってきた情報を全部「同じ形」に直してしまうという発想でできています。

この「同じ形」が何なのかがわかると、マルチモーダルAIが得意なこと、そして苦手なこともかなり見通しよくなります。順番にたどっていきましょう。

マルチモーダルAIとは何か?

マルチモーダルAIとは、テキスト・画像・音声・動画など複数種類のデータを同時に処理・理解できるAIのことです。ここでいう「モダリティ(modality)」は情報の種類、つまり文字なのか、画像なのか、音なのかという入り口の違いを指します。マルチモーダルは「複数のモダリティ」という意味です。

従来のAIは、画像分類なら画像だけ、音声認識なら音声だけと、単一のデータ種を扱うのが基本でした。マルチモーダルAIでは、1つのモデルで複合的な処理が実現できます。写真を見せながら「これ、どこがおかしい?」と声で尋ねる、といった使い方が成立するのはこのためです。

ただ、ここで素朴な疑問が残ります。文字の並びと、ピクセルの集まりと、空気の振動の記録。この3つはデータとしての形がまったく違います。同じモデルがどうやってまとめて扱えるのでしょうか。

違う種類の情報を、どうやって1つのモデルで扱うのか?

答えは、入り口で全部を「同じ表現」に翻訳してしまうことにあります。処理は3つの段階に分かれています。

段階入力される形そこで起きること
① エンコード写真・音声波形・文章(バラバラの形式)専用エンコーダが特徴量を取り出す
② 共通表現空間へのマッピングモダリティごとの特徴量意味の近さが距離になる同じベクトル空間へ配置する
③ LLM処理・デコード共通空間上の座標LLMが演算し、答えを出力形式へ変換して返す

上の表の3段階を、それぞれもう少し細かく見ていきます。

  1. エンコード(特徴量の抽出)画像・音声・テキストそれぞれに専用の変換器(エンコーダ)を用意し、生のデータから特徴量を取り出します。画像からは物体・色・形状、音声からは単語・トーン・感情、テキストからは意味・文脈が抽出されます。
  2. 共通の表現空間へのマッピング取り出した特徴量を、モダリティ共通のベクトル空間へ配置します。ここが中核です。この時点で、元が写真だったか音声だったかという区別は「どこに置かれたか」という座標の情報に置き換わっています。
  3. LLMでの処理とデコードマッピングした特徴量をLLM(大規模言語モデル)に知識として与え、演算した結果を出力形式に変換(デコード)して返します。

要にあたるのは②です。「ベクトル空間」という言い方が硬いので、地図を思い浮かべてください。意味が近いものほど近い場所に置かれる、そういう地図です。犬の写真と「犬」という単語と、犬の鳴き声。入り口はバラバラでも、この地図の上ではほぼ同じ地点に落ちます。モデルから見れば、あとはその地点の座標を読むだけで、元が何形式だったかを気にする必要がありません。

共通表現空間がやっていること
  • 入力の形式(画像・音声・テキスト)の違いを、座標という共通の物差しに置き換える
  • 意味が近いものを近くに、遠いものを遠くに配置する
  • 異なるモダリティ同士の相関を学習によって獲得する

CLIPはどうやって画像と言葉を同じ空間に置いたのか?

この考え方を代表する事例が、2021年にOpenAIが発表したCLIP(Contrastive Language-Image Pretraining)です。画像とテキストを同じ埋め込み(意味)空間にマッピングするモデルで、あらかじめ決めた固定カテゴリに縛られない点が、それまでのImageNetベースのモデルと決定的に違いました。

😲
カテゴリに縛られないって、どういうことですか?

従来の画像分類モデルは「この1000種類のどれか」という前提で作られていました。学習時に決めた選択肢の外にあるものは、原理的に答えられません。CLIPは画像とテキストを同じ地図の上に置くので、判定したい概念を「言葉で書けば」その場で照合できます。学習時に想定していなかった分類でも、テキスト側を書き換えるだけで対応できるわけです。

対照学習という訓練のしかた

CLIPのベースにあるのは対照学習(Contrastive Learning)という手法です。やっていることは案外シンプルで、正のペア(同じ意味の画像とテキスト)のベクトルを近づけ、負のペア(異なる意味の画像とテキスト)のベクトルを遠ざけるよう、ひたすら調整していきます。

「近づける/遠ざける」を膨大な回数繰り返した結果として、モダリティに依存しない意味表現空間ができあがる。正解ラベルを人が付けるのではなく、正しい組み合わせと間違った組み合わせを見比べさせることで地図の形を決めているところが、この手法の要点です。

学習に使われたのは、インターネットから集めた画像とテキストの40億ペアからなるデータセットです。この規模で訓練された結果、CLIPは多くの下流タスクでゼロショット性能(そのタスク専用の追加学習なしで解く能力)を発揮しました。

音声はどう組み込まれているのか?

画像とテキストの話をしてきましたが、音声も同じ枠組みで扱われます。

GPT-4oは、音声・画像・テキストをリアルタイムで処理できるマルチモーダル拡張モデルです。設計上の特徴は、大規模Transformerモデル(文章生成AIの土台になっている、入力全体の関係性をまとめて捉える方式の巨大なモデル)に音声波形を直接入力してテキストへ変換する点にあります。GPT-4o Transcribeシリーズは多彩で高品質な音声データによる大規模事前学習を経ており、100以上の言語・多様な話者の話し方に対応する音声認識能力を持ちます。

ここが従来型との分かれ目です。以前の構成では「音声認識ソフトが文字に起こす → その文字を言語モデルに渡す」という二段構えが一般的でした。この作りだと、文字に起こした時点でトーンや言いよどみといった音声にしかなかった情報が捨てられます。波形を直接受け取る設計なら、その情報を落とさずに先へ渡せます。

同様にGemini 2.5 Proも、テキスト・画像・音声・動画など多様な情報形式を統合的に処理でき、推論能力とコーディング性能に優れるモデルとして位置づけられています。

🤩
言い方のニュアンスまで届いてるから、あの会話っぽい応答になるんですね

音声対話(リアルタイム音声)は、カスタマーサポートや会議アシスタント機能といった投資対効果の高い応用例として挙げられています。人が声で伝えている情報のうち、文字起こしで抜け落ちる部分が大きい領域ほど、この設計の効き目が出やすいということです。

実務ではどんな使い方につながるのか?

仕組みがわかると、どこで効くかも読めてきます。ポイントは「複数の形式の情報を突き合わせないと結論が出ない場面」です。

複数形式の突き合わせが効く例
  • 商品レビュー分析:テキストだけでなく、投稿された画像や音声も同時に解析し、顧客の感情・評価をより詳細に把握する
  • 医療分野:診療記録(テキスト)とX線画像を同時に分析し、より精度の高い診断を目指す取り組みがある
  • カスタマーサポート・会議アシスタント:リアルタイムの音声対話をそのまま処理する

逆に言えば、扱う情報がテキストだけで完結する作業では、マルチモーダルであること自体は効きません。「片方の形式だけを見ていると判断を誤る」仕事かどうか——これが導入を検討するときの実用的な線引きになります。レビューの星の数と本文だけ見て良評価だと思っていたら、添付写真には傷が写っていた。そういう食い違いが起きる領域が候補です。

この仕組みの限界はどこにあるのか?

共通表現に「揃える」ことの副作用

異なる情報を同じ空間に置き直すというのは、裏を返せば元の形式が持っていた細部を、意味の座標へ要約しているということです。要約である以上、こぼれるものがあります。図面の寸法線のような、意味としては近くても数値として厳密さが要る情報は、意味が近い別の値と近い位置に落ちうる——それが取り違えとして現れます。

また、共通空間は学習データにあった組み合わせから作られています。CLIPが40億ペアという規模で訓練されているのも、地図の空白を減らすためです。学習時に見ていない種類の組み合わせでは、置かれる位置の信頼性が下がります。

もうひとつ、判断の根拠が追いにくいという性質もあります。画像側の何を見てその答えになったのかは、座標という中間表現に埋もれていて外からは見えません。正確さが要る場面では、AIの読み取り結果を元データと突き合わせて確認する工程を残しておくのが安全です。

なお、複数種類のデータを1つのモデルで扱えること自体は、精度の保証とは別の話です。「画像も読める」と「画像を正しく読める」の間には距離があります。ここを混同しないでおくと、期待外れを避けられます。

押さえておきたい3つの要点

マルチモーダルAIの核心
  • 共通表現空間:各モダリティを専用エンコーダで特徴量に変換し、意味の近さが距離になる同じベクトル空間へ配置する
  • 対照学習:正しい組み合わせを近づけ、誤った組み合わせを遠ざけることで、モダリティに依存しない地図を作る(CLIP/2021年・OpenAI発表)
  • 直接入力の設計:GPT-4oのように音声波形を直接扱う構成では、文字起こしを挟む方式で失われる情報を保てる

「複数の形式を扱える」という説明の下にあるのは、形式の違いを座標の違いに置き換えるという一手でした。ここさえ掴んでおけば、新しいモデルが「動画にも対応」と発表されたときも、何が拡張されたのかを同じ枠組みで読めるはずです。

よくある質問

マルチモーダルAIとは何ですか?

マルチモーダルAIとは、テキスト・画像・音声・動画など複数種類のデータを同時に処理・理解できるAIのことです。従来のAIが単一のデータ種のみを扱っていたのに対し、1つのモデルで複合的な処理が実現できる点が特徴です。

違う種類のデータを1つのAIが扱える仕組みはどうなっていますか?

画像・音声・テキストといった各モダリティの特徴量をそれぞれのエンコーダで抽出し、共通の表現(ベクトル)空間へマッピングします。画像からは物体・色・形状、音声からは単語・トーン・感情、テキストからは意味・文脈が抽出され、共通空間の中で相関が学習されます。その特徴量をLLMに与え、演算結果を出力形式にデコードして返す流れです。

CLIPはどんなモデルですか?

CLIP(Contrastive Language-Image Pretraining)は2021年にOpenAIが発表した、画像とテキストを同じ埋め込み空間にマッピングするモデルです。対照学習をベースに、同じ意味の画像とテキストのベクトルを近づけ、異なる意味のペアを遠ざけることでモダリティに依存しない意味表現空間を構築します。インターネットから集めた画像とテキストの40億ペアで学習し、固定カテゴリに縛られないゼロショット性能を多くの下流タスクで発揮します。

音声を扱えるAIは文字起こしとどう違いますか?

GPT-4oは大規模Transformerモデルに音声波形を直接入力してテキストへ変換する設計を採っており、音声認識を別工程として挟む構成とは異なります。GPT-4o Transcribeシリーズは大規模な事前学習を経て、100以上の言語・多様な話者の話し方に対応する音声認識能力を持ちます。リアルタイム音声はカスタマーサポートや会議アシスタント機能などで投資対効果の高い応用例とされています。

※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。