いろは堂AI ← 戻る

Guided visionとは?カメラで状況を説明するしくみ

2026年9月12日|いろは堂AI編集部
屋外で1人が両手でカメラの液晶画面を操作する様子

画像出典: Sóc Năng Động / Pexels

この記事の要点
Googleは2026年9月1日、Gemini Liveの新機能「Guided vision(ガイド付きビジョン)」を発表しました。スマホのカメラをかざすと目の前の状況を音声で説明する機能で、カメラの向きが合っていないときは「左右にスキャンして」「中央に合わせて」と声で誘導し、映像と音声を往復させながら説明の精度を上げていく設計です。土台はGoogle DeepMindの研究プロジェクト「Project Astra」由来のリアルタイム視覚AIで、視覚と音声を同時に処理できる点が特徴です。
🤔
カメラを向けるだけで「これは何」って教えてくれるやつ、写真を1枚撮って解析してるのとは違うの?

写真を1枚撮ってAIに読ませる、という使い方はもう珍しくありません。レシートを撮る、看板を撮る、手書きメモを撮る。撮ってから答えが返るまでの間に、私たちは待ちます。

2026年9月1日にGoogleが発表したGuided vision(ガイド付きビジョン)は、その「撮る→待つ→答え」の形をしていません。カメラは向けたまま、AIは映像を見続け、うまく写っていなければ声で「そっちじゃなくて、もう少し左」と教えてくれる。会話の途中でこちらがスマホを動かすと、返ってくる説明も変わります。

正直なところ、この違いは使ってみないと伝わりにくいところです。ただ、なぜそういう形になったのかは、公開されているしくみの説明からかなり追えます。

Guided Visionとは? 2026年9月に何が発表されたのか

Googleは2026年9月1日、Android向けの機能アップデート「September Android Drop」の一部として、Gemini Liveの新機能Guided visionを発表しました。Gemini Liveは、カメラ映像や画面を共有しながらGeminiと音声で会話できる機能です。その上に、スマホのカメラをかざすと目の前にあるものの説明を音声で聞けるという機能が載りました。

Android公式サイトでの見出しは「Hear descriptions of what's in front of you(目の前にあるものの説明を聞く)」。Googleはこの機能を、視覚障害者・低視力者のコミュニティと共に設計した(designed for and with the blind and low-vision communities)と明言しています。誰か向けに作った、ではなく、共に作った、という書き方です。

スマートフォンのカメラ画面。木製の棚に並んだ家型の陶器製スパイス容器が映り、画面中央に「Can you help me find the mustard powder?」という吹き出しが表示されている
Guided Visionの機能紹介に掲載された画面(出典: Google

上の画面では、棚にDILL(ディル)、BAY(ローリエ)、CLOVE(クローブ)といったラベルの容器がずらりと並んでいて、そこに「マスタードパウダーを見つけるのを手伝ってくれる?」という問いかけが重なっています。棚の前に立ってひとつずつラベルを確かめる作業を、カメラ越しの会話で代わりにやってもらう。そういう場面です。

Googleが挙げている利用シーンは具体的です。食品ラベルの細かい文字を読む照明が暗いレストランでメニューを読む見慣れない家庭用品を識別する。どれも「目の前にある」「文字か形を確かめたい」「その場で答えが欲しい」という条件が揃っています。

なぜ「音声で誘導する」設計になっているのか?

ここがGuided Visionの名前の由来であり、しくみとして一番おもしろいところです。Guided(ガイド付き)という語は、AIが説明を返すことではなく、AIがユーザーのカメラの向け方を導くことを指しています。

😲
AIが人間に「カメラをこう動かして」って言ってくるの?

カメラの向きが適切でないとき — 知りたい対象が枠に入っていない、端に切れている — Guided Visionは音声で具体的な指示を出します。報じられている内容では、カメラの向き(フレーミング)を直すよう伝える、空間を左右にパン(スキャン)するよう伝える、対象物を画面の中央に合わせるよう伝える、といった誘導です。

この設計が必要になる理由は、画面が見えない状態でカメラを構える難しさを考えると腑に落ちます。ファインダーを見られない人にとって、カメラを正しく向けることは、それ自体がひとつの難題です。棚のどのあたりを写せているのか、対象が枠に収まっているのか、手元では判断できません。ここでAIが「もう少し右にスキャンして」と返せるなら、目で確かめる代わりを声が果たします。

「撮って解析」と「見ながら会話」はどこが違うのか

写真を1枚撮って解析する方式では、うまく写っていなかったとき、やり直すかどうかの判断は人間側にあります。写真が失敗していることに気づけなければ、AIは写っているものについて答えるだけです。

対してGuided Visionは、カメラ映像から音声フィードバックが出て、ユーザーがカメラを動かし、その新しい映像をまた解析する、という往復のループを回します。1回の解析の精度を上げるのではなく、何往復かする前提で、少しずつ狙いを合わせていく。一発で当てる設計ではなく、二人がかりで合わせていく設計だと考えると近いはずです。

ループを構成する4つの要素
  • カメラ映像がリアルタイムで送られる
  • Geminiが映像を解析し、説明または誘導を音声で返す
  • ユーザーがその声を聞いてカメラを動かす
  • 変わった映像をふたたび解析する(以下くり返し)

土台になっている技術は何か? Project Astraとの関係

Guided Visionはゼロから作られた機能ではなく、既存のGemini Liveの上に構築されています。そしてGemini Liveのカメラ共有・リアルタイム視覚理解の基盤技術は、Google DeepMindの研究プロジェクトProject Astraに由来します。

Project Astraは、Google DeepMindが「ユニバーサルなAIアシスタントの実現に向けた研究プロトタイプ」と説明しているもので、視覚と音声の情報を同時にリアルタイムで処理できることを特徴として挙げています。研究段階で示されていた「見ながら話す」という体験が、Gemini Liveという製品を経由して、Guided Visionという具体的な用途に落ちてきた、という系譜です。

Gemini LiveのAndroid版については、カメラ映像を共有しながら会話でき、スマホを動かして視点を変えると、それに応じてGeminiが提示する情報がリアルタイムに更新されると説明されています。複数の角度から対象を理解できる設計です。Guided Visionの「左右にスキャンして」という誘導が成立するのは、この「動かすと更新される」性質が土台にあるからです。

また、Gemini Liveは会話中に地図・天気カード・写真といった視覚情報をリアルタイムで表示することもできます。音声だけ、画面だけ、ではなく、両方のアウトプットを組み合わせる設計になっています。

リアルタイムに「見ながら話す」を成り立たせる一般的なしくみ

ここからは、Guided Vision固有の内部仕様ではなく、Gemini Live系のリアルタイムAPIについて開発者向けに公開されている一般的なしくみの話です。Guided Visionがこの通りに動いていると断定できる公式情報はないので、「こういう作りならリアルタイムの会話が成立する」という背景知識として読んでください。

まず接続の形です。Gemini Live系のマルチモーダルAPI(音声・映像など複数の種類の入力を扱うAPI)は、WebSocket(一度つないだら切らずに双方向でデータを流し続けられる通信方式)を使ったステートフルな接続として説明されています。音声チャンクと映像フレーム(JPEG)を継続的に送り続け、サーバー側は音声・テキスト・ツール呼び出しを非同期に返します。

従来型のパイプラインと何が違うのか

音声で対話するAIの作り方として長く一般的だったのは、音声認識 → LLMで推論 → 音声合成を順につなぐ方式です。工程がバトンリレーになっているぶん、それぞれの待ち時間が積み上がります。

Gemini Live系のアプローチは、モダリティ(音声・映像といった情報の種類)をネイティブに橋渡しすることで、このチェーンを都度たどらずに済ませる設計だと説明されています。「見る」と「聞く」がほぼ同時に処理されるため、遅延が抑えられるとされています。カメラを動かしている最中に「そう、そこです」と返ってくるには、この速さが要ります。

映像は毎秒何枚あれば足りるのか

意外に思われるところですが、映像入力は毎秒1〜2フレーム程度で十分に文脈理解ができるとされています。動画として滑らかに見せる用途なら毎秒30フレームが要りますが、AIが「何が写っているか」を掴むだけなら、ぱらぱらと届く静止画で足ります。

これは帯域とトークンコストを抑えるための設計でもあります。映像をフルフレームで送り続ければ通信量も処理量も跳ね上がりますが、理解に必要なのは1秒に1〜2枚。削れるところを削って、応答の速さに回しているという見方ができます。

ここは公式に明記されていません

Guided Visionが実際に何フレーム毎秒で映像を解析しているのか、Project Astraのどのモデルを直接使っているのかといった機能固有の技術詳細は、2026年9月時点のGoogle公式発表には書かれていません。この章の内容はGemini Live API全般の公開情報であり、Guided Visionに一対一で対応するものではありません。

使うには何が必要か? 対応環境と有効化の方法

発表時点(2026年9月1日)でのステータスは「まもなく展開(coming soon)」で、即時に全世界へ行き渡るものではありません。Geminiが利用できる国から順次の展開とされています。

白背景に黒い太字で「Android Drop」と2行で書かれたタイトル画像。周囲にGoogleのGロゴ、青い吹き出しのメッセージアイコン、虹色の四芒星のGeminiアイコン、円形のGoogleフォトのようなアイコンが淡いにじみとともに配置されている
2026年9月のAndroid新機能をまとめた公式発表のヘッダー(出典: Google

Android Dropは、Androidの新機能をまとめて届ける定期アップデートの枠組みです。Guided Visionはこの9月分に含まれるかたちで発表されました。

対応OSAndroid 9以降
発表日2026年9月1日(September Android Drop の一部)
提供状況発表時点で「まもなく展開」。Gemini利用可能な国から順次
土台となる機能Gemini Live(カメラ・画面共有によるリアルタイム対話)

Googleの公表データをもとに作成

有効化の方法は3通りが案内されています。

  1. アクセシビリティのショートカットに追加する端末のアクセシビリティ設定からショートカットとして登録しておく方法です。
  2. TalkBackメニューから起動するTalkBack(Androidの画面読み上げ機能)のメニュー経由で呼び出します。
  3. Geminiアプリの設定から有効化するGeminiアプリ側の設定で機能をオンにします。

3通り用意されているのは、普段どの入り口を使っているかが人によって違うためだと読めます。TalkBackを常用している人はTalkBackのメニューから、そうでない人はGeminiアプリから。機能に人を合わせるのではなく、すでにある習慣の側に入り口を置くという置き方です。

視覚障害のない人にも関係があるのはなぜか?

Guided Visionは視覚障害者・低視力者コミュニティと共に設計された機能ですが、公式が挙げる利用シーンを眺めると、条件が重なる場面は誰にでもあります。照明が暗いレストランでメニューを読むのは、老眼が進んだ人にも、単に店が暗い日にも起きることです。食品ラベルの細かい文字も同じです。

さらに、しくみの側から見ると「AIが人間に操作を指示する」という往復の形そのものが、今後ほかの用途に広がりうる部品です。AIが持っている情報だけで答えを出すのではなく、足りない情報を取りに行くよう人間に頼む。機器の故障箇所を見てもらう、書類の一部を写してもらう。入力が足りないときに黙って推測せず、取り直しを依頼する、という振る舞いは応用の幅が広いはずです。

期待しすぎないほうがいいところ

カメラを向けて説明が返るとはいえ、返ってくるのはAIの読み取り結果です。薬の判別や、誤ると危険が伴う判断を、この説明だけに委ねるのは避けたほうが無難です。また、外出先でカメラを共有しながら会話する使い方は、周囲の人や書類が映り込む可能性があります。何を写しているかを意識しておくのは、これまでのカメラアプリと同じです。

なお、Guided Visionをユーザー側でオフにできるようにする、という趣旨の報道が2026年7月に出ていますが、これはリークや噂に基づく二次情報で、Googleの公式発表ではありません。現時点では未確認の話として扱うのが正確です。

Guided Visionから読み取れる、視覚AIの現在地

この機能が示しているのは、モデルの賢さが上がったという話だけではありません。AIが一度で正解を出せない前提を、体験の設計に組み込んだという点が新しいところです。

カメラが対象を捉えられていないなら、AIは推測で答えを埋めるのではなく、「左右にスキャンしてください」と返す。この一言は、AIが自分の入力の不足を認識し、それを人間に伝えられているということです。ハルシネーション(もっともらしい嘘を返してしまう現象)への対処として、モデルの精度を上げる方向とは別に、足りないものを足りないと言える設計という道筋があることを、この機能は具体的な形で見せています。

視覚と音声を同時に処理できるところまでは、Project Astraが研究として示してきました。そこから先、その速さを何に使うかを決めたのが今回の発表だと言えます。目の前の棚から瓶をひとつ探す、という日常の一場面に降りてきたことのほうが、技術そのものよりも大きい変化かもしれません。

よくある質問

Guided Visionはいつ発表され、どの端末で使えますか?

Googleが2026年9月1日にSeptember Android Dropの一部として発表した、Gemini Liveの新機能です。対応OSはAndroid 9以降で、発表時点では「まもなく展開」というステータスでした。Geminiが利用可能な国から順次の展開とされています。

Guided Visionは写真を撮ってAIに解析させるのと何が違いますか?

写真を撮る方式は1枚の画像で完結しますが、Guided Visionはカメラ映像と音声フィードバックを往復させ続けます。対象がうまく写っていない場合、AIが「左右にスキャンする」「中央に合わせる」といった指示を音声で返し、ユーザーがカメラを動かした結果をふたたび解析して、説明の精度を上げていく設計です。

Guided Visionはどんな場面で使えますか?

Googleが挙げている例は、食品ラベルの細かい文字を読む、照明が暗いレストランでメニューを読む、見慣れない家庭用品を識別する、の3つです。いずれも目の前にある物の文字や形をその場で確かめたい場面にあたります。

Guided Visionの技術的な土台は何ですか?

既存のGemini Live(カメラや画面を共有しながら音声で対話する機能)の上に構築されています。Gemini Liveのリアルタイム視覚理解の基盤技術は、Google DeepMindの研究プロジェクトProject Astraに由来し、視覚と音声の情報を同時にリアルタイムで処理できる点が特徴とされています。ただしGuided Vision固有の内部仕様は2026年9月時点で公式に明記されていません。

※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。