いろは堂AI ← 戻る

Google I/O 2026とは?「働くAI」への転換で変わること

2026年5月21日|いろは堂AI編集部
Google I/O 2026 基調講演メインビジュアル(Sundar Pichai)

画像出典: Google (blog.google)

この記事の要点
Google I/O 2026(2026年5月19〜20日開催)の中心は、Gemini 3.5 Flash・Gemini Omni・Gemini Sparkの3つでした。Sundar Pichai CEOは基調講演で「答えるAIから、自律的にタスクをこなすエージェント型AIへの転換」を明言し、「the agentic Gemini era」という言葉を使っています。要するに、質問に答えるAIから、依頼を受けて自分で手を動かすAIへ主役が移った、という発表でした。
😮‍💨
Google I/Oで何か大きい発表があったのは知ってるけど、モデル名が多すぎて何がどう違うのか全然わからない……

Google I/O 2026は、2026年5月19日〜20日にカリフォルニア州マウンテンビューのShoreline Amphitheatreで開催されました。基調講演は19日午前10時(太平洋時間)にSundar Pichai CEOが登壇して始まっています。

発表の数は多いのですが、押さえるべき軸は1本です。Pichaiは冒頭で「答えるAIから、自律的にタスクをこなすエージェント型AIへの転換」を明言し、「the agentic Gemini era(エージェント型Geminiの時代)」というフレーズを使いました。ここでいうエージェント型AIとは、質問に答えて終わりではなく、依頼された作業そのものを自分で進めるAIのことです。

正直なところ、モデル名を一つずつ暗記する必要はありません。3つのモデルが「その転換のどの部分を担うのか」だけ掴めば、発表全体の地図が頭に入ります。

Google I/O 2026で発表された主役は?

今回の発表で中心になったのは、次の3つです。役割がきれいに分かれているので、まずここだけ押さえてください。

押さえるべき3つ
  • Gemini 3.5 Flash — 速くて安い、エージェントを動かすためのエンジン(発表と同日に提供開始)
  • Gemini Omni — あらゆる入力からあらゆる出力を作る新しい生成モデル(まず動画から)
  • Gemini Spark — 24時間365日稼働する個人向けAIエージェント

さらに、シリーズ最高性能のGemini 3.5 Proも予告されました。I/O時点では内部テスト段階で、Googleは「来月(2026年6月)中にロールアウト予定」と述べています。最も高度な推論・コーディング・エージェント型リサーチ向けという位置付けですが、具体的な公開日やベンチマークの詳細は発表時点では示されていません。

🤔
3.5 Flashが「速い」って、どのくらい速いんだろう

Gemini 3.5 Flashは何がすごいのか?

数字で見ると、速度と価格の両方が同時に動いています。Pichaiは基調講演で、Gemini 3.5 Flashが「他の最先端モデルと比較して約4倍高速」だと明言しました。しかも、旧フラッグシップだったGemini 3.1 Proを、コーディングやエージェント系のベンチマークで上回る性能を持つとされています。

価格は同等モデルの50%未満。Googleの試算では、年間1兆トークンを処理する企業が処理の80%を3.5 Flashへ移した場合、年間10億ドルのコスト削減が可能とされています。

この「速い・安い・賢い」の同時達成が、なぜエージェントの話につながるのか。理由はシンプルです。エージェントは1回答えて終わりではなく、考える・調べる・実行する・確かめる、を何十回も繰り返します。1回のやり取りが遅くて高いモデルでは、その往復に耐えられません。速度と単価は、エージェントを実用にするための前提条件なのです。

Googleが3.5 Flashを「フロンティア級の知能」と「行動(エージェント実行)」を組み合わせた最初のモデルと位置付けているのも、この文脈です。提供は2026年5月19日の発表と同日に始まり、Googleのエージェント開発環境であるGoogle Antigravity、Gemini API、Google AI Studio、Android Studioで利用できます。

Gemini Omniの「any-to-any」とは何を指す?

Gemini Omniは、Googleにとって初の「あらゆる入力からあらゆる出力」を生成するany-to-anyモデルとして発表されました。any-to-anyとは、テキスト・画像・音声・動画といった種類の壁を越えて、入力の形式にも出力の形式にも縛られない、という意味です。

ここで技術的に効いているのは、処理のしかたです。従来よく採られてきたのは、入力の種類ごとに担当を振り分け、別々のステップで処理して最後につなぐ方式でした。Omniは全メディアタイプを単一のコアエンジンで同時に処理する、ネイティブ・マルチモーダル設計を採っています。絵と音と言葉を別々の担当者に渡して後で会議するのではなく、最初から一人が全部を見ている状態に近い、と考えるとイメージしやすいはずです。

第一弾の「Gemini Omni Flash」は、2026年5月19日からAI Plus/Pro/UltraのサブスクライバーにGeminiアプリとGoogle Flowで提供が始まりました。YouTube ShortsとYouTube Createでは無料で使えます。まず動画出力から始まり、後に画像・テキストへも広げる予定とされています。

1クリップの長さ最大10秒
編集方法複数ターンの自然言語による指示
一貫性キャラクターの見た目・声を維持
世界の理解物理法則・シーン・動作の一貫性
来歴表示生成物すべてにSynthID電子透かし

Googleの公表データをもとに作成

上の表で地味に重要なのが最後の行です。SynthIDはGoogleがAI生成物に埋め込む電子透かしで、後から「これはAIが作ったもの」と判別するための仕組みです。累計で1000億枚の画像・動画と、6万年分相当の音声に付与されており、新たにOpenAI、Kakao、Eleven Labsがパートナーとして採用しています。生成能力を上げるほど来歴の記録が要る、という判断がここに表れています。

Gemini Sparkは今までのアシスタントと何が違う?

😲
24時間動くAIって、寝てる間も何かしてくれるってこと?

Gemini Sparkは「24時間365日稼働する個人向けAIエージェント」として発表されました。チャット画面を開いている間だけ動くのではなく、Google Cloud上の専用仮想マシンで常時稼働します。土台になっているのは、Gemini 3.5と、先ほど触れたエージェント開発環境のAntigravityです。

使い方で象徴的なのがGmail統合です。Spark専用のメールアドレスにメールを送ることで、タスクを依頼できます。「チャット欄に質問を打ち込む」ではなく「同僚に仕事をメールで振る」という形になっているのが、今回の転換をいちばんよく表しています。

外部との接続にはModel Context Protocol(MCP)が使われています。MCPはAIと外部サービスをつなぐための共通の作法で、これに対応していることでGoogle製品以外のサービスとも連携できます。

  1. 依頼するGmailから専用アドレスへタスクを送る
  2. 実行するChrome統合で、アパート内見の予約や航空券情報の自動入力といったWebタスクを代行(この夏後半に提供予定と発表)
  3. 見守るAndroidの新しい通知レイヤー「Android Halo」で、エージェントの進捗をリアルタイム表示(Android 17と共に年内提供予定と発表)

提供の順番は段階的です。発表週に信頼できるテスターへ先行提供され、翌週から米国のGoogle AI Ultraサブスクライバー向けにベータ提供が始まる、と案内されました。

今すぐ全員が使えるわけではありません

Sparkは米国のGoogle AI Ultra向けベータからのスタートで、ChromeやAndroid Haloの機能は発表時点では「予定」です。Gemini 3.5 Proも6月の予告のみで、リリース日は明言されていません。今わかっているのは「Googleが何を作ろうとしているか」であって、「日本の自分の環境で今日から何ができるか」ではない、という線引きは持っておいたほうが誤解がありません。

「答えるAI」から「働くAI」への転換はどこで測れる?

宣言だけなら誰でもできます。この転換が言葉倒れでないかは、Googleが講演で示した数字の伸び方を見るとつかめます。

時点Geminiのトークン処理量(月間)
2024年5月9.7兆トークン
2025年5月480兆トークン
2026年5月3.2クアドリリオン(京)トークン

Googleの公表データをもとに作成

トークンとは、AIが文章や画像を処理するときの最小の単位です。上の表は前年比で約7倍の伸びを示していますが、注目したいのは伸び幅そのものより、利用者の増え方に対して処理量の増え方が明らかに大きいことです。Geminiアプリの月間ユーザー数は2025年の約4億人規模から2026年に9億人規模へと拡大していますが、こちらは倍程度の伸びにとどまります。

人の増え方より処理量の増え方が大きいということは、一人あたりが投げる処理が重くなっている、つまり「一問一答」ではなく「一度の依頼で何十回も考えて動く」使われ方が増えている、と読めます。エージェント化は理念ではなく、すでに負荷の形として現れているわけです。

「答えるAI」側の規模も参考になります。Search内の「AI Overviews」は月間アクティブ25億人、「AI Mode」は開始から1年で月間アクティブ10億人に達しました。画像生成モデルNano Bananaでの累計生成数は500億画像です。答えるAIが縮んだのではなく、その上に働くAIが積み上がった、という構図です。

この転換を支えている裏側は?

エージェントが増えるほど、必要になるのは計算資源です。Googleのインフラ投資(資本支出)は、2022年の310億ドルから2026年には1800〜1900億ドル規模へ、およそ6倍に拡大しています。

ハードウェア側では、AI処理に特化した自社チップであるTPUの新世代が示されました。新TPU「TPU 8t」は前世代比で3倍の計算能力、「TPU 8i」は2倍の電力効率改善とされています。

ここまで来ると、Gemini 3.5 Flashの「約4倍高速・価格50%未満」という数字の意味が変わって見えてきます。あれは単なるスペック自慢ではなく、エージェントが何十回も往復しても採算が合う水準まで単価を下げにいった、という設計判断だったわけです。開発者側の利用も月間850万人、APIは毎分190億トークンを処理し、Google Cloudの顧客375社が年間1兆トークン以上を処理しています。

今の自分の使い方は変えたほうがいい?

🥺
結局、明日から何を意識しておけばいいんだろう

結論から言えば、慌てて何かを乗り換える必要はありません。日本で使える形になるまでには段階があります。ただ、頭の中の前提を一つだけ入れ替えておくと、次に来る変化に驚かずに済みます。

押さえておきたい3点
  • AIへの依頼が「質問する」から「作業を振る」へ移りつつある。指示の粒度も、質問文より仕事の依頼メールに近づく
  • 速度と単価はエージェントの前提条件。モデル選びで「速い・安い」を軽く見ない
  • 生成物が増えるほど来歴の確認が要る。SynthIDのような電子透かしの話題は今後増える

実際、指示の書き方は変わります。答えを求めるなら「〜とは何ですか」で十分でしたが、作業を振るなら、目的・完成の条件・使ってよい情報源・どこまで自分で判断してよいか、を最初に渡す必要があります。同僚に仕事を頼むときと同じです。この書き分けは、Sparkが日本で使えるようになる前から、手元のAIで練習できます。

Google I/O 2026を一言でまとめるなら、AIが「知っている人」から「動く人」に配置換えされた発表でした。知ってから、自分の仕事のどこを振れるか考えれば十分です。

よくある質問

Google I/O 2026はいつ開催されましたか?

Google I/O 2026は2026年5月19日から20日にかけて、カリフォルニア州マウンテンビューのShoreline Amphitheatreで開催されました。基調講演は5月19日午前10時(太平洋時間)にSundar Pichai CEOが登壇して始まりました。

Gemini 3.5 FlashとGemini 3.5 Proの違いは何ですか?

Gemini 3.5 Flashは速度と価格を重視したモデルで、2026年5月19日の発表と同日から提供が始まりました。他の最先端モデルと比較して約4倍高速で、価格は同等モデルの50%未満とされています。一方Gemini 3.5 Proはシリーズ最高性能モデルで、最も高度な推論・コーディング・エージェント型リサーチ向けです。I/O時点では内部テスト段階で、Googleは2026年6月中のロールアウト予定と述べています。

Gemini Sparkは日本でも使えますか?

発表時点では、まず信頼できるテスターへの先行提供が行われ、翌週から米国のGoogle AI Ultraサブスクライバー向けにベータ提供が始まると案内されました。Chromeとの統合は2026年夏の後半、Androidの通知レイヤー「Android Halo」はAndroid 17と共に年内の提供予定とされています。日本での提供時期は発表内容には含まれていません。

Gemini Omniの「any-to-any」とはどういう意味ですか?

any-to-anyとは、テキスト・画像・音声・動画といった入力の種類にも出力の種類にも縛られずに生成できる、という意味です。Gemini OmniはGoogleにとって初のany-to-anyモデルで、全メディアタイプを単一のコアエンジンで同時に処理するネイティブ・マルチモーダル設計を採っています。まず動画出力から提供が始まり、後に画像・テキストへ対応を広げる予定です。

※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。