いろは堂AI ← 戻る

Gemini 3.7 Flashが半額の理由、蒸留とは?

2026年8月17日|いろは堂AI編集部
Gemini 3.7 Flash 発表メインビジュアル

画像出典: Google

この記事の要点
Gemini 3.7 Flashは2026年8月14日に公開され、API料金は入力100万トークンあたり0.75ドル・出力3.75ドルと前世代の半額になりました。軽量モデルが安く速いのは性能を雑にしたからではなく、大きなモデルの判断の傾向を小さなモデルへ写し取る「蒸留」という学習方法によるものです。同じ処理を大量に繰り返す作業ではFlash系、一発勝負の複雑な検討ではPro系、という分け方が実用的な基準になります。
😟
AIのモデル選択画面に「Flash」とか「Pro」とか並んでるけど、安い方って手抜き版ってこと?

モデル名に付く「Flash」「mini」「Lite」といった呼び名は、安くて速い方を指しています。ただ、その安さは「性能を削った分だけ安い」という単純な引き算ではありません。作り方そのものが違うのです。

正直なところ、ここを知らないまま高い方だけを使い続けると、月々の請求だけが膨らみます。逆に安い方だけで済ませると、肝心なところで答えが浅くなる。2026年8月14日に公開されたGemini 3.7 Flashを題材に、軽量モデルの中身と、どちらを選ぶかの線引きを見ていきます。

Gemini 3.7 Flashは何が変わったのか?

Googleは2026年8月14日、Gemini 3.7 Flashを発表しました。前世代の3.6 Flashからわずか3週間での後継リリースで、「コーディングおよびエージェント向けの最も高性能な主力モデル」と位置付けられています。個人ユーザーが試す経路として公式に案内されているのは、通常のGeminiチャットではなく、Geminiアプリのパーソナルエージェント「Spark」経由です。

数字を見る前に、何を測っているのかを先に置いておきます。ベンチマークはAIの総合的な賢さを測る万能テストではなく、それぞれ決まった種類の問題を解かせて正解率を出しているだけのものです。ここで出てくる4つは、おおまかに次のものを測っています。

  • FrontierCode 1.1 Main / DeepSWE v1.1… 実際のソフトウェア開発課題を解かせて、動くコードになったかを測る試験
  • ウェブ開発 Eloスコア… 生成されたウェブ画面同士を比較して勝ち負けをつけ、将棋の段位のように相対的な強さを数値化したもの
  • GDP.pdf… 複雑な体裁の文書を読み取らせて、正しく解釈できたかを測る試験
試験Gemini 3.7 FlashGemini 3.6 Flash
FrontierCode 1.1 Main43.6%34.4%
DeepSWE v1.165.3%49.0%
ウェブ開発 Elo15881538
GDP.pdf34.0%22.0%

Google公式ブログの公表データをもとに作成

上の表で注目したいのは、順位や「何位になった」ではなく伸びの偏り方です。ウェブ開発Eloは1538から1588と控えめですが、DeepSWEは49.0%から65.3%へ大きく動いています。同じ「軽量モデルの更新」でも、開発作業と文書処理に重心が置かれた改良だったことが読み取れます。自分の使い道がここに含まれていなければ、体感はさほど変わらない可能性もあるわけです。

軽量モデルはなぜ安く速いのか?

🤔
小さいってことは、覚えてる量が少ないってこと?

モデルの「大きさ」は、内部で調整されている数値の個数(パラメータ数)で表されます。この数が多いほど計算量が増え、1回の応答を作るのに時間も電気代もかかる。API料金が高くなるのも、応答が遅くなるのも、突き詰めればここです。

だから小さくしたい。ただ、単に小さいモデルをゼロから学習させると、当然ながら判断が粗くなります。そこで使われるのが知識蒸留(distillation)という学習方法です。

蒸留は、すでに完成している大規模なモデルを「教師」に立てて、小さなモデルを「生徒」として学ばせます。ポイントは、生徒に見せるのが正解そのものではなく、教師モデルが答えを出すときの迷い方まで含んだ出力(確率分布)だというところです。

たとえば写真を見て動物名を答える課題で、正解ラベルだけを渡すと「これは猫」としか学べません。教師の出力を渡すと「猫が8割、山猫が1割5分、犬が数パーセント」という判断の傾き方ごと写せます。正解の暗記ではなく、判断の癖を継承するのが蒸留です。人に例えるなら、模範解答だけを配られるのと、熟練者が迷った箇所や消去した選択肢まで見せてもらうのとの違いに近い。

蒸留で得られるもの
  • 少ないパラメータ数で、教師モデルに近い判断傾向を再現できる
  • 計算量が減るので1回の応答が速くなる(レイテンシの短縮)
  • 提供側の計算コストが下がるため、API料金を安く設定しやすい
  • スマホやIoT機器のような演算性能の限られた環境にも載せやすい

Gemini 3.7 Flashの2026年内の導入価格は、入力100万トークンあたり0.75ドル、出力100万トークンあたり3.75ドル。前世代3.6 Flashのちょうど半額です。ここまでの話でいえば、これは値引きキャンペーンというより、動かすのに必要な計算そのものが軽くなった結果と見るのが自然でしょう。

料金は据え置きではありません

この0.75ドル/3.75ドルは2026年内の導入価格として案内されているもので、2027年1月1日以降は入力1.50ドル・出力7.50ドルへ変更が予定されています。長期の費用を見積もるときは、値上げ後の金額で計算しておくほうが安全です。

それでもPro系が必要な場面は?

🤩
じゃあ全部Flashでいいのでは?

蒸留された生徒モデルは教師に「近い」のであって、同一ではありません。各種の解説記事で共通して指摘されているのは、Flash系のような軽量・高速モデルは、何段階も推論を積み重ねる複雑な思考や、長文全体を通した厳密な一貫性の保持でPro系に劣る場面があるという点です。

これは直感的にも納得できます。判断の癖は写せても、大量のパラメータがあってはじめて保てる細かい区別までは、小さな器に全部は入りません。短い応答では差が出にくく、思考の連鎖が長くなるほど差が開いていく。

  1. 処理の回数を数える同じ形式の処理を何十回・何百回も回すなら、1回あたりの単価と速度が効いてきます。ここはFlash系の土俵です。
  2. 失敗のコストを見る後工程で人が確認するなら軽量モデルで十分。そのまま外へ出る文章や、判断がそのまま結論になる場面はPro系を検討します。
  3. 思考の段数を見る「調べて、比べて、条件で分岐して、まとめる」のように段が重なる依頼ほどPro系が有利です。
  4. 両方で同じ依頼を試す実際の自分の仕事の依頼文で1度ずつ投げて、差が読み取れるかを見る。差が分からなければ安い方でよい、というのが最も確実な判断です。

Gemini 3.7 Flashが「エージェント向けの主力」と位置付けられているのも、この線引きの延長にあります。エージェント的な使い方——AIが道具を呼び出し、結果を見てまた次を呼ぶ、という繰り返し——では、1回の呼び出しが何十回にも積み上がる。1回あたりの速度と単価が、全体の使い勝手をそのまま決めてしまう領域なので、軽量モデルの改良がそのまま効いてくるわけです。

モデル選びで見るべき数字はどれか?

新モデルの発表を追っていると、ベンチマークの数値がいちばん目立ちます。ただ実務でモデルを決めるとき、本当に効いてくる数字は別のところにあります。

発表を見るときのチェック順
  • その試験が何を測っているか(自分の用途と重なるか)
  • 入力・出力それぞれの単価と、価格が期間限定かどうか
  • 前世代からどの項目が伸びたか(全体ではなく偏りを見る)
  • 自分が使える経路で提供されているか(アプリ経由かAPIか)

Gemini 3.7 Flashでいえば、コーディングと複雑文書の処理が伸びた一方でウェブ開発Eloの伸びは控えめでした。この偏りを見ずに「新しいから全部よくなった」と受け取ると、期待した用途で変化を感じられずに終わります。

そしてもうひとつ。軽量モデルの改良は、高性能モデルの値下がりよりも影響が大きいことがあります。普段の作業の多くは、要約・分類・下書き・整形といった定型に近い処理です。ここが半額で速くなるということは、これまで手作業に残していた処理をAIに回す採算が合うようになる、ということでもあります。

😌
高い方が偉い、じゃないんだね

モデル選びは性能の順位付けではなく、処理の性質に器を合わせる作業です。蒸留のしくみを知っておくと、「安い=手抜き」という思い込みが外れて、選択肢がひとつ増えます。次にモデル選択画面を開いたら、まず自分の依頼が「何段の思考を必要とするか」を数えてみてください。それだけで、だいたいの答えは出ます。

よくある質問

知識蒸留とは何ですか?

知識蒸留は、大規模な「教師モデル」の出力である確率分布(ソフトラベル)を学習信号として使い、小規模な「生徒モデル」に模倣させる技術です。正解ラベルだけでなく教師モデルの判断の傾き方ごと学ぶため、生徒モデルははるかに少ないパラメータ数で教師に近い判断傾向を再現できます。

Gemini 3.7 FlashのAPI料金はいくらですか?

2026年内の導入価格は入力100万トークンあたり0.75ドル、出力100万トークンあたり3.75ドルで、前世代のGemini 3.6 Flashの半額です。2027年1月1日以降は入力1.50ドル・出力7.50ドルへの変更が予定されています。

軽量モデルと大規模モデルはどう使い分ければよいですか?

同じ形式の処理を大量に繰り返す作業や、AIが道具を繰り返し呼び出すエージェント的な使い方では、1回あたりの速度と単価が効くため軽量モデルが向きます。一方、何段階も推論を積み重ねる複雑な検討や、長文全体で厳密な一貫性が求められる場面では大規模モデルのほうが有利とされています。

Gemini 3.7 Flashは個人でも使えますか?

使えます。個人ユーザー向けの利用経路として公式に案内されているのは、通常のGeminiチャットではなく、GeminiアプリのパーソナルAIエージェント「Spark」経由です。開発用途ではAPIから利用できます。

※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。