AIになぜGPUが必要?NVIDIA売上92%増の理由
画像出典: panumas nikhomkhai / Pexels
AIの計算の中心は行列のかけ算で、その結果の各要素は互いに独立して計算できます。だから数千の単純なコアを並べたGPUが向いていて、少数の高性能コアで順番に処理するCPUでは追いつきません。NVIDIAが毎週話題になるのは、この計算需要がそのまま同社のデータセンター向け売上(FY2027第1四半期で752億ドル、前年同期比92%増)に表れているためです。
AIとGPU(画像処理向けに発展した並列計算チップ)は、計算のかたちが一致しているから結びついています。AIが内部でやっている計算は、ほとんどが行列のかけ算です。そして行列のかけ算は、答えを一気に手分けして出せる形をしています。手分けが得意な部品がGPUで、その最大手がNVIDIA——それが毎週ニュースが流れる理由の出発点です。
ここでは、CPUとGPUの構造の違いから始めて、なぜAIの計算だけがここまでGPUを欲しがるのか、そして半導体の製造工程までがこの輪の中に入っている話まで順にたどります。
CPUとGPUは何が違うのか?
まず前提をそろえます。CPUもGPUも「計算する部品」という点では同じで、違うのはコア(計算を担当する回路の単位)の数と性格です。
CPUは少数の高性能なコアを持ち、順番に処理していく仕事(シーケンシャル処理)に最適化されています。対してGPUは、数千個の単純なコアを並べ、同時に大量の計算をこなす仕事(並列ワークロード)に最適化されています。この対比は学術論文でも技術解説でも一致して説明されている、基本の設計思想の差です。
- CPU=少数精鋭の熟練職人。難しい判断を含む工程を、順番に、賢くこなす
- GPU=大量の作業員。一人ひとりの仕事は単純だが、同じ作業を何千人で一斉にやれる
大事なのは、どちらが優れているかではなく、仕事の形がどちらに合っているかだという点です。書類を1枚ずつ順に判断していく仕事に作業員を1000人集めても意味がありません。逆に、同じ計算を100万回繰り返すだけの仕事なら、熟練職人が一人で頑張るより作業員1000人のほうが圧倒的に速く終わります。
なぜAIの計算はGPU向きなのか?
ディープラーニングの計算の中心にあるのは、行列やテンソルのかけ算です。言葉が難しく見えますが、やっていることは「数字が並んだ表どうしをかけ合わせて、新しい表を作る」ことです。文章も画像も、AIの内部では数字の並びに変換されて、この表のかけ算を何億回も通過していきます。
ここが決定的なポイントです。行列のかけ算では、答えの表の各マスが、他のマスの計算結果を待たずに独立して計算できます。1行1列目のマスを計算している最中に、5行8列目のマスを別の担当者が計算しても、まったく問題が起きない。だから大規模な並列実行ができます。
NVIDIAのGPUを動かすCUDA(同社のGPU向けプログラミング環境)では、この性質をそのまま設計に落とし込み、1本のスレッド(計算の担当者1人)が結果の1要素の計算を担当する形が一般的です。数千の作業員が、それぞれ担当マスを1つずつ持って一斉に手を動かす——AIの計算がGPUに乗る理由は、この一点に集約されます。
ただし「計算が速い」だけでは足りない
並列にできるからといって、素朴に書けば速くなるわけではありません。各スレッドが計算のたびにグローバルメモリ(GPU全体で共有する大きなメモリ)から元データを取り直すと、待ち時間ばかりが増えてメモリバウンド——計算能力ではなくメモリの読み書き速度が上限になる状態——に陥ります。
GPU側にはこれをやわらげる仕組みがあります。スレッドは32本単位のwarpという束にまとめられ、warpスケジューラがある束のデータ待ちの間に別の束を走らせることで、待ち時間を隠します。さらに近年のNVIDIA GPUにはTensor Coreという、特定サイズの行列積だけを解くために作られた専用ユニットが載っており、通常のCUDAコアでの演算より高いスループットを出します。
つまりGPUは、汎用の並列計算機からさらに一歩進んで、AIがやりたい計算の形そのものに合わせて回路が作り替えられてきたのです。世代交代のニュースが繰り返し流れるのは、この作り替えが今も続いているからです。
世代が変わると何が増えているのか?
製品名だけを聞いてもピンときにくいので、公表されている値を並べて比べます。表に出てくるTFLOPSは、1秒間に何兆回の計算をこなせるかを表す単位で、数字が大きいほど計算そのものが速いことを意味します。もう一つのTB/sはメモリとの間でデータを運べる量(1秒あたり何テラバイトか)で、こちらは道の太さにあたります。BF16・FP16・FP8・FP4は、AIが扱う一つひとつの数値をどれだけ細かく表すかの形式(数値精度)で、後ろの数字はその数値に使うビット数です。桁数を減らすほど1回の計算は粗くなりますが、そのぶん速く大量にこなせます。HBM3・HBM3eはGPUに直結する高帯域メモリ(HBM)の規格名で、eが付くHBM3eが後から出た改良版です。同じ世代の中での変化と、世代をまたいだ変化を見ると、開発の力点がどこにあるかが読み取れます。
| 項目 | H100 (Hopper) | H200 (Hopper) | B200 (Blackwell) |
|---|---|---|---|
| 演算性能(BF16/FP16) | 1,979 TFLOPS | 1,979 TFLOPS(H100と同等) | 非公表(本調査では未確認) |
| 演算性能(FP8) | 3,958 TFLOPS | 3,958 TFLOPS(H100と同等) | 非公表(本調査では未確認) |
| メモリ容量 | 80GB HBM3 | 141GB HBM3e | 非公表(本調査では未確認) |
| メモリ帯域 | 3.35 TB/s | 4.8 TB/s | ダイ間リンク10TB/s(参考値) |
| トランジスタ数 | 非公表(本調査では未確認) | 非公表(本調査では未確認) | 208億(デュアルダイ構成) |
| 製造プロセス | TSMC N4 | TSMC N4 | TSMC N4P(N4比+6%性能) |
E2E Networks(H100/H200)、IEEE Spectrum・Modal(B200)の公表データをもとに作成
H100とH200の比較が示唆的です。演算性能の数値は同じで、変わったのはメモリ容量(80GB→141GB)と帯域(3.35TB/s→4.8TB/s)だけ。実質「メモリのみのアップグレード」と表現される世代です。先ほどのメモリバウンドの話を思い出すと理由が見えてきます。計算する力を増やしても、データを運ぶ道が細ければ作業員は手待ちになる。だから道を広げるほうに投資した、という順序です。
Blackwell世代のB200になると、作りそのものが変わります。約1,600平方ミリメートルのプロセッサを2基つなげたデュアルダイ構成で、トランジスタ数は208億。2つのダイの間は10TB/sのリンクで結ばれています。製造はTSMCのN4P(4nmクラス)プロセスで、Hopper世代で使われたN4比で6%の性能向上とされています。
B200の演算性能やメモリ容量として出回っている数字のうち、一次資料で確認できなかったものは上の表で「非公表」としています。「H100比で推論が最大30倍」といった比較値も、独立した情報源で裏づけが取れなかったため採用していません。世代比較の見出し数字は、出どころを確かめてから受け取るのが安全です。
1枚のGPUでは足りないのはなぜ?
大規模なAIモデルは、1枚のGPUのメモリに収まりません。そのため実際の学習現場では、たくさんのGPUをつないで1つの巨大な計算機として扱います。ここで効いてくるのが、GPU同士をどれだけ太い線で結べるかです。
NVIDIAのDGX GB200は、Grace CPU 36基とBlackwell GPU 72基を1ユニットとして構成し、第5世代NVLink(GPU同士を直接つなぐNVIDIA独自の高速な接続線)で最大576基のBlackwell GPUを接続できます。さらにQuantum InfiniBand(サーバーの箱をまたいで機器同士を結ぶ、同社のデータセンター向け高速ネットワーク)を使えば数万GPU規模まで広げられる設計です。GB200 Grace Blackwell Superchipを用いたDGX SuperPODは、FP4精度(先ほどの数値精度のうち最も粗い4ビットの形式)で11.5エクサフロップス(1秒間に1,150京回の計算に相当)のAI計算性能を発揮すると公式に発表されています。
ここまで来ると、話は「速いチップを買う」ではなく「建物ごと計算機を建てる」規模になります。AI企業の設備投資がニュースになり、電力の話まで一緒に語られるのは、この段階の買い物をしているからです。
半導体の製造工程にまでGPUが入っているとは?
もう一段、輪がつながっている話をします。GPUを作るための半導体製造そのものが、GPUで高速化されています。
NVIDIAはTSMC・ASML・Synopsysと提携し、cuLithoという計算リソグラフィー(半導体を焼き付けるためのフォトマスク設計を計算で最適化する工程)向けのソフトウェアライブラリを、製造工程に統合しました。NVIDIA公式ブログによれば、同一のcuLithoワークロードにおいて350台のH100 Tensor Core GPUが、4万台のCPUシステムに匹敵する処理能力を持つとされています(2023年3月21日のNVIDIA Newsroom発表では、500台のDGX H100システムが4万台のCPUシステムに相当という表現も併存しており、システム構成の違いによる差と見られます)。
並列にできる計算はGPUが圧倒的に速い——という最初の原理が、AIの学習だけでなく、チップを作る側の計算にもそのまま当てはまっているわけです。
- AI:行列演算の塊なので、並列計算の力をいくらでも欲しがる
- GPU:その並列計算を担う。NVIDIAが設計し、TSMCが5nm/4nmクラスの最先端プロセスで製造する
- メモリ・製造:高帯域メモリ(HBM)はSK Hynixが市場シェア50%超を持つとされ、製造工程の計算最適化にはGPU自身が使われている
なぜ毎週ニュースになるのか?
ここまでの仕組みが、そのまま数字に出ています。NVIDIAの決算のうち、AI向けGPUが含まれるデータセンター部門の推移を見ると、需要の勢いがわかります。
| 会計期間 | 発表日 | 総売上高 | データセンター部門売上高 | データセンター前年同期比 |
|---|---|---|---|---|
| FY2026 Q4(2026年1月25日締め) | 2026-02-25 | 681億ドル(前年比73%増) | 623億ドル | +75% |
| FY2026 通期 | 2026-02-25 | 2,159億ドル(前年比65%増) | 1,937億ドル | +68% |
| FY2027 Q1(2026年4月26日締め) | 2026-05-20 | 816億ドル(前年比85%増) | 752億ドル | +92% |
NVIDIA公式ニュースルームの公表データをもとに作成
注目したいのは伸び率の向きです。FY2026通期のデータセンター部門は前年比68%増でしたが、FY2027第1四半期は前年同期比92%増。成長が鈍るどころか加速していることが公表値から読み取れます。1社の四半期売上が800億ドルを超え、その大半をAI向けの計算機が占めている——この規模になれば、株式市場も産業界も毎週追いかけます。
ニュースを読むときの見どころ
- どの層の話かを見分けるチップ単体(H100/B200など)の話か、それをつないだシステム(DGX/NVLink)の話か、製造プロセス(TSMC・HBM)の話か。同じ「NVIDIA」でも層が違えば意味が違います。
- 性能値は「何の性能か」を確かめる計算の速さ(TFLOPS)とデータを運ぶ量(TB/s)は別物です。H100→H200のように、演算は据え置きでメモリだけ強化される世代もあります。
- 倍率の出どころを追う「◯倍高速」は比較条件込みの数字です。何と比べて、どの作業で測ったのかが書かれていない倍率は保留しておきます。
- 需要側の話かを見る新チップの発表なのか、それを買う側(クラウド・AI企業)の投資の話なのか。後者はAIサービスの値段や供給に、より直接効いてきます。
並列にできない計算——前の結果を待たないと次に進めない処理——では、GPUの数千コアは活きません。AIの処理の中にも逐次的な部分はあり、そこはCPUが担います。また、素朴な実装ではメモリの読み書きが上限になり、カタログ上の演算性能を出しきれないこともあります。「GPUを積めば比例して速くなる」という理解は、実際にはかなり手前で頭打ちになります。
これを知っておくと何が変わるか
普段AIサービスを使う立場でも、この構造を知っていると腑に落ちることがいくつかあります。長い文章を扱う機能ほど料金が高いこと、高性能モデルに利用制限がかかること、新モデルの提供開始が地域ごとに時間差で進むこと——いずれも背後に、有限で高価な並列計算資源の配分という事情があります。
AIの「賢さ」は、アルゴリズムと同じくらい、それを回す計算機の物理に支えられています。毎週流れてくるNVIDIAのニュースは、遠い半導体業界の話ではなく、自分が使うAIの速さ・値段・使える量を決めている側の話だと考えると、読む意味が変わってきます。
よくある質問
AIの学習にCPUではなくGPUが使われるのはなぜですか?
ディープラーニングの計算の中心である行列積は、結果の各要素を互いに独立して計算できるため、大規模な並列実行に向いているからです。CPUは少数の高性能コアで順番に処理する設計、GPUは数千の単純なコアで同時並列に処理する設計であり、AIの計算はGPUの構造と一致します。
Tensor Coreとは何ですか?
NVIDIA GPUに搭載されている、特定サイズの行列積を解くことに特化した専用の演算ユニットです。汎用のCUDAコアで同じ計算を行うより高いスループットが得られるため、ディープラーニングの学習・推論で中心的な役割を果たします。
H100とH200は何が違うのですか?
演算性能は同等で、BF16/FP16(AIが扱う数値を16ビットで表す精度形式)で1,979 TFLOPS、FP8(同じく8ビットで表す形式)で3,958 TFLOPSです。TFLOPSは1秒間に何兆回計算できるかの単位を指します。違いはメモリ側にあり、H100が80GB HBM3・帯域3.35TB/sなのに対し、H200は141GB HBM3e・帯域4.8TB/sに増強されています。HBM3・HBM3eはGPUに直結する高帯域メモリの規格名で、HBM3eが後から出た改良版です。演算は据え置きのため「メモリのみのアップグレード」と説明される世代です。
GPUは半導体の製造にも使われているのですか?
使われています。NVIDIAはTSMC・ASML・Synopsysと提携し、フォトマスク設計を最適化する計算リソグラフィー向けライブラリcuLithoを製造工程に統合しました。NVIDIA公式ブログによれば、同一のcuLithoワークロードで350台のH100 GPUが4万台のCPUシステムに匹敵する処理能力を持つとされています。
※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。