いろは堂AI ← 戻る

ローカルLLMとは?VRAM容量で決まる向き不向き

2026年7月9日|いろは堂AI編集部
NVidia G71 GPU

画像出典: 写真: Diego3336(CC BY 2.0 / Wikimedia Commons)

この記事の要点
ローカルLLMとは、LlamaやQwen、Gemmaなどの公開モデル(オープンウェイト)を、クラウドではなく自分のPCや社内サーバーで動かす方式のことです。動かせるかどうかを決めるのはGPUの演算性能より<strong>VRAM容量</strong>で、VRAM 6〜8GBなら7B〜9Bクラスの量子化モデル、24GBあれば27Bクラスまでが目安になります。最新の最高性能モデルをすぐ使いたいならクラウド型が有利ですが、通信を一切発生させずに機密情報を扱える点はローカルLLMだけの強みです。
🤔
AIを自分のPCで動かせるって聞いたけど、うちのパソコンで本当に動くの?そもそもクラウドのChatGPTと何が違うんだろう。

「AIを手元で動かす」と聞くと、まず引っかかるのは自分の機材で足りるのかという点です。そして次に、わざわざ手元で動かす意味があるのか。この2つがはっきりしないまま、なんとなく気になっている状態の人は多いと思います。

結論から言うと、判断の材料はかなりシンプルです。動くかどうかはGPUのVRAM容量ひとつでほぼ決まります。そして手元で動かす意味は「賢さ」ではなく「通信が発生しないこと」にあります。ここを押さえると、自分に必要かどうかが自分で判断できるようになります。

ローカルLLMとは何ですか?

ローカルLLMとは、大規模言語モデル(大量の文章を学習して文章を生成するAI)を、クラウドのサーバーではなく自分のPCや社内サーバーで動かす方式の総称です。ChatGPTやClaudeのように事業者のサーバーへ質問を送るのではなく、モデルのファイルそのものを自分のマシンに置いて、その場で計算させます。

使われるのはオープンウェイトと呼ばれる、モデルの中身(重みのファイル)が公開されているモデルです。代表的なものにMeta の Llama 3 系、Mistral/Mixtral、Qwen、DeepSeek、Phi、Google の Gemma 系(Gemma 2、Gemma 3)があります。これらのファイルをダウンロードし、OllamaやLM Studioといった実行ツールで起動する、というのが標準的な使い方です。

Ollamaはコマンドラインでモデルの管理・推論・HTTPサーバー提供までをこなすツールで、Linux/macOS/Windowsに対応しています。LM StudioはGUIのデスクトップアプリで、Hugging Face(モデル配布サイト)から直接モデルを取ってこられます。黒い画面が苦手ならLM Studio、他のアプリからAPIとして呼びたいならOllama、という選び方でおおむね問題ありません。

クラウド型と何が違うのですか?

いちばん大きな違いは、通信が発生するかどうかです。クラウド型LLMは事業者のサーバー上で稼働し、インターネット経由でアクセスします。ローカルLLMは自分のPC上のモデルが計算するため、そもそも外部とのデータ送受信が起きません。

この差は、扱う情報の性質によって重みが変わります。ネットに出したくない情報――医療データ、契約書、通話の録音記録、社内の内部資料――を扱うとき、ローカルLLMは「送っていないので漏れようがない」という状態を作れます。逆に一般的な文章作成のように外に出て困らない情報なら、この強みは効いてきません。

どのくらいのスペックが必要ですか?

ここが最初の関門です。ローカルLLMの運用可否は、GPUの演算性能よりもVRAM容量(グラフィックボードに載っているメモリ)で決まります。モデルの重みをまるごとVRAMに載せる必要があるため、容量が足りなければそもそも起動しないか、極端に遅くなるからです。

容量ごとに、実際に選択肢へ入ってくるモデルは次のように変わります。

VRAM 6〜8GBMistral 7B-instruct(Q4_0量子化・約4GB)/Gemma 3 9B-instruct(Q4_0量子化・約6GB)
VRAM 12GBLlama 3 8B(Q8_0量子化)/Gemma 2 9B(Q8_0量子化)
VRAM 16GBMistral Small 24B(Q4_K_M量子化)
VRAM 24GBGemma 2 27B(Q4_K_M量子化)/Llama 3 70B(IQ2_XS等の超低ビット量子化)

ローカルLLMのVRAM要件解説(note)の公表データをもとに作成

表の中の「7B」「27B」はパラメータ数で、Bは10億を指します。「Q4」「Q8」は量子化(重みの数値を粗く丸めてファイルサイズを小さくする処理)の度合いを表し、数字が小さいほど軽くなり、そのぶん精度は落ちます。

この表を縦に眺めると、容量が増えたときの使い道が一本道ではないことが見えてきます。同じ予算の中で「小さいモデルを高精度な量子化で動かす」か「大きいモデルを粗い量子化で押し込む」かという分岐があり、VRAM 24GBの行はその両方が同居しています。Llama 3 70BをIQ2_XSで載せるのは、モデルの規模だけ見れば最上位ですが、丸めの影響も最大です。12GBでLlama 3 8BをQ8_0で素直に動かしたほうが、体感の安定度で上回る場面は珍しくありません。数字の大きいモデルを選ぶことと、良い出力を得ることは同じではありません

😲
量子化で軽くできるなら、どこまでも小さくすればいいんじゃないの?

量子化は無料の圧縮ではありません。重みの数値を粗く丸める処理なので、削るほど出力の質は落ちていきます。この劣化を抑える方向の工夫としてQAT(量子化適応トレーニング)があり、12BクラスのモデルをBF16(丸めをかけない形式)のまま動かす場合と比べてメモリ使用量を削減できます。ただし手元の判断としては、「載る範囲でいちばん丸めの少ない構成を選ぶ」が実用的な基準になります。

導入前に確認しておくこと
  • 自分のGPUのVRAM容量(GPUの型番で検索すれば出ます)
  • モデルファイルを置くストレージの空き容量
  • 試したいモデルが量子化版で配布されているか
  • そのモデルのライセンスが自分の用途を許しているか

クラウド型と比べて精度は落ちますか?

用途を分けずに一言で答えるなら、最新の最高性能を求める場面ではクラウド型に分があります。手元のVRAMに載る範囲のモデルと、事業者が大規模なサーバー群で動かしている最新モデルとでは、使えるリソースの前提が違うためです。最新モデルをすぐ使いたい用途では、クラウドAIのほうが適しています。

ただし「精度」を一般的な賢さだけで測ると判断を誤ります。ローカルLLMを社内の内部情報や資料でカスタマイズすれば、その領域に関してはより精度の高い出力を得られる場合があります。汎用の知識では及ばなくても、自社の用語や書式に沿った答えという意味では上回りうる、ということです。

向いていないケースもあります

手持ちのPCにGPUがない、あるいはVRAMが4GB程度しかない場合、無理に動かしても待ち時間が長くて実用になりません。また「とにかく賢いAIに難しい相談をしたい」という目的なら、ローカル環境を整える手間に対してクラウド型を使うほうが素直です。ローカルLLMは賢さを買う手段ではなく、情報を外に出さない手段だと考えると、判断を間違えにくくなります。

どんな用途に向いていますか?

用途で選ぼうとすると迷いますが、「その情報を事業者のサーバーへ送ってよいか」という一問で切ると、線はかなりはっきり引けます。送って困らないものはクラウドで済ませ、送信そのものを避けたいものだけを手元へ寄せる、という順番です。

判断に迷ったときは、その情報が漏れた場合に誰に説明する必要があるかを考えると早く決まります。自分だけで完結する下書きなら送って構いません。相手のいる情報――取引先の契約内容、患者や顧客の記録、録音された会話――は、説明責任が自分の外にあるため、送信しない選択に価値が出ます。医療データや企業の内部情報のようにセンシティブなデータでローカルLLMが推奨されるのは、この構造が理由です。

  1. 扱う情報を仕分ける外に出て困る情報と、困らない情報を分けます。ここが決まらないうちにツールを選んでも判断がぶれます。
  2. 困らない情報はクラウドで済ませる一般的な調べものや下書きは、性能の高いクラウド型のほうが速く良い結果になります。
  3. 困る情報だけをローカルに寄せる説明責任が自分の外にある情報に、ローカルLLMを充てます。全部を移そうとすると手間だけが増えます。
  4. 載るモデルから試すVRAMの目安表で自分の容量に合うモデルを選び、OllamaかLM Studioで一度動かしてみます。

まず何から始めればいいですか?

最初にやることは、購入でも設定でもなく確認です。自分のPCのVRAM容量を調べて、上の目安表のどの行に当てはまるかを見る。それだけで、選べるモデルの範囲が決まります。

6〜8GBあればMistral 7B-instructやGemma 3 9B-instructの量子化版が視野に入ります。この規模でも、定型的な文章の整形や、手元の文書に対する要約・抽出といった仕事なら十分に役立ちます。逆に、この段階で「思ったより賢くない」と感じたなら、それはローカルLLMの実力どおりで、そこからクラウドとの使い分けを考えればいい話です。

😌
動かす前に、自分のVRAMを調べるだけでいいのね。それなら今日できそう。

ローカルLLMは、導入すれば何かが劇的に良くなる魔法ではありません。情報を外に出さないという一点で、他の方法では代えがきかない選択肢です。その一点が自分の仕事にとって重いかどうか。判断の軸はそこに置いておけば十分です。

よくある質問

ローカルLLMとは何ですか?

ローカルLLMとは、LlamaやQwen、Gemmaなどの重みが公開されたモデル(オープンウェイト)を、クラウドの事業者サーバーではなく自分のPCや社内サーバー上で動かす方式の総称です。OllamaやLM Studioといった実行ツールでモデルを起動して使います。

ローカルLLMに必要なVRAMはどのくらいですか?

VRAM 6〜8GBでMistral 7B-instruct(Q4_0量子化・約4GB)やGemma 3 9B-instruct(Q4_0量子化・約6GB)、12GBでLlama 3 8BやGemma 2 9BのQ8_0、16GBでMistral Small 24BのQ4_K_M、24GBでGemma 2 27BのQ4_K_Mが目安です。ローカルLLMが動くかどうかはGPUの演算性能よりVRAM容量で決まります。

ローカルLLMはクラウド型より精度が落ちますか?

最新の高性能モデルをすぐ使いたい用途ではクラウド型のほうが適しています。一方で、社内の内部情報や資料でローカルLLMをカスタマイズした場合、その領域に関してはより精度の高い出力を得られることがあります。

ローカルLLMはどんな用途に向いていますか?

インターネット接続を必要とせず外部とのデータ送受信が発生しないため、医療データや企業の内部情報など機密性の高い情報を扱う用途に向いています。判断の基準としては、その情報が漏れたときに自分以外の誰かへ説明する必要があるかどうかで切り分けると決めやすくなります。

※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。