いろは堂AI
← 戻る

Grok 4.7の仕組み、賢くなった3つの中身と残る穴

2026年9月23日|いろは堂AI編集部
黒背景に白い「X1」マークと「Grok」の文字が並ぶロゴ画像

画像出典: パブリックドメイン(Wikimedia Commons)

この記事の要点
xAIは2026年9月21日にGrok 4.7を発表し、コーディングと知識労働で自社最高性能と位置づけました。変化の中身は「より大きなベースモデル」「推論時間を延ばす4段階設定(既定はhigh)」「SpaceXの機器ログを補助学習データに足した」と報じられている3点です。一方で独立系のArtificial Analysis総合指数は46で、Claude Fable 5.1・GPT-6 Astraの53には届いていません。
🤔
Grok 4.7が出たのは聞いたけど、前の版と比べて中身が何か変わったの?

新しいモデルが出るたびに「過去最高性能」と書かれるので、正直なところ差が見えにくくなります。ただ今回は、xAIの説明と報道を突き合わせると、変わった場所がはっきり3か所に絞れます

モデルの大きさ、答える前に考える時間、そして学習に使ったデータの種類。この3つを順に見ていくと、Grok 4.7がどの仕事で効きそうで、どこはまだ他社に届いていないのかまで見えてきます。

Grok 4.7とは? いつ発表され、どこで使えるのか

Grok 4.7は、イーロン・マスク氏が率いるxAIが2026年9月21日に発表した新しいフラグシップモデルです。xAIはこれを「コーディングと知識労働においてこれまでで最も高性能なモデル」と位置づけています。

使える場所は発表と同日に広がりました。コード補完エディタのCursor、Grok Build、Grok API、Grokアプリ、X、Teslaの音声アシスタントで即日利用できます。GitHub Copilot(Pro/Pro+/Max/Business/Enterprise)でも提供されています。

価格は前モデルのGrok 4.6と同額で、入力が100万トークンあたり2ドル、出力が6ドル。出力速度が2倍になる代わりに価格も2倍の高速バリアントも用意されています。値段が据え置きのまま中身が入れ替わった、という形です。

何が変わった? 賢さを底上げした3つの仕組み

1. ベースモデルが大きくなった

😲
パラメータが40%増えたって読んだけど、それって公式の数字なの?

パラメータ数は公式発表ページには書かれていません。ここは先に切り分けておきます。パラメータとは、モデルが学習の結果として内部に持っている調整つまみの数で、多いほど覚えられる知識やパターンの幅が広がります。

KuCoin/CoinDesk、Decryptなど複数のメディアは、Grok 4.7の規模を約2.1兆パラメータ、前世代のGrok 4.6の1.5兆から約40%増と報じています。数字が一致しているので信頼度は高いものの、xAI自身が公表した値ではない点は押さえておいてください。

xAIが公式に説明しているのは、より大規模なベースモデルを使い、強化学習の訓練パスを長くしたという点です。強化学習は、出した答えの良し悪しを採点しながらモデルの振る舞いを調整していく訓練で、その工程を長く回したということになります。

2. 答える前に「考える時間」を伸ばせる

ここが実務では一番効いてくる変更です。Grok 4.7は推論レベルをlow/medium/high/xhighの4段階から選べ、既定値はhighに設定されています。

推論時間とは、モデルが答えを返すまでに内部で検討に使う計算量のことです。xAIは「困難な問題に時間をかけ、自己検証(ダブルチェック)する頻度を増やした」と説明しており、数時間かかるような長時間タスクや難問に重みを置いた訓練を行ったとしています。

あわせて、一度に読み込める文脈の量であるコンテキストウィンドウが50万トークンに拡大しました。知識カットオフ(学習データに含まれる情報の期限)は2026年5月です。長い仕様書やリポジトリ全体を一度に渡して作業させる使い方を想定した設計といえます。

推論レベルの使い分けの目安
  • low/medium: 定型の書き換え、要約、短いコード片の生成。速さと費用を優先したいとき
  • high(既定): 通常の実装や調査。まずここから試す
  • xhigh: 原因が特定できていないバグの調査、仕様の整合性チェックなど、間違うと手戻りが大きい作業

費用はトークン量で決まるため、考える時間を伸ばすほど1回あたりの出力トークンも増えます。全部をxhighで回すのではなく、間違いのコストが高い作業だけ上げるのが現実的な運用です。

3. ロケット由来のデータを学習に足した

🤩
SpaceXのデータで学習って、AIとロケットに何の関係があるの?

報じられている内容はこうです。Grok 4.7の学習には、衛星通信サービスStarlinkのテレメトリ(機器から送られてくる稼働データ)、製造記録、エンジニアリングの故障ログが補助的な学習データとして追加されました。

狙いは、インターネット上の文章だけで学習したモデルより、ハードウェアや物理システムについての推論力を高めることだとされています。ネット上の技術文章は「うまくいった話」が中心ですが、故障ログには実際の機械がどう壊れ、どの兆候が先に出ていたかが記録されています。成功談ではなく失敗の記録から、原因と結果のつながりを学ばせようという発想です。

ただしこの件も、xAI公式発表ページ本文からは直接確認できず、KuCoin/CoinDesk、Decrypt、AndroidHeadlinesなど複数の二次報道が一致して伝えている情報です。効果がどの程度かを示す公表データも、現時点では出ていません。

ベンチマークの数値はどうなった?

まずxAIが公式発表ページで公表している値から見ていきます。

ベンチマークGrok 4.7備考
CursorBench 4.046.3%コーディング関連ベンチマーク
DeepSWE v1.1(高労力)71.0%Grok 4.6は65.2%
EEBench64.0%-
Harvey Legal Agent Benchmark19.6%法務エージェント関連
HackerBench v0.3危険プロンプト通過率3.3%安全性・悪用耐性ベンチマーク
LatchBio バイオセーフティベンチマーク62.4%生物安全性ベンチマークで首位と報道

xAIの公表データをもとに作成(LatchBioの項目は二次報道経由の引用)

上の表で世代間の伸びがはっきり出ているのはDeepSWE v1.1で、Grok 4.6の65.2%から71.0%へ上がっています。一方、Harvey Legal Agent Benchmarkの19.6%のように、まだ低い水準にとどまる領域もあります。

他社モデルと並べるとどう見えるか

自社発表の数値だけでは立ち位置が分かりません。独立系の評価を集計した二次報道の数値も並べます。

ベンチマークGrok 4.7Claude Fable 5.1GPT-6 Astra
Artificial Analysis 総合指数465353
Terminal-Bench 4.026%55〜60%55〜60%
GDPval16951735-
AA-Briefcase(Elo)16571678-

Decrypt・Yahoo Techの報道をもとに作成(xAI公式の公表値ではありません)

上の表を見ると、総合指数は46に対して競合2モデルが53、Terminal-Bench 4.0では26%に対して55〜60%と開きがあります。Decryptは総括として、CursorBench 4.0でもGPT-6 Astraより高コストでありながら、Claude Sonnet 5・Fable 5.1には性能で劣る、と評価しています。

「過去最高」は自社比の話です

xAIの「これまでで最も高性能」という表現は、あくまでGrokシリーズ内の比較です。他社モデルを含めた横並びでは、上の独立系指標のとおり差があります。導入を検討するときは、自分が実際に使う作業に近いベンチマークを1つ選んで見るほうが判断を誤りません。

安全性はどこまで強くなった?

Grok 4.7では、xAIが「これまでで最も強力な安全ガードレール」と呼ぶ仕組みが新設されました。ガードレールとは、危険な要求を拒否したり、規制をすり抜けようとする入力をはじいたりする防護の仕組みです。

xAI独自のHackerBench v0.3は、悪用にも正当な用途にも使える二重用途のプロンプトをどれだけ通してしまうかを測る試験です。ここでGrok 4.7が通過を許したのは危険プロンプトの3.3%にとどまり、正当なセキュリティ作業はほぼブロックしなかったとされています。生物安全性を測るLatchBioベンチマークでは62.4%で首位とも報じられました。

xAIはさらに、選定したサイバーセキュリティパートナー向けに、Grok 4.7のレッドチーム機能(攻撃者役としてモデルに弱点を探させる使い方)を招待制で防御研究用に提供し始めています。

それでも残る限界は? 過去の突破事例から考える

😟
ここまで数字が良いなら、もう安心して業務に使っていいのかな…

数値の良さと、実運用での安全は別の話として扱う必要があります。理由は、リリース前のレッドチーミングは有限の試験にすぎず、公開後のバイパスの可能性を排除できないからです。ロールプレイのシナリオ、言語、エンコーディング、会話履歴、外部文書、ツールの応答、そして攻撃者が適応的に変えてくる戦略。これらすべてを網羅する評価は存在しない、と指摘されています。

過去の実例がその通りになっています。前世代のGrok 4は公開からわずか48時間でジェイルブレイク(安全機構の回避)されました。NeuralTrustの研究者が「Echo Chamber」と「Crescendo」という既知の2手法を組み合わせ、明示的な悪意あるプロンプトを使わずに安全機構を突破したと報告しています。

Grok 4.5でも、リリース数時間後に「Pliny the Liberator」を名乗る研究者が安全制御の回避を主張しました。学術・教育・防御研究目的を装う言い換えによって、違法薬物製造、爆発物、有毒物質、マルウェアに関する要求に応答したと報告されています。また2026年7月には、ChatGPTを騙して性的・暴力的な画像を生成させた手法がGrokでも通用することを、Mindgardの研究者が確認したと報じられました。

これらはいずれも旧バージョンでの事例で、Grok 4.7に対する具体的な突破事例は2026年9月22日時点では確認されていません。ただし新モデルが発表直後から数日でジェイルブレイクされてきた流れを踏まえると、同種のリスクは残ると考えるのが妥当です。

自分の作業のどこに入れる? 今日からの組み込み方

ここまでの中身を、手元の運用に落とします。Grok 4.7の強みは「長い文脈」と「考える時間を選べること」なので、その2つが効く作業から入れるのが素直です。

  1. 入れる作業を1つだけ決める長い仕様書の読み合わせ、既存コードの不具合調査など、文脈の長さが効く作業を1つ選びます。いきなり全業務を置き換えないでください。
  2. まず既定のhighで同じ依頼を3回流す同じプロンプトで出力がどれくらいぶれるかを見ます。ぶれが大きいなら、指示の前提が足りていないサインです。
  3. 間違いのコストが高いものだけxhighに上げる手戻りの大きい調査系だけ推論レベルを上げ、定型作業はlow/mediumに下げます。出力トークンが増える分、費用も上がる点を見ておきます。
  4. 出力の検証手順をセットで決めるコードなら実行とテスト、調査結果なら一次情報での裏取りまでを1セットにします。検証しない出力は採用しない、と先に決めておくのが安全です。
  5. 権限は最小から始めるエージェントとして使う場合、ファイル書き込みや外部送信の権限は最初から全部渡さず、必要になった分だけ足します。安全ガードレールは万能ではない、という前提で組みます。
向いていないケースもあります

機密文書をそのまま長文で投げる使い方や、出力をそのまま外部に公開する運用には向きません。突破事例が示すとおり、防護は回避されうる前提で設計する必要があります。また独立系ベンチマークでは競合に差をつけられている領域もあるため、すでに他社モデルで安定している作業をわざわざ乗り換える理由は、現時点では強くありません。

結局、Grok 4.7で押さえるべきことは?

変わったのは3か所です。ベースモデルの規模(パラメータ約2.1兆という数値は報道ベース)、推論時間を4段階で選べる設計とコンテキスト50万トークン、そしてSpaceXの故障ログなどを補助学習データに足したとされる点。

そして自社比の「過去最高」と、他社を含めた横並びの評価は別物です。Artificial Analysis総合指数46対53という差は、導入判断の材料としてそのまま見ておく価値があります。まずは1つの作業で試し、検証手順と権限の設計をセットで決める。そこから広げれば十分です。

よくある質問

Grok 4.7はいつ発表され、どこで使えますか?

xAIが2026年9月21日に発表し、同日からCursor、Grok Build、Grok API、Grokアプリ、X、Teslaの音声アシスタントで利用できます。GitHub CopilotのPro/Pro+/Max/Business/Enterpriseプランでも提供されています。

Grok 4.7のパラメータ数は公式に発表されていますか?

いいえ。xAI公式発表ページ本文にパラメータ数の記載はありません。約2.1兆で前世代の1.5兆から約40%増という数値は、KuCoin/CoinDesk、Decryptなど複数の二次報道が一致して伝えているもので、公式の公表値ではありません。

Grok 4.7の推論レベルはどう選べばよいですか?

low/medium/high/xhighの4段階があり、既定はhighです。定型の要約や書き換えはlow/medium、通常の実装や調査は既定のhigh、原因不明のバグ調査など間違いのコストが高い作業だけxhighに上げる、という使い分けが現実的です。考える時間を伸ばすほど出力トークンが増え、費用も上がります。

Grok 4.7の安全性は他モデルと比べて十分ですか?

xAI独自のHackerBench v0.3では危険プロンプトの通過率が3.3%、LatchBioバイオセーフティベンチマークでは62.4%で首位と報じられています。ただしリリース前の試験では公開後のバイパスを排除できず、Grok 4やGrok 4.5は公開から数時間〜48時間でジェイルブレイクされた実例があります。Grok 4.7自体の突破事例は2026年9月22日時点で未確認です。

※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。