フィジカルAIとは?言葉のAIとの違い
画像出典: パブリックドメイン(Wikimedia Commons)
フィジカルAIとは、言語だけでなく画像・音声・センサーデータなど実世界のデータを扱い、現実世界で認識・推論・行動できるAIの総称です。言葉のAIとの決定的な違いは、出力が「文章」で終わるか「体の動き」まで届くかにあります。経済産業省は2026年6月30日、この分野の国産基盤モデルを開発する事業を開始しました。
ひとことで言えば、答えを文章で返して終わるのではなく、実際に体を動かすところまで担うAIのことです。チャットのAIに「机の上の赤いコップを取って」と言えば、取り方を丁寧に説明してくれます。ただし、コップは机の上に置かれたままです。
この「説明はできるが手は出せない」という壁を越えようとしているのが、フィジカルAIと呼ばれる領域です。そして2026年6月30日、経済産業省がこの領域の国産基盤モデルを開発する事業を発表しました。国が本腰を入れ始めた、という段階に来ています。
フィジカルAIとは何か?
フィジカルAIとは、言語に留まらず、音声・画像・動画・センサーデータなど多様な実世界のデータを扱い、現実世界で認識・推論・行動できるAIモデルの総称です。「フィジカル」は物理、つまり現実の空間を指しています。
ここで一度、前提を合わせておきます。ChatGPTのような文章のAIも、画像を読ませれば内容を説明してくれます。だから「もう実世界を扱えているのでは?」と感じるかもしれません。ですが、実世界の情報を「受け取れる」ことと、実世界へ「働きかけられる」ことはまったく別の能力です。フィジカルAIが目指しているのは後者のほうです。
NEDO(新エネルギー・産業技術総合開発機構)の公募資料では、フィジカルAIの実現によって製造業などの生産性向上やエネルギー消費の効率化が期待される、と位置づけられています。工場や倉庫といった、これまで人の手作業に頼ってきた現場が主な想定先です。
国はどんな事業を始めたのか?
経済産業省は2026年6月30日、「AIロボット・フィジカルAIを見据えたマルチモーダル基盤モデル開発事業」を発表・開始しました。マルチモーダルとは、文章・画像・音声など複数の種類のデータをひとつのAIがまとめて扱えることを指します。
事業の目的は、AIロボット・フィジカルAIの開発基盤となる国産のAI基盤モデルを開発し、日本が強みを持つ製造業などの産業競争力強化やGX(グリーントランスフォーメーション)の実現を目指すこと、とされています。
| 事業期間 | 2026年度〜2030年度 |
|---|---|
| 契約の方式 | 2026・2027年度分のみ先行契約。2027年度以降は毎年度のステージゲート審査で継続可否を判断 |
| 基盤モデル開発 | Noetra株式会社 |
| 実証・検証環境 | 産業技術総合研究所(産総研) |
NEDOの公表データをもとに作成
五年がかりの計画でありながら、二年分だけ先に契約して残りは毎年審査する、という慎重な組み立てになっているのが特徴です。成果が出なければ途中で止める前提が最初から仕込まれている、と読むこともできます。
予算規模については、日刊工業新聞社系のニュースイッチが、経済産業省とNEDOが本事業に205億円を投資すると報じています(経産省の一次資料での金額明記は確認できていないため、報道ベースの数字として扱ってください)。同記事によれば、適用先として想定されているのは小売り・製造・物流・建設などで、従来の作り込みでは対応できなかった多様な作業が可能になると期待されている、とされています。
採択されたNoetraは2026年7月1日に事業開始を発表し、画像や動画、音声情報、物理特性をはじめとする実空間に関する情報を統合的に扱い、認識・推論を行うためのマルチモーダル対応能力の高度化を掲げています。
なお別ルートとして、一般社団法人AIロボット協会(AIRoA)も2025年9月にNEDO採択を受け、ロボティクス分野の生成AI基盤モデル開発に有効なデータプラットフォームの研究開発に着手しています。SCSKは2026年1月にAIRoAへの参画を発表しました。国内でこの領域に向かう流れは、ひとつの事業だけではないということです。
言葉のAIと体を動かすAIは、仕組みのどこが違うのか?
この「つなぐだけ」に見える部分こそが、いちばん難しいところです。ここを理解するために、ロボット基盤モデルの世界でよく使われる2つの呼び名を先に渡しておきます。VLMとVLAです。
| VLM | VLA | |
|---|---|---|
| 扱う要素 | 視覚・言語 | 視覚・言語・行動 |
| 出力 | 言語情報 | 物理的な動作 |
| 担う範囲 | 認識・説明 | 認識→計画→実行 |
上の表で増えているのは「行動」の一列だけに見えます。しかしこの一列が、AIの立ち位置を「相談相手」から「作業者」へ変えてしまいます。それぞれが何をするものなのか、順に見ていきます。
VLM(視覚言語モデル)=わかるAI
VLM(Vision-Language Model、視覚言語モデル)は、画像とテキストを統合的に処理するマルチモーダルAIです。写真を見せて「これは何?」と聞けば説明を返します。私たちが普段スマホで使っているAIの多くは、この枠に入ります。
ただしVLMの出力は言語情報にとどまり、現実世界で行動を起こす機能は基本的に備えていません。「赤いコップが右奥にあります」まではわかる。そこで止まる。だから「わかるAI」と呼ばれます。
VLA(視覚言語行動モデル)=わかって動くAI
VLA(Vision-Language-Action Model、視覚言語行動モデル)は、VLMの能力を拡張したものです。視覚(Vision)・言語(Language)・行動(Action)の3要素を、単一のニューラルネットワークでエンドツーエンドに統合します。エンドツーエンドとは、途中を別々の部品でつなぐのではなく、入口から出口までをひとつのモデルとして扱うという意味です。
認識した状況をもとに行動計画を立て、物理的な動作を実行するところまでを担います。だから「わかって動くAI」です。
VLAは頭の中で何をしているのか
VLAの処理は、大きく3つの段階に分かれます。「赤いコップを取って」という指示を例に追ってみます。
- 視覚情報の数値化画像エンコーダがカメラの映像を数値に変換し、何がどこにあるかを検出します。「赤いコップ」がどの位置にあるのかを、AIが扱える形にする段階です。
- 指示文の言語解釈Transformerの自己注意機構(文中のどの語がどの語と関係しているかを重み付けする仕組み)が、「赤い」「コップ」「取って」の関係を読み解きます。赤いのはコップであって机ではない、と結びつける処理です。
- 行動計画と段階的実行動作をトークン化して扱い、「赤いコップを取って」を複数の動作に分解して順に実行します。腕を伸ばす、指を開く、握る、持ち上げる——という具合です。
注目すべきは、3段階目で「動作」が言語と同じようにトークンとして扱われている点です。文章生成AIが次に来る単語を選び続けて文章を作るように、VLAは次に取るべき動作を選び続けて一連の作業を組み立てます。言葉のAIで培われた仕組みが、そのまま体の動きへ拡張されている、という関係です。
言語モデルの進歩が、そのままロボットの側にも流れ込んでくる構図になっています。国の事業が「マルチモーダル基盤モデル開発」という名前になっているのも、ロボット専用の何かをゼロから作るのではなく、基盤モデルの延長線上でこの問題に取り組む発想だからです。
なぜ「作り込み」ではダメだったのか?
工場のロボットは以前から動いています。では何が新しいのでしょうか。
従来の産業用ロボットは、動作をあらかじめ人が細かく作り込む方式が中心でした。決まった位置に決まった向きで部品が来る前提なら、これで十分に速く正確です。ただし前提が崩れると止まります。部品の向きが違う、少しずれている、そもそも見たことのない形——といった変化に弱いわけです。
前掲のニュースイッチの記事では、この事業への期待として、従来の作り込みでは対応できなかった多様な作業が可能になる点が挙げられています。つまり狙いは「もっと速いロボット」ではなく「決め打ちしていない状況にも対応できるロボット」です。物流倉庫に流れてくる荷物の形が毎回違っても、小売りの棚に並ぶ商品が入れ替わっても、同じモデルのまま扱える——そこが目標地点になります。
この分野のニュースは、どう読めばいいのか?
フィジカルAIやヒューマノイドは注目度が高いぶん、市場規模の見通しや投資額が大きな数字とともに流通しやすい分野です。たとえば「ヒューマノイドを中心とする多用途ロボットの世界市場が2040年までに約60兆円規模へ拡大」という見通しも報じられていますが、これは一次資料での確認が取れておらず、参考情報として受け止めるのが妥当です。予算額の205億円も報道ベースの数字です。
見通しの数字そのものが悪いわけではありません。ただ、出どころが一次資料なのか報道なのかで、確からしさは変わります。この領域のニュースを読むときは、そこを一段確認する癖をつけておくと判断を誤りにくくなります。
- そのAIの出力は「説明」で終わるのか、「動作」まで届くのか(VLMかVLAか)
- デモの環境は決め打ちか、変化する状況か
- 数値の出どころは一次資料か報道か
- 研究段階の成果か、実際の現場で稼働しているものか
この4点を意識するだけで、同じニュースから読み取れる中身がかなり変わります。特に1つ目は、記事の見出しでは区別されないまま「AIがロボットを動かした」と一括りにされがちなところです。
これから何が起きるのか
国の事業は2026年度から2030年度までの計画で、分野ごとに個別モデルを開発して社会実装する方針が示されています。小売り・製造・物流・建設といった現場ごとに、必要な動作も判断も違うためです。
しばらくは、汎用の1体がなんでもこなすというより、特定の現場に向けたモデルが順に出てくる形になりそうです。言葉のAIが「文章の仕事」を肩代わりし始めたのと同じことが、これから物理的な作業の側で起き始める——その入口にあたるのが、いま動き出した基盤モデル開発です。
今日すぐ何かが変わるわけではありません。ただ、自分の仕事や生活のどこが「決め打ちできない作業」なのかを一度眺めておくと、この分野のニュースが自分ごととして読めるようになります。まずはそこからで十分です。
よくある質問
フィジカルAIとは何ですか?
フィジカルAIとは、言語に留まらず、音声・画像・動画・センサーデータなど多様な実世界データを扱い、現実世界で認識・推論・行動できるAIモデルの総称です。文章で答えを返して終わる従来のAIと異なり、物理的な動作の実行までを担う点が特徴です。
VLMとVLAの違いは何ですか?
VLM(視覚言語モデル)は画像とテキストを統合的に処理しますが、出力は言語情報にとどまり、現実世界で行動を起こす機能は基本的に備えていません。一方VLA(視覚言語行動モデル)は視覚・言語・行動の3要素を単一のニューラルネットワークでエンドツーエンドに統合し、認識した状況から行動計画を立てて物理的な動作を実行します。「わかるAI」と「わかって動くAI」の違いです。
経済産業省のフィジカルAI事業はいつ始まりましたか?
経済産業省は2026年6月30日に「AIロボット・フィジカルAIを見据えたマルチモーダル基盤モデル開発事業」を発表・開始しました。事業期間は2026年度から2030年度までで、2026・2027年度分のみ先行して契約し、2027年度以降は毎年度のステージゲート審査で継続可否を判断する方式です。
フィジカルAIはどんな分野で使われる予定ですか?
報道によれば、製造や物流のほか、小売り・建設などが適用先として想定されており、分野ごとに個別モデルを開発して社会実装する方針とされています。従来の作り込みでは対応できなかった多様な作業が可能になることが期待されています。
※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。