いろは堂AI ← 戻る

Shieldstralとは?再学習不要のAI安全判定の仕組み

2026年8月8日|いろは堂AI編集部
暗い室内でチャット画面「Hi, I'm DeepSeek.」を表示するノートパソコン画面の接写写真。

画像出典: Matheus Bertelli / Pexels

この記事の要点
Mistral AIが2026年8月4日に公開した「Shieldstral 1.0」は、AIの入出力が危険かどうかを判定する軽量な分類器です。従来は判定基準をモデルの中に学習で焼き込んでいましたが、Shieldstralは基準を推論のたびに自然言語の質問として渡す設計にしたため、基準を変えるのに再学習が要りません。約3Bパラメータで、16GBのGPU1枚で動きます。
🤔
AIの安全フィルターって、禁止ワードのリストを持ってるだけじゃないの?

安全フィルターの中身は、禁止ワードの一覧表ではありません。いまの主流は「ガードモデル」と呼ばれる小さなAIで、入力や出力の文章を読んで「これは危険か」を判定します。本体のAIとは別に、門番として横に立っているイメージです。

ただ、この門番には長く続いてきた不便がありました。何を危険とみなすかの基準を変えたいとき、門番そのものを学習し直すしかなかったのです。2026年8月4日にMistral AIが公開した「Shieldstral 1.0」は、そこを正面から作り替えたモデルです。

😟
うちのサービス、子ども向けなんだけど…基準ってそんなに変えたくなるもの?

むしろ、変えたくならない現場のほうが珍しいのが実情です。同じ「暴力表現」でも、子ども向け学習アプリと医療従事者向けの業務ツールでは、通していい線がまったく違います。国や年齢層、あとから増える社内規程まで含めれば、基準は増えも変わりもし続けます。

Shieldstral 1.0とは何か?

Shieldstral 1.0は、Mistral AIが2026年8月4日に発表した安全分類器です。文章だけでなく画像も扱えるマルチモーダル対応で、Apache 2.0ライセンスのオープンウェイトモデル(モデルの重みそのものが配布され、商用・非商用を問わず使えるもの)としてHugging Faceで公開されています。

規模は約3Bパラメータ。ベースは「Ministral-3-3B-Base-2512」で、画像を読み取る部分にはMistral独自のPixtralをそのまま組み込んでいます。一度に読み込める文章量を示すコンテキスト長は32,000トークン(トークンは単語より少し細かい、AIが文章を数える単位。日本語ならおおむね1文字前後)で、16GBのNVIDIA GPU1枚(BF16、モデル内部の数値を16ビットで持つ標準的な精度設定)で動く軽さです。対応言語は英語・フランス語・スペイン語・ドイツ語・イタリア語・ポルトガル語・オランダ語・中国語・日本語・韓国語・アラビア語・ロシア語の12言語で、日本語も入っています。

なお、パラメータ規模は資料によって表記が揺れています。Mistral公式のドキュメントは3.8B、Hugging Faceのモデルカードでは4Bとも書かれており、おおむね3B台の小型モデルと捉えるのが実態に近いところです。

回路状の装飾が施された大文字のMとエッフェル塔を組み合わせた、Mistral AIをイメージしたイラスト
Mistral AIを表すイメージ(出典: パブリックドメイン(Wikimedia Commons)

従来のガードモデルは何が不便だったのか?

これまでの安全分類器は、学習の段階で「暴力」「性的コンテンツ」といった有害カテゴリの区別を、モデルの重みの中に固定的に焼き込んでいました。門番の頭の中に、判定基準が最初から刻まれている状態です。

この作りだと、判定は速くて安定します。代わりに、基準を1行変えたいだけでも門番を作り直すことになります。学習データを用意し、再学習を回し、性能を測り直す。数日から数週間の話です。

ここが現場で効いてくる部分です

基準の変更が重いと、「とりあえず厳しめに倒しておく」という運用になりがちです。結果として、危険でない質問まで断られる。ユーザーから見れば「このAI、やたら拒否してくる」という体験になり、緩めようにも再学習が必要で動けない、という膠着が起きます。

Shieldstralは判定基準をどう渡しているのか?

Shieldstralは、判定基準をモデルの重みではなく、推論のたびのリクエストに載せて渡します。門番の頭に基準を刻むのをやめ、その場でルールブックを手渡す方式に変えた、と言い換えられます。

入力は、yes/noで答える質問応答の形をとり、3つの要素で構成されます。

  1. <Instruct>評価の文脈と、どのくらい厳しく見るかのレベルを指定します。
  2. <Query>「この内容は暴力を助長するか?」のように、yes/noで答えられる自然言語のポリシー質問を書きます。ここが判定基準そのものです。
  3. <Document>評価したい対象を渡します。テキスト、画像、あるいはプロンプトと応答のペアが入ります。

この3つをまとめて1回の推論(単一フォワードパス、モデルを1度通すだけの処理)に流すと、yes/noの確率が0〜1の連続的な安全スコアとして返ってきます。基準を変えたければ、<Query>の文章を書き替えるだけ。再学習は挟みません。

🤩
じゃあ、子ども向けと業務用で同じモデルのまま基準だけ切り替えられるってこと?

1つのモデルを配置したまま、アプリごと・画面ごとに渡すポリシー質問を変える。これがこの設計の狙いどおりの使い方です。スコアが0か1でなく連続値で返るため、「0.8を超えたら人間のレビューに回す」といった中間の運用も組めます。

どんな判定に使えるのか?

Shieldstralが担当できる仕事は、危険な入力を弾くことだけではありません。以下に出てくるモデレーションとは、投稿や発言の内容を基準に照らして通すか止めるかを判定する作業のことです。

Shieldstralが対応するタスク
  • ユーザーが入力したプロンプトのモデレーション
  • AIが返した応答のモデレーション
  • プロンプトと応答をペアで見た分類
  • 拒否(refusal)の検出 — AIが答えを断ったかどうかの判定
  • テキストと画像の安全フィルタリング

動かすための土台となる推論フレームワーク(モデルを読み込んで実行するソフトウェア)は、サーバー向けのvLLMとSGLang、手元のPCでも動かせるllama.cpp、そして標準的なHugging Face Transformersに対応しています。llama.cppが入っているので、自分のマシンで試す道も塞がれていません。

学習に使ったサンプルは合計約5,410万件。内訳はオープンソースのテキストが4,520万件、合成された対比的(contrastive、似ているが安全性の判定が分かれるペアを意図的に作ったもの)テキストが440万件、マルチモーダルデータが450万件です。基準を後から差し替えても判定がぶれないようにするには、「この線のどちら側か」を分ける訓練が要る、という設計思想が量にも表れています。

ベンチマークの数字はどう読めばいいのか?

先に、何を測っている数字なのかを押さえておきます。以下に出てくるF1スコアは、「危険なものを見逃さない度合い(再現率)」と「安全なものを誤って危険と判定しない度合い(適合率)」を両方まとめて1つにした指標です。片方だけ高くても上がりません。すべて有害・と答え続ければ見逃しはゼロになりますが、F1は下がる、という性質のものです。

Mistralの発表では、Shieldstralはテキストについて7倍規模の大型ガードモデルと同等以上、画像については評価した他モデルをすべて上回ったとされています。実際のスコアを項目ごとに並べると、次のようになります。

評価項目Shieldstralスコア比較対象・備考
テキスト安全性(F1平均)84.9%GPT-OSS-Safeguard-20Bと同水準
マルチモーダル安全性(F1平均)83.8%OmniGuard-7Bの77.6%を上回る
ポリシー適応性F191.3%Nemotron-3.5の91.8%にわずかに劣る
拒否検出91.5%GPT-OSS-Safeguard-20Bの93.7%をやや下回る

MarkTechPostの公表データをもとに作成

上の表で目を引くのは、勝っている項目より負けている項目のほうかもしれません。ポリシー適応性はNemotron-3.5にわずかに及ばず、拒否検出はGPT-OSS-Safeguard-20Bを下回っています。Shieldstralの価値は「全項目1位」ではなく、3B台という規模で桁違いに大きいモデルと同じ土俵に並んでいる点にあります。

ここは順位表として読むより、コストと性能の交換比として読むほうが実態に合います。20Bのガードモデルを全リクエストの手前に立たせるのと、16GBのGPU1枚で足りるモデルを立たせるのとでは、運用の重さがまるで違うからです。

なお、この比較表の数値はMistral公式ブログのグラフから直接取り出せなかったため、第三者媒体が整理した値です。一次情報の数値と細かく異なる可能性がある点は、そのまま受け取らずに頭に置いておいてください。

データセット別に見るとどうなるのか?

平均値は、得意なところと苦手なところを均してしまいます。Hugging Face公式のモデルカードには、個別のデータセットごとのスコアが載っています。

データセット分類F1スコア
WildGuardTestテキスト88.1%
ToxicChatテキスト84.1%
HarmBenchテキスト99.4%
VLGuardマルチモーダル97.7%
UnsafeBenchマルチモーダル81.8%

Mistral AI (Hugging Face)の公表データをもとに作成

同じマルチモーダルでも、VLGuardの97.7%とUnsafeBenchの81.8%で16ポイント近い開きがあります。テキスト側もHarmBenchの99.4%とToxicChatの84.1%では別物の数字です。ベンチマークごとに集めている題材も難易度も違うので、当然といえば当然の差ですが、平均の83.8%や84.9%だけを見て「だいたいこのくらいの精度」と当てはめると、自分の用途では外れます。

導入を検討するなら、平均値ではなく、自分の扱う内容に近いデータセットのスコアを見るほうが判断材料になります。もっと確実なのは、自社の実データで測り直すことです。

Shieldstralが苦手なのはどこか?

公式が明記している弱点

低リソース言語(学習データが少ない言語。特にアラビア語とインドネシア語が挙げられています)、難読化された入力、そして長い文書では性能が落ちるとされています。

難読化された入力というのは、文字の間に記号を挟む、綴りを崩す、別の言語表記に置き換えるといった、判定をすり抜けるために意図的に加工された文章のことです。ここが弱いということは、悪意を持って回避しようとする相手に対しては、単体で完全には防ぎきれないという意味になります。

長文書での低下も、実運用ではよく踏む点です。コンテキスト長32,000トークンまで入りますが、入るのと正確に判定できるのは別の話で、長い文章の中に一箇所だけ紛れた問題表現は取りこぼしやすくなります。

そして12言語に日本語は含まれるものの、日本語単体のスコアは公表されていません。日本語のサービスに入れるなら、公表値をそのまま自分の環境の精度と見なさず、実際のデータで測ってから判断するのが順当です。

この発表は何を変えたのか?

ひとつは、安全判定の基準を「学習資産」から「設定」に近づけたことです。これまでモデルの再学習が必要だった基準変更が、文章の書き替えで済むなら、扱いはコードやコンフィグに近づきます。バージョン管理もレビューもしやすく、間違えたときの戻しも速くなります。

もうひとつは、その仕組みがApache 2.0のオープンウェイトで出てきたことです。安全機構を外部APIに預けず、自社の環境の中に置いたまま基準を組み替えられる選択肢が増えました。判定対象には、ユーザーの生の入力という機微なデータが必ず含まれます。それを外に出さずに済むかどうかは、扱える業種の幅に直接効いてきます。

😌
全部を任せきりにはできないけど、動かせる部分が増えたって感じかな。

Shieldstral1枚で守り切る作りにはできません。難読化や長文の弱点が残るからです。前段のルールベースのチェック、後段の人間によるレビューと組み合わせ、その真ん中を安く柔軟に埋める部品として置く。今の性能で無理なく成立するのは、その形です。

「AIの安全対策」と聞くと、精度をどこまで上げるかの話に見えます。ただ今回変わったのは精度の数字より、基準を誰がいつ変えられるかという、運用の主導権の位置のほうでした。

よくある質問

Shieldstral 1.0はいつ発表されたモデルですか?

Mistral AIが2026年8月4日に発表した、軽量なマルチモーダル安全分類器です。Apache 2.0ライセンスのオープンウェイトモデルとしてHugging Faceで公開され、商用・非商用を問わず利用できます。

Shieldstralはなぜ再学習なしで判定基準を変えられるのですか?

判定基準をモデルの重みに焼き込まず、推論のたびに自然言語のポリシー質問として渡す設計だからです。入力は評価の文脈を示す&lt;Instruct&gt;、yes/noで答えられる基準の質問である&lt;Query&gt;、評価対象の&lt;Document&gt;の3要素で構成され、&lt;Query&gt;を書き替えれば基準が変わります。

Shieldstralを動かすにはどのくらいのマシンが必要ですか?

パラメータ規模は約3Bで、16GBのNVIDIA GPU1枚(BF16、数値を16ビットで扱う標準的な精度設定)で動作可能とされています。モデルを実行する推論フレームワークは、サーバー向けのvLLMとSGLang、手元のPCでも動くllama.cpp、標準的なHugging Face Transformersに対応しています。

Shieldstralは日本語のサービスでも使えますか?

対応12言語に日本語は含まれています。ただし日本語単体の性能スコアは公表されておらず、公式は低リソース言語・難読化された入力・長文書での性能低下を弱点として明記しています。導入前に自社の実データで精度を測ることをおすすめします。

※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。