MAI-Transcribe-2、議事録の誤字が減るしくみ
画像出典: ぱくたそ (© すしぱく)
Microsoftは2026年9月3日、音声認識AI「MAI-Transcribe-2」を発表し、対応言語を60言語に広げたうえで話者分離(誰の発言かの割り当て)と単語レベルのタイムスタンプを搭載しました。議事録の固有名詞の誤変換を減らす鍵は、前の版から入った「キーワードバイアシング」という指定語への寄せ込み機能です。一方で、複数人の声が重なる場面では今も精度が落ちます。これは音声認識が原理的に「1人の発話」を前提に学習されているためです。
文字起こしAIを使っていても、結局は手直しが残る。その手直しの中身は、だいたい決まっています。人名・製品名・社内の略語といった「その会社でしか使わない言葉」と、誰の発言かの取り違えです。この2つは、AIが苦手とする理由がそれぞれ違います。
Microsoftが2026年9月3日に発表した音声認識モデル「MAI-Transcribe-2」は、まさにこの2点に手を入れたモデルです。正直なところ、これを知ったからといって明日から議事録がゼロ手直しになるわけではありません。ただ、どの誤りが減って、どの誤りが残るのかを分けて理解できると、会議の進め方のほうを変えられます。
MAI-Transcribe-2とは? 何が新しくなったのか
MAI-Transcribe(マイ・トランスクライブ)は、Microsoftが自社開発している音声認識モデルのシリーズです。音声認識とは、話し声を文字に変換する技術のこと。Microsoftはこれまでこの部分をOpenAIのWhisperなど外部のモデルに頼っていましたが、2026年に入って自社モデルへ置き換える動きを進めています。
シリーズは2026年4月から9月にかけて3つの版が発表されました。発表内容を並べると、改良の方向がはっきり見えます。
| モデル | 発表日 | 対応言語数 | FLEURS平均WER | 主な新機能 |
|---|---|---|---|---|
| MAI-Transcribe-1 | 2026-04-02 | 25言語 | 3.9% | 雑音・低品質録音・発言重複への耐性 |
| MAI-Transcribe-1.5 | 2026-06 | 25言語 | 3.7%(Artificial Analysisでは2.4%) | キーワードバイアシング(ドメイン固有語補正、WER最大30%削減) |
| MAI-Transcribe-2 | 2026-09-03 | 60言語 | 5.2% | 話者分離、単語レベルのタイムスタンプ、言語混在対応、自動言語識別 |
Microsoft AIの公表データをもとに作成
上の表で目を引くのは、最新版でWER(ワー)の数値が上がっている点だと思います。WERは「単語誤り率」のことで、書き起こした単語のうちどれだけ間違えたかの割合です。低いほど正確、という指標です。
ただしこの5.2%と3.7%を直接比べることはできません。FLEURSという評価用のテストセットで測った値ですが、対応言語が25言語から60言語へ広がったため、測っている対象そのものが変わっています。学習データの少ない言語が加われば平均は当然上がります。Microsoftは60言語での評価で1位を維持したと発表しており、比べるなら「同じ土俵の中での順位」のほうです。順位表の数字だけを切り取っても、議事録が良くなるかはわかりません。
速度と価格も発表されています。処理速度はGPT-Transcribeの10倍、Scribe v2の7倍、Gemini 3.5 Transcribeの5倍高速とされ、価格は発表時点の公表値で1時間あたり0.10ドル(年末までの期間限定オファー)です。1時間の会議録音を10円台で処理できる水準まで来た、というのが2026年9月時点の状況です。
社内用語や人名の誤変換が減るのはなぜ?
議事録の手直しで一番面倒なのが、固有名詞です。取引先の社名、製品のコードネーム、社内でしか通じない略語。汎用の音声認識モデルにとって、これらは学習中にほとんど見たことのない「未知語」です。聞こえた音に一番近い、知っている単語へ引き寄せて書いてしまいます。
ここに効くのが、MAI-Transcribe-1.5から入ったキーワードバイアシングという機能です。バイアシングは「偏らせる」という意味で、名前のとおりあらかじめユーザーが登録した単語のリストへ、AIの予測を寄せる仕組みです。人名・製品名・医療用語・社内略語などを渡しておくと、その語が使われる場面で優先的に選ばれるようになります。Microsoftは、この機能を使ったときWERを最大30%削減できると発表しています。
面白いのは、その寄せ方です。リストに載っている語を機械的に当てはめるわけではありません。Microsoftの説明では、モデルは盲目的にマッチを強制するのではなく、共有された文脈を使ってバイアシングを適用するタイミングを判断すると設計されています。
たとえば「アヤセ」という社名を登録したとして、会議で誰かが地名として「綾瀬」と言った場合まで社名に書き換えてしまうと、かえって誤りが増えます。前後の話の流れを見て、寄せるべき場面かどうかを判断する。ここが単なる辞書置換との違いです。
- 社外の人には通じない社内略語(「ニハン」「キタガワ案件」など)
- 参加者の姓名、特に読みが割れる名字
- 製品コードネーム、プロジェクト名
- 業界特有の専門用語
「誰が言ったか」はどう割り当てているの?
MAI-Transcribe-2で加わったもう一つの柱が話者分離(speaker diarization/スピーカー・ダイアライゼーション)です。複数人が発言する音声に対して、どの発言が誰のものかを自動で割り当てる機能を指します。
議事録として使えるかどうかは、ここで決まる部分が大きいと思います。文字列としては正しく起こせていても、「Aさんが提案し、Bさんが懸念を示した」という構造が失われると、決定事項の記録として成立しないためです。同時に入った単語レベルのタイムスタンプは、各単語が録音の何分何秒にあたるかを記録するもので、あとから該当箇所の音声を聞き直すときに効きます。
言語混在への対応も、実務では地味に効きます。HinglishやSpanglishのように、1つの発言の中で2つの言語が混ざるケースに対応したと発表されています。日本語の会議でも、英語の製品名や用語が頻繁に挟まる場面は珍しくありません。
それでも精度が落ちるのはどんなとき?
ここからが、この記事でいちばん渡したい部分です。MAI-Transcribe-2は雑音環境でも堅牢な性能を維持し、管理された録音環境を超えて品質を保つと説明されています。それでも、精度が落ちる場面は残ります。理由は技術の完成度ではなく、音声認識という技術が持っている前提そのものにあります。
複数人の声が重なると、原理的に弱い
音声認識システムは基本的に「1人の話者の発話」を処理するよう学習されています。1本の音声の流れに対して、そこに含まれる言葉を推定する。これが基本の枠組みです。そこへ2人の声が同時に流れ込むと、どちらの音を主として扱うべきかが定まらず、単語が抜けたり誤って認識されたりします。これはMAI-Transcribeに限らず、音声認識技術全般に共通する限界として指摘されています。
ここで、2種類の誤りの性質が違うことに注意してください。専門用語の誤変換は、その単語1つだけの局所的な間違いで済みます。読めば文脈から推測もできます。一方、発言の重なりは文単位で聞き取り不能を招きます。何を言ったか自体が残らないため、あとから復元できません。前者はキーワード登録で減らせますが、後者は会議の進め方でしか減らせない、という違いがあります。
会議の形式で精度は大きく変わる
実務系の集計値として、Microsoft Teamsの運用データでは、発言者が明確で交互に話す構造化された会議では書き起こし精度90〜95%、雑音や被り発言のある非公式な会議では75〜85%まで低下するという報告があります。理想的な条件では99%に達する一方、雑音下の複数話者会話では70〜85%まで落ち込むとされています。強い訛りは認識精度を最大40%低下させ、背景雑音は「誰が話したか」の割り当て誤りの30%超の原因になるという調査もあります。
ただしこれらは公式発表ではなく実務系ブログの集計値なので、参考程度の数字として受け取ってください。それでも、会議の形式によって精度の幅が20ポイント近く動くという傾向そのものは、実感と合うのではないでしょうか。
MAI-Transcribe-1や2が、Microsoft Teamsの会議文字起こし機能に実際にどこまで組み込まれているかは、公式発表の中に明記された記述を確認できませんでした。モデルの発表とTeamsの文字起こし精度は別々の情報源によるもので、両者が統合されているかどうかは未確認です。「Teamsを使えばこの精度になる」とは言えない点にご注意ください。
今日からできる、精度を上げる会議の作り方
モデル側の限界がわかると、打ち手は自然と決まります。AIが苦手な条件を、こちら側で作らないようにすればいい。Teamsでの実務上の対策として挙げられているものを、会議の流れに沿って並べます。
- 会議前:固有名詞を書き出す参加者の氏名、議題に出る製品名・プロジェクト名・社内略語をリスト化しておきます。キーワードバイアシングに対応したツールならそのまま登録し、対応していなくても、あとで一括置換する際のチェックリストとして使えます。
- マイクを分ける会議室の据え置きスピーカーではなく、参加者それぞれの個人デバイスのマイクを使います。声が1本の流れに混ざりにくくなり、話者分離の精度にも効きます。
- 発言を交互にする相づちを声に出さず、うなずきやリアクション機能で返すだけでも重なりは減ります。司会が「順番に一言ずつ」と回す形にすると、構造化された会議の条件に近づきます。
- 決定事項だけ口頭で復唱する会議の最後に決まったことを一人がまとめて話す。雑音も重なりもない単独発話なので、書き起こしがもっとも正確に残る場面になります。
- 会議後:固有名詞から直す全文を読み直すのではなく、事前のリストで検索して固有名詞を直し、次に話者の割り当てを確認します。誤りの出やすい順に見るほうが早く終わります。
音声認識モデルの精度競争は、2026年に入ってから半年で3世代進みました。ただ、モデルがどれだけ良くなっても、同時に2人がしゃべった音から失われた情報は戻ってきません。モデル側で減る誤りと、会議の作り方でしか減らない誤り。この線引きを持っておくと、次に新しいモデルが出たときも、自分の仕事に効くかどうかを自分で判断できるはずです。
よくある質問
MAI-Transcribe-2はいつ発表され、何が変わりましたか?
Microsoftが2026年9月3日に発表した音声認識モデルです。FLEURSベンチマークでの対応言語が25言語から60言語に拡大し、話者分離(発言を話者ごとに割り当てる機能)、単語レベルのタイムスタンプ、言語混在への対応、自動言語識別が新たに搭載されました。価格は発表時点の公表値で1時間あたり0.10ドル(年末までの期間限定オファー)です。
WERが3.7%から5.2%に上がったのは精度が落ちたということですか?
単純にそうとは言えません。WER(単語誤り率)はFLEURSという評価用テストセットで測る値ですが、評価対象の言語が25言語から60言語へ増えたため、測っている対象自体が変わっています。学習データの少ない言語が加われば平均値は上がります。Microsoftは60言語での評価で1位を維持したと発表しており、版をまたいだ数値の単純比較には注意が必要です。
キーワードバイアシングとは何ですか?
ユーザーがあらかじめ指定した人名・製品名・専門用語・社内略語などの単語リストへ、音声認識の予測を寄せる機能です。MAI-Transcribe-1.5で導入され、使用時にWERを最大30%削減できるとされています。リストの語を機械的に当てはめるのではなく、その場の文脈から適用すべきタイミングをモデルが判断する設計になっています。
複数人が同時に話すと書き起こし精度が落ちるのはなぜですか?
音声認識システムは基本的に1人の話者の発話を処理するよう学習されているためです。複数の声が同時に重なると、どの音を認識対象とすべきかが定まらず、単語の欠落や誤認識が起きます。これは特定のモデルの弱点ではなく音声認識技術全般に共通する限界であり、参加者が個々のマイクを使う、発言を交互にするといった運用面の工夫で減らすのが現実的です。
※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。