議事録AIが名前を聞き間違える理由と精度の上げ方
画像出典: 写真: Heather.utley(CC BY-SA 4.0 / Wikimedia Commons)
議事録AIは「音を音素に変換する音響モデル」と「単語のつながりやすさで文字に決める言語モデル」の二段構えで動いています。固有名詞や同音異義語が崩れるのは、言語モデルが持っている語彙と出現確率のなかに、その会議で使う言葉が入っていないためです。だから精度を上げる打ち手は、辞書登録で語彙を教える・音を区切って話す・誤りやすい箇所だけ人が確認する、の3つに集約されます。
議事録AIの誤変換には、はっきりした偏りがあります。雑談や一般的な言い回しはきれいに起こせるのに、社名・人名・製品名・業界用語だけが決まって崩れる。そして同じ会議で何度も同じ間違い方をする。この「決まったところだけ間違える」という性質が、実は仕組みの側から説明できます。
正直なところ、ツールを乗り換えても、この偏りが根本から消えることはあまりありません。どの議事録AIも大枠は同じ処理をしているからです。逆に言えば、その処理の流れを知っていれば、ツールを変えずに誤変換を減らす手が打てます。仕組みの話から入って、最後は今日の会議から使える運用まで持っていきます。
議事録AIは音声をどう文字にしているのか?
音声認識は、ひとつの巨大な変換器が音をそのまま文章にしているわけではありません。音響分析 → 音響モデル → 言語モデルという3つの段階を通ります。ここを分けて理解すると、どこで何が壊れているのかが見えてきます。
- 音響分析マイクが拾ったアナログの音をデジタルに変換し、周波数・時間の並び・強弱といった「特徴量」(音の性質を数値の並びに直したもの)を取り出します。ここはまだ言葉ではなく、音の物理的な特徴の段階です。
- 音響モデル取り出した特徴量を、学習済みの音のデータと照らし合わせて音素(「か」を k と a に分けたときの、言葉を構成する最小の音の単位)を特定します。ここでの出力は「どんな音が並んでいたか」であって、まだ意味を持ちません。
- 言語モデル並んだ音素を、単語どうしの出現しやすさをもとに文字に落とし込みます。「こうしょう」という音の並びに対して、前後の言葉から見ていちばんありそうな表記を選ぶのがこの段階です。
この分業がわかると、誤変換の見え方が変わります。社名が別の言葉になるのは、耳(音響モデル)が聞き取れなかったからではなく、言葉を決める側(言語モデル)が「その表記の候補」を持っていなかったからです。音としては正しく拾えているのに、最後の一歩で知っている単語に引き寄せられて着地している。同じ会議で同じ間違いを繰り返すのは、毎回まったく同じ判断が再現されているからです。
滑舌が無関係とまでは言えませんが、原因の比重はもっと後ろの段階にあります。特に日本語では、この最後の段階がかなり難しい仕事を任されています。
なぜ固有名詞と同音異義語ばかり間違えるのか?
日本語は世界の言語のなかでも同音異義語がとりわけ多い言語です。「こうしょう」ひとつ取っても、交渉・考証・高尚のように3つ以上の候補が並ぶケースは珍しくありません。音の並びだけでは正解を決められないので、言語モデルは前後の文脈から確率で選ぶしかない。つまり同音異義語の変換は、聞き取りの問題ではなく確率的な賭けです。
この構造から、崩れやすい言葉の条件が導けます。
- 会社名・部署名・人名(一般語と音が重なるものは特に)
- 社内でしか使わない略語やプロジェクト名
- 業界特有の専門用語
- 同音異義語が複数ある一般語(交渉/考証、機械/機会 など)
- 表記のゆれがある言葉(AI/エーアイ/AI)
共通しているのは、一般的な日本語の世界では出現頻度が低いのに、その会議のなかでは頻出する言葉だという点です。言語モデルが学習した「世の中でよく出てくる言葉の並び」と、あなたの会議室で交わされている言葉の分布がずれている。専門用語や固有名詞が多い会議ほど文字起こしの精度が下がりやすいのは、このずれがそのまま誤変換の量になるからです。
そしてここが大事なところですが、このずれは埋められます。世の中の頻度は変えられなくても、そのツールが参照する語彙の側に、自分たちの言葉を足すことはできるからです。
精度を上げる打ち手はどこにあるのか?
打てる手は、処理の3段階のどこに効くかで整理できます。
| どの段階か | 効く打ち手 | 手間 |
|---|---|---|
| 音響分析(音の入力) | 固有名詞を一拍置いて発音する、文末を明瞭に、区切りに約0.5秒のポーズを入れる | 小 |
| 言語モデル(語彙) | ユーザー辞書に固有名詞・専門用語を読み仮名つきで登録、表記ゆれも網羅、頻出語には重み付け | 中(初回のみ重い) |
| 出力後(確認) | 固有名詞と数値だけを抜き出して突合、辞書の更新フローを回す | 小〜中(継続) |
効果がいちばん大きいのは真ん中の辞書登録です。自社用語を辞書に登録すると精度は大きく改善します。言語モデルが持っていなかった候補を直接渡す作業なので、原因にまっすぐ効くからです。
辞書登録は「読み仮名」と「ゆれ」まで入れる
社名を1つ登録して終わりにすると、効果が半分になります。読み仮名を添えることで音素の並びと表記が結びつき、表記ゆれ(AI/エーアイ/AI)を並べて登録することで、実際に会議で使われるどの形でも拾えるようになります。会議で毎回出てくる言葉には重み付け(ブースト)をかけられるツールもあり、候補が競り合ったときに自社の用語が勝つようになります。
話し方は「区切り」だけ意識すれば足りる
アナウンサーのように話す必要はありません。効くのは3点だけです。固有名詞の前で一拍置く、文末をはっきり言い切る、質問や話題の区切りで0.5秒ほど間を空ける。最後のポーズは、複数人の発話が重なるのを防ぐ効果もあります。同時に話されると音響分析の段階で特徴量が混ざり、その後の段階でどう頑張っても復元できません。
確認は「固有名詞と数値」に絞る
全文を読み直すと続きません。誤変換には偏りがあるとわかっている以上、確認する箇所も絞れます。固有名詞と数値だけを抜き出して原文と突き合わせる、という形にすると、確認は数分で終わります。品質確認を仕組みにするなら、①固有名詞・数値を機械的に抽出して突合する自動確認、②見つかった誤りを辞書へ戻す更新フロー、③要約部分を複数のモデルで見比べる多重確認、という三層に分けて考えると設計しやすくなります。
この循環が運用の核心です。誤変換は毎回ランダムに起きるのではなく、語彙の穴があるところで再現的に起きます。修正した言葉を辞書へ戻す作業を続けると、穴が1つずつ埋まり、会議を重ねるほど直す量が減っていきます。逆にこの戻しをしないと、何ヶ月経っても同じ社名を手で直し続けることになります。
ツールを乗り換えれば解決するのか?
乗り換えが効く場面はあります。建設・IT/情報通信など、特定の業界の専門用語に強く作られた音声認識モデルが存在するためです。自分の会議で崩れる言葉が業界用語に集中しているなら、業界特化型のモデルを試す価値はあります。学習に使われた言葉の分布が、そもそも自分の会議に近いからです。
一方で、公表されている認識精度の数字は、そのまま自分の環境の予測にはなりません。たとえば独自の音声認識AIで96.2%の認識精度を掲げる会議音声の自動文字起こしシステムもありますが、これは提供事業者の公表値で、第三者による検証は確認できていません。録音環境・話者の人数・専門用語の多さが変われば結果も変わるため、数字は比較の目安として見て、最終判断は自分の会議の録音で試すべきです。
参加者が5人以上で同時に話す会議や、対面とオンラインが混ざって一部の声がスピーカー越しに入る環境では、音響分析の段階で音が混ざるため、辞書登録をどれだけ整えても精度の頭打ちが来ます。この場合はマイクの配置や、発言者ごとに音声を分けて録る方を先に手当てするほうが効果的です。また、辞書登録は初回にまとまった時間がかかるので、単発の会議1回のためだけに整備するのは割に合いません。同じメンバー・同じ用語で繰り返す定例会議にこそ効く手です。
今日の会議から始めるなら何をするか?
いきなり完璧な辞書を作る必要はありません。効き目が大きい順に、小さく始められます。
- 直近の議事録から誤変換を10個拾うすでにある文字起こしを開き、手で直した箇所を書き出します。ここに出てくる言葉が、あなたの会議で確率的に負けている語彙そのものです。
- その10個を読み仮名つきで辞書登録する表記ゆれがある言葉は、ゆれの形も一緒に入れます。この時点で、次の会議の誤変換はかなり減ります。
- 会議の冒頭で区切りのルールだけ共有する「固有名詞の前で一拍置く」「発言が終わったら少し間を空ける」の2つだけで十分です。ルールが多いと守られません。
- 会議後は固有名詞と数値だけ確認する全文を読み直さず、確認範囲を絞ります。見つけた誤りは、その場で辞書に戻します。
この4つを回すと、議事録AIは「間違えるもの」から「間違え方がわかっているもの」に変わります。仕組みの側から見れば、あなたがやっているのは言語モデルの語彙の穴を埋める作業であり、続けるほど穴は減っていきます。精度は買うものではなく、運用で育てるものです。
誤変換の一覧を眺めるのは気が重い作業ですが、それは同時に、いちばん効率よく精度を上げられる材料でもあります。まずは直近の議事録を1本開いて、直した箇所を数えるところからで十分です。
よくある質問
議事録AIが固有名詞を間違えるのはなぜですか?
音声認識は音を音素に変換する音響モデルと、音素を文字に決める言語モデルの二段構えで動いています。固有名詞が崩れるのは音を聞き取れないからではなく、言語モデルが持つ語彙と出現確率のなかにその社名・製品名が入っておらず、音の似た一般的な言葉に置き換えられてしまうためです。ユーザー辞書に登録すれば候補として認識されるようになります。
日本語の音声認識で同音異義語の誤変換が多いのはなぜですか?
日本語は世界の言語のなかでも同音異義語が特に多く、「こうしょう」に対して交渉・考証・高尚のように候補が3つ以上並ぶケースが珍しくありません。音の並びだけでは正解を決められないため、言語モデルは前後の文脈から確率で選びます。文脈が短い発言や、一般的でない使われ方をする言葉ほど外れやすくなります。
議事録AIの精度を上げるのにいちばん効果がある方法は何ですか?
自社の固有名詞・専門用語をユーザー辞書に登録することです。読み仮名を添え、AI/エーアイ/AIのような表記ゆれも網羅し、頻出する用語には重み付け(ブースト)をかけると効果が高まります。誤変換の原因である語彙の不足に直接対処する方法のため、話し方の工夫より効き目が大きくなります。
会議中の話し方で気をつけることはありますか?
固有名詞を発音するときに一拍置くこと、文末を明瞭に言い切ること、質問や話題の区切りのあとに約0.5秒のポーズを入れることの3点です。特に区切りのポーズは、複数人の発言が重なるのを防ぐ効果があります。発言が重なると音の特徴量が混ざり、あとの処理段階では復元できません。
※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。