いろは堂AI ← 戻る

AI翻訳の精度差はなぜ?確認すべき5箇所

2026年8月19日|いろは堂AI編集部
木製デスクでノートパソコンを操作する1人の手元とノート、飲み物

画像出典: StartupStockPhotos / Pixabay

この記事の要点
AI翻訳の精度が言語によってばらつく主因は、学習データ量の不均衡と言語構造(語順)の距離です。英語↔スペイン語のような近縁でデータの多いペアは安定しますが、構造の離れたペアや低リソース言語ほど崩れます。人が確認すべきは、語順・修飾の掛かり先、敬語などの丁寧表現、専門用語と固有名詞、数値と単位、否定表現の5箇所です。
😟
同じ原稿を英語とタイ語に訳したら、英語版は問題なかったのにタイ語版だけ現地から「意味がわからない」と言われました。同じAIを使ったのに、どうして差が出るんでしょう。

翻訳AIは、どの言語も同じ品質で訳しているわけではありません。言語ごとに得意・不得意がはっきりあり、その差は使う側からは見えにくいところにあります。訳文はどの言語でも同じように流暢に見えるからです。

正直なところ、この「見た目の流暢さ」が一番やっかいです。壊れた訳文なら気づけますが、自然な日本語・自然な英語に見えて中身がずれている訳文は、原文と突き合わせない限り気づけません。海外拠点へ送る社内文書で、それが起きると困ります。

ではなぜ言語によって差が出るのか。理由は大きく2つあり、どちらも仕組みを知ると「どこを疑えばいいか」が具体的に見えてきます。

なぜ言語によって翻訳精度が変わるのか?

理由の1つ目は学習データの量の差です。翻訳AIは、対訳になっている大量の文章(コーパスと呼びます。原文と訳文が対になった文章の集まりのことです)から、言い回しの対応関係を学びます。つまり、その言語ペアの対訳文がどれだけ集まっているかが、そのまま精度の土台になります。

ここに大きな不均衡があります。英語を軸にした学習データは、フランス語や中国語といった主要言語では豊富に存在しますが、それ以外の多くの言語になると急激に減ります。データが少ない言語は低リソース言語と呼ばれ、誤訳が生じやすくなることが指摘されています。

🤔
データが多ければ、どんな言語同士でもうまくいくということですか?

データ量だけでは説明しきれない部分があり、それが2つ目の理由――言語同士の構造的な距離です。英語とスペイン語のように語族が近く、語順や文の組み立て方が似ているペアでは、比較的高い精度が出やすいとされています。一方で、日本語と英語のように構造が大きく異なるペアでは、文の種類や内容によって精度が左右されます。

日本語と英語で何がそんなに違うのか?

Microsoft Research Asiaの周明(Ming Zhou)博士は、日本語が機械翻訳や音声認識で精度を出しにくい理由をこう説明しています。英語は「主語+動詞+目的語」の順に並ぶのに対し、日本語は「主語+目的語+動詞」で並ぶ。語順が根本から違います。さらに目的語から始まる語順、文末まで続く修飾語、敬語や機能語といった要素が加わるため、特別な扱いが必要になる、と。

これは感覚的な話ではなく、エラーの内訳にも表れています。同研究所の分析では、英語から日本語への翻訳で生じるエラーの要因は、「語順の乱れ」が44.7%、「単語選択のミス」が31%を占めていました。合わせて4分の3以上が、この2つに集中していることになります。

言語ペアの傾向(複数の解説記事からの整理)
  • 英語↔スペイン語など、近縁でデータが豊富なペア:安定しやすい
  • 日本語↔英語:構造が大きく異なり、文の種類・内容で精度が振れる
  • 低リソース言語を含むペア:データ量の少なさから誤訳が生じやすい

ここで大事なのは、語順の乱れは「訳文だけを読んでも気づけない」種類の誤りだということです。単語がすべて正しく訳されていて、日本語としても英語としても自然に読める。それでも「誰が誰に何をするのか」が入れ替わっていることがあります。訳文の流暢さは、正しさの証明にはなりません。

ツールを変えれば解決するのか?

ツール選びで改善する部分はありますが、限界もあります。DeepLが2024年7月に実施した調査では、プロの翻訳者によるブラインドテストで、DeepLの訳文がGoogle翻訳より1.3倍、ChatGPT-4より1.7倍の頻度で「より好ましい」と評価されたとされています。ただしこれはDeepL自身が実施した調査であり、中立の第三者による評価ではない点は差し引いて読む必要があります。

さらに実務で効いてくるのは、対応言語そのものです。DeepLは英語↔日本語のビジネスメールや技術文書、英語↔ドイツ語、英語↔フランス語・スペイン語・イタリア語で評価が高いとされる一方、2026年時点でタイ語・ベトナム語・アラビア語・ヒンディー語などには対応していません。冒頭のタイ語のケースのように、そもそも得意なツールが存在しない言語があるということです。

「精度が高い」という評価の読み方に注意

翻訳の品質評価には長らくBLEU(機械の訳文と人の訳文がどれだけ一致するかを自動採点する指標)が使われてきましたが、それだけでは語りきれないとして、COMET(人の評価により近づけることを目指した自動採点の指標)やBUFFET(多言語にまたがる性能をまとめて測るための評価の枠組み)といった新しい評価手法の研究が続いています。評価方法自体がまだ発展途上の分野です。「精度◯%」といった数字を見たときは、何をどう測った値なのかを確認してから判断してください。

英語以外で二重チェックすべきなのはどこか?

ここからが実務の話です。全文を人が読み直せるなら苦労はありませんが、現実には時間もコストも限られます。誤訳が起きやすい箇所は仕組みから絞り込めるので、そこに確認の労力を集中させます。

  1. 語順と修飾語の掛かり先「誰が」「誰に」「何を」が入れ替わっていないか。日本語⇄英語のように構造の異なるペアでは最優先。長い修飾語が別の名詞に掛かってしまう誤りも起きやすい箇所です。
  2. 敬語・丁寧表現のニュアンス日本語特有の要素で、機械翻訳が苦手とする部分です。社内向けか取引先向けかで文体が変わる文書では、訳出後に温度感を確認します。
  3. 専門用語・固有名詞・製品名ニューラル機械翻訳(文全体の文脈をふまえて訳文を生成する、現在主流の方式)でも誤訳の主因になりやすい箇所です。社内の呼称や製品名は、訳す前に用語の対応表を用意しておくと事故が減ります。
  4. 数値・単位・否定表現否定は誤訳の主因として挙げられており、しかも間違うと意味が正反対になります。「〜してはいけない」が「〜してください」になる事故は、規程やマニュアルでは致命的です。
  5. 原文の曖昧さが残っている箇所主語が省略された文、複数の解釈ができる文は、AIがどれか一つを勝手に選びます。訳文を直す前に、原文側を直すほうが早いことが多いです。
🤩
言語ごとにチェックの重さを変えればいいんですね。

確認の労力は、言語ペアごとに配分を変えるのが現実的です。データが豊富で構造の近いペアは軽めに、低リソース言語や構造の離れたペアは重めに。人手を均等に配るのではなく、崩れやすいところへ寄せる。これが仕組みを知っておく実利です。

チェックの手を増やせないときはどうするか?

現地の確認者を立てられない言語があるとき、次善の手が逆翻訳です。訳文をもう一度もとの言語へ訳し戻し、原文と読み比べます。語順の入れ替わりや否定の反転は、この工程で表面化しやすい誤りです。完全な検証ではありませんが、訳文だけを眺めるよりは崩れを拾えます。

もう一つは、翻訳前に原文を整えることです。一文を短くする、省略された主語を書く、二重否定を避ける、社内の略語を正式名称に開く。翻訳AIの誤りの多くは、原文の曖昧さをそのまま引き継いだ結果です。原文を1本直せば、展開先のすべての言語で同じ誤りが消えます。5言語に展開するなら、直す価値は5倍あります。

多言語展開の前にやっておくこと
  • 一文を短く区切り、省略された主語を書き足す
  • 製品名・部署名・社内用語の対応表を先に作る
  • 否定表現は「〜しないでください」と明確な形に統一する
  • 展開先の言語ごとに、確認者を立てられるかを事前に把握する
  • 確認者がいない言語では、逆翻訳を工程に組み込む

それでも残る限界をどう扱うか?

ここまで整理した「二重チェックすべき箇所」は、複数の解説記事や研究コラムからの整理であり、言語別の誤訳率を比較した統計データではありません。事例的な性質が強い整理だと理解したうえで使ってください。

そのうえで実務上の結論はシンプルです。翻訳AIは下訳としては十分に強力ですが、訳文の流暢さと正確さは別物です。読める訳文が出てきたことは、意味が通っていることの証明にはなりません。規程・契約・安全に関わる文書ほど、この差が効いてきます。

言語ごとの得意不得意を把握しておけば、どこに人の目を入れるかを判断できます。全部を疑う必要も、全部を信じる必要もありません。崩れやすい場所を知ってから配分を決めればいい話です。

よくある質問

AI翻訳の精度が言語によって変わる主な理由は何ですか?

主な理由は2つです。1つは学習データ量の不均衡で、英語を軸にした対訳データはフランス語や中国語では豊富ですが、その他の多くの言語では急減します。もう1つは言語同士の構造的な距離で、英語とスペイン語のように近縁なペアは精度が出やすく、日本語と英語のように語順が根本的に異なるペアは文の内容によって精度が左右されます。

日本語と英語の翻訳では、どんな誤りが多いのですか?

Microsoft Research Asiaの分析によると、英語から日本語への翻訳エラーの要因は「語順の乱れ」が44.7%、「単語選択のミス」が31%を占めます。英語は主語+動詞+目的語、日本語は主語+目的語+動詞と語順が根本的に異なり、さらに文末まで続く修飾語や敬語・機能語が加わることが背景にあります。

翻訳結果のどこを人が確認すべきですか?

優先すべきは5箇所です。(1)語順と修飾語の掛かり先、(2)敬語・丁寧表現のニュアンス、(3)専門用語・固有名詞・製品名、(4)数値・単位・否定表現、(5)原文の曖昧さが残った箇所。特に否定表現は誤訳すると意味が正反対になるため、規程やマニュアルでは重点的に確認します。

確認できる人がいない言語では、どうすればいいですか?

逆翻訳が次善の手になります。訳文をもとの言語へ訳し戻して原文と読み比べると、語順の入れ替わりや否定の反転といった誤りが表面化しやすくなります。あわせて、翻訳前に原文の一文を短くする、省略された主語を書き足す、社内の略語を正式名称に開くといった整備をしておくと、展開先のすべての言語で同じ誤りを防げます。

※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。