Phonemaブログ

SiriやAlexaがあなたの英語を聞き取れない理由(と実際に効く対策)

Siri、Alexa、音声入力が非ネイティブの英語を誤認識しやすい理由、特に誤りが多い音、そして人にも機械にも伝わるために何を練習すべきかを解説します。

結論

音声アシスタントがあなたの言葉を聞き間違えるのは、故障しているからではありません。ネイティブ、多くの場合アメリカ英語を中心に学習されているため、アクセントのある発話がモデルの想定する音のパターンから外れてしまうのです。 The Washington Post が報じた比較テストでは、GoogleとAmazonのスマートスピーカーは、非アメリカ系のアクセントを正しく理解する確率がネイティブより約30%低いという結果でした。

これは機械にも人にも伝わることを諦める理由にはなりません。音声認識モデルを混乱させる音は、たいてい人間の聞き手が聞き返したくなる音と同じです。そこを直せば効果は二重に返ってきます。

SiriやAlexaがアクセントのある英語を誤認識する仕組み

音声認識は、Siriでも、Googleアシスタントでも、Alexaでも、スマートフォンの音声入力キーボードでも、大量の学習音声から学んだパターンとあなたの発話の音を照合して動きます。その音声の大半はネイティブの英語で、しかもかなりの割合がアメリカ英語です。モデルは「どの音がどれか」の内部的な地図を作ります。「t」がどこで終わり「d」がどこから始まるのか、「長い」と判定されるには母音がどれだけ続く必要があるのか、速い発話で単語の切れ目はどう聞こえるのか。

非ネイティブの発話は、その地図にきれいには収まりません。想定よりわずかに短い母音、弱められたり脱落したりした語末子音、舌の位置が違う音は、地図のまったく別の領域に落ちてしまうことがあります。システムは意図的に不公平なわけではなく、あなたのような発話が十分に含まれていなかった学習データから得た統計を当てはめているだけです。

この仕組みを最も明確に示した研究は、実は非ネイティブの発話を扱ったものではありません。PNAS掲載のスタンフォード大学の研究は主要な音声認識システム5つを検証し、アフリカ系アメリカ英語を話す黒人話者の単語誤り率が平均約35%、同じ地域の白人話者では約19%だったと報告しています。誤りはおよそ2倍で、どちらも英語のネイティブ話者です。つまり問題は「非ネイティブであること」ではありません。学習音声で十分に代表されていない変種であれば、どれであっても精度は落ちるということであり、非ネイティブ英語はまさにその代表が少ない側にいます。

特に誤認識されやすい音

アクセントに関連する文字起こしの誤りには、繰り返し現れる対比があります。

  • think の /θ/:thinkthreethroughsinktreethrew と書き起こされがちです。/θ/ は世界の言語の中でも珍しく、/t/、/s/、/d/ に置き換えられやすいためです。
  • 語末の子音:want の /t/ や called の /d/ のような語末の音は、多くのアクセントで弱まるか脱落します。音声入力はその最後の音を強く手がかりにするため、wantwon に、workedwalk になります。
  • ship の短い /ɪ/sheep の長い /iː/:shipsheepliveleave の長さの差はわずかですが決定的です。音声モデルはこの差でよく似た語を切り分けており、人間の聞き手も同じです。これは古典的な最小対立ペアと同じ対比です。
  • red の /ɹ/:英語の音声認識の多くは R を発音する(rhotic な)変種で学習されています。ふるえ音や弾き音、別の舌の形で作られた R は、別の音として読まれるか、文字起こしから消えてしまうことがあります。

どれも特殊な音ではありません。ごく普通で頻度の高い英語の音が、たまたまモデルがどこかに引かなければならない判定の境界線の近くにあるだけです。

聞き取ってもらえなかったときの応急処置

音声アシスタントや音声入力に誤認識されたその場では、同じ文をより大きな声で繰り返すより、次の習慣のほうが効きます。

  • 間違えられた単語だけを切り出す。 その一語だけを言い、そこから文を組み立て直します。速くつながった句より、はっきりした一語のほうがソフトにも人にも捉えやすくなります。
  • 語末の子音を最後まで出す。 鍵になる語の終わりの音をわずかに長めに——want は /t/ を開放し、called は /d/ をはっきりと——駆け抜けないようにします。
  • 重要な語の直前に短い間を置く。 すべての語の前ではありません。内部に間のない速い文は、モデルにとっても人にとっても区切りにくくなります。
  • 繰り返すより言い換える。 特定の語が何度も失敗するなら、その音を避けられる同義語のほうが、同じ語と5回戦うより速いことがよくあります。
  • 感覚ではなく文字起こしを見る。 特定の語のペア(think/sinkship/sheep)が繰り返し入れ替わるなら、それは「自分のアクセントが悪い」という漠然とした感覚ではなく、練習可能な具体的な手がかりです。

良い面:同じ練習が人にも効く

ここが、この厄介な問題の役に立つ部分です。上に挙げた音はどれも、機械に対してだけ意味があるわけではありません。語末の子音、母音の長さ、/θ/ は、人間の聞き手が一度で理解できるか聞き返すかを決める、まさにその種の細部です。アクセント自体は問題でないのに発音に取り組む価値があるのかと考えたことがあるなら、それは別の重要な問いです。伝わりやすさ vs. アクセントを読んでみてください。

音声認識の失敗は、ある意味で非常に直接的で再現性のあるフィードバックです。人は語が不明瞭でも文脈から理解できますが、アプリには頼れる文脈がないため、明瞭さが崩れた場所をそのまま示してくれます。

より新しい種類のツールは逆のことをします——あなたのアクセントを理解しようとする代わりに、通話中にリアルタイムで書き換えます。それが本当に役立つかは、ひとつの会話を乗り切りたいのか、すべての会話でより明瞭でいたいのかによります。

機械ではなく人に向けて、プライベートに練習する

この問題にはもう一つの層があります。Siriやアレクサ、音声入力キーボードに聞き間違えられるたび、あなたの声はたいてい端末を離れ、サーバーへ送られて答えを得ています。自分のアクセントを理解しづらいシステムに不安があるのなら、練習のたびにその声を送り続けるのは割に合う取引とは言えません。

Phonemaは発音の採点をすべてあなたのiPhone上で、単語ごとに、ここで説明したのと同じ音レベルの細かさで行います。録音をどこにもアップロードしません。オンデバイス処理が重要な理由と、採点の仕組みであるGOP(Goodness of Pronunciation)が測るものもあわせてどうぞ。

まとめ

SiriやAlexaが聞き間違えるのは、あなたの英語が下手だからではなく、あなたのアクセントが学習音声で十分に代表されていないからです。同じ偏りはネイティブの変種にも及びます。文字起こしを最も壊すのは /θ/、語末の子音、ship/sheep の母音の長さの対比、そして /ɹ/ の4つ。これは人間の聞き手があなたを理解するために使うものと同じなので、機械が聞いていてもいなくても練習する価値があります。

関連する音