プライベートな発音練習: オンデバイス処理が重要な理由
発音アプリがクラウドで解析するとき自分の声に何が起きるのか、ローカル解析が練習のループそのものをどう変えるのか、そして録音する前にアプリへ確かめるべきこと。
結論
解析がどこで走るかは、3つのことを同時に決めます。声が端末の外に出るかどうか、答えが返るまでの速さ、そして練習量に誰かが上限をかけられるかどうか。 これは3つの別々の機能ではありません。すべて同じ設計上の選択から出てきます。1つ目は好みの問題ではありません。GDPRでは、生体データは個人を一意に識別できる技術的手段によって処理される場合に、特別なカテゴリーとして扱われます。音声の録音は、まさにそこに変えられるものです。規則の第9条を参照。
最初に気になるのはプライバシーで、それは本物の論点です。ただ、学習者にとってオンデバイスがいちばん効いてくるのは練習のループのほうです。ループは、返答が即座で、繰り返しが無料でなければ成立しません。
クラウド解析で実際に起きていること
録音ボタンを押すと、アプリが数秒の音声を取り込み、サーバーへ送ります。サーバーはモデルを走らせ、スコアを計算し、返してきます。この工程のあいだに、たぶん考えたことのない事実がいくつも成立しています。
あなたの声は、いまや他人のコンピューター上のファイルです。すぐ消されるのか、デバッグのためにしばらく保持されるのか、モデル改善のために残されるのかはポリシーの問題であり、正直な答えはマーケティングではなくプライバシーポリシーのほうに書いてあります。
さらに、自分が話している録音は中立なデータではありません。声そのものを含んでおり、声は生体情報です。個人を特定できますし、近年は本人の声を合成するのにも使えます。間違えた単語のリストとはカテゴリーが違います。
以上はクラウド解析を不当だと言うためのものではありません。惰性ではなく意識して決めるべきことだ、と言うためのものです。
より重いのはループの話
think という単語を直したいとします。効く方法はこうです。言う、何がまずかったかを聞く、ひとつ変える、また言う。90秒で10回。
ここにネットワークの往復を挟んでみてください。1回ごとに1〜2秒、電波が悪ければもっと待たされます。10回はもう作業になり、頭の中に持っていたもの、つまり「いま舌が何をしたか」は答えが来る前に消えています。
まだ試行を覚えているうちに届くフィードバックは、あとから届くフィードバックとは別の道具です。差は秒数では小さく、効果では大きい。
カウンターの問題
サーバー側の解析はリクエストごとにお金がかかります。その費用はどこかへ行かねばならず、行き先が上限です。1日5回、月20回、課金すれば無制限。
繰り返しの日次上限は、発音ツールに付けるものとしては奇妙です。繰り返しこそが仕組みだからです。ある音は5回試して翌日に持ち越すことでは上達しません。ひと続きで40回試し、30回目で何が変わったかに気づくことで上達します。上限が教え方ではなく課金の判断であるとき、それはやろうとしていることの正面から邪魔をします。
ローカル解析には1回あたりの費用がないので、数えるものがありません。
オフラインはニッチではない
静かな10分が実際に取れる場所は、まともな通信がない場所であることが多い。飛行機、地下鉄、地下のオフィス、ローミングが高い国。そこで練習ツールが止まるなら、それはもう手が伸びるツールではありません。
正直なトレードオフ
オンデバイスはタダではありません。
モデルが小さくなければならない。 端末で走るモデルは、サーバーが抱えられるものと比べて量子化され圧縮されています。これは実在する天井であり、だからこそ有用な設計は狭いものになります。何でもそこそこにこなすのではなく、発音の採点をきちんとやる。
アプリのダウンロードが重くなる。 モデルがアプリの中に同梱されるので、APIを呼ぶだけの薄いクライアントよりインストールが大きくなります。
古い端末はつらい。 解析が遅すぎてループを保てなくなる、端末の下限があります。
更新はリリース作業になる。 サーバー上のモデルを良くすれば全員に一度に届きます。オンデバイスのモデルを良くするにはアプリを出し直す必要があります。
これがコストです。速く・無制限に・プライベートに繰り返せることに価値が乗るツールなら、払う価値があります。可能なかぎり大きなモデルが要るツールなら、ありません。
スピーキングアプリに投げる4つの質問
- 音声は端末の外に出るか。 明確な「いいえ」が返ってこないなら、出ると考えてください。
- 出るなら、どれだけ保持され、学習に使われるか。 これはプライバシーポリシーにあります。機能一覧にはありません。
- 機内モードで動くか。 解析がどこで走っているかを確かめる、いちばん速いテストです。
- 試行回数に日次・月次の上限があるか。 上限は、誰も説明してくれなくてもアーキテクチャを教えてくれます。
Phonemaの答えはいつも同じです。解析はiPhone上で走り、音声はそこから出ず、アカウントもカウンターもなく、通信を切っても動きます。これはクラウド一般への態度表明ではありません。練習のループが要求している条件です。
アーキテクチャではなく練習方法が知りたい場合は英語の発音を自分で確認する方法から、解析が実際に何を計算しているのかは文単位のスコアだけでは足りない理由をどうぞ。
よくある質問
発音アプリにインターネット接続は必要ですか? 解析がサーバーで行われる場合だけ必要です。端末上でモデルを動かすアプリなら、通信を切ったままでも発音を採点できます。
スピーキングアプリを使うと自分の声はアップロードされますか? 解析がクラウドで走るならされます。音声は端末を離れ、その後どう扱われるかはプライバシーポリシーに書かれているとおりになります。
発音アプリに試行回数の上限があるのはなぜですか? サーバー側の解析はリクエストごとに費用がかかるため、その上限は教え方の判断ではなく課金上の判断です。
端末上での音声解析にはどんな欠点がありますか? モデルはアプリの中に収まり端末で動く大きさでなければならないため、プライバシーと速さを、サイズと古い端末が扱える範囲と引き換えに手に入れることになります。