「自分の発音が正しく採点されるか」を、わざと間違えずに測ります。
TTS で作ったミニマルペア(right / light など)を
既知の正解として入力し、システムの出力が変わるかどうかを見ます。
なぜこの測り方なのか: 音声認識は訛りに強くなるよう訓練されているため、 文脈があると誤った発音を正しい単語に引き戻してしまいます。 検出力があるかどうかは、機械が作った「確実に違う2音」で確かめるのが確実です。
お手本音声そのものを採点させます。ここで高得点が出なければ、採点自体が壊れています。 (TTS は雑音も息継ぎも無いため実際の人間より有利な条件です。あくまで上限の確認)
各ペアの2音声を続けて認識させます。出力が変われば検出力あり、 同じならそのペアは判別できません。
わざと間違える必要はありません。表示された2語を自然に発音してください。 ②で機械側に検出力があると確認できたペアだけが意味を持ちます。
先にモデルを読み込んでください。
通じにくさへの影響が最も大きいのは、音素の取り違えではなく
「語強勢の位置ずれ」と「母音挿入」です。
聞き手は強勢を手がかりに語を切り出すため位置がずれると語が伝わらず、
strike が su-to-ra-i-ku になるとリズムが壊れます。
この2つは信号処理だけで測れるため、モデルの読み込みが不要で、 認識エンジンが使えない環境でも動きます。 お手本音声14語での一致率は 音節数 86% / 強勢位置 89%(校正済み)。
読み込み中…
同じ語を3回言って、結果が安定するかを見ます。ばらつきが大きい採点は学習の役に立ちません。