Phonema가 발음을 채점하는 방식
Phonema는 영어 발음을 연습하는 iOS 앱입니다. 이 페이지는 채점이 어떻게 작동하고 그 한계가 어디인지 설명합니다. 발음 점수는 그것이 어떻게 만들어졌는지 아는 만큼만 가치가 있기 때문입니다.
모델
Phonema는 음성 모델 wav2vec2 XLS-R을 사용하며, 사람이 발음을 주석한 공개 제2언어 영어 말뭉치 speechocean762로 음소 인식에 맞게 파인튜닝했습니다. CoreML로 변환해 앱 안에 함께 담습니다.
전부 기기에서 실행됩니다
모델은 당신의 iPhone에서 돌아갑니다. 녹음은 업로드되지 않고, 서버에 저장되지 않으며, 무엇을 학습시키는 데도 쓰이지 않습니다. 계정도, 음성 업로드 단계도 없습니다 — 앱이 오프라인에서 작동하는 이유와 사적인 이유는 같습니다. 온디바이스 처리가 중요한 이유도 보세요.
문장이 아니라 소리 단위로 채점합니다
영어는 42개 ARPAbet 음소로 채점합니다. 각각에 대해 GOP(Goodness of Pronunciation) 값을 계산합니다. 주변 맥락을 고려했을 때, 당신이 낸 소리가 그 단어가 요구한 소리라고 음향 모델이 얼마나 확신하는지를 나타내는 값입니다. 문장 전체의 단일 퍼센트는 실제로 어떤 소리가 무너졌는지를 가립니다. 그래서 이 앱은 소리마다 따로 채점하고 단어 수준으로 돌려줍니다. 자세한 내용은 GOP가 측정하는 것에 있습니다.
할 수 없는 것
점수는 청자가 아닙니다. 당신의 맥락도, 목표로 하는 억양도, 실제 사람이 당신을 이해했는지도 알지 못합니다. 자동 채점과 사람의 발음 판단은 관련은 있지만 같은 것이 아니며, 연구도 이를 분명히 말합니다 — 전달력 vs. 억양을 참고하세요. Phonema는 "어떤 단어가 불분명했는가"를 알려주려고 만들어졌습니다. "원어민처럼 들리는가"가 아닙니다. 이것은 의도한 설계이지, 우리가 덮으려는 결함이 아닙니다.