PhonemaBlog

Qué es GOP (Goodness of Pronunciation) y por qué un score por frase no basta

Cómo funciona la puntuación GOP, qué te dice una nota por sonido que una nota por frase no puede darte, y las cuatro cosas que sigue haciendo mal.

Respuesta directa

GOP significa Goodness of Pronunciation: una forma de puntuar cada sonido de una frase por separado en vez de puntuar la frase entera. Lo presentaron Silke Witt y Steve Young en el año 2000 y sigue siendo la base de casi toda la corrección de pronunciación que te vas a encontrar en una app.

La diferencia práctica está en qué puedes hacer con el resultado. Una nota de 68 por frase te dice que lo intentes otra vez. Una nota por sonido te dice que la vocal de leave te salió como la de live, y eso ya te dice qué practicar.

Cómo se produce la nota

Tres pasos, ninguno misterioso.

1. Alineamiento. El sistema ya sabe qué ibas a decir, porque elegiste la frase o la escribiste. Usa ese texto para trocear tu grabación en segmentos, uno por sonido esperado. Se llama alineamiento forzado: no intenta adivinar qué dijiste, intenta localizar en qué punto de tu audio ocurrió cada sonido previsto.

2. Comparación. Para cada segmento, un modelo acústico entrenado con habla nativa se hace dos preguntas. ¿Cuánto se parece este audio al sonido que tocaba aquí? ¿Y cuánto se parece al sonido al que más se acerca, sea cual sea? La distancia entre las dos respuestas es la nota.

3. Agregación. Las notas de sonido se combinan en notas de palabra, y las de palabra en una nota de frase. Casi todas las apps te enseñan solo la última de esas tres cifras, y ahí es donde se pierde la información.

El artículo original lo plantea en términos de probabilidades posteriores: la nota de un fono es el logaritmo de la probabilidad del fono previsto dado el audio, normalizado por la duración del segmento. Si prefieres ir a la fuente, el PDF es público.

Por qué un número por frase no basta

Imagina que dos personas graban I think this is the third one y las dos sacan 68.

La primera pronunció todos los sonidos con limpieza pero fue acelerada, así que las fronteras entre segmentos quedaron sucias y la nota bajó de forma pareja. La segunda dijo think, this y third con /t/ y /d/ en lugar de las dos TH, y el resto le salió bien.

Los dos problemas piden soluciones opuestas. La primera tiene que frenar. La segunda tiene que trabajar la /θ/ sorda y la /ð/ sonora. El 68 no distingue entre las dos, y el consejo “vuelve a intentarlo” tampoco.

Ese es el fallo que convierte la práctica de pronunciación en repetición sin aprendizaje. Repites, el número se mueve un poco y nunca averiguas qué cambio lo movió.

En qué es buena una nota por sonido

Encontrar la palabra que falla. Con notas a nivel de sonido, una app puede señalar la palabra concreta de la frase que acabas de decir y avisarte de que fue la que se cayó. Eso ya es una palanca.

Detectar sustituciones constantes. Si la misma sustitución aparece en diez palabras distintas a lo largo de una semana, ahí hay un patrón que merece una hora de trabajo. Una nota por frase no puede enseñarte un patrón porque no tiene dónde guardar el detalle.

Separar un desliz de una costumbre. Un sonido que te sale bien nueve veces de cada diez no es lo que te está frenando. Uno que no te ha salido bien nunca, sí.

Ser rápida. La comparación es aritmética una vez que el modelo ha corrido. No necesita servidor ni esperar a nada, así que la respuesta puede llegarte mientras todavía recuerdas qué hizo tu boca.

Cuatro cosas que GOP hace mal

Límites honestos, porque una nota en la que confías a ciegas es peor que ninguna nota.

No mide inteligibilidad. Mide distancia respecto a un modelo de habla nativa. Las dos cosas correlacionan, pero no son lo mismo, y el estándar que de verdad importa es que quien te escucha te siga sin esfuerzo. Ver inteligibilidad frente a acento.

Penaliza variación legítima. El inglés tiene muchas variedades estándar. Un modelo entrenado sobre todo con una de ellas bajará la nota a las demás. Si una nota te lleva la contraria en una palabra que dices como la dice la gente de tu entorno, lo más probable es que la equivocada sea la nota.

Es sensible a la grabación. El ruido de fondo, un micrófono lejano, un resfriado o una voz baja bajan la nota sin que tu pronunciación haya cambiado nada. Graba en las mismas condiciones si quieres comparar entre días.

Necesita saber el objetivo. GOP puntúa tu audio contra un texto previsto. No puede corregir habla libre en la que nadie sabe qué querías decir, y por eso las apps que puntúan conversación abierta están haciendo otra cosa, normalmente más laxa.

Cómo usar una nota por sonido sin volverte loco

Trátala como una pista, no como un veredicto. El ciclo útil es corto: graba una frase, mira qué palabra se cayó, hazte una sola pregunta sobre ella, cambia una sola cosa y vuelve a grabar. Si una palabra baja tres veces seguidas en frases distintas, créetelo. Si baja una vez, en una grabación, ignóralo.

Phonema te lo enseña al nivel en el que puedes actuar, que son las palabras. El motor trabaja en sonidos porque ahí está la señal, pero lo que ves es la palabra que salió poco clara en la frase que estabas intentando decir. Tienes la versión larga de ese método en cómo comprobar tu pronunciación en inglés.

Preguntas frecuentes

¿Qué significa GOP en tecnología del habla? GOP significa Goodness of Pronunciation, un método de puntuación presentado por Silke Witt y Steve Young en el año 2000 que valora cada sonido de una frase por separado en lugar de valorar la frase entera.

¿Cómo se calcula una puntuación GOP? El sistema alinea tu grabación con los sonidos que la frase debería contener y luego compara cuánto se parece cada tramo de audio al sonido que se esperaba frente a cuánto se parece al sonido al que más se acerca.

¿Por qué no basta con una sola nota por frase? Dos personas pueden sacar la misma nota por motivos completamente distintos, y ninguna de las dos aprende qué cambiar solo con el número.

¿Una puntuación de pronunciación te dice si se te entiende? No. Una puntuación mide cuánto se parece tu audio a lo que el modelo espera; la inteligibilidad se mide por si quien escucha te sigue sin esfuerzo.

Sonidos relacionados