La IA que ve el sonido
Con la persona registrada acierta casi siempre. Con otra persona falla cerca de la mitad de las veces.
Este es el problema que el reconocimiento de voz no supo resolver durante setenta años. Cada persona tiene una voz distinta. Y una misma persona, si se resfría, ya suena diferente.
Pero ¿cómo maneja el sonido una máquina, para empezar?
Convierte el sonido en un dibujo
Aquí vuelve la historia del capítulo anterior.
Lo único que conoce un ordenador son números. Así que el sonido también hay que convertirlo en números. Pero al convertir sonido en números sale una fila larguísima de números: más de diez mil por segundo.
Mirando esa fila tal cual no se ve nada. Por eso se hace así:
se corta el sonido en trocitos muy cortos,
en cada trocito se mide qué altura de sonido suena con qué fuerza,
y se pone cada medida en una columna, una al lado de otra.
Y entonces sale un dibujo. A esto lo llamamos .
Para leerlo basta con saber tres cosas: arriba y abajo es lo agudo o grave, a lo ancho es el tiempo, y cuanto más claro, más fuerte suena.
La misma palabra da dibujos parecidos. Pero no idénticos: una persona no puede decir dos veces exactamente igual la misma palabra.
Pulsa también silbido y palmada. Son muy distintos de una voz. El silbido es una línea horizontal suave; la palmada es una línea vertical.
Y así volvemos a 2.2
Cuando el sonido se vuelve dibujo pasa algo divertido.
En 2.2 barríamos la foto con un filtro para encontrar rasgos. Con este dibujo se puede hacer exactamente igual.
Si pasas un filtro por encima del espectrograma salen los rasgos del sonido. Y apilando capas se reconocen cosas cada vez más grandes. Lo que en las fotos era línea → dibujo → bulto, en el sonido es sonido corto → trozo de palabra → palabra.
Es el mismo método. Solo cambió el material.
Hasta aquí la IA que ve y oye
Se acabó la parte 2. Al final, tanto las fotos como los sonidos se convierten en tablas de números, un filtro los barre, y al apilar capas se reconocen cosas cada vez más grandes.
Pero ¿quién decidió los números de dentro del filtro? Es la pregunta que dejamos pendiente al final de 2.2. La respondemos en la próxima parte.
Lo que sostiene este capítulo
- 4 Davis, Biddulph & Balashek, "Automatic Recognition of Spoken Digits", Journal of the Acoustical Society of America 24(6) (1952)
- 22 IBM ViaVoice user guide — "Enrollment" (reading set sentences to train the recogniser on one voice), 1990s editions
- H12·P5 Las voces preparadas las hizo un ordenador. También se indica en pantalla
- H12·P5 Es lo que sale al registrar la voz preparada y probar los nueve. En coreano: la voz registrada seis veces y otra voz dos. En inglés: nueve y cuatro. En japonés: ocho y dos. En español: nueve y cuatro. En inglés y en español las palabras de los números suenan tan distintas entre sí que la diferencia entre voces se estrecha