AI Teading - TeensPrueba tú mismo la IA

Parte 2 · La IA que ve y oye

2.4

La IA que ve el sonido

El ordenador no escucha el sonido. Lo convierte en un dibujo y lo mira.

H12 La máquina que solo entendía númerosP5 Hacer un espectrograma

La IA que ve el sonido

Ejercicio H12

Pulsa Registrar con la voz preparada. Y después pulsa Que hable otra persona.

Con la persona registrada acierta casi siempre. Con otra persona falla cerca de la mitad de las veces.

Este es el problema que el reconocimiento de voz no supo resolver durante setenta años. Cada persona tiene una voz distinta. Y una misma persona, si se resfría, ya suena diferente.

Pero ¿cómo maneja el sonido una máquina, para empezar?

Convierte el sonido en un dibujo

Aquí vuelve la historia del capítulo anterior.

Lo único que conoce un ordenador son números. Así que el sonido también hay que convertirlo en números. Pero al convertir sonido en números sale una fila larguísima de números: más de diez mil por segundo.

Mirando esa fila tal cual no se ve nada. Por eso se hace así:

Y entonces sale un dibujo. A esto lo llamamos .

Para leerlo basta con saber tres cosas: arriba y abajo es lo agudo o grave, a lo ancho es el tiempo, y cuanto más claro, más fuerte suena.

Ejercicio P5

Pulsa hola 1 y hola 2 y compara los dos dibujos.

La misma palabra da dibujos parecidos. Pero no idénticos: una persona no puede decir dos veces exactamente igual la misma palabra.

Pulsa también silbido y palmada. Son muy distintos de una voz. El silbido es una línea horizontal suave; la palmada es una línea vertical.

Y así volvemos a 2.2

Cuando el sonido se vuelve dibujo pasa algo divertido.

En 2.2 barríamos la foto con un filtro para encontrar rasgos. Con este dibujo se puede hacer exactamente igual.

Si pasas un filtro por encima del espectrograma salen los rasgos del sonido. Y apilando capas se reconocen cosas cada vez más grandes. Lo que en las fotos era línea → dibujo → bulto, en el sonido es sonido corto → trozo de palabra → palabra.

Es el mismo método. Solo cambió el material.

Hasta aquí la IA que ve y oye

Se acabó la parte 2. Al final, tanto las fotos como los sonidos se convierten en tablas de números, un filtro los barre, y al apilar capas se reconocen cosas cada vez más grandes.

Pero ¿quién decidió los números de dentro del filtro? Es la pregunta que dejamos pendiente al final de 2.2. La respondemos en la próxima parte.

Lo que sostiene este capítulo

  1. 4 Davis, Biddulph & Balashek, "Automatic Recognition of Spoken Digits", Journal of the Acoustical Society of America 24(6) (1952)
  2. 22 IBM ViaVoice user guide — "Enrollment" (reading set sentences to train the recogniser on one voice), 1990s editions

Ver la lista completa