Cómo se encuentran los rasgos
¿Has visto cómo se derrumba el de la izquierda?
Esa manera compara la letra entera, superponiéndola. Pone encima tu letra y el dibujo de referencia y cuenta cuántos píxeles no coinciden. Por eso, con que la inclines un poco o la escribas un poco más grande, los píxeles que no coinciden se disparan.
Una persona reconoce un 3 torcido como un 3. Porque conoce la forma del 3: arriba sobresale redondeado, en medio se estrecha, y abajo vuelve a ser redondo. A eso lo llamamos .
Pero ¿cómo se le hace encontrar rasgos a un ordenador?
Barrer con una ventana pequeña
La manera es sorprendentemente simple: hacer una ventana pequeña y pasarla por encima de la foto. A esa ventanita la llamamos .
La ventanita se va moviendo casilla a casilla por encima de la foto.
Dentro del filtro hay nueve números. Cuando el filtro se posa en un sitio, se multiplican uno a uno los nueve brillos de la foto de ese sitio por los nueve números del filtro y se suma todo. Ese es el resultado de ese sitio.
Multiplicar y sumar, eso es todo. Y sin embargo, según qué números pongas dentro del filtro, este cálculo tan simple encuentra solo las líneas verticales o solo las horizontales.
Con una sola capa no basta
Un filtro solo encuentra una clase de línea. Pero lo que queremos reconocer no es una línea, es un gato.
Por eso se apilan varias capas.
Se juntan las líneas que encontró la primera capa y por encima se pasa otro filtro. Entonces salen los dibujos que forman esas líneas. Si vuelves a pasar otro por encima, salen los bultos que forman esos dibujos.
Cuantas más capas, más grande es lo que se reconoce.
Los filtros que encuentran líneas están de verdad en la capa 1. No importa que no sea idéntico al tuyo: si hace lo mismo, está en el mismo sitio. Y si vas a la capa 3, se ven cosas como ojos o caras.
Apilando así las se llega a reconocer cosas cada vez más grandes en este orden: líneas → dibujos → bultos.
El de la derecha no compara la letra entera. Busca rasgos a trocitos y los junta. Por eso, aunque se incline un poco, los rasgos siguen ahí.
Pero ¿quién decide estos números?
Puede que te hayas dado cuenta de algo raro.
Antes hiciste un filtro que encuentra líneas horizontales. Pero en el mundo hay miles de cosas que reconocer: orejas de gato, ruedas de coche, trazos de letras, formas de hojas… ¿Podría una persona escribirlas todas una por una?
No puede. Y en una IA de verdad eso no lo escribe una persona.
Entonces, ¿quién lo decide? De eso hablamos en la próxima parte.
Lo que sostiene este capítulo
- 15 OCR-A (American Type Founders, 1968) · ANSI X3.17-1981 · ISO 1073-1
- 27 United States Postal Service, 1997 Annual Report, p.43 — the Remote Computer Reader, built on University at Buffalo (CEDAR) handwritten address interpretation
- 28 OCR trade histories on the first commercial installations (Shepard / Intelligent Machines Research Corp. at Reader's Digest, mid-1950s) — decade only; no primary source located
- H1 Son pesos que entrenamos nosotros. Las letras usadas para entrenar también las dibujamos nosotros
- P2·P3 Fotos que no necesitan atribución (CC0 · dominio público · Pexels)
- P3 Para sacar los mapas de reacción de las fotos usamos una red neuronal ya entrenada. No distribuimos sus pesos