Saltar al contenido
Volver al curso

Semana 3 · Lección 2 · 45-55 minutos

Entrena y prueba un clasificador

Aprende por qué se revisa un clasificador con fotos con las que nunca se entrenó, y mide qué tan bien le va usando la exactitud sobre un conjunto de prueba justo.

Materiales
Esta lección en un navegador web · Papel y lápiz, o una app de notas · El conjunto de prueba etiquetado incluido que aparece en la lección
Esta lección
En curso

Se guarda solo en este dispositivo

Lo que vas a poder hacer

  • Explicar por qué un clasificador se prueba con fotos aparte con las que no se entrenó.
  • Calcular la exactitud como predicciones correctas sobre el total de predicciones.
  • Leer la exactitud por categoría y detectar cuál categoría es la más débil.
  • Explicar por qué un solo número de exactitud general puede esconder una categoría débil.

Para pensar

Un clasificador acierta absolutamente todas las fotos de entrenamiento. Quienes lo hicieron dicen que es "perfecto". Después se topa con fotos totalmente nuevas y falla en muchas. ¿Qué salió mal en la forma en que lo midieron?

Piensa en la diferencia entre memorizar las respuestas y de verdad aprender el patrón.

Haz una predicción

Predice: si un clasificador saca 90% de exactitud general con gatos, perros y conejos, ¿crees que le va igual de bien en las tres categorías?

Exactitud
Con qué frecuencia acierta un clasificador; normalmente el número de predicciones correctas dividido entre el total de predicciones, mostrado como porcentaje.
Exactitud por categoría
La exactitud medida por separado para cada categoría, para que puedas ver cuáles maneja bien el clasificador y con cuáles batalla.
Conjunto de prueba
Un grupo de fotos etiquetadas apartadas y nunca usadas en el entrenamiento, que sirve para revisar de forma justa qué tan bien le va al clasificador con imágenes nuevas.
Conjunto de entrenamiento
Las fotos etiquetadas de las que el clasificador aprende sus patrones antes de que se le ponga a prueba.

Por qué se prueba con fotos con las que el clasificador nunca se entrenó

Un clasificador aprende de un conjunto de entrenamiento. Si después lo pruebas con esas mismas fotos, puede verse fantástico simplemente por haberlas memorizado, como un estudiante que vio de antemano las preguntas exactas del examen. Esa calificación no te diría cómo le va con fotos nuevas.

Por eso guardamos un conjunto de prueba aparte: fotos etiquetadas apartadas y nunca usadas en el entrenamiento. Probar con fotos que el clasificador no ha visto es la forma justa de medir si de verdad aprendió el patrón.

  • Entrenar con 800 fotos de mascotas y luego probar con 200 fotos distintas de mascotas.
  • Una calificación alta de entrenamiento junto con una baja de prueba es señal de alerta de memorización.
  • Las fotos de prueba también deben estar etiquetadas, para poder revisar cada predicción.

Exactitud: con qué frecuencia acierta el clasificador

La exactitud es la calificación más sencilla: el número de predicciones correctas dividido entre el total de predicciones, escrito como porcentaje. Si el clasificador acierta 90 de 100 fotos de prueba, su exactitud es del 90%.

La exactitud es fácil de entender, y por eso es tan común. Pero un solo número lo cubre todo a la vez, así que puede esconder problemas, y ahí es donde entra la exactitud por categoría.

  • 45 aciertos de 50 fotos es 90% de exactitud.
  • Dos clasificadores pueden tener la misma exactitud y cometer errores muy distintos.
  • La exactitud solo tiene sentido con un conjunto etiquetado, donde conoces las respuestas correctas.

La exactitud por categoría cuenta la historia completa

La exactitud por categoría mide la calificación de cada categoría por separado. La exactitud general podría ser del 90%, pero el clasificador podría acertar los gatos el 98% de las veces y los conejos solo el 74%. El número general promedió calladito la categoría débil.

Desglosar la exactitud por categoría te muestra exactamente dónde mejorar. Suele ser el primer paso para descubrir qué categoría confunde el clasificador, el tema de la siguiente lección.

  • General 90%, pero gatos 98%, perros 92%, conejos 74%.
  • Una categoría débil puede quedar escondida si tiene pocas fotos en el conjunto de prueba.
  • Arreglar la categoría más débil suele ser lo que más sube la exactitud general.

Ejemplo resuelto

Medir de forma justa un clasificador de mascotas

  1. Divide las fotos: 800 van al conjunto de entrenamiento y otras 200 distintas al conjunto de prueba.
  2. Entrena: el clasificador aprende los patrones de gato, perro y conejo solo con las 800 fotos de entrenamiento.
  3. Prueba: pasa las 200 fotos apartadas y compara cada predicción con la etiqueta verdadera.
  4. Exactitud general: 180 de las 200 fueron correctas, así que 180 ÷ 200 = 90% de exactitud.
  5. Por categoría: gatos 98%, perros 92%, conejos 74%. Los conejos están jalando todo hacia abajo, aunque el 90% general se veía sólido.

Lo importante: Prueba con fotos apartadas, calcula la exactitud como aciertos sobre el total, y luego desglósala por categoría para hallar el punto débil que esconde el número general.

Exactitud por categoría en el conjunto de prueba

Una gráfica de barras de la exactitud por categoría, en porcentaje, sobre el conjunto de prueba de 200 fotos. Los gatos están en 98 por ciento, los perros en 92 por ciento y los conejos apenas en 74 por ciento. Una línea punteada de referencia marca el 90 por ciento de exactitud general. La gráfica deja claro que los conejos son la categoría más débil y están jalando hacia abajo la calificación general, aunque el número general por sí solo se veía sólido.

El 90% general esconde que los conejos están muchísimo más débiles que los gatos y los perros.

Por qué un conjunto de prueba aparte es justo

Antes (injusto): el clasificador se prueba con exactamente las mismas fotos con las que se entrenó, así que puede sacar una calificación alta solo por haberlas memorizado, y esa calificación no predice cómo maneja fotos nuevas. Después (justo): las fotos se dividen para que el entrenamiento y la prueba usen fotos distintas; el clasificador se califica solo con fotos que nunca vio en el entrenamiento, lo que muestra si de verdad aprendió el patrón.

Probar con fotos que el clasificador no ha visto es lo que hace confiable la calificación.

Actividad

Entrena y prueba un clasificador

Elegir un tema, escoger las imágenes de entrenamiento, entrenar de verdad un clasificador en tu dispositivo, y leer la exactitud general, la exactitud por categoría y una matriz de confusión sobre imágenes nunca vistas.

  1. Elige un tema y lee las categorías.
  2. Elige con qué imágenes entrenar (con el teclado o tocando) y observa los conteos por categoría.
  3. Predice cuál va a ser la categoría más fácil y la más difícil, entrena y después lee los resultados, la matriz de confusión y la exactitud por categoría.

1 · Elige un tema de clasificación

2 · Categorías

Círculo
Una figura redonda sin esquinas.
Triángulo
Una figura con tres lados rectos y tres esquinas.
Cuadrado
Una figura con cuatro lados rectos iguales y cuatro esquinas.
3 · Elige las imágenes de entrenamiento

Las imágenes seleccionadas son de las que aprende el modelo. Desactiva alguna para ver cómo cambia el resultado.

Por categoría:Círculo: 3Triángulo: 3Cuadrado: 3

Este modelo de clase es un clasificador de vecinos más cercanos sobre características simples de forma: corre por completo en tu dispositivo, sin cámara, sin internet y sin ningún servicio grande de IA. Es simple a propósito, así que comete el mismo tipo de errores que aquí puedes ver y explicar.

Revisa lo que entendiste

Responde esto para comprobar que sabes medir un clasificador de forma justa con la exactitud.

  1. Question 1. Un clasificador acierta 45 de 50 fotos de prueba. ¿Cuál es su exactitud?

  2. Question 2. ¿Cuál clasificador se midió de forma justa?

    El equipo A prueba su clasificador con exactamente las mismas 500 fotos con las que se entrenó y reporta 99%. El equipo B aparta 100 fotos, entrena con el resto y prueba solo con las 100 apartadas.

  3. Question 3. Decide si la afirmación es verdadera o falsa.

    Un solo número de exactitud general puede esconder que al clasificador le va mal en una categoría concreta.

0 de 3 respondidas

Pruébalo tú

Divídelo de forma justa

Diseña un plan justo de entrenamiento y prueba para un clasificador que ordene fotos de tres tipos de fruta, y describe qué medirías.

  1. Decide cuántas fotos van al conjunto de entrenamiento y cuántas se apartan para el conjunto de prueba.
  2. Explica por qué las fotos de prueba no deben usarse durante el entrenamiento.
  3. Enumera los números de exactitud que reportarías: la exactitud general y la exactitud de cada fruta.

Lo lograste cuando

  • Una división clara de las fotos en grupos de entrenamiento y de prueba.
  • Una razón por la que las fotos de prueba deben quedar fuera del entrenamiento.
  • Se nombran tanto la exactitud general como la exactitud por categoría entre las cosas que hay que reportar.

Reflexión

Se guarda en este dispositivo mientras escribes

Por favor no incluyas información privada. Tus respuestas se guardan solo en este navegador y nunca se envían a ningún lado.

Repaso

Un clasificador se mide de forma justa sobre un conjunto de prueba apartado usando la exactitud, y desglosar la exactitud por categoría revela puntos débiles que el número general esconde.

  • Prueba con un conjunto aparte de fotos con las que el clasificador nunca se entrenó.
  • La exactitud son las predicciones correctas divididas entre el total de predicciones.
  • La exactitud por categoría muestra cuál categoría es la más débil, incluso cuando la calificación general se ve sólida.

Extensión para 7.º y 8.º

Cuando la exactitud puede engañar

Imagina un conjunto de prueba que es 95% gatos y solo 5% conejos. Un clasificador flojo que respondiera "gato" siempre sacaría 95% de exactitud fallando en todos los conejos. La exactitud alta esconde un fracaso total con los conejos.

Explica por qué importa la mezcla de categorías de un conjunto de prueba. ¿Qué podrías medir o cambiar para que un clasificador no pueda "hacer trampa" ignorando una categoría poco frecuente?

Termina esta lección

  • Attempt the knowledge check: sin hacer
  • Save a reflection (recommended): sin hacer

Haz la revisión de conocimientos para terminar esta lección.