Saltar al contenido
Volver al curso

Semana 2 · Lección 2 · 45-55 minutos

Datos de entrenamiento frente a datos de prueba

Descubre por qué a un modelo se le enseña con un conjunto de ejemplos y se le revisa con otro, y cómo probarlo con ejemplos que nunca vio mide si de verdad aprendió el patrón.

Materiales
Esta lección en un navegador web · Papel y lápiz, o una app de notas · El conjunto de datos de animales incluido que aparece en esta lección
Esta lección
En curso

Se guarda solo en este dispositivo

Lo que vas a poder hacer

  • Explicar la diferencia entre datos de entrenamiento y datos de prueba.
  • Describir por qué un modelo debe probarse con ejemplos de los que no aprendió.
  • Definir generalización y exactitud y conectarlas con las pruebas.

Para pensar

Un maestro reparte una hoja de práctica y luego pone un examen con exactamente las mismas preguntas y respuestas. Si todos sacan 100 por ciento, ¿eso prueba que aprendieron el tema, o solo que memorizaron esas respuestas?

Guarda esta idea: un modelo revisado con los mismos ejemplos de los que aprendió tiene el mismo problema.

Haz una predicción

Predice: si pruebas un modelo solo con los mismos ejemplos con los que se entrenó, ¿su calificación te dirá qué tan bien maneja ejemplos completamente nuevos?

Entrenamiento
Mostrarle a un modelo muchos ejemplos etiquetados para que pueda aprender el patrón que conecta las características con una categoría.
Prueba
Revisar un modelo con ejemplos etiquetados nuevos, de los que no aprendió, para ver qué tan bien funciona de verdad.
Datos de entrenamiento
Los ejemplos de los que aprende un modelo durante el entrenamiento.
Datos de prueba
Un conjunto aparte de ejemplos, apartados del entrenamiento, que se usa solo para revisar el modelo.
Generalización
Qué tan bien funciona un modelo con ejemplos nuevos que nunca ha visto, no solo con aquellos de los que aprendió.
Exactitud
La proporción de ejemplos de prueba que un modelo etiqueta correctamente, muchas veces escrita como fracción o como porcentaje.

Entrenamiento: aprender el patrón a partir de ejemplos

El entrenamiento es el paso en el que un modelo observa muchos ejemplos etiquetados y aprende un patrón que conecta las características con las categorías. Los ejemplos que se usan para esto son los datos de entrenamiento.

Durante el entrenamiento, el modelo puede ver tanto las características como la etiqueta correcta de cada ejemplo, así que puede ajustarse hasta que sus respuestas tiendan a coincidir con las etiquetas.

  • Mostrarle a un modelo 100 filas de animales etiquetadas para que aprenda que "tener alas casi siempre significa ave"
  • Alimentar un filtro de spam con miles de correos ya marcados como spam o no spam

Prueba: una revisión justa con ejemplos nunca vistos

Si solo revisaras un modelo con los mismos ejemplos de los que aprendió, podría limitarse a repetir respuestas que ya memorizó, como un estudiante al que le preguntan exactamente la hoja de práctica que estudió. Eso no probaría que aprendió nada útil.

Por eso apartamos algunos ejemplos como datos de prueba. El modelo nunca se entrena con ellos. Probar significa aplicar el modelo a ese conjunto aparte, nunca visto, y comparar sus respuestas con las etiquetas verdaderas. Esa sí es una revisión justa de lo que realmente aprendió.

  • Apartar 20 filas de animales; entrenar con las otras 80; luego probar con las 20 filas apartadas
  • Una hoja de práctica para estudiar y un examen aparte con el que te califican

Generalización y exactitud

La generalización es qué tan bien le va a un modelo con ejemplos nuevos que nunca ha visto. Un modelo que generaliza bien aprendió el patrón real, no solo las filas exactas del entrenamiento. Probar con datos nunca vistos es la manera de medir la generalización.

La exactitud es una calificación sencilla de esa revisión: de todos los ejemplos de prueba, ¿qué proporción etiquetó bien el modelo? Si etiqueta correctamente 18 de 20 animales de prueba, su exactitud es 18/20, o sea 90 por ciento. Una exactitud alta con datos de prueba nunca vistos es la señal de que un modelo realmente generaliza.

  • 16 de 20 ejemplos de prueba correctos → exactitud del 80 por ciento
  • Un modelo con calificación alta en las filas de entrenamiento pero baja en las de prueba no generalizó

Ejemplo resuelto

Dividir 20 animales en entrenamiento y prueba

  1. Empieza con un conjunto de datos de 20 animales etiquetados (cada fila tiene características y una etiqueta de "ave" o "no ave").
  2. Divídelo: pon 15 filas en el conjunto de entrenamiento y aparta 5 filas como conjunto de prueba.
  3. Entrena: deja que el modelo aprenda el patrón usando solo las 15 filas de entrenamiento.
  4. Prueba: muéstrale al modelo las 5 filas apartadas sin sus etiquetas y anota sus respuestas.
  5. Calcula la exactitud: compara sus 5 respuestas con las etiquetas verdaderas. Si 4 son correctas, la exactitud es 4/5, o sea 80 por ciento, una medida de qué tan bien generaliza.

Lo importante: Entrena con una parte de los datos, prueba con una parte apartada y mide la exactitud sobre la parte nunca vista para juzgar la generalización.

Divide los datos y luego revisa

Dos etapas. Etapa 1 (Entrenamiento): los datos de entrenamiento, la mayoría de las filas, entran al modelo, que aprende un patrón. Etapa 2 (Prueba): entran los datos de prueba apartados, que el modelo nunca vio; sus respuestas se comparan con las etiquetas verdaderas para obtener una exactitud. La idea clave: las filas de prueba se mantienen completamente separadas del entrenamiento.

El modelo aprende de los datos de entrenamiento y se califica con datos de prueba aparte.

El mismo modelo, dos calificaciones

Una gráfica de barras que compara la exactitud de un mismo modelo con los datos con los que se entrenó frente a datos de prueba nunca vistos, medida en porcentaje. Barra 1, "Con datos de entrenamiento", 98 por ciento. Barra 2, "Con datos de prueba nunca vistos", 82 por ciento. La calificación de prueba es la medida honesta de qué tan bien generaliza el modelo; una barra de prueba mucho más baja advierte que el modelo sobre todo memorizó.

Actividad

Entrena, prueba y cambia los datos

Dividir un conjunto de datos de frutas espaciales en entrenamiento y prueba, correr un modelo transparente y luego experimentar con cómo los datos equilibrados, desequilibrados y mal etiquetados cambian los resultados.

  1. Reparte las 16 frutas en un conjunto de entrenamiento (para aprender) y uno de prueba (apartado para revisar el modelo).
  2. Cada fruta va en un solo conjunto. Deja algunas de cada categoría en el conjunto de prueba.
  3. Corre el modelo, lee su exactitud y después prueba los tres experimentos de datos de abajo.

Asigna cada fruta

Conjunto de entrenamiento

12

Aptas: 6 · No aptas: 6

Conjunto de prueba (apartado)

4

Aptas: 2 · No aptas: 2

Dieciséis frutas espaciales. Para cada una, un botón la asigna al conjunto de entrenamiento o al de prueba, y se muestra su etiqueta correcta.
FrutaEtiqueta correcta¿En qué conjunto?
Baya del AlbaUna fruta carmesí de forma redonda, de 10 cm, con piel lisa y 6 semillas, dulzura 8 de 10, nivel de brillo 0 de 5, que crece en el dosel del bosque. Apto
Ciruela de ArenaUna fruta ámbar de forma ovalada, de 8 cm, con piel con bultos y 4 semillas, dulzura 7 de 10, nivel de brillo 1 de 5, que crece en una duna. Apto
Fruta de MareaUna fruta verde azulado de forma redonda, de 12 cm, con piel peluda y 8 semillas, dulzura 9 de 10, nivel de brillo 0 de 5, que crece en un arrecife. Apto
Pera BrasaUna fruta carmesí de forma ovalada, de 9 cm, con piel lisa y 5 semillas, dulzura 6 de 10, nivel de brillo 2 de 5, que crece en el dosel del bosque. Apto
Gota de DunaUna fruta ámbar de forma redonda, de 7 cm, con piel con bultos y 3 semillas, dulzura 7 de 10, nivel de brillo 1 de 5, que crece en una duna. Apto
Higo del DoselUna fruta verde azulado de forma ovalada, de 11 cm, con piel peluda y 7 semillas, dulzura 8 de 10, nivel de brillo 0 de 5, que crece en el dosel del bosque. Apto
Calabaza RojaUna fruta carmesí de forma redonda, de 10 cm, con piel lisa y 6 semillas, dulzura 5 de 10, nivel de brillo 2 de 5, que crece en una duna. Apto
Ciruela de ArrecifeUna fruta ámbar de forma ovalada, de 8 cm, con piel peluda y 4 semillas, dulzura 9 de 10, nivel de brillo 1 de 5, que crece en un arrecife. Apto
Destello EstelarUna fruta violeta de forma de estrella, de 5 cm, con piel con púas y 2 semillas, dulzura 3 de 10, nivel de brillo 4 de 5, que crece en un cráter. No apto
Espiral LuminosaUna fruta azul cielo de forma de espiral, de 4 cm, con piel con bultos y 1 semillas, dulzura 2 de 10, nivel de brillo 5 de 5, que crece en una caverna. No apto
Estrella BrillanteUna fruta violeta de forma de estrella, de 6 cm, con piel lisa y 0 semillas, dulzura 4 de 10, nivel de brillo 3 de 5, que crece en un cráter. No apto
Estrella de EspinasUna fruta azul cielo de forma de estrella, de 5 cm, con piel con púas y 3 semillas, dulzura 2 de 10, nivel de brillo 2 de 5, que crece en una caverna. No apto
Espiral con PúasUna fruta violeta de forma de espiral, de 4 cm, con piel con púas y 1 semillas, dulzura 3 de 10, nivel de brillo 1 de 5, que crece en un cráter. No apto
Fulgor de CavernaUna fruta azul cielo de forma de estrella, de 7 cm, con piel con bultos y 2 semillas, dulzura 1 de 10, nivel de brillo 4 de 5, que crece en una caverna. No apto
Estrella del VacíoUna fruta violeta de forma de espiral, de 5 cm, con piel lisa y 0 semillas, dulzura 3 de 10, nivel de brillo 5 de 5, que crece en un cráter. No apto
Estrella PúaUna fruta azul cielo de forma de estrella, de 6 cm, con piel con púas y 4 semillas, dulzura 2 de 10, nivel de brillo 3 de 5, que crece en una caverna. No apto

Experimento: cambia los datos y deja la prueba igual

Cada experimento entrena con una versión distinta de los datos y se revisa con las mismas 8 frutas de prueba apartadas. Predice qué va a pasar y después córrelo.

A · Datos equilibrados y correctos

Los 24 ejemplos, repartidos por igual entre aptos y no aptos, con todas las etiquetas correctas. Este es el punto de partida justo.

Primero escribe una predicción.

B · Datos desequilibrados

Todos los ejemplos aptos pero solo 2 no aptos, así que el modelo casi no ve la categoría de no aptos.

Primero escribe una predicción.

C · Datos con etiquetas incorrectas

Los mismos 24 ejemplos, pero a 5 de ellos les cambiaron la etiqueta por la respuesta equivocada.

Primero escribe una predicción.

Este es un modelo de clase simplificado (k vecinos más cercanos). Compara una fruta nueva con las frutas de entrenamiento más parecidas y copia la etiqueta más común. Los sistemas de IA reales son mucho más grandes, pero las mismas ideas sobre los buenos datos siguen valiendo. La regla inventada es: Una fruta espacial no es apta para comer si brilla mucho (nivel de brillo 3 o más) O si tiene púas. Si no, es apta para comer.

Revisa lo que entendiste

Responde esto para comprobar que entiendes el entrenamiento, la prueba y la exactitud.

  1. Question 1. ¿Por qué probamos un modelo con ejemplos con los que no se entrenó?

  2. Question 2. ¿El resultado de quién es una medida justa de aprendizaje?

    Ava estudia una hoja de práctica y luego la evalúan con preguntas totalmente nuevas del mismo tipo. Ben estudia una hoja de práctica y luego lo evalúan con exactamente las mismas preguntas, con las respuestas que ya vio durante la práctica.

  3. Question 3. Un modelo etiqueta correctamente 15 de 20 ejemplos de prueba. ¿Cuál es su exactitud?

0 de 3 respondidas

Pruébalo tú

Planea una prueba justa

Diseña un plan justo de entrenamiento y prueba para un modelo que clasifique mensajes en "pregunta" o "no es pregunta".

  1. Decide cuántos mensajes de ejemplo reunirías en total.
  2. Elige cómo dividirlos en un conjunto de entrenamiento y uno de prueba, y explica por qué.
  3. Explica cómo calcularías la exactitud a partir de los resultados de la prueba.

Lo lograste cuando

  • Un número total claro de ejemplos y una división entre entrenamiento y prueba.
  • Una razón por la que el conjunto de prueba se mantiene aparte del entrenamiento.
  • Una descripción correcta de cómo se mediría la exactitud.

Reflexión

Se guarda en este dispositivo mientras escribes

Por favor no incluyas información privada. Tus respuestas se guardan solo en este navegador y nunca se envían a ningún lado.

Repaso

Los modelos se entrenan con un conjunto de ejemplos y se prueban con un conjunto aparte y nunca visto; la exactitud sobre esos datos de prueba mide qué tan bien generaliza el modelo.

  • Los datos de entrenamiento le enseñan al modelo; los datos de prueba lo revisan.
  • Las filas de prueba deben apartarse y nunca verse durante el entrenamiento.
  • Generalizar es irle bien con ejemplos nuevos; la exactitud es la proporción de ejemplos de prueba etiquetados correctamente.

Extensión para 7.º y 8.º

Cuando el entrenamiento se ve genial pero la prueba se ve mal

A veces un modelo saca una calificación casi perfecta con sus datos de entrenamiento pero muy baja con los datos de prueba. Eso suele significar que memorizó las filas exactas de entrenamiento en lugar de aprender el patrón general.

Describe un caso donde esto podría pasar, por ejemplo, un modelo que memorizó frutas concretas por su peso exacto. ¿Qué podrías cambiar en los datos o en la división para tener una imagen más honesta de cómo se va a comportar?

Termina esta lección

  • Attempt the knowledge check: sin hacer
  • Save a reflection (recommended): sin hacer

Haz la revisión de conocimientos para terminar esta lección.