Saltar al contenido
Volver al curso

Semana 5 · Lección 1 · 50-60 minutos

Audita un conjunto de datos en busca de justicia

Aprende cómo unos ejemplos desparejos crean sesgos, lee resultados por grupo para ver para quién funciona bien un sistema, y audita un conjunto de datos en busca de justicia.

Materiales
Esta lección en un navegador web · Papel y lápiz, o una app de notas
Esta lección
En curso

Se guarda solo en este dispositivo

Lo que vas a poder hacer

  • Definir sesgo y representación y explicar cómo están conectados.
  • Leer un resultado por grupo para comparar qué tan bien funciona un sistema con distintos grupos.
  • Explicar qué significa la justicia cuando una IA trata a los grupos de forma distinta.
  • Auditar un conjunto de datos descrito y nombrar una forma en que sus ejemplos están desequilibrados.

Para pensar

Un asistente de voz entiende a un amigo casi siempre, pero no deja de oír mal a otro amigo que tiene un acento distinto. El software es el mismo para los dos. ¿Por qué podría funcionar tan diferente con cada uno?

Ten presente tu primera respuesta: más adelante en la lección la vas a poner a prueba con números reales por grupo.

Haz una predicción

Predice: si un sistema de reconocimiento facial aprendió sobre todo con fotos de personas adultas, ¿crees que funcionará igual de bien con fotos de niños?

Sesgo
Cuando un sistema funciona de forma habitual mejor o peor con unas personas o cosas que con otras, normalmente por los ejemplos de los que aprendió.
Representación
Cuánto aparece un grupo en un conjunto de datos. Un grupo está bien representado si tiene muchos ejemplos, y subrepresentado si tiene pocos.
Resultado por grupo
Una calificación medida por separado para cada grupo, en lugar de un solo número para todos, para que puedas ver con quién funciona bien un sistema.
Justicia
Tratar a los grupos de una manera que la gente consideraría pareja y razonable, para que ningún grupo quede peor sin una buena razón.

El sesgo viene de los ejemplos, no de que la computadora "quiera" algo

Una computadora no tiene opiniones ni sentimientos. Cuando decimos que una IA tiene sesgo, queremos decir que funciona de forma habitual mejor con unas personas o cosas que con otras. Casi siempre eso ocurre por los ejemplos de los que aprendió.

Si un sistema aprende de ejemplos desparejos, se vuelve bueno en los casos comunes y más flojo en los raros. El software está haciendo exactamente aquello para lo que se entrenó: lo desparejo vino de los datos que le dieron las personas.

  • Un sistema de voz entrenado sobre todo con un acento entiende mejor ese acento.
  • Un clasificador de fotos entrenado sobre todo con imágenes de día batalla de noche.
  • Una herramienta de traducción entrenada con escritura formal maneja mal la jerga.

Representación: quién aparece en los ejemplos, y cuánto

La representación tiene que ver con cuánto aparece cada grupo en los datos. Un grupo está bien representado cuando tiene muchos ejemplos, y subrepresentado cuando tiene pocos. Un conjunto de datos puede tener miles de ejemplos y aun así dejar a algunos grupos casi sin ninguno.

La subrepresentación es una de las mayores fuentes de sesgo. Un modelo solo puede aprender patrones que ha visto. Si un grupo casi no aparece en los ejemplos, el modelo tiene poco de dónde aprender, así que tiende a cometer más errores con ese grupo.

  • Un conjunto de 10,000 fotos de perros con solo 20 fotos de una raza.
  • Un conjunto de datos médicos reunido sobre todo con personas adultas y con pocos niños.
  • Un conjunto de escritura a mano con mucha letra de molde y muy poca cursiva.

Los resultados por grupo muestran lo que esconde una sola calificación general

Es tentador juzgar un sistema por un solo número, como "tiene 92 por ciento de exactitud". Pero un solo número es un promedio de todo el mundo. Puede verse fantástico y aun así fallar feo con un grupo pequeño cuyos errores quedan enterrados en el promedio.

Un resultado por grupo mide la exactitud por separado para cada grupo. Cuando desglosas la calificación, puedes ver con quién funciona bien el sistema y con quién funciona mal. Las preguntas de justicia casi siempre necesitan resultados por grupo, no solo un número general.

  • 92 por ciento en general, pero solo 74 por ciento con un grupo de acento.
  • Exactitud general alta, pero muchísimos más errores en fotos nocturnas que en las de día.
  • Una prueba que en promedio aprueba, pero que falla seguido con quienes escriben con la mano izquierda.

Justicia: ¿alguien queda peor sin una buena razón?

La justicia significa tratar a los grupos de una manera que la gente consideraría pareja y razonable. No siempre exige resultados idénticos, pero sí pregunta si algún grupo está quedando peor, y si hay una buena razón para esa diferencia.

La justicia es un juicio humano, no algo que decida la computadora. Son las personas quienes tienen que mirar los resultados por grupo, decidir si una diferencia es aceptable y hacerse responsables de corregirla, muchas veces reuniendo ejemplos más equilibrados.

  • Decidir que una diferencia de 74 por ciento frente a 92 por ciento de exactitud es demasiado grande como para lanzar el producto.
  • Elegir reunir más ejemplos de los grupos subrepresentados.
  • Preguntarse a quién perjudica que el sistema cometa un error con un grupo en particular.

Ejemplo resuelto

Auditar el conjunto de datos de un detector de sonrisas

  1. Nombra la tarea. Una app de cámara intenta tomar la foto cuando todos están sonriendo. Entrada: un rostro. Salida: "sonriendo" o "no sonriendo".
  2. Mira la representación. El conjunto de entrenamiento tiene 8,000 fotos de personas adultas y solo 500 fotos de niños pequeños.
  3. Predice el efecto. Con tan pocos ejemplos de niños, el modelo tiene poco de dónde aprender cómo sonríen los niños, así que seguramente cometerá más errores con ellos.
  4. Revisa el resultado por grupo, no solo el promedio. La exactitud general es del 90 por ciento, pero desglosada por grupo es del 94 por ciento con personas adultas y del 71 por ciento con niños.
  5. Toma la decisión de justicia. La diferencia es grande y los niños quedan peor sin una buena razón, así que la solución justa es reunir más ejemplos de niños y volver a probar antes de lanzarlo.

Lo importante: Audita un conjunto de datos preguntando quién está subrepresentado, y luego revisa los resultados por grupo para ver si esa desigualdad se convirtió en errores injustos.

Exactitud por grupo: un promedio esconde una diferencia real

Una gráfica de barras de la exactitud de un sistema de reconocimiento de voz, medida por separado para cuatro grupos de acento, en porcentaje. El promedio general es del 88 por ciento, pero los grupos están desparejos: grupo de acento A, 94 por ciento; grupo de acento B, 91 por ciento; grupo de acento C, 82 por ciento; y grupo de acento D, 74 por ciento. Los grupos C y D, que tuvieron menos ejemplos de entrenamiento, quedan muy por debajo del promedio, así que el número general por sí solo esconde una diferencia real de unos 20 puntos entre el mejor y el peor grupo.

Desglosa el promedio y queda claro que el sistema funciona mejor con unos grupos que con otros.

La representación coincide con la diferencia de exactitud
Grupo de acentoEjemplos de entrenamientoExactitud
A5,00094%
B4,20091%
C90082%
D40074%

Una tabla que relaciona cuántos ejemplos de entrenamiento tuvo cada grupo de acento con su exactitud. Grupo A: 5,000 ejemplos, 94 por ciento de exactitud. Grupo B: 4,200 ejemplos, 91 por ciento. Grupo C: 900 ejemplos, 82 por ciento. Grupo D: 400 ejemplos, 74 por ciento. Los grupos con menos ejemplos tienen la exactitud más baja, lo que muestra cómo la subrepresentación se convierte en sesgo.

Actividad

Auditoría de justicia

Auditar el recomendador de programas de ciencia y tecnología de una escuela ficticia: ver cómo una exactitud general esconde un mal resultado para un grupo más pequeño, y luego corregirlo limitando una característica sustituta y agregando ejemplos subrepresentados.

  1. Lee la exactitud general y después mira la de cada grupo. No son lo mismo.
  2. El modelo se apoya en una característica sustituta engañosa. Bájale el peso y agrega ejemplos del grupo poco representado.
  3. Vuelve a correr la auditoría y compárala con la línea base con fallas. Mejorar la justicia es un avance, no una garantía.

Situación ficticia: una escuela recomienda programas STEM extraescolares. Cada estudiante, grupo y barrio de aquí es inventado. Dos grupos: Lomalta (más grande, cerca del plantel) y Ribera (más chico, más lejos).

Exactitud general

63%

5 of 8 test students predicted correctly.

Exactitud por grupo

Lomalta100% (4/4)

Aprobaciones falsas: 0 · Estudiantes que sí encajaban y se pasaron por alto: 0 · Ejemplos de entrenamiento: 10

Ribera25% (1/4)

Aprobaciones falsas: 0 · Estudiantes que sí encajaban y se pasaron por alto: 3 · Ejemplos de entrenamiento: 6

El número general puede verse bien mientras a un grupo le va mucho peor: siempre lee los resultados por grupo.

¿En qué características se apoya el modelo?
Área de interés peso 1

Lo que le gusta al estudiante: directamente relevante para saber si el programa le queda.

Libre después de clases peso 1

Si el estudiante puede asistir: relevante.

Actividades STEM anteriores peso 1

Participación previa: relevante.

Vive cerca del plantel proxypeso 2

Un sustituto del barrio. No mide si el programa le queda, pero sí indica a qué grupo pertenece el estudiante: una característica engañosa.

Agregar ejemplos poco representados

Ahora el entrenamiento tiene 10 estudiantes de Lomalta y 6 de Ribera. Faltaban estos estudiantes de Ribera que sí encajan:

Antes y después

Comparación de la exactitud general y por grupo entre la línea base con fallas y tus ajustes actuales de auditoría.
MedidaLínea base con fallasTu versión
Exactitud general63%63%
Exactitud de Lomalta100%100%
Exactitud de Ribera25%25%

Bajar el peso de la característica sustituta o agregar ejemplos de Ribera sube la exactitud de Ribera. Ten en cuenta que un cambio también puede mover el resultado de otro grupo: mejorar la representación es un avance real, pero no garantiza una justicia perfecta.

Revisa lo que entendiste

Responde esto para comprobar que sabes detectar sesgos, leer resultados por grupo y juzgar la justicia.

  1. Question 1. ¿De dónde viene con más frecuencia el sesgo en un sistema de IA?

  2. Question 2. Decide si la afirmación es verdadera o falsa.

    Un solo número de exactitud general basta para demostrar que un sistema es justo con todos los grupos.

  3. Question 3. Con base en los resultados por grupo, ¿cuál es el siguiente paso más razonable?

    Una app de fotos reporta 90 por ciento de exactitud general. Desglosada por grupo, es del 95 por ciento con personas adultas y del 70 por ciento con niños. El conjunto de entrenamiento tenía muy pocas fotos de niños.

0 de 3 respondidas

Pruébalo tú

Diseña un conjunto de datos más justo

Elige una tarea sencilla de IA y planea un conjunto de datos que sería justo entre grupos, antes de entrenar ningún modelo.

  1. Elige una tarea, como leer escritura a mano o reconocer mascotas.
  2. Enumera los grupos con los que el sistema debería funcionar bien.
  3. Decide más o menos cuántos ejemplos necesita cada grupo para que ninguno quede subrepresentado.
  4. Escribe cómo revisarías el resultado con una exactitud por grupo, y no solo con un promedio general.

Lo lograste cuando

  • Se nombran al menos tres grupos a los que el sistema debería servir.
  • Un plan le da a cada grupo suficientes ejemplos para evitar la subrepresentación.
  • El plan revisa la justicia usando resultados por grupo.

Reflexión

Se guarda en este dispositivo mientras escribes

Por favor no incluyas información privada. Tus respuestas se guardan solo en este navegador y nunca se envían a ningún lado.

Repaso

El sesgo suele venir de una representación despareja, y solo los resultados por grupo revelan si un sistema es justo con todos los grupos.

  • El sesgo significa que un sistema funciona de forma habitual mejor con unos grupos que con otros, normalmente por sus ejemplos.
  • Los grupos subrepresentados suelen recibir más errores, porque el modelo vio menos de ellos.
  • Una sola calificación general puede esconder una diferencia real; los resultados por grupo muestran con quién funciona el sistema.
  • La justicia es un juicio humano sobre si una diferencia es aceptable y cómo corregirla.

Extensión para 7.º y 8.º

Cuando una exactitud igual sigue sin ser justa

A veces dos grupos tienen la misma exactitud, pero los errores pesan más para uno de ellos. Imagina un sistema que marca libros de la biblioteca como "atrasados". Una marca equivocada podría ser una molestia menor para un grupo, pero impedirle a otro grupo pedir libros prestados del todo.

Elige una decisión que podría tomar una IA y describe un caso en el que una exactitud igual entre grupos aun así lleve a un resultado injusto, porque el costo de un error no es igual. ¿Qué información adicional necesitarías para darte cuenta de eso?

Termina esta lección

  • Attempt the knowledge check: sin hacer
  • Save a reflection (recommended): sin hacer

Haz la revisión de conocimientos para terminar esta lección.