Ir para o conteúdo
Return to course

Week 3 · Lesson 1 · 45-55 minutos

Como funciona um classificador de imagens

Acompanhe uma foto dos pixels até o rótulo, e aprenda como um classificador de imagens transforma características visuais em uma previsão com uma pontuação de confiança.

Materials
Esta aula em um navegador web · Papel e lápis, ou um aplicativo de notas · Os conjuntos de imagens rotuladas já incluídos que aparecem na aula
This lesson
In progress

Auto-saves on this device

What you'll be able to do

  • Explicar que uma imagem é feita de pixels que o computador lê como números.
  • Descrever como um classificador usa características visuais para fazer uma previsão.
  • Ler uma pontuação de confiança e dizer o que ela significa e o que não significa.
  • Acompanhar uma imagem pelo classificador, da entrada até a saída rotulada.

Think about it

Você mostra uma imagem a um aplicativo de fotos e na hora ele diz "gato, 96% de certeza". Ele nunca viu essa foto exata antes. Como um computador, que só enxerga números, consegue decidir que é um gato?

Guarde o seu primeiro palpite: você vai conferi-lo depois de ver como os pixels viram uma previsão.

Make a prediction

Preveja: quando um classificador olha uma foto, você acha que ele reconhece o "gato" inteiro de uma vez, ou que monta a resposta a partir de padrões menores, como bordas e formas?

Pixel
Um pontinho minúsculo de uma imagem. Uma foto é uma grade de pixels, e o computador guarda cada um como números que indicam a cor e o brilho dele.
Característica visual
Um padrão em uma imagem ao qual o classificador presta atenção, como bordas, cores, formas ou texturas.
Classificação
Colocar algo em um de vários grupos com nome, chamados categorias ou classes.
Previsão
A categoria que o classificador escolhe como melhor palpite para uma imagem de entrada.
Confiança
Um número, muitas vezes mostrado como porcentagem, que indica o quanto o classificador está seguro da previsão dele. Mais alto significa mais seguro, mas nem sempre mais correto.

Uma imagem é uma grade de pixels, e pixels são números

Um computador não consegue "ver" uma foto do jeito que você vê. Para um computador, uma imagem é uma grade de pontinhos chamados pixels, e cada pixel é guardado como números que descrevem a cor e o brilho dele. Uma foto pequena pode ter centenas de milhares de pixels.

Então a primeira coisa que um classificador recebe não é um "gato": é uma grade enorme de números. Tudo o que o classificador decidir precisa ser construído a partir desses números.

  • Um pixel em preto e branco pode ser guardado como um número de 0 (preto) a 255 (branco).
  • Um pixel colorido costuma ser guardado como três números: quanto de vermelho, verde e azul ele tem.
  • Uma foto de 100 por 100 tem 10.000 pixels: um monte de números para uma imagem pequena.

Dos pixels às características visuais

Trabalhar só com pixels crus é difícil, então um classificador procura características visuais: padrões úteis como bordas, cantos, cores, texturas e formas. Formas triangulares e pontudas perto do topo podem ser uma característica que costuma aparecer com gatos (as orelhas).

O classificador aprendeu quais características importam estudando muitos exemplos rotulados no treinamento anterior. Ninguém disse a ele, como regra, que "gatos têm orelhas pontudas": ele achou padrões assim a partir dos exemplos, a mesma ideia de aprendizado das semanas anteriores.

  • Bordas onde uma área escura encontra uma área clara
  • Formas redondas, que podem ser olhos ou rodas
  • Texturas como pelo, escamas ou metal liso

Previsão e confiança

Depois de somar as características visuais, o classificador faz uma previsão: escolhe a categoria que melhor combina, como "gato" ou "cachorro". Junto com a previsão ele normalmente informa uma confiança, um número de o quanto ele está seguro, muitas vezes mostrado como porcentagem.

A confiança é útil, mas traiçoeira. Uma confiança alta significa que as características combinaram muito com uma categoria, e não que a resposta esteja com certeza correta. Um classificador pode errar com toda a segurança, e é exatamente esse tipo de erro que você vai estudar esta semana.

  • "Cachorro, 91%": as características combinaram com cachorro muito mais do que com qualquer outra categoria.
  • "Gato 55%, cachorro 45%": o classificador está inseguro, a imagem tinha características dos dois.
  • Um seguro 98% ainda pode estar errado se a foto for incomum.

Worked example

Acompanhando uma foto dos pixels até o rótulo

  1. Entrada: a foto de um gato chega como uma grade de pixels, só números de cor e brilho.
  2. Achar características: o classificador detecta bordas, depois duas formas pontudas perto do topo, formas redondas de olhos e uma textura de pelo.
  3. Pontuar cada categoria: essas características combinam muito com "gato" e só um pouquinho com "cachorro".
  4. Prever com uma confiança: ele devolve "gato" com 96% de confiança, porque as características de gato pontuaram bem mais alto que as outras.
  5. Saída: o rótulo "gato" e a confiança são mostrados a você. A resposta inteira foi construída a partir de pixels, e não de o computador realmente "ver" um gato.

Takeaway: Um classificador transforma pixels em características visuais, pontua cada categoria a partir dessas características, e informa a melhor combinação como uma previsão com uma confiança.

Dos pixels a uma previsão rotulada

Um fluxo de quatro passos. Passo 1: imagem de entrada, desenhada como uma grade de pixels (números). Passo 2: achar características visuais: bordas, formas, cores, texturas. Passo 3: pontuar cada categoria a partir das características, por exemplo gato 96, cachorro 3, coelho 1. Passo 4: devolver a categoria mais alta como previsão, com a confiança dela: "gato, 96%". A seta deixa claro que o rótulo é construído a partir dos pixels, e não visto diretamente.

Toda previsão é construída a partir dos pixels, passando pelas características, até virar um palpite pontuado.

A confiança em cada categoria para uma foto

Um gráfico de barras da confiança do classificador para cada categoria em uma única foto de gato, em porcentagem. Gato é de longe a barra mais alta, com 96 por cento; cachorro tem 3 por cento e coelho, 1 por cento. A barra mais alta é a previsão; a altura dela é a confiança. As barras somam cerca de 100 por cento porque o classificador divide a certeza dele entre as categorias.

A barra mais alta é a previsão; a altura dela é a confiança.

Activity

Passo a passo pelo classificador

Acompanhar uma imagem já incluída dos pixels até uma previsão rotulada, e ver como a confiança compara as categorias sem garantir a resposta.

  1. Pick a picture. See it the way a computer does — a grid of numbered pixels.
  2. Look at the visual features the model measured, then its prediction and confidence.
  3. Notice that confidence compares the categories; it is not a promise the answer is right.

1 · Choose a picture

2 · A picture is a grid of pixels

A solid circle, smaller size, centered.

A solid circle, smaller size, centered. The computer stores this 16×16 grid as 256 numbers — one brightness value per pixel.

3 · Features measured from the pixels

  • ink coverage18%
  • fill inside its box81%
  • top-left corner18%
  • left-right symmetry100%
  • edge (outline) amount38%

4 · Prediction and confidence

Predicted: CircleActual: Circle Correct
Circle66%
Triangle0%
Square34%

The closest training pictures were: Circle (91% similar), Square (86% similar), Circle (80% similar). The model added up the similarities and chose Circle, giving it 66% confidence. Confidence compares the categories to each other — it is not a promise the answer is right.

Confidence is not certainty

A square rotated 45 degrees, so it looks like a diamond.

A square rotated 45 degrees, so it looks like a diamond.

The real answer is Square, but the model predicts Circle with 69% confidence. A model can be confident and still wrong — high confidence only means the categories looked lopsided to the model, not that it is correct.

Optional: try your own picture

Everything above works with the built-in pictures — this is an extra. If you upload a picture, it is shrunk to a 16×16 grid and classified entirely on your device. It is never saved and never sent to any service. Draw a big circle, triangle, or square on white paper for the best result.

Check your understanding

Responda a estas perguntas para conferir se você entendeu como um classificador de imagens transforma pixels em uma previsão.

  1. Question 1. O que um classificador de imagens realmente recebe como entrada?

  2. Question 2. Coloque em ordem os passos da classificação de imagens, de receber a foto até mostrar a resposta.

    1. 1.Receber a imagem como uma grade de pixels
    2. 2.Achar características visuais como bordas, formas e texturas
    3. 3.Pontuar o quanto as características combinam com cada categoria
    4. 4.Devolver a categoria mais alta como previsão, com a confiança dela
  3. Question 3. Decida se a afirmação é verdadeira ou falsa.

    Uma previsão com 98% de confiança tem garantia de estar correta.

0 of 3 answered

Try it yourself

Seja você o classificador

Escolha um objeto simples que você consiga imaginar (uma maçã, uma bicicleta, uma casa) e descreva como um classificador poderia diferenciá-lo de um parente próximo usando características visuais.

  1. Escolha o seu objeto e um objeto parecido com que ele possa ser confundido (maçã e tomate, bicicleta e motocicleta).
  2. Liste três características visuais que empurrariam a previsão na direção do seu objeto.
  3. Liste uma característica que os dois objetos compartilham e que poderia deixar o classificador inseguro.

Success looks like

  • Um par de objetos parecidos é escolhido.
  • Três características visuais que os distinguem são listadas.
  • Uma característica compartilhada que poderia baixar a confiança é apontada.

Reflection

Saved on this device as you type

Please don't include private information. Your answers are saved only in this browser and are never sent anywhere.

Recap

Um classificador de imagens transforma uma grade de pixels em características visuais, pontua cada categoria e devolve a melhor combinação como uma previsão com uma confiança.

  • Para um computador, uma imagem é uma grade de pixels guardados como números.
  • Os classificadores trabalham a partir de características visuais como bordas, formas, cores e texturas.
  • Uma previsão vem com uma confiança, e confiança alta não garante uma resposta correta.

Grades 7–8 extension

Por que a confiança pode te enganar

A confiança diz o quanto as características combinaram com uma categoria, e não o quanto a resposta está correta. Um classificador treinado só com fotos claras de dia pode estar 95% confiante e errado em uma foto noturna borrada, porque aqueles pixels incomuns mesmo assim combinaram melhor com uma categoria.

Descreva uma situação em que você iria querer que um sistema dissesse "não tenho certeza" em vez de dar uma resposta segura. Por que quem projeta poderia criar uma regra como "se a confiança for menor que 60%, pergunte a uma pessoa"?

Finish this lesson

  • Attempt the knowledge check — not done
  • Save a reflection (recommended) — not done

Attempt the knowledge check to finish this lesson.