Educação financeira · artigo prático

Visão computacional: aplicações práticas

Explicação conceitual de visão computacional: classificação de imagens, detecção de objetos e OCR, com exemplos de aplicação prática.

Visão computacional extrai informação de imagens e vídeos — identificar o que está em uma imagem, onde está, ou converter conteúdo visual em texto. É, na prática, uma das frentes de machine learning aplicado com mais tempo de maturação, com uso direto em pipelines de digitalização de documentos.

As três aplicações mais comuns — classificação, detecção de objetos e OCR — respondem perguntas diferentes sobre a mesma imagem: o que é, onde está, e o que está escrito.

Classificação e detecção de objetos

Classificação de imagem responde 'o que é isto', atribuindo uma ou mais categorias à imagem inteira. Detecção de objetos vai além: localiza um ou mais objetos dentro da imagem, normalmente desenhando uma caixa delimitadora (bounding box) ao redor de cada um e atribuindo uma categoria e um nível de confiança a cada detecção.

OCR e extração de informação de imagens

OCR converte texto em imagem para texto digital editável e pesquisável. Aplicações combinam técnicas: detectar região com um campo, aplicar OCR só naquela região, classificar o texto extraído — um pipeline que, quando o modelo de classificação é ajustado a um domínio específico, costuma envolver fine-tuning.

Ferramenta interativa

Pontos-chave