Educação financeira · artigo prático
Visão computacional: aplicações práticas
Explicação conceitual de visão computacional: classificação de imagens, detecção de objetos e OCR, com exemplos de aplicação prática.
Visão computacional extrai informação de imagens e vídeos — identificar o que está em uma imagem, onde está, ou converter conteúdo visual em texto. É, na prática, uma das frentes de machine learning aplicado com mais tempo de maturação, com uso direto em pipelines de digitalização de documentos.
As três aplicações mais comuns — classificação, detecção de objetos e OCR — respondem perguntas diferentes sobre a mesma imagem: o que é, onde está, e o que está escrito.
Classificação e detecção de objetos
Classificação de imagem responde 'o que é isto', atribuindo uma ou mais categorias à imagem inteira. Detecção de objetos vai além: localiza um ou mais objetos dentro da imagem, normalmente desenhando uma caixa delimitadora (bounding box) ao redor de cada um e atribuindo uma categoria e um nível de confiança a cada detecção.
OCR e extração de informação de imagens
OCR converte texto em imagem para texto digital editável e pesquisável. Aplicações combinam técnicas: detectar região com um campo, aplicar OCR só naquela região, classificar o texto extraído — um pipeline que, quando o modelo de classificação é ajustado a um domínio específico, costuma envolver fine-tuning.
Ferramenta interativa