Todos os artigos
OCRIAextração de dados

OCR ou IA: qual a diferença para extrair dados de documentos

Entenda o que o OCR faz, onde ele falha e quando vale usar extração guiada por schema com IA para transformar documentos em dados confiáveis.

Equipe Colunar · Publicado em · 9 min de leitura

OCR (reconhecimento óptico de caracteres) transforma a imagem de um documento em texto. Ele lê os pixels e devolve letras, números e espaços. O que ele não faz é dizer qual daqueles números é o valor total, qual é a data de vencimento ou a quem pertence o CNPJ da terceira linha.

Extração de dados é o passo seguinte: pegar aquele texto (ou a imagem diretamente) e preencher campos definidos, como total, data e fornecedor, com o valor certo, no formato certo. Hoje isso é feito por regras de posição (OCR por template) ou por modelos de linguagem com visão, que leem o documento como um todo e entendem rótulos e contexto.

Se você pesquisou "OCR" porque precisa tirar dados de notas, contas ou recibos e jogar numa planilha, este artigo explica onde cada abordagem funciona, onde quebra e como avaliar uma ferramenta.

O que o OCR clássico faz (e o que ele não faz)

O OCR clássico recebe uma imagem e devolve texto. Internamente, ele localiza regiões com caracteres, segmenta linhas e palavras e classifica cada forma como uma letra ou dígito. O resultado é uma sequência de texto, às vezes com coordenadas.

Isso resolve bem um problema: tornar o conteúdo pesquisável e copiável. O que o OCR não faz:

  • Não sabe que "R$ 1.234,56" ao lado de "TOTAL A PAGAR" é o valor da fatura, e não o subtotal da linha de cima.
  • Não distingue "data de emissão" de "data de vencimento" quando as duas aparecem no mesmo bloco.
  • Não entende que uma tabela tem colunas; devolve o texto linha por linha e a estrutura se perde.
  • Não avisa quando errou. Se leu "8" onde estava "3", o texto de saída simplesmente contém o 8.

Para transformar texto em dados, alguém (ou algo) ainda precisa interpretar.

OCR por template (zonal): funciona até o layout mudar

A primeira resposta da indústria foi o OCR zonal, ou baseado em template. Você marca na página onde fica cada campo: "o total está no retângulo do canto inferior direito; a data está na segunda linha do cabeçalho". A ferramenta roda o OCR só naquelas zonas e associa cada uma a um campo.

Funciona bem quando:

  • Todos os documentos vêm da mesma fonte, com o mesmo layout.
  • O layout é estável por meses ou anos.

E quebra quando:

  • O fornecedor muda o modelo da fatura e o total desce dois centímetros.
  • Chegam documentos de 40 fornecedores diferentes, cada um com seu layout. Você precisaria de 40 templates e manter todos.
  • Uma foto de celular chega inclinada e a zona marcada cai em cima de outro campo.

O custo de manter templates cresce com a variedade de documentos. Para um único formulário padronizado, é uma solução razoável. Para quem recebe documentos de origens diversas, a manutenção vira um trabalho em si.

Modelos de linguagem com visão: leem o documento como um todo

Modelos de linguagem com visão (ou modelos multimodais) recebem a imagem da página e uma instrução em texto. Em vez de recortar zonas, eles processam a página inteira e relacionam o que veem com o que foi pedido.

Isso muda três coisas:

  1. Rótulos e contexto. O modelo entende que "Vencimento" é um rótulo e que a data ao lado é o valor dele, mesmo que a posição varie entre documentos.
  2. Tabelas e blocos. Ele consegue ler uma tabela de itens e devolver cada linha com descrição, quantidade e valor, sem que alguém tenha desenhado as colunas antes.
  3. Variedade de layouts. O mesmo pedido ("extraia distribuidora, período e consumo em kWh") funciona para contas de distribuidoras diferentes, porque o modelo lê os rótulos, não as coordenadas.

Onde eles erram: confiança sem garantia

Modelos de linguagem podem errar de forma convincente. Alguns padrões que aparecem:

  • Inventar um valor quando o campo não está no documento, em vez de deixar em branco.
  • Trocar campos parecidos, como período de leitura e período de faturamento.
  • Errar formato: devolver "12/03/2026" quando o sistema esperava "2026-03-12", ou "1.234,56" quando esperava um número.
  • Ler mal texto pequeno ou borrado e seguir em frente sem sinalizar.

O problema não é só o erro. É que a saída parece correta e chega com a mesma cara de um acerto.

Por isso schema, validação e origem importam

Uma ferramenta séria de extração com IA coloca controles em volta da resposta do modelo:

  • Schema. Antes de extrair, você define os campos, os tipos (texto, número, data), quais são obrigatórios e os formatos aceitos. O modelo é instruído a preencher exatamente isso.
  • Validação. Cada registro produzido é conferido contra o schema. Se o total veio como texto, se a data está fora do formato ou se um campo obrigatório ficou vazio, o registro é marcado e reportado, em vez de entrar na planilha em silêncio.
  • Origem. Cada dado extraído carrega de onde veio: página, aba ou linha. Quando um número parece estranho, você confere no lugar exato.

É esse conjunto que separa "um modelo leu o documento" de "tenho dados que posso usar". No Colunar, por exemplo, o playbook define os campos e gera o JSON Schema; cada registro é validado contra ele, os problemas são reportados por arquivo e página, e a origem fica gravada junto com o dado. Se quiser ir a fundo no schema, veja o guia prático de JSON Schema para extração.

Quando OCR simples basta

Nem todo problema precisa de extração estruturada. OCR puro resolve quando:

  • Você só precisa encontrar documentos por palavra ("todas as notas que mencionam frete").
  • Quer copiar um trecho de texto de um PDF escaneado.
  • Precisa de acessibilidade ou indexação em um sistema de gestão de documentos.

Nesses casos, o OCR embutido no scanner ou no leitor de PDF já é suficiente.

Quando a extração guiada por schema é necessária

A extração estruturada se justifica quando o destino do dado é uma tabela, um sistema ou um cálculo. Sinais claros:

  • Campos fixos. Você sempre precisa dos mesmos 8 ou 12 campos de cada documento.
  • Muitos layouts. Documentos de fornecedores, distribuidoras ou bancos diferentes, cada um com seu modelo.
  • Lote. Dezenas ou centenas de arquivos por mês, e ninguém quer digitar.
  • Consequência do erro. O dado alimenta um fechamento contábil, um inventário de emissões ou uma conciliação, e um número errado custa caro.
  • Rastreabilidade. Alguém vai perguntar "de onde veio esse valor?" e você precisa responder.

Se marcou dois ou mais desses pontos, OCR puro vai deixar a parte mais trabalhosa nas suas mãos.

Tabela comparativa: OCR, OCR por template e extração com IA

CritérioOCR clássicoOCR por templateExtração guiada por schema (IA)
O que entregaTexto corridoCampos de zonas fixasCampos definidos, tipados e validados
Entende rótulos e contextoNãoNão (usa posição)Sim
Lida com layouts variadosIndiferente (só texto)Mal; exige um template por layoutBem, com o mesmo schema
Tabelas de itensPerde a estruturaSó se a tabela for fixaLê linha a linha
Fotos de celular inclinadasLê, com mais errosZonas desalinhamLê a página inteira; depende da qualidade da foto
Aponta o que não conseguiu lerNãoPoucoSim, se houver validação e avisos
Origem do dado (página, linha)Coordenadas brutasZonaRegistrada junto com o dado
ManutençãoBaixaAlta com muitos layoutsBaixa; ajusta o schema e as instruções
Melhor usoBusca, cópia, indexaçãoUm formulário padronizadoCampos fixos, muitos layouts, lote

A tabela é qualitativa. Os resultados reais dependem da qualidade dos documentos e de como a ferramenta trata erros.

Como avaliar uma ferramenta de extração de dados

Antes de escolher, faça um teste com material seu. Alguns critérios que ajudam:

  1. Use seus próprios documentos. Pegue 10 a 20 documentos reais, incluindo os feios: foto torta, escaneado com sombra, layout antigo.
  2. Olhe os avisos, não só os acertos. O que a ferramenta faz quando não encontra um campo? Deixa vazio e avisa, ou preenche com algo plausível? Prefira a que avisa.
  3. Confira a origem. Clique em um valor e veja se consegue chegar à página e à linha de onde ele saiu.
  4. Teste a validação. Defina um campo como número e veja se um valor com texto é rejeitado ou passa disfarçado.
  5. Mude o layout. Inclua documentos do mesmo tipo vindos de fontes diferentes e veja se precisa reconfigurar algo.
  6. Processe um lote. A ferramenta aceita vários arquivos de uma vez e mostra o progresso por arquivo, ou exige um por um? E a saída sai no formato do seu próximo passo (Excel, CSV, JSON)?

Se a ferramenta oferece créditos gratuitos, use-os nesse teste antes de assinar. Para o caso de fotos e digitalizações difíceis, leia como extrair dados de documentos escaneados e fotos de celular.

Perguntas frequentes

OCR e extração de dados são a mesma coisa?

Não. OCR converte imagem em texto. Extração de dados identifica quais valores correspondem a quais campos e os entrega em formato estruturado. Muitas ferramentas de extração usam OCR ou modelos de visão como etapa interna, mas o resultado final é diferente.

Preciso de OCR se meu PDF já tem texto selecionável?

Não para o texto em si. Mas o problema de saber qual texto é o total ou a data continua. Extração guiada por schema funciona tanto para PDFs nativos quanto para escaneados e imagens.

A IA substitui a revisão humana?

Não por completo. A validação por schema e os avisos reduzem o que precisa ser conferido, porque apontam os registros com problema. A revisão continua necessária para exceções e para documentos que a ferramenta sinalizou como ilegíveis ou incompletos.

Quanto custa testar?

Depende da ferramenta. No Colunar, a conta é criada com 20 créditos gratuitos, sem cartão; um PDF consome 4 créditos e uma imagem, 3. Dá para processar alguns documentos reais antes de decidir.

Se você quer ver a diferença na prática, crie um playbook com os campos que precisa, solte alguns documentos reais e confira os avisos e a origem de cada valor. Comece grátis com 20 créditos.

Continue lendo