OCR ou IA: qual a diferença para extrair dados de documentos
Entenda o que o OCR faz, onde ele falha e quando vale usar extração guiada por schema com IA para transformar documentos em dados confiáveis.
Equipe Colunar · Publicado em · 9 min de leitura
OCR (reconhecimento óptico de caracteres) transforma a imagem de um documento em texto. Ele lê os pixels e devolve letras, números e espaços. O que ele não faz é dizer qual daqueles números é o valor total, qual é a data de vencimento ou a quem pertence o CNPJ da terceira linha.
Extração de dados é o passo seguinte: pegar aquele texto (ou a imagem diretamente) e preencher campos definidos, como total, data e fornecedor, com o valor certo, no formato certo. Hoje isso é feito por regras de posição (OCR por template) ou por modelos de linguagem com visão, que leem o documento como um todo e entendem rótulos e contexto.
Se você pesquisou "OCR" porque precisa tirar dados de notas, contas ou recibos e jogar numa planilha, este artigo explica onde cada abordagem funciona, onde quebra e como avaliar uma ferramenta.
O que o OCR clássico faz (e o que ele não faz)
O OCR clássico recebe uma imagem e devolve texto. Internamente, ele localiza regiões com caracteres, segmenta linhas e palavras e classifica cada forma como uma letra ou dígito. O resultado é uma sequência de texto, às vezes com coordenadas.
Isso resolve bem um problema: tornar o conteúdo pesquisável e copiável. O que o OCR não faz:
- Não sabe que "R$ 1.234,56" ao lado de "TOTAL A PAGAR" é o valor da fatura, e não o subtotal da linha de cima.
- Não distingue "data de emissão" de "data de vencimento" quando as duas aparecem no mesmo bloco.
- Não entende que uma tabela tem colunas; devolve o texto linha por linha e a estrutura se perde.
- Não avisa quando errou. Se leu "8" onde estava "3", o texto de saída simplesmente contém o 8.
Para transformar texto em dados, alguém (ou algo) ainda precisa interpretar.
OCR por template (zonal): funciona até o layout mudar
A primeira resposta da indústria foi o OCR zonal, ou baseado em template. Você marca na página onde fica cada campo: "o total está no retângulo do canto inferior direito; a data está na segunda linha do cabeçalho". A ferramenta roda o OCR só naquelas zonas e associa cada uma a um campo.
Funciona bem quando:
- Todos os documentos vêm da mesma fonte, com o mesmo layout.
- O layout é estável por meses ou anos.
E quebra quando:
- O fornecedor muda o modelo da fatura e o total desce dois centímetros.
- Chegam documentos de 40 fornecedores diferentes, cada um com seu layout. Você precisaria de 40 templates e manter todos.
- Uma foto de celular chega inclinada e a zona marcada cai em cima de outro campo.
O custo de manter templates cresce com a variedade de documentos. Para um único formulário padronizado, é uma solução razoável. Para quem recebe documentos de origens diversas, a manutenção vira um trabalho em si.
Modelos de linguagem com visão: leem o documento como um todo
Modelos de linguagem com visão (ou modelos multimodais) recebem a imagem da página e uma instrução em texto. Em vez de recortar zonas, eles processam a página inteira e relacionam o que veem com o que foi pedido.
Isso muda três coisas:
- Rótulos e contexto. O modelo entende que "Vencimento" é um rótulo e que a data ao lado é o valor dele, mesmo que a posição varie entre documentos.
- Tabelas e blocos. Ele consegue ler uma tabela de itens e devolver cada linha com descrição, quantidade e valor, sem que alguém tenha desenhado as colunas antes.
- Variedade de layouts. O mesmo pedido ("extraia distribuidora, período e consumo em kWh") funciona para contas de distribuidoras diferentes, porque o modelo lê os rótulos, não as coordenadas.
Onde eles erram: confiança sem garantia
Modelos de linguagem podem errar de forma convincente. Alguns padrões que aparecem:
- Inventar um valor quando o campo não está no documento, em vez de deixar em branco.
- Trocar campos parecidos, como período de leitura e período de faturamento.
- Errar formato: devolver "12/03/2026" quando o sistema esperava "2026-03-12", ou "1.234,56" quando esperava um número.
- Ler mal texto pequeno ou borrado e seguir em frente sem sinalizar.
O problema não é só o erro. É que a saída parece correta e chega com a mesma cara de um acerto.
Por isso schema, validação e origem importam
Uma ferramenta séria de extração com IA coloca controles em volta da resposta do modelo:
- Schema. Antes de extrair, você define os campos, os tipos (texto, número, data), quais são obrigatórios e os formatos aceitos. O modelo é instruído a preencher exatamente isso.
- Validação. Cada registro produzido é conferido contra o schema. Se o total veio como texto, se a data está fora do formato ou se um campo obrigatório ficou vazio, o registro é marcado e reportado, em vez de entrar na planilha em silêncio.
- Origem. Cada dado extraído carrega de onde veio: página, aba ou linha. Quando um número parece estranho, você confere no lugar exato.
É esse conjunto que separa "um modelo leu o documento" de "tenho dados que posso usar". No Colunar, por exemplo, o playbook define os campos e gera o JSON Schema; cada registro é validado contra ele, os problemas são reportados por arquivo e página, e a origem fica gravada junto com o dado. Se quiser ir a fundo no schema, veja o guia prático de JSON Schema para extração.
Quando OCR simples basta
Nem todo problema precisa de extração estruturada. OCR puro resolve quando:
- Você só precisa encontrar documentos por palavra ("todas as notas que mencionam frete").
- Quer copiar um trecho de texto de um PDF escaneado.
- Precisa de acessibilidade ou indexação em um sistema de gestão de documentos.
Nesses casos, o OCR embutido no scanner ou no leitor de PDF já é suficiente.
Quando a extração guiada por schema é necessária
A extração estruturada se justifica quando o destino do dado é uma tabela, um sistema ou um cálculo. Sinais claros:
- Campos fixos. Você sempre precisa dos mesmos 8 ou 12 campos de cada documento.
- Muitos layouts. Documentos de fornecedores, distribuidoras ou bancos diferentes, cada um com seu modelo.
- Lote. Dezenas ou centenas de arquivos por mês, e ninguém quer digitar.
- Consequência do erro. O dado alimenta um fechamento contábil, um inventário de emissões ou uma conciliação, e um número errado custa caro.
- Rastreabilidade. Alguém vai perguntar "de onde veio esse valor?" e você precisa responder.
Se marcou dois ou mais desses pontos, OCR puro vai deixar a parte mais trabalhosa nas suas mãos.
Tabela comparativa: OCR, OCR por template e extração com IA
| Critério | OCR clássico | OCR por template | Extração guiada por schema (IA) |
|---|---|---|---|
| O que entrega | Texto corrido | Campos de zonas fixas | Campos definidos, tipados e validados |
| Entende rótulos e contexto | Não | Não (usa posição) | Sim |
| Lida com layouts variados | Indiferente (só texto) | Mal; exige um template por layout | Bem, com o mesmo schema |
| Tabelas de itens | Perde a estrutura | Só se a tabela for fixa | Lê linha a linha |
| Fotos de celular inclinadas | Lê, com mais erros | Zonas desalinham | Lê a página inteira; depende da qualidade da foto |
| Aponta o que não conseguiu ler | Não | Pouco | Sim, se houver validação e avisos |
| Origem do dado (página, linha) | Coordenadas brutas | Zona | Registrada junto com o dado |
| Manutenção | Baixa | Alta com muitos layouts | Baixa; ajusta o schema e as instruções |
| Melhor uso | Busca, cópia, indexação | Um formulário padronizado | Campos fixos, muitos layouts, lote |
A tabela é qualitativa. Os resultados reais dependem da qualidade dos documentos e de como a ferramenta trata erros.
Como avaliar uma ferramenta de extração de dados
Antes de escolher, faça um teste com material seu. Alguns critérios que ajudam:
- Use seus próprios documentos. Pegue 10 a 20 documentos reais, incluindo os feios: foto torta, escaneado com sombra, layout antigo.
- Olhe os avisos, não só os acertos. O que a ferramenta faz quando não encontra um campo? Deixa vazio e avisa, ou preenche com algo plausível? Prefira a que avisa.
- Confira a origem. Clique em um valor e veja se consegue chegar à página e à linha de onde ele saiu.
- Teste a validação. Defina um campo como número e veja se um valor com texto é rejeitado ou passa disfarçado.
- Mude o layout. Inclua documentos do mesmo tipo vindos de fontes diferentes e veja se precisa reconfigurar algo.
- Processe um lote. A ferramenta aceita vários arquivos de uma vez e mostra o progresso por arquivo, ou exige um por um? E a saída sai no formato do seu próximo passo (Excel, CSV, JSON)?
Se a ferramenta oferece créditos gratuitos, use-os nesse teste antes de assinar. Para o caso de fotos e digitalizações difíceis, leia como extrair dados de documentos escaneados e fotos de celular.
Perguntas frequentes
OCR e extração de dados são a mesma coisa?
Não. OCR converte imagem em texto. Extração de dados identifica quais valores correspondem a quais campos e os entrega em formato estruturado. Muitas ferramentas de extração usam OCR ou modelos de visão como etapa interna, mas o resultado final é diferente.
Preciso de OCR se meu PDF já tem texto selecionável?
Não para o texto em si. Mas o problema de saber qual texto é o total ou a data continua. Extração guiada por schema funciona tanto para PDFs nativos quanto para escaneados e imagens.
A IA substitui a revisão humana?
Não por completo. A validação por schema e os avisos reduzem o que precisa ser conferido, porque apontam os registros com problema. A revisão continua necessária para exceções e para documentos que a ferramenta sinalizou como ilegíveis ou incompletos.
Quanto custa testar?
Depende da ferramenta. No Colunar, a conta é criada com 20 créditos gratuitos, sem cartão; um PDF consome 4 créditos e uma imagem, 3. Dá para processar alguns documentos reais antes de decidir.
Se você quer ver a diferença na prática, crie um playbook com os campos que precisa, solte alguns documentos reais e confira os avisos e a origem de cada valor. Comece grátis com 20 créditos.