Como extrair dados de documentos escaneados e fotos de celular
Guia prático para tirar dados de contas, recibos e notas fotografadas ou escaneadas: como fotografar melhor, reconhecer PDFs só imagem e evitar erros.
Equipe Colunar · Publicado em · 9 min de leitura
Dá para extrair dados de documentos escaneados e de fotos de celular, mas a qualidade do resultado depende mais da imagem do que da ferramenta. Uma foto bem tirada de um recibo de papel pode render dados tão bons quanto um PDF nativo. Uma foto torta, com sombra e texto pequeno, vai gerar erros ou campos em branco em qualquer sistema.
Este guia mostra por que fotos são mais difíceis de ler, como tirar uma foto melhor, o que fazer com PDFs que são só imagem, como as ferramentas atuais leem essas páginas e quais limites nenhuma delas resolve. O último bloco traz um fluxo prático para processar lotes de contas e recibos.
Por que uma foto de celular é mais difícil de ler que um PDF nativo
Um PDF nativo (gerado por um sistema) contém o texto como caracteres. Não há nada a "reconhecer": o valor total já está lá como "1.234,56". Uma foto ou um documento escaneado é uma grade de pixels. Antes de qualquer campo ser identificado, alguém precisa decidir quais pixels formam um "1", quais formam um "7" e onde termina uma palavra.
Os problemas mais comuns em fotos:
- Inclinação e perspectiva. A câmera raramente fica paralela ao papel. Linhas viram trapézios e o texto fica maior de um lado que do outro.
- Sombra e luz irregular. A mão ou o celular projetam sombra sobre parte do documento. Metade da página fica escura e os caracteres perdem contraste.
- Baixa resolução ou foco errado. Fotos tiradas de longe, com zoom digital ou com a câmera ainda focando deixam as letras borradas.
- Dobras, amassados e reflexo. Recibos de papel térmico dobram, apagam com o tempo e refletem luz.
- Texto pequeno. Notas de combustível e cupons fiscais usam fontes muito pequenas. Numa foto de página inteira, cada caractere pode ter poucos pixels.
Nenhum desses problemas impede a leitura por si só, mas cada um reduz a margem. Dois ou três juntos costumam gerar erros.
Como tirar uma foto melhor de um documento
A maior parte dos erros de leitura em fotos é evitável na hora da captura. Um checklist curto:
- Luz uniforme, sem flash. Prefira luz natural ou de ambiente vinda de cima. O flash cria um ponto de reflexo no centro e escurece as bordas.
- Apoie o documento em uma superfície plana e lisa. Alise dobras com a mão. Fundo escuro e liso ajuda a câmera a encontrar as bordas.
- Câmera paralela ao papel. Segure o celular por cima do documento, não em ângulo. Se o app da câmera tem modo "documento" ou "scanner", use-o: ele corrige a perspectiva.
- Enquadre o documento inteiro, com pequena margem. Se o documento é comprido (cupom fiscal), tire duas fotos ou use a digitalização contínua do app.
- Espere o foco. Toque na tela sobre o texto e aguarde a imagem ficar nítida.
- Confira antes de enviar. Amplie a foto e veja se consegue ler os números menores. Se você não consegue, a ferramenta provavelmente também não.
- Formato. Salve como JPG ou PNG, ou deixe o app de scanner gerar um PDF. Evite prints de tela de outra foto, que perdem resolução duas vezes.
Se outras pessoas fotografam para você (equipe de campo, motoristas), distribua este checklist. Um minuto de orientação economiza horas de correção.
PDF "só imagem": como reconhecer e o que fazer
Um PDF escaneado costuma ser um PDF "só imagem": cada página é uma foto, sem camada de texto.
Como reconhecer:
- Abra o arquivo e tente selecionar o texto com o mouse. Se a seleção marca a página inteira como um bloco ou não seleciona nada, é só imagem.
- Use Ctrl+F (ou Cmd+F) para buscar uma palavra que está claramente na página. Se não encontra, não há camada de texto.
Há um caso intermediário: PDFs escaneados que passaram por OCR no scanner e têm uma camada de texto invisível. O texto é selecionável, mas pode estar errado, porque ninguém revisou. Para extração, é mais seguro que a ferramenta olhe para a imagem e não confie só nessa camada.
O que fazer com PDFs só imagem:
- Não tente converter antes. Ferramentas com modelos de visão leem a imagem da página diretamente. Converter para texto antes só adiciona uma etapa em que erros entram sem aviso.
- Confira a resolução do scanner. 300 dpi é um valor comum para documentos de texto. Digitalizações em resolução muito baixa deixam o texto pequeno ilegível.
- Prefira colorido ou escala de cinza quando o documento tem áreas sombreadas ou carimbos. O modo preto e branco puro pode apagar traços finos.
- Respeite os limites de tamanho e de páginas da ferramenta. Um lote grande em um único PDF pode precisar ser dividido.
Como modelos de visão leem fotos e digitalizações
As ferramentas atuais de extração usam modelos de linguagem com visão. Em vez de passar o documento por um OCR tradicional e depois interpretar o texto, o modelo recebe a imagem da página e uma instrução ("encontre o valor total, a data e o CNPJ do emissor") e responde com base no que vê, usando rótulos e contexto. Isso ajuda em fotos porque o modelo tolera melhor inclinação e variação de layout: ele procura o rótulo "Total" e o valor ao lado, não uma coordenada fixa.
O ponto fraco desse método é texto pequeno. Uma página inteira reduzida para o modelo processar pode transformar um cupom fiscal em uma mancha cinza. Por isso, algumas ferramentas trabalham com ampliação de regiões: além da visão da página inteira, recortam e ampliam partes específicas (o bloco de itens, o rodapé com totais, o cabeçalho do emissor) e leem cada uma em tamanho maior. O Colunar faz isso: amplia partes da página para ler texto pequeno que não seria legível na visão geral. Notas de combustível, cupons e recibos térmicos, os casos mais difíceis, ficam ao alcance quando a foto foi bem tirada.
Mesmo com ampliação, o processo continua dependente da imagem. Ampliar um borrão dá um borrão maior.
Limites honestos: o que nenhuma ferramenta resolve
Vale dizer com clareza o que não funciona, para você não perder tempo:
- Texto ilegível continua ilegível. Se o papel térmico apagou, se a foto está fora de foco ou se a dobra cortou a linha do total, não há dado a extrair. A ferramenta pode, no máximo, avisar.
- Informação que não está no documento não pode ser extraída. O campo vai ficar vazio.
- Caligrafia irregular é lida com menos confiabilidade do que texto impresso e merece revisão campo a campo.
- Ambiguidade real. Quando o documento tem dois valores chamados "Total" (por exemplo, total de itens e total com frete), a ferramenta precisa de instrução sobre qual usar. Sem isso, pode escolher o errado.
O critério mais importante ao escolher uma ferramenta para fotos é o que ela faz quando não consegue ler. As opções são duas: preencher com um valor plausível e seguir em frente, ou deixar em branco e avisar. A primeira parece melhor no relatório e é pior na prática, porque o erro só aparece meses depois, numa conciliação. O Colunar segue a segunda: cada registro é validado contra o schema dos campos, e os problemas são reportados por arquivo e página, nunca descartados em silêncio. A origem (página e linha) fica junto com o dado, e a conferência de um registro sinalizado leva segundos. Sobre a diferença entre OCR e esse tipo de leitura, veja OCR ou IA: qual a diferença para extrair dados.
Fluxo prático para lotes de recibos e contas
Um roteiro para quem recebe dezenas de recibos, contas ou notas por mês, em parte como foto:
- Padronize a captura. Envie o checklist de foto para quem fotografa. Peça JPG, PNG ou PDF, um documento por arquivo. Fotos com dois recibos lado a lado dificultam a separação.
- Junte tudo em uma pasta por período. Contas de setembro em uma pasta, recibos de setembro em outra. Fica fácil ver se falta algum documento.
- Defina os campos antes. Para recibos: data, fornecedor, CNPJ ou CPF, descrição, valor, forma de pagamento. Para contas de energia: distribuidora, unidade consumidora, período, consumo em kWh, valor total. Marque como obrigatórios só os campos que não podem faltar.
- Processe em lote. Solte todos os arquivos de uma vez e deixe a tabela ser preenchida conforme cada um termina. Se a ferramenta tem modelos prontos para recibos e contas de energia, use-os como ponto de partida.
- Revise só o que foi sinalizado. Filtre os registros com aviso: campo obrigatório vazio, valor fora do formato, página ilegível. Abra o documento na origem indicada e corrija ou refotografe.
- Exporte. Excel ou CSV para a planilha de despesas; JSON se o próximo passo for um sistema.
- Guarde a foto original junto com o dado. Em auditoria ou fechamento, o valor sem o comprovante vale pouco.
Esse fluxo serve tanto para o financeiro que fecha despesas de viagem quanto para a contabilidade que recebe documentos de vários clientes. O que mais muda o resultado é o primeiro passo: fotos melhores geram menos avisos e menos revisão.
Perguntas frequentes
Foto de celular funciona tão bem quanto scanner?
Pode funcionar, se a foto for tirada com luz uniforme, câmera paralela ao papel e foco correto. Apps de scanner no celular ajudam porque corrigem a perspectiva e cortam o fundo. Um scanner de mesa ainda leva vantagem em consistência com volume grande.
Preciso passar OCR no PDF antes de enviar?
Não. Ferramentas baseadas em modelos de visão leem a imagem da página diretamente, com ou sem camada de texto. Fazer OCR antes adiciona uma etapa em que erros podem entrar sem que ninguém perceba.
O que acontece se parte do documento estiver ilegível?
O esperado é que o campo fique vazio e o registro receba um aviso indicando o arquivo e a página. Você então decide se corrige à mão, se refotografa ou se descarta.
Quantos créditos uma foto consome?
No Colunar, uma imagem (PNG ou JPG) consome 3 créditos e um PDF, 4, seja ele nativo ou escaneado. Cada arquivo pode ter até 50 MB e cada PDF, até 200 páginas. A conta gratuita começa com 20 créditos, o suficiente para testar algumas fotos reais antes de assinar.
Se você tem uma pasta de fotos e digitalizações esperando digitação, teste com os documentos mais difíceis primeiro e veja quais avisos aparecem. Comece grátis com 20 créditos.