
Como revisar o OCR de um PDF em português
OCR reconhece caracteres em imagens e pode tornar um PDF pesquisável. O reconhecimento pode errar mesmo quando o arquivo abre normalmente. Revise os trechos que importam antes de copiar o texto para outro sistema.
Passo a passo e cuidados
- Em Reconhecer texto, escolha Português no idioma do documento. Para páginas realmente bilíngues, a opção Português e inglês também está disponível.
- Escolha PDF pesquisável para pesquisar no documento, Texto TXT para obter texto simples, ou PDF e TXT para receber ambos.
- Avalie Corrigir inclinação e Preservar páginas que já têm texto conforme o seu arquivo. Essas opções não restauram detalhes que o scanner não capturou.
- Pesquise uma frase no PDF e compare o texto extraído com a imagem original. Revise especialmente os trechos que serão reutilizados.
Acentos, letras parecidas e algarismos
Confira ç, ã, õ e palavras acentuadas. Atenção às trocas entre O e 0, I e 1, além de pontos e vírgulas em valores. Uma palavra plausível pode estar errada. Nomes, datas, códigos e números exigem comparação direta com o original.
Pesquisar não significa reconstruir tabelas
O PDF pesquisável acrescenta texto para busca, mas isso não transforma tabelas em células de Excel. Para trabalhar com colunas e registros, use PDF para Excel e revise sua estrutura. Para reescrever parágrafos, considere PDF para Word no modo Texto fluido.
Colunas e ordem de leitura
Jornais, formulários e páginas com duas colunas podem produzir texto fora da sequência esperada. Confira uma passagem que atravessa a mudança de coluna. Um TXT mistura o conteúdo reconhecido em texto simples e não preserva toda a diagramação.
Melhorar a entrada antes de repetir
Prefira digitalizações nítidas, sem cortes, sombras ou perspectiva acentuada. Ampliar uma imagem pequena não recupera caracteres ausentes. Se o original está ilegível, uma nova digitalização pode ajudar mais que repetir a tarefa com as mesmas opções.