OCR de PDF
Reconheça o texto de documentos e imagens digitalizados, diretamente no seu navegador.
Enviar
Selecione ou arraste e solte o seu arquivo.
Ajustar
Escolha as suas opções — tudo acontece no seu navegador.
Baixar
Salve o arquivo pronto na hora. Sem marcas d'água.
Um PDF digitalizado não passa de uma pilha de fotografias. Não o consegue pesquisar, não consegue copiar um parágrafo dele nem colar de lá um número de referência. A ferramenta de OCR da PDFora lê o texto contido nessas imagens de página com o Tesseract, o mesmo motor de código aberto em que assentam pipelines documentais sérios, e entrega-lhe o texto reconhecido num ficheiro .txt limpo que pode pesquisar, editar e reaproveitar.
O que distingue este OCR é isto: corre inteiramente dentro do seu navegador. Praticamente todos os serviços de OCR online carregam a sua digitalização para um servidor para a processar. O nosso não. O reconhecimento acontece no seu próprio aparelho, por isso um passaporte digitalizado, um contrato de arrendamento assinado ou uma página de resultados médicos nunca é transmitido para lado nenhum. Em documentos destes, isso não é um pormenor simpático, é a questão toda.
A ferramenta reconhece atualmente inglês, hindi, espanhol e francês, e o idioma é escolhido antes de iniciar a leitura. É gratuita, sem registo, sem marca de água e sem quota de páginas. A velocidade de reconhecimento depende do seu aparelho, já que é o seu processador que faz o trabalho, mas uma página típica demora apenas alguns segundos num portátil moderno.
Como fazer OCR a um PDF online
- Abra a ferramenta OCR PDF na PDFora num navegador moderno.
- Arraste o seu PDF digitalizado para a zona de largada ou clique para o escolher no seu aparelho.
- Selecione o idioma do documento: inglês, hindi, espanhol ou francês. O idioma certo melhora drasticamente a exatidão.
- Clique em Reconhecer Texto e deixe o Tesseract processar cada página localmente, no seu navegador.
- Acompanhe o progresso à medida que as páginas ficam concluídas; documentos mais longos demoram um pouco mais.
- Descarregue o texto extraído num ficheiro .txt e pesquise, edite ou copie dele à vontade.
When to use this tool
- Extrair o texto de uma sentença judicial digitalizada com 60 páginas para poder procurar uma cláusula concreta em vez de ler página a página.
- Retirar citações de páginas de manuais fotografadas para um trabalho de investigação, sem as reescrever à mão.
- Digitalizar uma pasta de faturas antigas em papel para que os valores e os números de fatura se tornem registos pesquisáveis.
- Converter uma circular oficial digitalizada em hindi para texto editável, com vista a tradução ou resumo.
- Recuperar o texto de um documento de que só sobreviveu a versão impressa, digitalizando-a e passando-a por OCR.
- Tornar citáveis por e-mail os resumos de reuniões e os relatórios impressos, extraindo o texto em vez de fotografar o ecrã.
Tips for the best results
- Dê-lhe a digitalização mais limpa que tiver. 300 DPI, boa iluminação e texto escuro sobre fundo claro produzem um reconhecimento muito melhor do que uma fotografia mal iluminada tirada com o telemóvel.
- Endireite primeiro a digitalização. Páginas tortas baralham o reconhecimento de caracteres, por isso passe um documento inclinado pela ferramenta de correção de inclinação da PDFora antes do OCR.
- Faça corresponder a definição de idioma ao documento. Passar uma carta em espanhol pelo modelo de inglês produz um resultado deturpado, e vice-versa.
- Conte com execuções mais lentas em telemóveis e portáteis antigos. O motor usa o processador do seu aparelho, por isso uma digitalização de 100 páginas é trabalho para um computador de secretária e não para um tablet com cinco anos.
- Reveja os números. O OCR é muito bom, mas não é perfeito, e os dígitos em números de conta ou em totais merecem uma verificação manual antes de confiar neles.
Perguntas frequentes
O meu documento digitalizado é carregado para ser processado?
Não, e isso é raro entre as ferramentas de OCR online. O motor Tesseract corre dentro do seu navegador, por isso cada página é reconhecida no seu próprio aparelho. Nada é enviado para um servidor em momento algum, o que torna a ferramenta segura para documentos de identificação, contratos e registos médicos.
O que recebo como resultado?
A ferramenta extrai o texto reconhecido e entrega-lho num ficheiro .txt para descarregar. A partir daí pode pesquisá-lo, colá-lo num documento ou alimentá-lo a qualquer outro fluxo de trabalho que precise de texto simples.
Que idiomas são suportados?
Neste momento estão disponíveis inglês, hindi, espanhol e francês. Escolha o idioma que corresponde ao seu documento antes de iniciar o reconhecimento, porque o motor carrega um modelo específico para cada idioma e a exatidão depende de acertar na escolha.
Qual é a exatidão do reconhecimento de texto?
Numa digitalização limpa e bem iluminada de texto impresso, a exatidão costuma ser muito elevada. A qualidade cai com fotografias desfocadas, tipos de letra invulgares, escrita manual ou muita inclinação. A qualidade do que entra é o fator com maior peso, por isso volte a digitalizar ou endireite uma página fraca antes de culpar o motor.
Porque é que o OCR é mais lento no meu aparelho do que no do meu colega?
Porque o processamento é local, a velocidade acompanha o seu equipamento. Um portátil recente devora páginas em segundos, enquanto um telemóvel mais antigo demora bastante mais. A contrapartida positiva desse processamento local é a privacidade total.
Existe limite de páginas ou de ficheiros, e tem algum custo?
Sem custo, sem conta, sem marca de água e sem quota de páginas. Pode fazer OCR a um arquivo inteiro de digitalizações, se quiser. A única restrição prática é o tempo, já que documentos longos demoram mais a processar na sua própria máquina.