PDFora
Pricing Todas as ferramentas
👁️

OCR de PDF

Reconheça o texto de documentos e imagens digitalizados, diretamente no seu navegador.

🔒 Seus arquivos são processados localmente no seu navegador e nunca são enviados.
1

Enviar

Selecione ou arraste e solte o seu arquivo.

2

Ajustar

Escolha as suas opções — tudo acontece no seu navegador.

3

Baixar

Salve o arquivo pronto na hora. Sem marcas d'água.

Um PDF digitalizado não passa de uma pilha de fotografias. Não o consegue pesquisar, não consegue copiar um parágrafo dele nem colar de lá um número de referência. A ferramenta de OCR da PDFora lê o texto contido nessas imagens de página com o Tesseract, o mesmo motor de código aberto em que assentam pipelines documentais sérios, e entrega-lhe o texto reconhecido num ficheiro .txt limpo que pode pesquisar, editar e reaproveitar.

O que distingue este OCR é isto: corre inteiramente dentro do seu navegador. Praticamente todos os serviços de OCR online carregam a sua digitalização para um servidor para a processar. O nosso não. O reconhecimento acontece no seu próprio aparelho, por isso um passaporte digitalizado, um contrato de arrendamento assinado ou uma página de resultados médicos nunca é transmitido para lado nenhum. Em documentos destes, isso não é um pormenor simpático, é a questão toda.

A ferramenta reconhece atualmente inglês, hindi, espanhol e francês, e o idioma é escolhido antes de iniciar a leitura. É gratuita, sem registo, sem marca de água e sem quota de páginas. A velocidade de reconhecimento depende do seu aparelho, já que é o seu processador que faz o trabalho, mas uma página típica demora apenas alguns segundos num portátil moderno.

Como fazer OCR a um PDF online

  1. Abra a ferramenta OCR PDF na PDFora num navegador moderno.
  2. Arraste o seu PDF digitalizado para a zona de largada ou clique para o escolher no seu aparelho.
  3. Selecione o idioma do documento: inglês, hindi, espanhol ou francês. O idioma certo melhora drasticamente a exatidão.
  4. Clique em Reconhecer Texto e deixe o Tesseract processar cada página localmente, no seu navegador.
  5. Acompanhe o progresso à medida que as páginas ficam concluídas; documentos mais longos demoram um pouco mais.
  6. Descarregue o texto extraído num ficheiro .txt e pesquise, edite ou copie dele à vontade.

When to use this tool

  • Extrair o texto de uma sentença judicial digitalizada com 60 páginas para poder procurar uma cláusula concreta em vez de ler página a página.
  • Retirar citações de páginas de manuais fotografadas para um trabalho de investigação, sem as reescrever à mão.
  • Digitalizar uma pasta de faturas antigas em papel para que os valores e os números de fatura se tornem registos pesquisáveis.
  • Converter uma circular oficial digitalizada em hindi para texto editável, com vista a tradução ou resumo.
  • Recuperar o texto de um documento de que só sobreviveu a versão impressa, digitalizando-a e passando-a por OCR.
  • Tornar citáveis por e-mail os resumos de reuniões e os relatórios impressos, extraindo o texto em vez de fotografar o ecrã.

Tips for the best results

  • Dê-lhe a digitalização mais limpa que tiver. 300 DPI, boa iluminação e texto escuro sobre fundo claro produzem um reconhecimento muito melhor do que uma fotografia mal iluminada tirada com o telemóvel.
  • Endireite primeiro a digitalização. Páginas tortas baralham o reconhecimento de caracteres, por isso passe um documento inclinado pela ferramenta de correção de inclinação da PDFora antes do OCR.
  • Faça corresponder a definição de idioma ao documento. Passar uma carta em espanhol pelo modelo de inglês produz um resultado deturpado, e vice-versa.
  • Conte com execuções mais lentas em telemóveis e portáteis antigos. O motor usa o processador do seu aparelho, por isso uma digitalização de 100 páginas é trabalho para um computador de secretária e não para um tablet com cinco anos.
  • Reveja os números. O OCR é muito bom, mas não é perfeito, e os dígitos em números de conta ou em totais merecem uma verificação manual antes de confiar neles.

Perguntas frequentes

O meu documento digitalizado é carregado para ser processado?

Não, e isso é raro entre as ferramentas de OCR online. O motor Tesseract corre dentro do seu navegador, por isso cada página é reconhecida no seu próprio aparelho. Nada é enviado para um servidor em momento algum, o que torna a ferramenta segura para documentos de identificação, contratos e registos médicos.

O que recebo como resultado?

A ferramenta extrai o texto reconhecido e entrega-lho num ficheiro .txt para descarregar. A partir daí pode pesquisá-lo, colá-lo num documento ou alimentá-lo a qualquer outro fluxo de trabalho que precise de texto simples.

Que idiomas são suportados?

Neste momento estão disponíveis inglês, hindi, espanhol e francês. Escolha o idioma que corresponde ao seu documento antes de iniciar o reconhecimento, porque o motor carrega um modelo específico para cada idioma e a exatidão depende de acertar na escolha.

Qual é a exatidão do reconhecimento de texto?

Numa digitalização limpa e bem iluminada de texto impresso, a exatidão costuma ser muito elevada. A qualidade cai com fotografias desfocadas, tipos de letra invulgares, escrita manual ou muita inclinação. A qualidade do que entra é o fator com maior peso, por isso volte a digitalizar ou endireite uma página fraca antes de culpar o motor.

Porque é que o OCR é mais lento no meu aparelho do que no do meu colega?

Porque o processamento é local, a velocidade acompanha o seu equipamento. Um portátil recente devora páginas em segundos, enquanto um telemóvel mais antigo demora bastante mais. A contrapartida positiva desse processamento local é a privacidade total.

Existe limite de páginas ou de ficheiros, e tem algum custo?

Sem custo, sem conta, sem marca de água e sem quota de páginas. Pode fazer OCR a um arquivo inteiro de digitalizações, se quiser. A única restrição prática é o tempo, já que documentos longos demoram mais a processar na sua própria máquina.