PDFora
Pricing Tous les outils
👁️

OCR PDF

Reconnaissez le texte de documents scannés et d'images, directement dans votre navigateur.

🔒 Vos fichiers sont traités localement dans votre navigateur et ne sont jamais téléversés.
1

Importer

Sélectionnez votre fichier ou glissez-déposez-le.

2

Régler

Choisissez vos options — tout se passe dans votre navigateur.

3

Télécharger

Enregistrez instantanément le fichier terminé. Sans filigrane.

Un PDF scanné n'est rien d'autre qu'une pile de photographies. Impossible d'y faire une recherche, d'en copier un paragraphe ou d'en extraire un numéro de référence. L'outil OCR de PDFora lit le texte contenu dans ces images de pages grâce à Tesseract, le moteur libre utilisé dans des chaînes de traitement documentaire exigeantes, et vous restitue le texte reconnu sous forme d'un fichier .txt propre, que vous pouvez rechercher, modifier et réutiliser.

Voici ce qui distingue cet OCR : il s'exécute intégralement dans votre navigateur. Presque tous les services d'OCR en ligne envoient votre scan sur un serveur pour le traiter. Pas le nôtre. La reconnaissance se fait sur votre propre appareil : un passeport scanné, un bail signé ou une page de résultats d'analyses n'est donc jamais transmis nulle part. Pour ce type de documents, ce n'est pas un détail de confort, c'est tout l'intérêt.

L'outil reconnaît actuellement l'anglais, le hindi, l'espagnol et le français, et vous choisissez la langue avant de lancer l'analyse. Il est gratuit, sans inscription, sans filigrane et sans quota de pages. La vitesse de reconnaissance dépend de votre appareil, puisque c'est votre processeur qui fait le travail, mais une page ordinaire ne prend que quelques secondes sur un ordinateur portable récent.

Comment appliquer l'OCR à un PDF en ligne

  1. Ouvrez l'outil OCR PDF sur PDFora dans un navigateur récent.
  2. Faites glisser votre PDF scanné sur la zone de dépôt, ou cliquez pour le choisir sur votre appareil.
  3. Sélectionnez la langue du document : anglais, hindi, espagnol ou français. La bonne langue améliore considérablement la précision.
  4. Cliquez sur Reconnaître le texte et laissez Tesseract traiter chaque page en local, dans votre navigateur.
  5. Suivez la progression au fil des pages traitées ; les documents longs demandent un peu plus de temps.
  6. Téléchargez le texte extrait sous forme de fichier .txt, puis recherchez, modifiez ou copiez son contenu librement.

When to use this tool

  • Extraire le texte d'un jugement scanné de 60 pages pour y rechercher une clause précise au lieu de tout lire.
  • Récupérer des citations de pages de manuel photographiées pour un mémoire de recherche, sans les retaper à la main.
  • Numériser un dossier d'anciennes factures papier afin que les montants et les numéros de facture deviennent des données consultables.
  • Convertir une circulaire administrative hindi scannée en texte modifiable, en vue d'une traduction ou d'une synthèse.
  • Récupérer le contenu d'un document dont il ne restait qu'une impression papier, en le scannant puis en lançant l'OCR.
  • Rendre citables dans un e-mail des supports de réunion et des rapports imprimés en récupérant leur texte plutôt qu'en les prenant en capture d'écran.

Tips for the best results

  • Fournissez le scan le plus propre possible. 300 DPI, un bon éclairage et un texte foncé sur fond clair donnent une reconnaissance bien meilleure qu'une photo de téléphone mal éclairée.
  • Redressez d'abord le scan. Les pages de travers perturbent la reconnaissance de caractères : faites passer un document incliné par l'outil de redressement de PDFora avant l'OCR.
  • Faites correspondre le réglage de langue au document. Passer une lettre en espagnol dans le modèle anglais produira un résultat truffé d'erreurs, et inversement.
  • Attendez-vous à des traitements plus lents sur téléphone et sur les ordinateurs anciens. Le moteur utilise le processeur de votre appareil : un scan de 100 pages est un travail pour un ordinateur de bureau, pas pour une tablette de cinq ans d'âge.
  • Relisez les chiffres. L'OCR est très performant mais pas infaillible, et les chiffres d'un numéro de compte ou d'un total méritent une vérification manuelle avant que vous ne vous y fiiez.

Questions fréquentes

Mon document scanné est-il envoyé quelque part pour être traité ?

Non, et c'est rare parmi les outils d'OCR en ligne. Le moteur Tesseract fonctionne à l'intérieur de votre navigateur : chaque page est donc reconnue sur votre propre appareil. Rien n'est transmis à un serveur à aucun moment, ce qui rend l'outil sûr pour les pièces d'identité, les contrats et les dossiers médicaux.

Qu'est-ce que j'obtiens comme résultat ?

L'outil extrait le texte reconnu et vous le fournit sous forme d'un fichier .txt téléchargeable. Vous pouvez ensuite y faire des recherches, le coller dans un document ou l'injecter dans n'importe quel autre traitement nécessitant du texte brut.

Quelles langues sont prises en charge ?

L'anglais, le hindi, l'espagnol et le français sont disponibles pour le moment. Choisissez la langue correspondant à votre document avant de lancer la reconnaissance : le moteur charge un modèle propre à chaque langue et la précision dépend de ce choix.

Quelle est la précision de la reconnaissance de texte ?

Sur un scan propre et bien éclairé de texte imprimé, la précision est généralement très élevée. Elle baisse avec les photos floues, les polices inhabituelles, l'écriture manuscrite ou une forte inclinaison. La qualité de l'entrée est le levier le plus déterminant : rescannez ou redressez une page médiocre avant d'incriminer le moteur.

Pourquoi l'OCR est-il plus lent sur mon appareil que sur celui d'un collègue ?

Parce que le traitement est local, la vitesse suit votre matériel. Un ordinateur portable récent avale les pages en quelques secondes chacune, tandis qu'un téléphone plus ancien met sensiblement plus de temps. La contrepartie de ce traitement local, c'est une confidentialité totale.

Y a-t-il une limite de pages ou de fichiers, et cela a-t-il un coût ?

Aucun coût, aucun compte, aucun filigrane et aucun quota de pages. Vous pouvez passer toute une archive de scans à l'OCR si vous le souhaitez. La seule contrainte réelle est le temps, puisque les documents longs demandent davantage de traitement sur votre propre machine.