Aller au contenu
100 % local · 0 Ko téléversésCompresser un PDF

Comment rendre un PDF recherchable

🔒 Vos fichiers ne quittent jamais votre appareil. Tout le traitement se fait localement dans votre navigateur.

Un PDF numérisé est une photographie de papier — il n'y a pas de texte dans le fichier, seulement des pixels. Vous ne pouvez pas y chercher, sélectionner, copier ni utiliser un lecteur d'écran. Le rendre recherchable signifie exécuter OCR (reconnaissance optique de caractères) pour ajouter une couche de texte qui se place derrière l'image. Ce guide couvre les trois types de sortie OCR, les outils locaux qui le font bien et pourquoi IXPDF ne fait pas d'OCR dans le navigateur aujourd'hui.

IXPDF ne peut pas faire d'OCR dans le navigateur aujourd'hui
Il existe des moteurs OCR pour navigateur (Tesseract.js, OCRad.js), mais leur précision sur des numérisations réelles n'est pas assez fiable pour être expédiée. Ils mal interprètent des polices courantes, peinent sur les mises en page multicolonnes et produisent un texte pire que pas de texte pour la recherche et l'accessibilité. Nous n'expédierons pas un outil qui renvoie silencieusement du texte erroné (AGENTS.md §16). C'est marqué Recherche requise. Les outils ci-dessous s'exécutent localement sur votre machine et ne téléversent pas votre fichier.

Les trois types de sortie OCR

Les outils OCR peuvent produire trois types différents de sortie. Lequel vous voulez dépend de ce que vous ferez du résultat.

1. PDF recherchable (image + texte invisible)

Le plus courant et généralement le bon choix. L'image de page originale reste visible — mise en page, signatures, tampons, écriture manuscrite apparaissent exactement comme avant. Derrière l'image, OCR ajoute une couche de texte invisible avec les caractères reconnus. Vous pouvez chercher, sélectionner, copier et utiliser un lecteur d'écran ; ce que vous voyez à l'écran est le numérisation original. C'est ce que produisent Adobe Acrobat, Tesseract et ABBYY par défaut.

Mieux pour : archiver des documents numérisés où l'apparence originale compte (contrats, reçus, lettres signées).

2. PDF texte seul (texte reconnu, sans image)

OCR remplace l'image entièrement par le texte reconnu. Le résultat est petit, entièrement sélectionnable et ressemble à un PDF texte normal — mais la mise en page originale est approximative, et tout contenu qu'OCR n'a pas pu reconnaître (signatures, tampons, écriture manuscrite) a disparu.

Mieux pour : quand vous n'avez besoin que du texte et que l'apparence originale n'importe pas (p. ex., extraire le corps d'une lettre numérisée dans un fichier recherchable pour une base de connaissances).

3. PDF double couche (image + texte, les deux visibles)

Un format moins courant qui montre à la fois l'image originale et le texte reconnu côte à côte, ou superpose le texte sur l'image avec l'image estompée. Utilisé dans les flux légaux et d'archivage où les relecteurs doivent comparer la sortie OCR à l'original pour détecter les erreurs de reconnaissance. ABBYY FineReader et Adobe Acrobat Pro le prennent en charge.

Mieux pour : relecture juridique, contrôle qualité d'archivage, tout flux où la précision OCR doit être vérifiée contre la source.

Outils OCR locaux

Chaque outil ci-dessous s'exécute sur votre machine. Aucun ne téléverse votre document. Cela compte : un contrat numérisé, dossier médical ou formulaire fiscal ne devrait pas être envoyé à un service « OCR en ligne gratuit » — à ce stade le contenu est sur le serveur de quelqu'un d'autre.

1. Adobe Acrobat Pro (payant, l'étalon-or)

Ouvrez le PDF numérisé, puis Outils > Numériser et OCR > Reconnaître le texte > Dans ce fichier. Choisissez la langue et le type de sortie (Image recherchable est le défaut et généralement correct). L'OCR d'Acrobat est le plus précis sur des numérisations réelles, gère bien les mises en page multicolonnes et vous permet de corriger les mots mal reconnus en ligne. L'inconvénient est le coût — Acrobat Pro est un abonnement.

2. Tesseract (gratuit, open source, ligne de commande)

Le moteur OCR gratuit le plus précis. Installez depuisle projet GitHub de Tesseract ou votre gestionnaire de paquets (brew install tesseract sur macOS,apt install tesseract-ocr sur Linux). Puis :

tesseract input.pdf output -l eng pdf

Cela produit output.pdf comme un PDF recherchable avec l'image originale et une couche de texte anglais invisible. Tesseract n'est pas aussi précis qu'Acrobat sur les mises en page complexes mais est excellent sur les numérisations propres à colonne unique. Il prend en charge plus de 100 langues — passez -l eng+fra pour documents mixtes anglais/français.

3. Live Text de Preview sous macOS (gratuit, macOS 12+)

Sur macOS Monterey et ultérieurs, Preview peut reconnaître le texte dans les PDF numérisés et images via la fonction Live Text du système. Ouvrez le PDF dans Preview et vous pouvez sélectionner, copier et chercher du texte directement — macOS ajoute la couche de texte à la volée. Pour enregistrer la version recherchable, Fichier > Exporter en PDF. Live Text est rapide et précis sur les documents en anglais mais limité en prise en charge de langues comparé à Tesseract.

4. ABBYY FineReader (payant, haute précision)

Un outil OCR commercial connu pour sa haute précision sur des numérisations difficiles — écriture manuscrite, faible contraste, polices mixtes, mises en page multicolonnes. Il prend en charge la sortie double couche pour vérification. Utilisez-le quand Tesseract n'est pas assez précis et que vous ne pouvez justifier l'abonnement Acrobat Pro. FineReader est un achat unique, non un abonnement.

Étape par étape : rendre un PDF recherchable avec Tesseract

  1. Installez Tesseract. Sur macOS,brew install tesseract. Sur Linux,apt install tesseract-ocr. Sur Windows, téléchargez l'installeur depuis le projet GitHub de Tesseract.
  2. Installez les données de langue. L'anglais est inclus par défaut. Pour d'autres langues, installez le pack de langue correspondant (p. ex., brew install tesseract-lang sur macOS).
  3. Ouvrez un terminal. Naviguez au dossier contenant le PDF numérisé.
  4. Exécutez OCR.tesseract input.pdf output -l eng pdf
  5. Vérifiez le résultat. Ouvrez output.pdf, cherchez un mot que vous voyez dans l'image et essayez de sélectionner un paragraphe. Si la recherche et la sélection fonctionnent, la couche de texte est en place.
  6. Relisez. OCR fait des erreurs. Copiez un paragraphe dans un éditeur de texte et comparez-le à l'image. Corrigez toute mauvaise reconnaissance critique dans le document source si vous comptez vous fier au texte.

Précision OCR : à quoi s'attendre

La précision OCR dépend presque entièrement de la qualité de l'image source. Une numérisation propre à 300 DPI d'une page imprimée dans une police courante (Arial, Times New Roman) se reconnaîtra à 98–99 % de précision de caractères. Une numérisation à 150 DPI d'une page photocopiée avec une police décorative peut chuter à 90 % ou moins — c'est 1 caractère erroné sur 10, assez pour casser la recherche et le copier-coller.

Ce qui nuit à la précision : faible résolution (sous 200 DPI), inclinaison (pages numérisées en angle), bruit (speckles d'un verre de scanner sale), polices mixtes, écriture manuscrite, mises en page multicolonnes, tableaux et texte sur fonds colorés. Si votre numérisation présente l'un de ces éléments, attendez-vous à relire soigneusement.

Erreurs courantes

  • Utiliser un service OCR en ligne gratuit pour un document sensible. Le fichier est téléversé vers un serveur. Utilisez un outil local — Tesseract, Acrobat ou Live Text de macOS.
  • Faire confiance à la sortie OCR sans relire. OCR fait des erreurs. Si vous copiez du texte dans un contrat, une citation ou une base de données, vérifiez chaque mot contre l'image.
  • Choisir la sortie texte seul quand vous avez besoin de l'apparence originale. L'OCR texte seul discard l'image. Si les signatures, tampons ou mise en page importent, utilisez la sortie PDF recherchable à la place.
  • OCR-iser un PDF qui a déjà du texte. Si le fichier a déjà une couche de texte (testez avec Ctrl+F), OCR est inutile et peut dégrader le texte existant. Voir Pourquoi ne puis-je pas sélectionner de texte dans un PDF ? pour confirmer que le fichier a réellement besoin d'OCR.
  • Omettre le pack de langue. Tesseract utilise l'anglais par défaut. OCR-iser un document français avec le modèle anglais produit des déchets. Passez toujours -l avec la langue correcte.

Modifiez les métadonnées de votre PDF recherchable

Une fois qu'OCR a ajouté une couche de texte, utilisez l'outil Éditer les métadonnées d'IXPDF pour définir le titre, l'auteur, le sujet et les mots-clés — localement dans votre navigateur, sans téléversement.

Ouvrir Éditer les métadonnées