Qu'est-ce que l'OCR ? Signification, fonctionnement et quand un PDF en a besoin
OCR signifie reconnaissance optique de caractères : la technologie transforme des images de texte en texte réel et consultable. Ce que le terme veut dire, ce qu'est la numérisation OCR et comment savoir si votre PDF en a besoin.
En une phrase : OCR signifie reconnaissance optique de caractères (en anglais Optical Character Recognition) : la technologie lit les lettres à l'intérieur d'une image et les transforme en texte réel que vous pouvez rechercher, sélectionner et copier.
Si vous avez déjà ouvert un PDF scanné et constaté que vous ne pouviez pas sélectionner les mots ni rechercher avec Ctrl+F, vous avez rencontré un document qui a besoin d'OCR.
Ce que signifie l'OCR
Le terme se décompose clairement :
- Optique — la reconnaissance travaille à partir d'une image, comme le ferait un œil.
- Caractères — elle identifie les lettres, chiffres et signes de ponctuation un par un.
- Reconnaissance — elle détermine quel caractère chaque forme représente le plus probablement.
L'OCR consiste donc à regarder une image d'écriture et à comprendre ce qui y est écrit. L'entrée, ce sont des pixels ; la sortie, du texte.
Ce que signifie l'OCR dans un PDF, concrètement : un PDF peut contenir soit de vrais caractères, soit seulement une image de la page. L'OCR prend le second type et ajoute une couche invisible de texte réel, positionnée exactement sur l'image. Visuellement, rien ne change — mais le document cesse d'être une photographie pour devenir un document.
Ce qu'est la numérisation OCR
Beaucoup emploient « numérisation OCR » pour désigner tout le trajet du papier au fichier consultable. Ce sont en réalité deux étapes distinctes que l'on confond souvent :
- La numérisation — un scanner ou l'appareil photo d'un téléphone produit une image de la page. À ce stade, l'ordinateur ne dispose que de points colorés. Il n'y a aucun « mot » dans le fichier.
- L'OCR — un logiciel analyse cette image et détermine quels caractères s'y trouvent.
Un scanner seul ne donne pas de texte consultable. C'est le malentendu le plus fréquent autour de ce terme : si votre scanner a produit un PDF dans lequel vous ne pouvez pas rechercher, il a fait la première étape et sauté la seconde.
Comment fonctionne l'OCR
L'OCR moderne se déroule à peu près ainsi :
- Prétraitement — l'image est redressée et le contraste nettoyé pour que les lettres se détachent du fond.
- Analyse de mise en page — le logiciel distingue les zones de texte des photos, tableaux et espaces vides. Il en déduit aussi l'ordre de lecture : colonnes, titres, légendes.
- Reconnaissance des caractères — chaque forme est comparée à un modèle de l'apparence des lettres dans la langue choisie.
- Correction linguistique — un dictionnaire et un modèle statistique corrigent les résultats improbables. C'est pourquoi « rn » ne devient généralement pas « m », et pourquoi le choix de la langue compte autant.
- Sortie — le texte reconnu est réécrit sous forme de couche invisible alignée sur l'image d'origine.
Quand avez-vous besoin d'OCR ?
Vous avez besoin d'OCR lorsque le PDF est basé sur une image et que vous voulez :
- rechercher dans le document avec Ctrl+F,
- copier du texte depuis celui-ci,
- l'envoyer à d'autres outils (traduction, indexation, extraction de données),
- ou répondre à des exigences d'accessibilité — les lecteurs d'écran ont besoin de texte réel, et une image de texte leur est invisible.
Vous n'avez pas besoin d'OCR pour les PDF exportés depuis Word, un navigateur ou une application. Ils contiennent déjà de vrais caractères, et y appliquer l'OCR n'apporte rien.
Comment savoir si un PDF a besoin d'OCR
Le test le plus rapide prend deux secondes : ouvrez le fichier et essayez de sélectionner une ligne de texte.
| Ce qui se passe | Ce que cela signifie |
|---|---|
| Des mots individuels se surlignent | C'est déjà du vrai texte — pas besoin d'OCR |
| Toute la page se sélectionne d'un bloc, ou rien ne se sélectionne | C'est une image — OCR nécessaire |
| Ctrl+F ne trouve rien qui figure visiblement sur la page | C'est une image — OCR nécessaire |
Un second indice est la taille du fichier. Un PDF texte de dix pages fait souvent moins de 200 Ko ; dix pages scannées pèsent généralement plusieurs mégaoctets, car chaque page est une photographie.
Ce qui détermine la précision de l'OCR
La précision se joue en grande partie avant même que l'OCR ne s'exécute, par la qualité de l'image :
- La résolution. 300 DPI est le point d'équilibre en pratique. En dessous d'environ 200 DPI, les lettres perdent le détail nécessaire pour distinguer des formes voisines.
- La rectitude. Les pages de travers dégradent nettement le résultat. La plupart des logiciels redressent automatiquement, mais partir droit reste préférable.
- Le contraste et l'éclairage. Les ombres sur une photo prise au téléphone, ou le scan gris d'une page grise, brouillent la frontière entre l'encre et le papier.
- Le choix de la langue. Sélectionner la bonne langue active le jeu de caractères et le dictionnaire adaptés. Cela compte énormément pour les caractères accentués — é, è, ê, à, ç, ù — souvent mal lus avec un mauvais modèle linguistique.
- La police et l'état du document. Un texte imprimé propre est lu presque parfaitement. L'écriture manuscrite, les polices décoratives, les tickets thermiques passés et les textes recouverts de tampons sont bien plus difficiles.
Ce que l'OCR ne fait pas
Autant fixer les attentes, car ces points surprennent souvent :
- Il ne rend pas le PDF modifiable. L'OCR rend le texte consultable ; il ne reconstruit pas le document en paragraphes modifiables. Pour cela, il faut convertir le PDF en Word, en étape distincte.
- Il ne lit pas l'écriture manuscrite de façon fiable. La reconnaissance d'écriture manuscrite est un autre problème (parfois appelé ICR, reconnaissance intelligente de caractères) et les résultats varient beaucoup.
- Il n'améliore pas l'image. La page garde exactement la même apparence. L'OCR travaille derrière l'image, pas dessus.
- Il n'est pas infaillible. Sur un scan propre, les erreurs sont rares mais pas nulles. Pour tout document important sur le plan juridique ou financier, vérifiez le résultat.
Rendre un PDF consultable
Une fois que vous savez qu'un document est un scan, lancer l'OCR prend quelques secondes. Consultez le guide pas à pas pour rendre un PDF scanné consultable ou allez directement à l'outil OCR — gratuit à l'usage, sans compte.