Qu'est-ce que l'OCR ? Signification, fonctionnement et quand un PDF en a besoin

OCR signifie reconnaissance optique de caractères : la technologie transforme des images de texte en texte réel et consultable. Ce que le terme veut dire, ce qu'est la numérisation OCR et comment savoir si votre PDF en a besoin.

Mis à jour 1 août 20265 min de lecture

En une phrase : OCR signifie reconnaissance optique de caractères (en anglais Optical Character Recognition) : la technologie lit les lettres à l'intérieur d'une image et les transforme en texte réel que vous pouvez rechercher, sélectionner et copier.

Si vous avez déjà ouvert un PDF scanné et constaté que vous ne pouviez pas sélectionner les mots ni rechercher avec Ctrl+F, vous avez rencontré un document qui a besoin d'OCR.

Ce que signifie l'OCR

Le terme se décompose clairement :

  • Optique — la reconnaissance travaille à partir d'une image, comme le ferait un œil.
  • Caractères — elle identifie les lettres, chiffres et signes de ponctuation un par un.
  • Reconnaissance — elle détermine quel caractère chaque forme représente le plus probablement.

L'OCR consiste donc à regarder une image d'écriture et à comprendre ce qui y est écrit. L'entrée, ce sont des pixels ; la sortie, du texte.

Ce que signifie l'OCR dans un PDF, concrètement : un PDF peut contenir soit de vrais caractères, soit seulement une image de la page. L'OCR prend le second type et ajoute une couche invisible de texte réel, positionnée exactement sur l'image. Visuellement, rien ne change — mais le document cesse d'être une photographie pour devenir un document.

Ce qu'est la numérisation OCR

Beaucoup emploient « numérisation OCR » pour désigner tout le trajet du papier au fichier consultable. Ce sont en réalité deux étapes distinctes que l'on confond souvent :

  1. La numérisation — un scanner ou l'appareil photo d'un téléphone produit une image de la page. À ce stade, l'ordinateur ne dispose que de points colorés. Il n'y a aucun « mot » dans le fichier.
  2. L'OCR — un logiciel analyse cette image et détermine quels caractères s'y trouvent.

Un scanner seul ne donne pas de texte consultable. C'est le malentendu le plus fréquent autour de ce terme : si votre scanner a produit un PDF dans lequel vous ne pouvez pas rechercher, il a fait la première étape et sauté la seconde.

Comment fonctionne l'OCR

L'OCR moderne se déroule à peu près ainsi :

  1. Prétraitement — l'image est redressée et le contraste nettoyé pour que les lettres se détachent du fond.
  2. Analyse de mise en page — le logiciel distingue les zones de texte des photos, tableaux et espaces vides. Il en déduit aussi l'ordre de lecture : colonnes, titres, légendes.
  3. Reconnaissance des caractères — chaque forme est comparée à un modèle de l'apparence des lettres dans la langue choisie.
  4. Correction linguistique — un dictionnaire et un modèle statistique corrigent les résultats improbables. C'est pourquoi « rn » ne devient généralement pas « m », et pourquoi le choix de la langue compte autant.
  5. Sortie — le texte reconnu est réécrit sous forme de couche invisible alignée sur l'image d'origine.

Quand avez-vous besoin d'OCR ?

Vous avez besoin d'OCR lorsque le PDF est basé sur une image et que vous voulez :

  • rechercher dans le document avec Ctrl+F,
  • copier du texte depuis celui-ci,
  • l'envoyer à d'autres outils (traduction, indexation, extraction de données),
  • ou répondre à des exigences d'accessibilité — les lecteurs d'écran ont besoin de texte réel, et une image de texte leur est invisible.

Vous n'avez pas besoin d'OCR pour les PDF exportés depuis Word, un navigateur ou une application. Ils contiennent déjà de vrais caractères, et y appliquer l'OCR n'apporte rien.

Comment savoir si un PDF a besoin d'OCR

Le test le plus rapide prend deux secondes : ouvrez le fichier et essayez de sélectionner une ligne de texte.

Ce qui se passeCe que cela signifie
Des mots individuels se surlignentC'est déjà du vrai texte — pas besoin d'OCR
Toute la page se sélectionne d'un bloc, ou rien ne se sélectionneC'est une image — OCR nécessaire
Ctrl+F ne trouve rien qui figure visiblement sur la pageC'est une image — OCR nécessaire

Un second indice est la taille du fichier. Un PDF texte de dix pages fait souvent moins de 200 Ko ; dix pages scannées pèsent généralement plusieurs mégaoctets, car chaque page est une photographie.

Ce qui détermine la précision de l'OCR

La précision se joue en grande partie avant même que l'OCR ne s'exécute, par la qualité de l'image :

  • La résolution. 300 DPI est le point d'équilibre en pratique. En dessous d'environ 200 DPI, les lettres perdent le détail nécessaire pour distinguer des formes voisines.
  • La rectitude. Les pages de travers dégradent nettement le résultat. La plupart des logiciels redressent automatiquement, mais partir droit reste préférable.
  • Le contraste et l'éclairage. Les ombres sur une photo prise au téléphone, ou le scan gris d'une page grise, brouillent la frontière entre l'encre et le papier.
  • Le choix de la langue. Sélectionner la bonne langue active le jeu de caractères et le dictionnaire adaptés. Cela compte énormément pour les caractères accentués — é, è, ê, à, ç, ù — souvent mal lus avec un mauvais modèle linguistique.
  • La police et l'état du document. Un texte imprimé propre est lu presque parfaitement. L'écriture manuscrite, les polices décoratives, les tickets thermiques passés et les textes recouverts de tampons sont bien plus difficiles.

Ce que l'OCR ne fait pas

Autant fixer les attentes, car ces points surprennent souvent :

  • Il ne rend pas le PDF modifiable. L'OCR rend le texte consultable ; il ne reconstruit pas le document en paragraphes modifiables. Pour cela, il faut convertir le PDF en Word, en étape distincte.
  • Il ne lit pas l'écriture manuscrite de façon fiable. La reconnaissance d'écriture manuscrite est un autre problème (parfois appelé ICR, reconnaissance intelligente de caractères) et les résultats varient beaucoup.
  • Il n'améliore pas l'image. La page garde exactement la même apparence. L'OCR travaille derrière l'image, pas dessus.
  • Il n'est pas infaillible. Sur un scan propre, les erreurs sont rares mais pas nulles. Pour tout document important sur le plan juridique ou financier, vérifiez le résultat.

Rendre un PDF consultable

Une fois que vous savez qu'un document est un scan, lancer l'OCR prend quelques secondes. Consultez le guide pas à pas pour rendre un PDF scanné consultable ou allez directement à l'outil OCR — gratuit à l'usage, sans compte.

Questions fréquentes

Que signifie le sigle OCR ?+

OCR vient de l'anglais « Optical Character Recognition », soit reconnaissance optique de caractères. C'est le procédé qui consiste à lire les lettres à l'intérieur d'une image et à les convertir en texte réel, exploitable par une machine.

Que signifie l'OCR dans un PDF ?+

Dans un PDF, l'OCR consiste à ajouter une couche de texte invisible par-dessus les images des pages scannées. La page garde exactement la même apparence, mais les mots en dessous deviennent consultables, sélectionnables et copiables.

Qu'est-ce que la numérisation OCR ?+

La numérisation OCR combine deux étapes : d'abord scanner un document papier pour obtenir une image, puis exécuter l'OCR sur cette image. Le fichier obtenu contient alors du vrai texte et non une simple image de texte.

Un PDF scanné est-il la même chose qu'un PDF texte ?+

Non. Un PDF scanné est une image de la page : le texte n'est pas sélectionnable. Un PDF texte (numérique) stocke de vrais caractères que vous pouvez rechercher et copier. L'OCR convertit le premier type en second.

L'OCR fonctionne-t-il sur les photos ?+

Oui. L'OCR fonctionne sur toute image de texte, y compris les photos de documents, tant que le texte est suffisamment net et bien éclairé.

L'OCR est-il fiable à 100 % ?+

Aucun OCR n'est parfait, mais la précision est très élevée sur des scans propres. Choisir la bonne langue et scanner à 300 DPI réduit fortement les erreurs.

L'OCR rend-il un PDF modifiable dans Word ?+

Pas à lui seul. L'OCR rend le texte consultable et copiable à l'intérieur du PDF. Pour obtenir un document modifiable, il faut aussi convertir le PDF en Word, ce qui est une étape distincte.

Outils associés

Essayer maintenant