Qu'est-ce que l'OCR et comment ça fonctionne ?

La reconnaissance optique de caractères (OCR) expliquée simplement. Découvrez comment l'OCR convertit images et scans en texte consultable, ses usages, limites et meilleures applications.

Qu'est-ce que l'OCR et comment ça fonctionne ?

Vous scannez un document ou prenez en photo une page imprimée, et vous obtenez un fichier image. Ça ressemble à du texte, mais pour un ordinateur, ce ne sont que des pixels -- des rangées et des rangées de données de couleur sans aucune compréhension des lettres, des mots ou du sens qu'ils représentent. La reconnaissance optique de caractères, universellement connue sous le nom d'OCR, est la technologie qui comble ce fossé. Elle analyse les formes d'une image et les convertit en véritables caractères textuels que vous pouvez chercher, sélectionner, copier, modifier et traduire.

Bref historique de l'OCR

Le concept de machines lisant du texte remonte au début des années 1900, mais la technologie OCR pratique a émergé dans les années 1960 et 1970 lorsque les ordinateurs centraux ont acquis assez de puissance pour analyser des images scannées. Les premiers systèmes ne pouvaient lire que des polices de machine à écrire spécifiques et nécessitaient une qualité d'image irréprochable. Dans les années 1990, des logiciels OCR commerciaux comme OmniPage et ABBYY FineReader géraient plusieurs polices avec une précision raisonnable. Aujourd'hui, l'apprentissage automatique et les réseaux de neurones ont poussé la précision de l'OCR au-dessus de 99 pour cent pour du texte imprimé propre, et les systèmes modernes peuvent même traiter l'écriture manuscrite, le texte courbé sur les étiquettes de produits et le texte dans des photographies prises sous des angles variés.

Comment fonctionne l'OCR : le processus technique

1. Prétraitement de l'image

Avant d'analyser le texte, le logiciel OCR nettoie l'image. Cela inclut la conversion en niveaux de gris, l'ajustement de la luminosité et du contraste, la suppression du bruit (taches, bavures, motifs de fond) et le redressement de toute inclinaison ou rotation. Un bon prétraitement est crucial -- un scan légèrement incliné ou une ombre sur la page peut réduire considérablement la précision s'ils ne sont pas corrigés au préalable.

2. Analyse de la mise en page

Le logiciel identifie la structure de la page : où sont les colonnes, en-têtes, paragraphes, images, tableaux et légendes ? Cette étape empêche le moteur OCR d'essayer de lire une photographie comme du texte ou de fusionner deux colonnes en une seule ligne illisible.

3. Segmentation des caractères

Chaque ligne de texte est découpée en caractères individuels. Pour les langues avec un espacement clair entre les lettres (comme le français ou l'anglais), c'est relativement simple. Pour les écritures connectées (comme l'arabe ou l'écriture cursive), la segmentation est bien plus complexe et repose fortement sur l'analyse contextuelle.

4. Reconnaissance des caractères

C'est le coeur de l'OCR. Chaque caractère segmenté est comparé à une base de données de formes de caractères connues. Les systèmes modernes utilisent des réseaux de neurones convolutifs (CNN) entraînés sur des millions d'échantillons de texte, leur permettant de reconnaître des caractères même partiellement masqués, de style inhabituel ou dégradés. Le système génère un score de confiance pour chaque caractère -- essentiellement, à quel point il est sûr qu'une forme particulière est un « A » plutôt qu'un « H ».

5. Post-traitement

Le texte reconnu est affiné à l'aide de dictionnaires et de modèles linguistiques. Si le moteur OCR est sûr à 60 pour cent qu'un mot est « maison » et à 40 pour cent qu'il est « maisou », le modèle linguistique reconnaît que « maison » est un mot français valide et « maisou » ne l'est pas, et sélectionne l'interprétation correcte. Cette étape corrige de nombreuses erreurs que la simple reconnaissance de formes manquerait.

À quoi sert l'OCR ?

  • Rendre les documents scannés consultables. Après avoir lancé l'OCR, vous pouvez utiliser la recherche de votre système d'exploitation pour trouver un mot spécifique parmi des milliers de pages scannées. Cela transforme une archive statique en base de données consultable.
  • Numériser des livres et articles imprimés. Les bibliothèques et éditeurs utilisent l'OCR pour convertir des livres physiques en livres numériques et archives numériques consultables.
  • Extraire des données de reçus et factures. Les applications de suivi de dépenses utilisent l'OCR pour lire les totaux, dates et noms de fournisseurs sur les photos de reçus, éliminant la saisie manuelle.
  • Lire du texte dans les photos. Les applications de traduction utilisent l'OCR pour identifier le texte sur les panneaux, menus et étiquettes de produits, puis le traduire en temps réel.
  • Traiter des formulaires et demandes. Les administrations et compagnies d'assurance utilisent l'OCR pour extraire des données de formulaires manuscrits et imprimés, réduisant les délais de traitement de plusieurs jours à quelques minutes.
  • Accessibilité. Les lecteurs d'écran peuvent lire à voix haute le texte traité par OCR, rendant les documents scannés accessibles aux personnes malvoyantes.

Limites de l'OCR

L'OCR n'est pas parfait. La précision chute significativement avec :

  • Mauvaise qualité d'image. Les scans flous, sombres ou en basse résolution perturbent le moteur de reconnaissance.
  • L'écriture manuscrite. Si l'OCR moderne gère l'écriture manuscrite soignée avec une précision modérée, l'écriture désordonnée ou très stylisée reste un défi.
  • Mises en page complexes. Les documents à colonnes multiples, avec du texte superposé à des images ou une mise en forme inhabituelle peuvent perturber l'analyse de la mise en page.
  • Polices inhabituelles. Les polices décoratives, ultra-fines ou très stylisées réduisent la précision de reconnaissance.
  • Documents endommagés. Les documents froissés, tachés ou décolorés présentent des informations visuelles manquantes que l'OCR ne peut pas récupérer.

Conseils pour de meilleurs résultats OCR

  1. Scannez à 300 DPI ou plus. Une résolution inférieure rend les contours des caractères flous et ambigus.
  2. Assurez un éclairage uniforme et lumineux lors de la prise de photo de documents. Les ombres sur le texte réduisent la précision.
  3. Gardez l'appareil photo parallèle au document pour minimiser la distorsion de perspective.
  4. Utilisez un filtre noir et blanc ou niveaux de gris pour les documents textuels. Les informations de couleur sont sans intérêt pour l'OCR et ajoutent du bruit.
  5. Vérifiez le résultat OCR pour détecter les erreurs, surtout pour les noms propres, les chiffres et les termes techniques qui peuvent ne pas figurer dans le dictionnaire linguistique.

L'OCR sur votre iPhone

Votre iPhone est un puissant appareil OCR. Avec la bonne application, vous pouvez scanner une page avec l'appareil photo et obtenir du texte entièrement consultable et sélectionnable en quelques secondes. PDF Creator - Scanner & OCR combine un scanner de documents de haute qualité avec un moteur OCR précis, transformant n'importe quel document physique en PDF consultable et modifiable. Scannez, reconnaissez et gérez vos documents en un seul endroit avec 29 outils PDF professionnels à portée de main.

Try PDF Creator for Free

29 PDF tools. Scan with OCR. Merge, split, compress, watermark. Everything on your iPhone.

Télécharger PDF Creator Gratuit