BrowserTools
Accueil / Images / Image en texte (OCR)

Image en texte (OCR)

Extrayez le texte de captures d'écran, de numérisations et de photos dans votre navigateur. OCR gratuit en cinq langues, par lots, avec copie, .txt et .zip, sans aucun envoi vers un serveur.

Chargement de Image en texte (OCR)… Si rien ne se passe, activez JavaScript.

La reconnaissance optique de caractères, OCR en abrégé, consiste à retransformer une image de texte en texte que vous pouvez sélectionner, rechercher et modifier. Cet outil s'appuie sur Tesseract, le moteur d'OCR que Google maintient en open source depuis 2006, compilé en WebAssembly pour fonctionner dans votre navigateur plutôt que sur un serveur. Déposez une capture d'écran, une page numérisée, la photo d'un reçu ou une diapositive de présentation, choisissez la langue, et vous obtenez du texte brut à copier, à télécharger en fichier .txt ou à coller directement dans un document. Vous pouvez mettre plusieurs images en file d'attente : elles sont lues l'une après l'autre.

Questions fréquentes

Mes images sont-elles envoyées à un serveur ?
Non. Le moteur d'OCR s'exécute dans votre navigateur sous forme de WebAssembly : l'image est traitée localement et ne quitte jamais votre appareil. Rien n'est stocké, rien n'est journalisé. C'est la raison principale de préférer cet outil à un service d'OCR en ligne si vos images sont des reçus, des contrats, des pièces d'identité ou tout autre document que vous préféreriez ne pas confier.
Pourquoi le premier lancement est-il lent ?
La première fois que vous extrayez du texte, votre navigateur télécharge le moteur d'OCR (environ 4 Mo) et les données de la langue choisie (0,7 à 3 Mo). Les deux sont servis depuis ce site et non par un tiers, et les deux sont mis en cache : les lancements suivants démarrent aussitôt et fonctionnent même hors ligne. La reconnaissance elle-même prend ensuite quelques secondes par image, selon sa taille et votre appareil.
Quelles langues sont prises en charge ?
L'anglais, le portugais, l'espagnol, le français et l'allemand. Choisissez la langue du texte présent dans l'image, pas celle de votre interface. Se tromper ici est la cause la plus fréquente de mauvais résultats sur du texte accentué, car le moteur s'appuie sur le modèle de langue pour trancher entre des caractères visuellement proches.
Sait-il lire l'écriture manuscrite ?
Pas de façon fiable. Tesseract est entraîné sur des caractères imprimés : des capitales d'imprimerie bien tracées au stylo foncé passent parfois, mais l'écriture cursive presque jamais. Si vous avez besoin de reconnaissance d'écriture manuscrite, il s'agit d'une autre catégorie de modèle et cet outil n'est pas le bon.
Pourquoi le texte extrait est-il rempli de caractères absurdes ?
Le plus souvent, les caractères de l'image sont trop petits : Tesseract veut du texte d'une vingtaine de pixels de haut au minimum. Renumérisez à 300 ppp, ou recadrez et agrandissez avant de réessayer. Les autres causes courantes sont une image de travers ou pivotée, une ombre ou un reflet sur la page, du texte clair sur fond sombre, et une langue mal choisie. Passer la mise en page en bloc unique après un recadrage serré débloque beaucoup d'images récalcitrantes.
Que signifie le score de confiance ?
C'est la certitude moyenne que le moteur s'attribue sur les mots reconnus, de 0 à 100. Au-dessus de 90 environ, le texte est généralement propre ; entre 70 et 89, attendez-vous à quelques caractères erronés à relire ; en dessous de 70, le problème vient de l'image et non du moteur. Voyez-y une invitation à vérifier, pas une garantie dans un sens ou dans l'autre.
Quels formats d'image puis-je utiliser ?
Tous ceux que votre navigateur sait décoder : PNG, JPEG, WebP, BMP, GIF et généralement AVIF. Une capture d'écran collée depuis le presse-papiers en PNG est l'entrée idéale, car elle est sans perte et déjà à la résolution de l'écran. Un JPEG très compressé perd les contours fins des petites lettres : préférez le PNG quand vous avez le choix.
Peut-il lire un PDF numérisé ?
Pas directement, cet outil accepte des images. Si votre PDF contient du vrai texte, utilisez plutôt l'outil d'extraction de texte de PDF, plus rapide et exact. S'il s'agit d'une numérisation, exportez ou capturez d'abord les pages en images, puis passez-les ici par lot.
La mise en page, les tableaux et les colonnes sont-ils conservés ?
Seulement de manière approximative. La sortie est du texte brut avec des retours à la ligne à peu près là où le moteur les a vus, et l'ordre de lecture suit ce qu'attend le mode de mise en page choisi. Les pages sur plusieurs colonnes ressortent généralement dans le bon ordre en mode automatique, mais les tableaux perdent leur alignement et deviennent des lignes de texte. Si le tableau est important, recadrez et lisez colonne par colonne.
Combien d'images puis-je traiter à la fois ?
Autant que vous voulez, jusqu'à 25 Mo par fichier. Elles sont mises en file et lues une par une, car l'OCR sollicite le processeur et en lancer plusieurs en parallèle ne ferait que ralentir chacune d'elles. Chaque fichier obtient sa zone de texte, son bouton de copie et son téléchargement .txt, et à partir de deux résultats vous pouvez tout télécharger dans une seule archive .zip.

À propos de Image en texte (OCR)

Deux réglages déterminent l'essentiel du résultat. La langue compte plus qu'on ne l'imagine, car Tesseract ne se contente pas de comparer des formes, il évalue aussi quelles séquences de lettres sont plausibles dans la langue choisie. Lire un texte français avec le modèle anglais est la première cause de caractères accentués mal restitués, choisissez donc la bonne langue avant tout. Le réglage de mise en page indique au moteur quelle structure attendre : le mode automatique gère une page normale avec paragraphes et colonnes, le bloc unique convient quand vous avez recadré au plus près d'un seul fragment de texte, la ligne unique sert pour un numéro de série ou un code, le mot unique pour une étiquette, et le texte dispersé est le mode à choisir quand les mots sont éparpillés dans l'image, comme sur un schéma, une carte ou une capture de jeu.

La qualité de l'image fixe le plafond de la précision, et la résolution en est le levier principal. Tesseract apprécie des caractères d'une vingtaine de pixels de haut au minimum, ce qui explique qu'une capture d'écran nette ressorte souvent parfaite alors qu'une photo du même texte prise à l'autre bout de la pièce non. Le cas idéal reste du texte sombre sur fond clair, droit, uniformément éclairé et contrasté : documents imprimés, captures d'écran, sous-titres, pages de livre, factures, formulaires et diapositives fonctionnent tous très bien. La déformation de perspective, une ombre en travers de la page, le flou de bougé, les polices décoratives ou très stylisées, les tableaux denses et l'écriture manuscrite sont les points faibles de l'OCR, et aucun moteur tournant sur votre téléphone ne lira l'écriture cursive de façon fiable. Si un résultat est mauvais, recadrez plus près du texte, redressez l'image, renumérisez à 300 ppp, et seulement ensuite accusez le moteur.

Tout se passe sur votre appareil. Le moteur lui-même, environ 4 Mo de WebAssembly, et les données de langue, entre 0,7 et 3 Mo selon la langue, sont téléchargés depuis ce site au premier lancement de l'OCR puis mis en cache par votre navigateur : les visites suivantes démarrent immédiatement et fonctionnent hors ligne. Vos images ne sont jamais envoyées, rien n'est stocké et rien n'est journalisé, et c'est là la différence concrète avec les nombreux services d'OCR en ligne qui vous demandent de confier un contrat, un scan de passeport ou un formulaire médical. Chaque résultat est accompagné d'un score de confiance qui indique d'un coup d'œil s'il faut s'y fier, et avec plusieurs fichiers chargés vous pouvez télécharger tous les textes extraits dans une seule archive .zip.

Cent ans de machines à lire

L'idée d'une machine qui lit est plus ancienne que l'ordinateur. En 1913, le physicien Edmund Fournier d'Albe construisit l'Optophone, un appareil qui balayait une ligne imprimée et la traduisait en sons musicaux afin que des lecteurs aveugles puissent entendre la forme des lettres. Cela fonctionnait, à sa manière, au rythme d'environ un mot par minute. En 1929, Gustav Tauschek breveta une machine qui comparait les caractères imprimés à des gabarits métalliques à l'aide d'un photodétecteur, et en 1931 Emanuel Goldberg déposa une machine statistique pour interroger des archives de microfilms par motif. Aucune ne reconnaissait le texte au sens général, mais toutes ont posé le principe que l'OCR utilise encore : éclairer la page et mesurer ce qui revient.

La percée commerciale est venue d'une direction inattendue. En 1974, Ray Kurzweil fonda une entreprise pour construire un OCR omni-font, capable de lire n'importe quelle police et non une seule pour laquelle il aurait été réglé, et le premier client qu'il avait en tête n'était pas un bureau mais un lecteur aveugle. La Kurzweil Reading Machine de 1976 réunissait un scanner à plat, un OCR et un synthétiseur vocal dans un seul appareil de la taille d'un bureau. Stevie Wonder acheta l'une des premières unités et resta client et ami de l'entreprise pendant des décennies. À la même époque, la poste américaine commença à trier le courrier par OCR en lisant les adresses, ce qui reste l'un des plus vastes déploiements d'OCR jamais réalisés.

Tesseract, le moteur derrière cette page, a une histoire qui tient du petit miracle de préservation logicielle. Il a été écrit au laboratoire Hewlett-Packard de Bristol entre 1984 et 1994, jugé suffisamment précis pour figurer près du sommet des tests de précision de l'UNLV en 1995, puis remisé lorsque HP a quitté ce marché. Il est resté inutilisé pendant dix ans. En 2005, HP a publié le code en open source, et en 2006 Google en a repris la maintenance, jusqu'à réécrire le cœur de reconnaissance autour de réseaux neuronaux LSTM dans la version 4. Résultat : un programme compilé à l'origine pour des stations de travail HP des années 1980 est aujourd'hui le moteur d'OCR par défaut du monde open source et, compilé en WebAssembly, tourne dans un onglet de navigateur sur un téléphone.

Un détail explique l'essentiel des frustrations liées à l'OCR. Le moteur ne lit pas lettre à lettre de façon isolée : il combine les formes qu'il voit avec un modèle des séquences plausibles dans la langue, exactement comme vous le faites en déchiffrant une écriture difficile. C'est pourquoi la même image donne des résultats différents selon la langue, pourquoi les noms propres et les numéros de série sont plus difficiles que la prose ordinaire, et pourquoi l'erreur classique de l'OCR est un mot faux mais prononçable. C'est aussi pourquoi les lettres qui piègent les machines sont celles qui piègent les humains : 0 contre O, 1 contre l contre I, rn contre m, et cl contre d.

Soutenir