Un PDF scanné est l’un des formats de document les plus courants dans les bureaux, les tribunaux et les archives. Il ressemble à une page, s’imprime comme une page et porte souvent une signature officielle. Pourtant, en matière d’accessibilité, il est généralement le pire coupable. Les lecteurs d’écran ne peuvent pas le lire, les moteurs de recherche ne peuvent pas l’indexer, et les utilisateurs ne peuvent ni sélectionner ni redimensionner le texte. Un PDF scanné est essentiellement une photographie enveloppée dans un conteneur PDF, et c’est là la source de presque tous les problèmes.
nn
Pourquoi les PDF scannés échouent sur le plan de l’accessibilité
nn
Le problème est simple : un scanner capture des pixels, pas des caractères. L’image résultante peut afficher la lettre A, mais le fichier ne contient aucune information indiquant que cette lettre est un A. Un lecteur d’écran rencontre un bloc de silence. Un moteur de recherche rencontre une image sans texte à explorer. Un utilisateur mobile ne peut pas réorganiser le texte, car les lignes sont des images fixes et non du vrai texte.
nn
De mauvais scans aggravent les choses. Une faible résolution, des pages déformées, des taches et de l’encre estompée réduisent la précision même lorsque la reconnaissance optique de caractères est appliquée ultérieurement. Les mises en page multi-colonnes, les notes de bas de page, les tableaux et les formulaires perturbent les outils OCR simples, car l’ordre de lecture n’est pas évident à partir de l’image seule.
nn
Ce que fait réellement l’OCR
nn
La reconnaissance optique de caractères, ou OCR, convertit le texte visible dans une image en caractères réels et sélectionnables. Les moteurs OCR modernes utilisent la correspondance de motifs et l’apprentissage automatique pour identifier les lettres, les chiffres et les symboles. Ils peuvent également détecter les paragraphes, les tableaux et l’ordre de lecture.
nn
Cependant, l’OCR n’est pas magique. Il ne peut pas ajouter une structure qui n’a jamais existé. Il ne comprend pas les titres, les listes ou la signification sémantique, à moins que l’outil ne les mappe spécifiquement. Il a aussi du mal avec l’écriture manuscrite, les polices ornées et le papier endommagé. Un bon OCR est la première étape vers un document accessible, mais ce n’est qu’une étape.
nn
Comment effectuer un OCR correctement
nn
Faire de l’OCR correctement signifie choisir les bons paramètres avant d’appuyer sur le bouton de conversion. Commencez par ces quatre domaines.
nn
Choisir la bonne langue
nn
Les moteurs OCR chargent des modèles linguistiques pour reconnaître les formes de caractères. Si vous traitez un document anglais avec un modèle allemand, chaque th devient une paire confuse. Définissez toujours la langue du document, et pour les fichiers multilingues, choisissez un outil qui prend en charge la reconnaissance de langues mixtes.
nn
Choisir le bon format de sortie
nn
PDF/A est le format d’archivage le plus sûr sur le long terme, car il intègre les polices et le texte et est conçu pour l’archivage. Lorsque l’accessibilité est importante, exportez vers un PDF balisé si votre logiciel OCR le permet. Les balises transportent les niveaux de titre, les listes et la structure des tableaux vers les technologies d’assistance. Évitez les sorties purement image.
nn
Conserver la couche texte
nn
Le meilleur résultat OCR est un PDF consultable qui conserve le scan original visible tout en plaçant une couche de texte invisible par-dessus. Cela préserve l’apparence visuelle pour l’impression et les signatures tout en donnant aux lecteurs d’écran et aux moteurs de recherche quelque chose à exploiter.
nn
Nettoyer avant l’OCR
nn
Redressez les pages de travers, supprimez les bordures noires et augmentez le contraste si l’original est terne. Certains outils peuvent désincliner et débruiter automatiquement. Un scan propre fait passer la précision de correcte à excellente.
nn
Étapes de correction après l’OCR
nn
Même le meilleur traitement OCR nécessite encore une vérification. Ouvrez le document obtenu et vérifiez l’ordre de lecture. Assurez-vous que les titres sont balisés comme des titres et que les tableaux ont des en-têtes corrects. Recherchez les erreurs courantes : le chiffre 0 lu comme la lettre O, ou rn lu comme m.
nn
Si vous travaillez dans un workflow d’accessibilité, exécutez un vérificateur automatique tel que PAC pour PDF ou le vérificateur d’accessibilité d’Acrobat. Testez ensuite avec un véritable lecteur d’écran pour entendre ce que les utilisateurs entendront. Corrigez les problèmes restants dans le document source ou dans les balises PDF.
nn
Quand un document scanné est trop endommagé ou trop complexe, le recréer à partir de la source originale est parfois plus rapide et plus propre que d’essayer de réparer un mauvais résultat OCR.
nn
Les PDF scannés n’ont pas à rester inaccessibles. Avec la bonne approche OCR et une courte passe de correction, vous pouvez transformer une image silencieuse en un document que tout le monde peut lire, rechercher et utiliser.
nn
Besoin d’aide pour rendre votre collection de documents accessible ? EasyAccessPDF convertit et corrige les PDF scannés afin que vous respectiez les normes de conformité sans la contrainte manuelle.