El PDF escaneado es uno de los formatos de documento más comunes en oficinas, tribunales y archivos. Parece una página, se imprime como una página y a menudo lleva una firma oficial. Sin embargo, en cuanto a accesibilidad, suele ser el peor infractor. Los lectores de pantalla no pueden leerlo, los motores de búsqueda no pueden indexarlo y los usuarios no pueden seleccionar ni cambiar el tamaño del texto. Un PDF escaneado es esencialmente una fotografía envuelta en un contenedor PDF, y esa es la fuente de casi todos los problemas.
nn
Por qué los PDF escaneados fallan en accesibilidad
nn
El problema es simple: un escáner captura píxeles, no caracteres. La imagen resultante puede mostrar la letra A, pero el archivo no contiene información de que la letra es una A. Un lector de pantalla encuentra un bloque de silencio. Un motor de búsqueda encuentra una imagen sin texto para rastrear. Un usuario móvil no puede reorganizar el texto porque las líneas son imágenes fijas, no texto real.
nn
Las exploraciones deficientes empeoran las cosas. La baja resolución, las páginas torcidas, las manchas y la tinta desvaída reducen la precisión incluso cuando se aplica el reconocimiento óptico de caracteres más tarde. Los diseños de varias columnas, las notas al pie, las tablas y los formularios confunden a las herramientas OCR simples porque el orden de lectura no es evidente solo a partir de la imagen.
nn
Qué hace realmente el OCR
nn
El reconocimiento óptico de caracteres, o OCR, convierte el texto visible en una imagen en caracteres reales y seleccionables. Los motores OCR modernos utilizan el reconocimiento de patrones y el aprendizaje automático para identificar letras, números y símbolos. También pueden detectar párrafos, tablas y orden de lectura.
nn
Sin embargo, el OCR no es magia. No puede agregar estructura que nunca existió. No entiende encabezados, listas o significado semántico a menos que la herramienta los mapee específicamente. También tiene dificultades con la escritura a mano, las fuentes ornamentales y el papel dañado. Un buen OCR es el primer paso hacia un documento accesible, pero es solo un paso.
nn
Cómo aplicar OCR correctamente
nn
Hacer OCR correctamente significa elegir la configuración adecuada antes de presionar el botón de convertir. Comience con estas cuatro áreas.
nn
Elegir el idioma correcto
nn
Los motores OCR cargan modelos de idioma para reconocer formas de caracteres. Si procesa un documento en inglés con un modelo en alemán, cada th se convierte en un par confuso. Siempre configure el idioma del documento y, para archivos multilingües, elija una herramienta que admita el reconocimiento de idiomas mixtos.
nn
Elegir el formato de salida correcto
nn
PDF/A es el formato a largo plazo más seguro porque incrusta fuentes y texto y está diseñado para archivar. Cuando la accesibilidad importa, exporte a un PDF etiquetado si su software OCR lo admite. Las etiquetas transportan niveles de encabezado, listas y estructura de tablas a las tecnologías de asistencia. Evite las salidas basadas únicamente en imágenes.
nn
Preservar la capa de texto
nn
El mejor resultado de OCR es un PDF searchable que mantiene el escaneo original visible mientras coloca una capa de texto invisible encima. Esto preserva la apariencia visual para impresión y firmas mientras proporciona a los lectores de pantalla y motores de búsqueda algo con qué trabajar.
nn
Limpiar antes del OCR
nn
Gire las páginas torcidas, elimine los bordes negros y aumente el contraste si el original es débil. Algunas herramientas pueden enderezar y reducir el ruido automáticamente. Un escaneo limpio eleva la precisión de aceptable a excelente.
nn
Pasos de remediación después del OCR
nn
Incluso la mejor ejecución de OCR necesita revisión. Abra el documento resultante y verifique el orden de lectura. Verifique que los encabezados estén etiquetados como encabezados y que las tablas tengan encabezados correctos. Busque errores comunes: el número 0 leído como la letra O, o rn leído como m.
nn
Si trabaja en un flujo de accesibilidad, ejecute un verificador automático como PAC para PDF o el verificador de accesibilidad de Acrobat. Luego pruebe con un lector de pantalla real para escuchar lo que escucharán los usuarios. Corrija los problemas restantes en el documento fuente o en las etiquetas del PDF.
nn
Cuando un documento escaneado está demasiado dañado o es demasiado complejo, recrearlo desde la fuente original a veces es más rápido y limpio que intentar reparar un mal resultado de OCR.
nn
Los PDF escaneados no tienen que permanecer inaccesibles. Con el enfoque de OCR adecuado y una breve pasada de remediación, puede convertir una imagen silenciosa en un documento que todos pueden leer, buscar y usar.
nn
¿Necesita ayuda para hacer accesible su colección de documentos? EasyAccessPDF convierte y remedia PDF escaneados para que pueda cumplir con los estándares de conformidad sin el dolor de cabeza manual.