OCR y PDF escaneados: anonimizar documentos sin capa de texto
Un PDF escaneado no contiene texto: contiene una imagen de la página. Por eso los anonimizadores que solo buscan cadenas fallan en silencio, y el tachado manual sobre la imagen deja a menudo texto recuperable si la capa no se destruye bien o si el OCR posterior «lee» lo que creías oculto.
En administraciones, salud, educación y bufetes, el escáner sigue siendo la puerta de entrada de expedientes. Esta guía explica cómo diseñar un flujo serio: OCR → detección → revisión → censura, cuándo generar PDF texto copiable, cuándo pasar a Word OCR, y cómo hacerlo con procesamiento en la UE.
Tres problemas distintos (no los mezcles)
1. Anonimizar el escaneado
Objetivo: publicar o compartir sin PII. Necesitas OCR para detectar y luego censurar de forma efectiva en el PDF de salida.
2. Hacer el PDF buscable
Objetivo: conservar la apariencia del escaneo pero permitir buscar/copiar texto (PDF texto copiable / searchable PDF).
3. Reutilizar el contenido
Objetivo: editar en Word. Necesitas OCR de conversión (PDF a Word OCR), no solo una capa invisible.
Elegir mal el objetivo es la causa nº1 de proyectos «OCR» que no satisfacen a negocio ni a cumplimiento.
Calidad de escaneo: lo que nadie cuenta y lo paga el OCR
- Resolución: apunta a 300 dpi o más para DNI, sellos y letras pequeñas.
- Contraste y sesgo: páginas torcidas o grises aumentan confusiones (0/O, 1/l).
- Páginas mixtas: un expediente con nativo + escaneado necesita detectar qué páginas carecen de texto.
- Idioma: modelos OCR rinden distinto según idioma y tipografía; valida con muestras reales de tu archivo.
- Sellos y firmas manuscritas: pueden requerir zonas visuales además del OCR de texto.
Por qué el tachado «a mano» en escaneados es frágil
Pintar negros sobre la imagen en un editor genérico no garantiza irreversibilidad: a veces queda información en otras capas, miniaturas, o el operador olvida una página. Además, sin OCR no sabes si dejaste un segundo DNI en el margen. Un flujo con detección automática + previsualización reduce ese riesgo operativo.
Flujo A — Anonimizar PDF escaneados (recomendado para publicación)
- Sube el PDF (o imágenes/HEIC según soporte).
- El sistema detecta ausencia de capa de texto y aplica OCR.
- Se proponen entidades (nombres, identificadores, direcciones, etc.).
- Revisas inclusiones/exclusiones en previsualización.
- Generas el PDF censurado y verificas con búsqueda sobre el resultado (si hay capa) y revisión visual.
Nota: en el producto, el detalle de pasos puede variar según modalidad; lo importante es no saltarse la revisión humana en documentos de alto riesgo.
Anonimiza PDF escaneados con OCR en el flujo de Anonimatum.
Anonimizador PDF escaneadosFlujo B — PDF texto copiable (searchable) sin cambiar el aspecto
Cuando archivo y búsqueda importan pero la imagen del escaneo debe preservarse (sellos, disposición original), genera un PDF con capa de texto. Úsalo para indexar expedientes *después* de decidir si aún contienen PII; si deben publicarse, anonimiza primero o asegúrate de que la capa no reexpone datos que pensabas ocultos solo visualmente.
Crea PDF texto copiable con OCR.
PDF texto copiableFlujo C — PDF a Word OCR (cuando necesitas editar)
Si el equipo debe reescribir o reutilizar el contenido, convierte a DOCX vía OCR. Después aplica las mismas precauciones que en la guía de Word: comentarios, metadatos y verificación. No conviertas y compartas el Word sin pasar por anonimización si el escaneo original tenía PII.
Obtén Word editable desde escaneados.
PDF a Word OCRChecklist de cumplimiento para escaneados
- ¿El documento es solo imagen, híbrido o nativo?
- ¿Hay base jurídica / finalidad claras para el OCR y la anonimización?
- ¿El procesamiento ocurre en la UE sin LLMs externos sobre el contenido?
- ¿Quién valida la previsualización en expedientes sensibles?
- ¿Se conservan evidencias de verificación (muestras, fecha, revisor)?
- ¿El fichero de salida se probó buscando identificadores conocidos?
Cómo lo aborda Anonimatum
Anonimatum integra OCR en el flujo de anonimización y ofrece herramientas dedicadas de PDF texto copiable y PDF a Word OCR, con IA local en infraestructura europea. Así evitas encadenar tres proveedores distintos (escáner → OCR cloud → redactor) con transferencias y criterios inconsistentes.
¿Remesas grandes de escaneados en ZIP?
Procesamiento por lotesValida tu tipología documental con Politeia Soft.
Contactar