Anonimatum

OCR + anonimización · IA local en la UE

Anonimizador de PDF escaneados con OCR

PDF de escáner o foto sin capa de texto: OCR en el flujo de anonimización para detectar y censurar datos personales antes de compartir.

Un PDF escaneado no es un documento con texto seleccionable: es una secuencia de imágenes. Si intentas censurar a mano o con herramientas que solo leen la capa de texto, los nombres, fechas y direcciones del escáner pasan desapercibidos. Anonimatum integra OCR real dentro del flujo de anonimización para que esos datos vuelvan a ser texto procesable y, a continuación, susceptibles de detección automática.

El procesamiento ocurre en infraestructura europea. No se envían páginas a APIs de LLM externas: la detección combina patrones, wordsets, listas blancas/inversas e IA local. Puedes revisar las coincidencias antes de aplicar la censura y exportar un PDF anonimizado apto para archivo, publicación o entrega a terceros.

Si solo necesitas una capa de texto searchable sin anonimizar, usa la herramienta PDF texto copiable. Cuando el objetivo es cumplir minimización y RGPD sobre un escaneado, este flujo es el adecuado: OCR + revisión + censura en un mismo entorno.

Cómo anonimizar un PDF escaneado

  1. 1

    Sube el PDF o las imágenes

    Arrastra el escaneado a la app. El sistema detecta si falta capa de texto y prepara el OCR en servidor europeo.

  2. 2

    Revisa detección tras OCR

    Patrones, wordsets e IA local marcan fechas, direcciones, importes, QR y otros datos sensibles. Ajusta coincidencias antes de censurar.

  3. 3

    Descarga el PDF anonimizado

    Exporta el resultado listo para archivar, publicar o compartir. El original permanece bajo tu control de cuenta.

Qué incluye

  • OCR real integrado en anonimización de PDF escaneados
  • Detección con patrones, wordsets, whitelist e IA local UE
  • Detectores activos: fechas, direcciones, importes y QR
  • Previsualización y revisión antes de aplicar censura
  • Procesamiento en infraestructura europea (RGPD)
  • Compatible con cola por lotes según plan
  • Complementario con PDF texto copiable y PDF a Word OCR
  • Sin APIs de LLM externas en el pipeline de detección

Para quién es este flujo

Administraciones y archivos

Expedientes digitalizados por escáner que deben publicarse o compartirse sin datos identificativos.

Despachos y compliance

Contratos o dictámenes escaneados donde la capa de texto no existe o es incompleta.

Sanidad y seguros

Informes o justificantes fotografiados que aún contienen datos de pacientes o asegurados.

Equipos RGPD

Responsables que necesitan evidencia de que el escaneado se trató con OCR y revisión previa.

Por qué anonimizar escaneados aquí

OCR y censura en el mismo entorno europeo, sin depender de nubes de LLM ajenas.

OCR en el flujo de anonimización

No hace falta un pipeline externo: el escáner se convierte en texto y se detectan datos sensibles en el mismo proceso.

IA local en la UE

Detección contextual sin enviar el documento a APIs de modelos generativos de terceros.

Patrones, wordsets y whitelist

Combina reglas deterministas con revisión humana para reducir falsos positivos y negativos.

Cola por lotes

Procesa volúmenes de escaneados en cola cuando el plan lo permite, sin saltarte la revisión.

Casos de uso frecuentes

Expedientes históricos

Digitalizaciones antiguas sin OCR previo que deben entrar en un portal de transparencia.

Justificantes móviles

Fotos de facturas o DNI en PDF que llegan por correo y hay que reenviar censuradas.

Actas escaneadas

Actas firmadas en papel, digitalizadas, con nombres y domicilios a ocultar.

Preparación a Word OCR

Cuando además necesitas editar, combina con PDF a Word OCR tras o antes de anonimizar según el flujo.

FAQ — PDF escaneados

¿Puedo anonimizar un PDF sin texto seleccionable?

Sí. El flujo activa OCR para extraer texto de páginas imagen y después aplica la detección y censura.

¿El OCR se ejecuta fuera de la UE?

No. OCR y anonimización corren en la infraestructura europea de Anonimatum.

¿Sirve solo para obtener un PDF searchable?

Si solo necesitas texto copiable sin censura, usa la herramienta PDF texto copiable.

¿Qué detectores de IA puedo usar sobre el escaneado?

Entre otros activos: fechas, direcciones, importes/cantidades y códigos QR, además de patrones y wordsets.

¿Hay que revisar a mano?

Se recomienda revisar las coincidencias. Whitelist e inversa ayudan a afinar qué se censura y qué se conserva.

¿Dónde abro el flujo?

En https://app.anonimatum.com, dentro de la zona de anonimización.

Anonimiza tus PDF escaneados

Prueba el flujo con OCR en la aplicación Anonimatum.

Abrir anonimización