OCR + anonimización · IA local en la UE
PDF de escáner o foto sin capa de texto: OCR en el flujo de anonimización para detectar y censurar datos personales antes de compartir.
Un PDF escaneado no es un documento con texto seleccionable: es una secuencia de imágenes. Si intentas censurar a mano o con herramientas que solo leen la capa de texto, los nombres, fechas y direcciones del escáner pasan desapercibidos. Anonimatum integra OCR real dentro del flujo de anonimización para que esos datos vuelvan a ser texto procesable y, a continuación, susceptibles de detección automática.
El procesamiento ocurre en infraestructura europea. No se envían páginas a APIs de LLM externas: la detección combina patrones, wordsets, listas blancas/inversas e IA local. Puedes revisar las coincidencias antes de aplicar la censura y exportar un PDF anonimizado apto para archivo, publicación o entrega a terceros.
Si solo necesitas una capa de texto searchable sin anonimizar, usa la herramienta PDF texto copiable. Cuando el objetivo es cumplir minimización y RGPD sobre un escaneado, este flujo es el adecuado: OCR + revisión + censura en un mismo entorno.
Arrastra el escaneado a la app. El sistema detecta si falta capa de texto y prepara el OCR en servidor europeo.
Patrones, wordsets e IA local marcan fechas, direcciones, importes, QR y otros datos sensibles. Ajusta coincidencias antes de censurar.
Exporta el resultado listo para archivar, publicar o compartir. El original permanece bajo tu control de cuenta.
Expedientes digitalizados por escáner que deben publicarse o compartirse sin datos identificativos.
Contratos o dictámenes escaneados donde la capa de texto no existe o es incompleta.
Informes o justificantes fotografiados que aún contienen datos de pacientes o asegurados.
Responsables que necesitan evidencia de que el escaneado se trató con OCR y revisión previa.
OCR y censura en el mismo entorno europeo, sin depender de nubes de LLM ajenas.
No hace falta un pipeline externo: el escáner se convierte en texto y se detectan datos sensibles en el mismo proceso.
Detección contextual sin enviar el documento a APIs de modelos generativos de terceros.
Combina reglas deterministas con revisión humana para reducir falsos positivos y negativos.
Procesa volúmenes de escaneados en cola cuando el plan lo permite, sin saltarte la revisión.
Digitalizaciones antiguas sin OCR previo que deben entrar en un portal de transparencia.
Fotos de facturas o DNI en PDF que llegan por correo y hay que reenviar censuradas.
Actas firmadas en papel, digitalizadas, con nombres y domicilios a ocultar.
Cuando además necesitas editar, combina con PDF a Word OCR tras o antes de anonimizar según el flujo.
Sí. El flujo activa OCR para extraer texto de páginas imagen y después aplica la detección y censura.
No. OCR y anonimización corren en la infraestructura europea de Anonimatum.
Si solo necesitas texto copiable sin censura, usa la herramienta PDF texto copiable.
Entre otros activos: fechas, direcciones, importes/cantidades y códigos QR, además de patrones y wordsets.
Se recomienda revisar las coincidencias. Whitelist e inversa ayudan a afinar qué se censura y qué se conserva.
En https://app.anonimatum.com, dentro de la zona de anonimización.