Cómo funciona
Cada documento recorre nueve etapas verificables. La redacción nunca es automática: exige revisión y aprobación humanas antes de tocar un solo dato.
Carga PDF, Word, Excel, PowerPoint, TXT o imágenes. El documento se
guarda y se encola en la cola RQ de tu empresa
(company:{id}) para su procesamiento.
El extractor del formato produce texto posicionado (páginas,
segmentos y palabras con bbox u offsets) persistido en
extraction.json; los escaneados pasan por OCR con
Tesseract.
La IA en capas identifica datos personales y sensibles: patrones, capa gráfica, NER con spaCy, inferencial y un LLM opcional solo sobre los fragmentos ambiguos. Los hallazgos solapados se deduplican por mayor confianza.
Revisión humana obligatoria (REV-01): el pipeline automático nunca redacta. Un revisor aprueba, descarta o agrega cada hallazgo sobre el documento listo para revisar.
Solo cuando el documento queda approved puede encolarse
la redacción, y únicamente se aplican los hallazgos aprobados
(REV-10).
El redactor del formato aplica la acción de la política a cada hallazgo: tachado, anonimización, seudonimización o enmascaramiento parcial o total.
Saneamiento profundo de metadatos, capas ocultas y objetos incrustados, para que el dato protegido no quede recuperable en ninguna parte del artefacto.
La verificación post-redacción re-extrae el artefacto y comprueba que no quede texto recuperable: si lo hay, se destruye y el proceso falla. Un hallazgo activo sin ubicar también detiene el proceso.
El documento redactado se publica y cada acción queda registrada en la cadena de hashes SHA-256 inmutable, con trazabilidad completa de qué se detectó, quién aprobó y qué tratamiento se aplicó.
El pipeline es idempotente ante reintentos: re-extraer descarta la extracción previa y re-detectar reemplaza solo los hallazgos no manuales, conservando lo que un revisor ya agregó o decidió.
Un ser humano siempre aprueba antes de que se elimine un dato. Sin sorpresas, sin fugas.