Iniciar sesión

Cómo funciona

Un pipeline transparente, de la subida a la auditoría

Cada documento recorre nueve etapas verificables. La redacción nunca es automática: exige revisión y aprobación humanas antes de tocar un solo dato.

  1. 1

    Sube

    Carga PDF, Word, Excel, PowerPoint, TXT o imágenes. El documento se guarda y se encola en la cola RQ de tu empresa (company:{id}) para su procesamiento.

  2. 2

    Extrae

    El extractor del formato produce texto posicionado (páginas, segmentos y palabras con bbox u offsets) persistido en extraction.json; los escaneados pasan por OCR con Tesseract.

  3. 3

    Detecta

    La IA en capas identifica datos personales y sensibles: patrones, capa gráfica, NER con spaCy, inferencial y un LLM opcional solo sobre los fragmentos ambiguos. Los hallazgos solapados se deduplican por mayor confianza.

  4. 4

    Revisa

    Revisión humana obligatoria (REV-01): el pipeline automático nunca redacta. Un revisor aprueba, descarta o agrega cada hallazgo sobre el documento listo para revisar.

  5. 5

    Aprueba

    Solo cuando el documento queda approved puede encolarse la redacción, y únicamente se aplican los hallazgos aprobados (REV-10).

  6. 6

    Redacta

    El redactor del formato aplica la acción de la política a cada hallazgo: tachado, anonimización, seudonimización o enmascaramiento parcial o total.

  7. 7

    Sanitiza

    Saneamiento profundo de metadatos, capas ocultas y objetos incrustados, para que el dato protegido no quede recuperable en ninguna parte del artefacto.

  8. 8

    Verifica

    La verificación post-redacción re-extrae el artefacto y comprueba que no quede texto recuperable: si lo hay, se destruye y el proceso falla. Un hallazgo activo sin ubicar también detiene el proceso.

  9. 9

    Publica y audita

    El documento redactado se publica y cada acción queda registrada en la cadena de hashes SHA-256 inmutable, con trazabilidad completa de qué se detectó, quién aprobó y qué tratamiento se aplicó.

El pipeline es idempotente ante reintentos: re-extraer descarta la extracción previa y re-detectar reemplaza solo los hallazgos no manuales, conservando lo que un revisor ya agregó o decidió.

La redacción nunca es automática

Un ser humano siempre aprueba antes de que se elimine un dato. Sin sorpresas, sin fugas.