La auditoría manual sobre sistemas ERP empresariales no escala con el volumen transaccional. Detectar pagos duplicados, órdenes de compra fraccionadas y comportamientos anómalos mediante reglas tradicionales resulta costoso y frágil. Este proyecto propone una arquitectura distribuida que lo haga con machine learning, sobre datos históricos reales extraídos de la base de datos SAP Business One de una empresa minera peruana: alrededor de 30 GB entre 2017 y 2026.

El pipeline va de SQL Server (SAP B1) a PySpark sobre EC2, luego a Amazon S3 en zonas raw y curated, a los modelos de ML, a DynamoDB y finalmente a un dashboard de auditoría en Tableau. La detección combina cuatro técnicas: la ley de Benford para el análisis estadístico, Isolation Forest para detección no supervisada, un autoencoder basado en deep learning y un ensemble híbrido que prioriza las anomalías encontradas. Los objetivos son pagos duplicados, fraccionamiento de órdenes de compra, backdating de documentos, movimientos financieros atípicos y activos fantasma.

Los datos sensibles se protegen antes de salir del ERP: hashing SHA-256 sobre identificadores críticos y ofuscación de montos con técnicas de preservación distribucional, de modo que las propiedades estadísticas sobrevivan. Este documento es la propuesta del proyecto — la implementación vive en notebooks de Spark y trabajos de EMR.

Tu navegador no puede mostrar el PDF aquí. Abrir PDF

← Toda la investigación