Big DataCiclo II · 2026-1
Detección distribuida de anomalías transaccionales en SAP Business One para auditoría minera
Una arquitectura Big Data para encontrar anomalías financieras y operativas en unos 30 GB de historial real de un ERP minero peruano. Propuesta de proyecto.
La auditoría manual sobre sistemas ERP empresariales no escala con el volumen transaccional. Detectar pagos duplicados, órdenes de compra fraccionadas y comportamientos anómalos mediante reglas tradicionales resulta costoso y frágil. Este proyecto propone una arquitectura distribuida que lo haga con machine learning, sobre datos históricos reales extraídos de la base de datos SAP Business One de una empresa minera peruana: alrededor de 30 GB entre 2017 y 2026.
El pipeline va de SQL Server (SAP B1) a PySpark sobre EC2, luego a Amazon S3 en zonas raw y curated, a los modelos de ML, a DynamoDB y finalmente a un dashboard de auditoría en Tableau. La detección combina cuatro técnicas: la ley de Benford para el análisis estadístico, Isolation Forest para detección no supervisada, un autoencoder basado en deep learning y un ensemble híbrido que prioriza las anomalías encontradas. Los objetivos son pagos duplicados, fraccionamiento de órdenes de compra, backdating de documentos, movimientos financieros atípicos y activos fantasma.
Los datos sensibles se protegen antes de salir del ERP: hashing SHA-256 sobre identificadores críticos y ofuscación de montos con técnicas de preservación distribucional, de modo que las propiedades estadísticas sobrevivan. Este documento es la propuesta del proyecto — la implementación vive en notebooks de Spark y trabajos de EMR.