Aprendizaje por RefuerzoCiclo II · 2026-1
Enrutamiento de tickets de soporte con aprendizaje por refuerzo profundo: cuando la generalización importa más que la profundidad
El despacho de tickets formulado como proceso de decisión de Markov y resuelto desde Q-learning tabular hasta A2C, sobre un simulador calibrado con 177 940 incidentes reales. Ganó el modelo menos profundo.
Las mesas de ayuda grandes enrutan cientos de incidentes al día hacia decenas de grupos resolutores, y una asignación incorrecta significa devoluciones, demoras e incumplimiento de acuerdos de nivel de servicio. La línea dominante en la industria trata el despacho como un problema de clasificación de texto, pero un clasificador que aprende “a qué grupo fue este ticket” ignora el acoplamiento entre decisiones. Un agente de aprendizaje por refuerzo, en cambio, puede aprender a desviar tickets cuando la cola preferida se congestiona.
Formulamos el enrutamiento de incidentes como un proceso de decisión de Markov y lo resolvemos con métodos tabulares, aproximación lineal y aprendizaje por refuerzo profundo (DQN, Double DQN y actor–crítico A2C). El entorno de simulación se calibra íntegramente con 177 940 incidentes reales de la mesa de ayuda de un sistema tributario (2021–2026): las llegadas se modelan como un proceso de Poisson no homogéneo simulado por thinning, los tiempos de servicio se muestrean de las distribuciones empíricas por grupo, el arranque en régimen se fija mediante la ley de Little y los objetivos de SLA se definen como el percentil 75 histórico por tipo.
Con un espacio de estados de 8,3 × 10¹⁵ configuraciones la tabla Q colapsa —cobertura de apenas 0,01 % en evaluación—, y eso es lo que motiva la aproximación de funciones. Bajo un protocolo de réplicas múltiples con intervalos de confianza al 95 % y corrección de Holm–Bonferroni, el aproximador lineal (46→15) supera a la heurística histórica de despacho con significancia estadística, mientras que el DQN profundo (46→128→128→15) queda por debajo. La causa es el sesgo de maximización, medido directamente como la diferencia entre el valor Q predicho y el retorno realmente obtenido; Double DQN reduce ese sesgo de forma significativa (p = 0,016), lo que confirma el mecanismo sin revertir el déficit. La conclusión: en problemas con señal moderada y ruido de cola pesada, la ventaja proviene de la capacidad de generalizar de la red y no de su profundidad — y el protocolo estadístico con réplicas es imprescindible para no extraer conclusiones espurias.