Título: Reinforcement Learning para gestión de Stocks
Universidad que ofrece el proyecto: Universidade de Santiago de Compostela
Director/a: Pateiro López, Beatriz; Saavedra Nieves, Alejandro
Alumno/a: Darriba Golán, Lorena
Resumen:
El TFM consistirá en el diseño y entrenamiento de un agente basado en Aprendizaje por
Refuerzo (Reinforcement Learning) aplicado a la optimización de la cadena de suministro, específicamente
en la toma de decisiones dinámicas para la gestión de inventarios. El objetivo principal se
centrará en que el agente aprenda una política óptima de reabastecimiento que responda de forma
autónoma a las preguntas clave del negocio: cuándo comprar y qué cantidad adquirir de cada referencia
(SKU) en entornos de demanda incierta y cambiante.
El proyecto contempla simular un entorno que penalice tanto los costes de almacenamiento (exceso
de stock) como las roturas de inventario o el tirado de productos debido a su caducidad. La
finalidad del TFM es evaluar la capacidad de adaptación de los algoritmos de RL ante una demanda
cambiante, contrastando sus resultados (reducción de costes operacionales y nivel de servicio) frente
a otras políticas de inventario más tradicionales, como puede ser un sistema de valores Min-Max
fijo y preestablecido.
| Más información |