Inspiración
Nuestra inspiración nació al enfrentarnos a un desafío real de analítica de datos en el canal tradicional (tienditas). Queríamos entender a fondo el comportamiento de los clientes y encontrar patrones ocultos que permitan predecir y prevenir la deserción (churn) antes de que ocurra, ayudando a optimizar la toma de decisiones.
Qué hace
Es una solución integral de Machine Learning que analiza el histórico de transacciones, datos de clientes y registros de Arca Continental. El sistema limpia y filtra los datos bajo ML para entrenar un modelo que identifica con precisión qué clientes están en riesgo de abandonar la plataforma.
Cómo lo construimos
- Base de datos: Estructurada y optimizada en MySQL (XAMPP), manejando grandes volúmenes de datos mediante técnicas avanzadas de inyección masiva (
LOAD DATA INFILE). - Análisis y Filtros: Desarrollado en Python utilizando la librería Pandas para segmentar el mercado (enfocándonos en marcas clave como TCC, Monster y Jugos del Valle, canal tradicional, México y registros desde 2024).
- Modelado de ML: Construido con Scikit-Learn para entrenar y evaluar el modelo de clasificación de Churn.
- Control de versiones: Gestionado a través de GitHub (utilizando Git LFS para el manejo de archivos de datos a gran escala).
Retos con los que nos topamos
El principal desafío fue técnico: el manejo, limpieza y carga de archivos de bases de datos extremadamente pesados (¡más de 500 MB!). Nos enfrentamos a bloqueos de sistema, superamos las restricciones estrictas de tamaño de archivos de GitHub implementando Git LFS, y lidiamos con la sincronización de llaves foráneas complejas entre tablas masivas.
Logros de los que nos sentimos orgullosos
- Haber montado, conectado y optimizado una base de datos relacional robusta con millones de registros reales.
- Hacer que nuestro código de filtrado en Python sea lo suficientemente eficiente para procesar el volumen de datos de Arca Continental.
- ¡No rendirnos ante los errores de Git y mantener el repositorio en pie!
Qué aprendimos
Aprendimos la importancia de la optimización en el manejo de Big Data (apagar llaves foráneas e índices temporalmente salva vidas). También reforzamos cómo traducir reglas de negocio complejas en filtros de código de Pandas y comprendimos que el verdadero valor de los datos está en la calidad de su segmentación, no solo en su volumen.
¿Qué sigue para COMMIT AND CRY?
- Automatizar el pipeline de datos para que la base de datos se actualice en tiempo real.
- Probar algoritmos avanzados de Machine Learning (como XGBoost o Random Forest) para comparar y elevar el porcentaje de precisión del modelo.
Log in or sign up for Devpost to join the conversation.