Inspiración

Nuestra inspiración nació al enfrentarnos a un desafío real de analítica de datos en el canal tradicional (tienditas). Queríamos entender a fondo el comportamiento de los clientes y encontrar patrones ocultos que permitan predecir y prevenir la deserción (churn) antes de que ocurra, ayudando a optimizar la toma de decisiones.

Qué hace

Es una solución integral de Machine Learning que analiza el histórico de transacciones, datos de clientes y registros de Arca Continental. El sistema limpia y filtra los datos bajo ML para entrenar un modelo que identifica con precisión qué clientes están en riesgo de abandonar la plataforma.

Cómo lo construimos

  • Base de datos: Estructurada y optimizada en MySQL (XAMPP), manejando grandes volúmenes de datos mediante técnicas avanzadas de inyección masiva (LOAD DATA INFILE).
  • Análisis y Filtros: Desarrollado en Python utilizando la librería Pandas para segmentar el mercado (enfocándonos en marcas clave como TCC, Monster y Jugos del Valle, canal tradicional, México y registros desde 2024).
  • Modelado de ML: Construido con Scikit-Learn para entrenar y evaluar el modelo de clasificación de Churn.
  • Control de versiones: Gestionado a través de GitHub (utilizando Git LFS para el manejo de archivos de datos a gran escala).

Retos con los que nos topamos

El principal desafío fue técnico: el manejo, limpieza y carga de archivos de bases de datos extremadamente pesados (¡más de 500 MB!). Nos enfrentamos a bloqueos de sistema, superamos las restricciones estrictas de tamaño de archivos de GitHub implementando Git LFS, y lidiamos con la sincronización de llaves foráneas complejas entre tablas masivas.

Logros de los que nos sentimos orgullosos

  • Haber montado, conectado y optimizado una base de datos relacional robusta con millones de registros reales.
  • Hacer que nuestro código de filtrado en Python sea lo suficientemente eficiente para procesar el volumen de datos de Arca Continental.
  • ¡No rendirnos ante los errores de Git y mantener el repositorio en pie!

Qué aprendimos

Aprendimos la importancia de la optimización en el manejo de Big Data (apagar llaves foráneas e índices temporalmente salva vidas). También reforzamos cómo traducir reglas de negocio complejas en filtros de código de Pandas y comprendimos que el verdadero valor de los datos está en la calidad de su segmentación, no solo en su volumen.

¿Qué sigue para COMMIT AND CRY?

  • Automatizar el pipeline de datos para que la base de datos se actualice en tiempo real.
  • Probar algoritmos avanzados de Machine Learning (como XGBoost o Random Forest) para comparar y elevar el porcentaje de precisión del modelo.

Built With

Share this project:

Updates