
Durante el Bootcamp de Data Science e IA en The Bridge, «Desafío» planteaba algo distinto a un ejercicio académico aislado: construir un proyecto completo de ciencia de datos que no se quedara en el notebook, sino que llegara hasta una API funcional capaz de servir predicciones reales. El reto no era solo entrenar un modelo, sino pensar en todo el ciclo de vida del dato.
De los datos sintéticos al pipeline completo
Para abordarlo, diseñé un flujo de trabajo estructurado en fases claras: primero un análisis exploratorio (EDA) para entender la naturaleza y calidad de los datos, después una fase de feature engineering para preparar las variables, y finalmente el entrenamiento y comparación de modelos predictivos con XGBoost. Todo el conjunto se apoya en una base de datos PostgreSQL y se expone a través de una API propia, documentada paso a paso.

Objetivos del proyecto
El análisis perseguía varios objetivos clave:
- Cubrir el ciclo completo de un proyecto de datos: desde la ingesta y exploración hasta el modelo en producción, sin detenerse en el notebook.
- <Aplicar feature engineering real: transformar variables en bruto en features que mejoraran el rendimiento del modelo, iterando sobre varias versiones.
- Comparar y justificar el modelo elegido: entrenar con XGBoost y documentar por qué era la opción más adecuada frente a otras alternativas.
- Persistir y servir los datos correctamente: estructurar una base de datos PostgreSQL como capa de almacenamiento, en lugar de depender solo de archivos CSV.
Retos y soluciones
Durante el desarrollo surgieron varios desafíos:
- Escasez o sensibilidad de los datos reales: se generaron datos sintéticos para complementar el conjunto original y poder entrenar el modelo sin comprometer información sensible.
- Iteración del feature engineering: las primeras versiones de las variables no capturaban bien las relaciones del problema, lo que llevó a crear una segunda versión (
feature_engineering_actualizado) con mejoras sobre el enfoque inicial. - Llevar el modelo más allá del notebook: entrenar un modelo es solo la mitad del trabajo; se construyó una API y se documentó formalmente para que el modelo pudiera consumirse como un servicio real.
Resultados
El resultado es un proyecto que cubre el recorrido completo de un caso de uso de Data Science: desde el dato bruto hasta un modelo XGBoost servido a través de una API documentada, con persistencia en PostgreSQL. Más que un ejercicio puntual, es una demostración de cómo estructurar un proyecto de ciencia de datos pensado para producción, no solo para el aula.
El código, los notebooks y la documentación completa están disponibles en el repositorio de GitHub.