Programa de Prácticas en Ingeniería de Machine Learning
Este repositorio es el sistema de incorporación y trabajo del programa de prácticas del equipo de Data Science e Inteligencia Artificial. Su objetivo es la transición del código académico a la ingeniería de Machine Learning en producción, con cuatro principios transversales:
- Reproducibilidad: cualquier miembro del equipo puede reproducir un resultado a partir del repositorio y de un único comando de instalación.
- Operaciones vectorizadas: la manipulación de datos tabulares no utiliza iteración fila a fila.
- Orquestación mediante Pipelines: el preprocesado y el modelo constituyen un único artefacto evaluable y desplegable.
- Prevención del Data Leakage: ninguna decisión ni ningún parámetro se obtiene a partir de datos de validación o de prueba.
Itinerario
| Bloque | Contenido | Pregunta que resuelve |
|---|---|---|
| B00 | Entorno y control de versiones | ¿Puede otra persona reproducir exactamente mi trabajo? |
| B01 | Manipulación vectorizada y EDA | ¿Qué contienen los datos y qué problemas presentan? |
| B02 | Modelado predictivo base | ¿Qué rendimiento alcanza un primer modelo evaluado sobre datos no vistos? |
| B03 | Evaluación y métricas | ¿Qué significa ese rendimiento en términos del problema de negocio? |
| B04 | Pipelines y Data Leakage | ¿Es el proceso completo robusto, libre de fugas y desplegable? |
| B05 | Aprendizaje no supervisado | ¿Aportan valor predictivo las representaciones latentes de los datos? |
| B06 | Especialización | Aplicación de la metodología a un dominio técnico concreto. |
| Tareas_Asignadas | Integración operativa | Aplicación de la metodología a requerimientos reales del equipo. |
Los bloques son secuenciales: cada uno parte del entregable del anterior y no se inicia hasta que el Pull Request del bloque previo ha sido aprobado e integrado en main.
Inicio
Comience por el Bloque 0, que establece el entorno de desarrollo y las convenciones de trabajo obligatorias para todo el programa.
Estructura del Repositorio
.
├── .github/pull_request_template.md # Checklist de auditoría obligatoria en cada Pull Request
├── B00_ … B06_ # Bloques formativos: enunciado (README.md) y entregables
├── Tareas_Asignadas/ # Requerimientos reales del equipo
├── data/ # Datos locales (no versionado)
├── models/ # Modelos serializados (no versionado)
├── pyproject.toml # Declaración de dependencias
└── uv.lock # Versiones exactas de las dependencias (generado en B00)