En cualquier fondo o área de riesgo seria, el 80% del trabajo ocurre antes del modelo. Este programa entrega la pieza que casi nadie enseña: ingesta automatizada, almacén point-in-time, validaciones que fallan ruidosamente y un feature store versionado que otro analista puede usar sin preguntarte nada. Es el entregable de portafolio que distingue a un candidato de todos los demás.
Ocho semanas de ingeniería de datos aplicada a research financiero, con estándares de producción. El alumno diseña una arquitectura por capas —raw, curated, features—, escribe SQL analítico en DuckDB con window functions y as-of joins, y orquesta ingestas idempotentes que pueden correrse dos veces sin duplicar un solo registro. Implementa calidad de datos como código con pandera y Great Expectations, de modo que un esquema roto o un dato viejo detengan el pipeline en lugar de contaminar el análisis. El módulo central es el que separa a los amateurs: reconstrucción point-in-time, revisiones de cifras, universos históricos y emisoras desaparecidas, es decir, atacar el sesgo de supervivencia y el de anticipación desde la infraestructura y no con parches en el notebook. Cierra con rendimiento —Polars, Parquet, profiling—, reproducibilidad —Git, entornos, pytest, GitHub Actions— y una evaluación de features con vectorbt que conecta el pipeline con la decisión de inversión.
Quant Data Pipeline: la infraestructura del research — te enviamos el brochure y un asesor te contacta.