Temario del curso
Introducción, objetivos y estrategia de migración
- Objetivos del curso, alineación del perfil del participante y criterios de éxito.
- Enfoques de migración a alto nivel y consideraciones de riesgos.
- Configuración de espacios de trabajo, repositorios y conjuntos de datos para laboratorios.
Día 1 — Fundamentos de migración y arquitectura
- Conceptos de Lakehouse, resumen de Delta Lake y arquitectura de Databricks.
- Diferencias entre SMP y MPP e implicaciones para la migración.
- Diseño de Medallion (Bronze→Silver→Gold) y resumen de Unity Catalog.
Laboratorio Día 1 — Traducción de un procedimiento almacenado
- Migración práctica de un procedimiento almacenado de ejemplo a un cuaderno (notebook).
- Mapeo de tablas temporales y cursores a transformaciones de DataFrame.
- Validación y comparación con la salida original.
Día 2 — Delta Lake avanzado y carga incremental
- Transacciones ACID, registros de confirmación (commit logs), versionado y viaje en el tiempo (time travel).
- Auto Loader, patrones MERGE INTO, inserciones/actualizaciones (upserts) y evolución de esquemas.
- OPTIMIZE, VACUUM, Z-ORDER, particionamiento y ajuste de almacenamiento.
Laboratorio Día 2 — Ingesta incremental y optimización
- Implementación de ingesta con Auto Loader y flujos de trabajo MERGE.
- Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados.
- Medición de mejoras en el rendimiento de lectura/escritura.
Día 3 — SQL en Databricks, rendimiento y depuración
- Características de SQL analítico: funciones de ventana, funciones de orden superior, manejo de JSON/arrays.
- Lectura de Spark UI, DAGs, mezclas (shuffles), etapas (stages), tareas y diagnóstico de cuellos de botella.
- Patrones de ajuste de consultas: uniones de difusión (broadcast joins), pistas (hints), caché y reducción de desbordamiento (spill).
Laboratorio Día 3 — Refactorización SQL y ajuste de rendimiento
- Refactorizar un proceso SQL pesado en Spark SQL optimizado.
- Utilizar trazas de Spark UI para identificar y corregir problemas de sesgo (skew) y mezclas (shuffle).
- Ejecución de pruebas de rendimiento (benchmark) antes/después y documentación de los pasos de ajuste.
Día 4 — PySpark táctico: Reemplazo de la lógica procedimental
- Modelo de ejecución de Spark: controlador (driver), ejecutores (executors), evaluación perezosa (lazy evaluation) y estrategias de particionamiento.
- Transformación de bucles y cursores en operaciones vectorizadas de DataFrame.
- Modularización, UDFs/UDFs de pandas, widgets y bibliotecas reutilizables.
Laboratorio Día 4 — Refactorización de scripts procedimentales
- Refactorizar un script ETL procedimental en cuadernos PySpark modulares.
- Introducción de parametrización, pruebas de estilo unitario y funciones reutilizables.
- Revisión de código y aplicación de lista de verificación de mejores prácticas.
Día 5 — Orquestación, tubería de extremo a extremo y mejores prácticas
- Databricks Workflows: diseño de trabajos, dependencias de tareas, disparadores (triggers) y manejo de errores.
- Diseño de tuberías Medallion incrementales con reglas de calidad y validación de esquemas.
- Integración con Git (GitHub/Azure DevOps), CI y estrategias de pruebas para la lógica PySpark.
Laboratorio Día 5 — Construir una tubería completa de extremo a extremo
- Ensamblar la tubería Bronze→Silver→Gold orquestada con Workflows.
- Implementación de registros (logging), auditoría, reintentos y validaciones automatizadas.
- Ejecución de la tubería completa, validación de salidas y preparación de notas de despliegue.
Operacionalización, gobernanza y preparación para producción
- Gobernanza de Unity Catalog, linaje y mejores prácticas de controles de acceso.
- Costos, dimensionamiento de clústeres, escalado automático (autoscaling) y patrones de concurrencia de trabajos.
- Listas de verificación de despliegue, estrategias de reversión (rollback) y creación de manuales de procedimientos (runbooks).
Revisión final, transferencia de conocimientos y próximos pasos
- Presentaciones de los participantes sobre el trabajo de migración y lecciones aprendidas.
- Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de capacitación.
- Referencias, rutas de aprendizaje adicionales y opciones de soporte.
Requerimientos
- Comprensión de los conceptos de ingeniería de datos.
- Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server).
- Conocimiento de los conceptos de orquestación ETL (ADF o similar).
Público objetivo
- Gerentes de tecnología con antecedentes en ingeniería de datos.
- Ingenieros de datos que están migrando la lógica procedimental de OLAP a patrones Lakehouse.
- Ingenieros de plataforma responsables de la adopción de Databricks.
Reseñas (1)
Todos los temas que abarca, aunque muchos fueron muy rápidos, nos da una idea de lo que necesitaremos ahondar. Además me gustó que pudimos hacer practicas, aunque insisto, creo que el curso amerita mas.