Ponte en Contacto

Temario del curso

Introducción, objetivos y estrategia de migración

  • Objetivos del curso, alineación del perfil del participante y criterios de éxito.
  • Enfoques de migración a alto nivel y consideraciones de riesgos.
  • Configuración de espacios de trabajo, repositorios y conjuntos de datos para laboratorios.

Día 1 — Fundamentos de migración y arquitectura

  • Conceptos de Lakehouse, resumen de Delta Lake y arquitectura de Databricks.
  • Diferencias entre SMP y MPP e implicaciones para la migración.
  • Diseño de Medallion (Bronze→Silver→Gold) y resumen de Unity Catalog.

Laboratorio Día 1 — Traducción de un procedimiento almacenado

  • Migración práctica de un procedimiento almacenado de ejemplo a un cuaderno (notebook).
  • Mapeo de tablas temporales y cursores a transformaciones de DataFrame.
  • Validación y comparación con la salida original.

Día 2 — Delta Lake avanzado y carga incremental

  • Transacciones ACID, registros de confirmación (commit logs), versionado y viaje en el tiempo (time travel).
  • Auto Loader, patrones MERGE INTO, inserciones/actualizaciones (upserts) y evolución de esquemas.
  • OPTIMIZE, VACUUM, Z-ORDER, particionamiento y ajuste de almacenamiento.

Laboratorio Día 2 — Ingesta incremental y optimización

  • Implementación de ingesta con Auto Loader y flujos de trabajo MERGE.
  • Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados.
  • Medición de mejoras en el rendimiento de lectura/escritura.

Día 3 — SQL en Databricks, rendimiento y depuración

  • Características de SQL analítico: funciones de ventana, funciones de orden superior, manejo de JSON/arrays.
  • Lectura de Spark UI, DAGs, mezclas (shuffles), etapas (stages), tareas y diagnóstico de cuellos de botella.
  • Patrones de ajuste de consultas: uniones de difusión (broadcast joins), pistas (hints), caché y reducción de desbordamiento (spill).

Laboratorio Día 3 — Refactorización SQL y ajuste de rendimiento

  • Refactorizar un proceso SQL pesado en Spark SQL optimizado.
  • Utilizar trazas de Spark UI para identificar y corregir problemas de sesgo (skew) y mezclas (shuffle).
  • Ejecución de pruebas de rendimiento (benchmark) antes/después y documentación de los pasos de ajuste.

Día 4 — PySpark táctico: Reemplazo de la lógica procedimental

  • Modelo de ejecución de Spark: controlador (driver), ejecutores (executors), evaluación perezosa (lazy evaluation) y estrategias de particionamiento.
  • Transformación de bucles y cursores en operaciones vectorizadas de DataFrame.
  • Modularización, UDFs/UDFs de pandas, widgets y bibliotecas reutilizables.

Laboratorio Día 4 — Refactorización de scripts procedimentales

  • Refactorizar un script ETL procedimental en cuadernos PySpark modulares.
  • Introducción de parametrización, pruebas de estilo unitario y funciones reutilizables.
  • Revisión de código y aplicación de lista de verificación de mejores prácticas.

Día 5 — Orquestación, tubería de extremo a extremo y mejores prácticas

  • Databricks Workflows: diseño de trabajos, dependencias de tareas, disparadores (triggers) y manejo de errores.
  • Diseño de tuberías Medallion incrementales con reglas de calidad y validación de esquemas.
  • Integración con Git (GitHub/Azure DevOps), CI y estrategias de pruebas para la lógica PySpark.

Laboratorio Día 5 — Construir una tubería completa de extremo a extremo

  • Ensamblar la tubería Bronze→Silver→Gold orquestada con Workflows.
  • Implementación de registros (logging), auditoría, reintentos y validaciones automatizadas.
  • Ejecución de la tubería completa, validación de salidas y preparación de notas de despliegue.

Operacionalización, gobernanza y preparación para producción

  • Gobernanza de Unity Catalog, linaje y mejores prácticas de controles de acceso.
  • Costos, dimensionamiento de clústeres, escalado automático (autoscaling) y patrones de concurrencia de trabajos.
  • Listas de verificación de despliegue, estrategias de reversión (rollback) y creación de manuales de procedimientos (runbooks).

Revisión final, transferencia de conocimientos y próximos pasos

  • Presentaciones de los participantes sobre el trabajo de migración y lecciones aprendidas.
  • Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de capacitación.
  • Referencias, rutas de aprendizaje adicionales y opciones de soporte.

Requerimientos

  • Comprensión de los conceptos de ingeniería de datos.
  • Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server).
  • Conocimiento de los conceptos de orquestación ETL (ADF o similar).

Público objetivo

  • Gerentes de tecnología con antecedentes en ingeniería de datos.
  • Ingenieros de datos que están migrando la lógica procedimental de OLAP a patrones Lakehouse.
  • Ingenieros de plataforma responsables de la adopción de Databricks.
 35 Horas

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas