Contacta con nosotros

Temario del curso

PySpark & Aprendizaje Automático 

Módulo 1: Fundamentos de Big Data y Spark

  • Descripción general del ecosistema de Big Data y el papel de Spark en las plataformas de datos modernas.
  • Comprensión de la arquitectura de Spark: conductor (driver), ejecutores, gestor de clústeres, evaluación perezosa, DAG y planificación de ejecución.
  • Diferencias entre las APIs RDD y DataFrame y cuándo utilizar cada enfoque.
  • Creación y configuración de SparkSession y comprensión de los fundamentos de la configuración de aplicaciones.

Módulo 2: DataFrames de PySpark

  • Lectura y escritura de datos desde fuentes y formatos empresariales (CSV, JSON, Parquet, Delta).
  • Trabajo con DataFrames de PySpark: transformaciones, acciones, expresiones de columna, filtrado, unions (joins) y agregaciones.
  • Implementación de operaciones avanzadas como funciones de ventana, manejo de marcas de tiempo y trabajo con datos anidados.
  • Aplicación de controles de calidad de datos y escritura de código PySpark reutilizable y mantenible.

Módulo 3: Procesamiento Eficiente de Grandes Conjuntos de Datos

  • Comprensión de los fundamentos del rendimiento: estrategias de particionamiento, comportamiento del shuffling (repartición), almacenamiento en caché y persistencia.
  • Uso de técnicas de optimización, incluyendo unions broadcast (difundidas) y análisis de planes de ejecución.
  • Procesamiento eficiente de grandes conjuntos de datos y mejores prácticas para flujos de trabajo de datos escalables.
  • Comprensión de la evolución del esquema y los formatos de almacenamiento modernos utilizados en entornos empresariales.

Módulo 4: Ingeniería de Características a Gran Escala

  • Realización de ingeniería de características con Spark MLlib: manejo de valores faltantes, codificación de variables categóricas y escalado de características.
  • Diseño de pasos de preprocesamiento reutilizables y preparación de conjuntos de datos para pipelines de aprendizaje automático.
  • Introducción a la selección de características y manejo de conjuntos de datos desequilibrados.

Módulo 5: Aprendizaje Automático con Spark MLlib

  • Comprensión de la arquitectura de MLlib y el patrón Estimador/Transformador.
  • Entrenamiento de modelos de regresión y clasificación a gran escala (Regresión Lineal, Regresión Logística, Árboles de Decisión, Bosques Aleatorios).
  • Comparación de modelos e interpretación de resultados en flujos de trabajo de aprendizaje automático distribuido.

Módulo 6: Pipelines de ML de Cabecera a Cola

  • Construcción de pipelines completos de aprendizaje automático que combinan preprocesamiento, ingeniería de características y modelado.
  • Aplicación de estrategias de división en entrenamiento/validación/prueba.
  • Realización de validación cruzada y ajuste de hiperparámetros utilizando búsqueda en cuadrícula y búsqueda aleatoria.
  • Estructuración de experimentos de aprendizaje automático reproducibles.

Módulo 7: Evaluación de Modelos y Toma de Decisiones Prácticas en ML

  • Aplicación de métricas de evaluación adecuadas para problemas de regresión y clasificación.
  • Identificación de sobreajuste (overfitting) y subajuste (underfitting), y toma de decisiones prácticas en la selección de modelos.
  • Interpretación de la importancia de las características y comprensión del comportamiento del modelo.

Módulo 8: Prácticas de Producción y Empresariales

  • Persistencia y carga de modelos en Spark.
  • Implementación de flujos de trabajo de inferencia por lotes (batch) en grandes conjuntos de datos.
  • Comprensión del ciclo de vida del aprendizaje automático en entornos empresariales.
  • Introducción a los conceptos de versionado, seguimiento de experimentos y estrategias básicas de pruebas.

 

Resultado Práctico

  • Capacidad para trabajar de forma autónoma con PySpark.
  • Capacidad para procesar grandes conjuntos de datos de manera eficiente.
  • Capacidad para realizar ingeniería de características a gran escala.
  • Capacidad para construir pipelines de aprendizaje automático escalables.

Requerimientos

Los participantes deben tener el siguiente conocimiento previo:

Conocimientos básicos de programación en Python, incluyendo el uso de funciones, estructuras de datos y bibliotecas.
Comprensión fundamental de conceptos de análisis de datos, como conjuntos de datos, transformaciones y agregaciones.
Conocimientos básicos de SQL y conceptos de datos relacionales. Comprensión introductoria de conceptos de aprendizaje automático, como conjuntos de datos de entrenamiento, características y métricas de evaluación.
Se recomienda familiaridad con entornos de línea de comandos y prácticas básicas de desarrollo de software.

Experiencia con Pandas, NumPy o bibliotecas similares de procesamiento de datos es útil, pero no obligatoria.

 21 Horas

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas