Ponte en Contacto
 Duración 14 horas

Temario del curso

Introducción al AIOps Predictivo

  • Visión general de la analítica predictiva en operaciones de TI
  • Fuentes de datos para predicción (registros, métricas, eventos)
  • Conceptos clave en predicción de series temporales y patrones de anomalías

Diseño de Modelos de Predicción de Incidentes

  • Etiquetado de incidentes históricos y comportamiento del sistema
  • Selección y entrenamiento de modelos (p. ej., LSTM, Random Forest, AutoML)
  • Evaluación del rendimiento del modelo y manejo de falsos positivos

Recopilación de Datos e Ingeniería de Características

  • Ingesta y alineación de datos de registros y métricas para la entrada del modelo
  • Extracción de características de datos estructurados y no estructurados
  • Manejo del ruido y datos faltantes en pipelines operativos

Automatización del Análisis de Causa Raíz (RCA)

  • Correlación basada en grafos de servicios e infraestructura
  • Uso de ML para inferir causas raíz probables a partir de cadenas de eventos
  • Visualización del RCA con paneles de control conscientes de la topología

Remediación y Automatización de Flujos de Trabajo

  • Integración con plataformas de automatización (p. ej., Ansible, Rundeck)
  • Activación de retrocesos, reinicios o redirección de tráfico
  • Auditoría y documentación de intervenciones automatizadas

Escalado de Pipelines Inteligentes de AIOps

  • MLOps para observabilidad: reentrenamiento y versionado de modelos
  • Ejecución de predicciones en tiempo real a través de nodos distribuidos
  • Mejores prácticas para el despliegue de AIOps en entornos de producción

Casos de Estudio y Aplicaciones Prácticas

  • Análisis de datos de incidentes reales utilizando modelos de AIOps predictivos
  • Despliegue de pipelines de RCA con datos sintéticos y de producción
  • Revisión de casos de uso en la industria: interrupciones en la nube, inestabilidad de microservicios, degradaciones de red

Resumen y Próximos Pasos

Requerimientos

  • Experiencia con sistemas de monitorización como Prometheus o ELK
  • Conocimiento práctico de Python y de aprendizaje automático básico
  • Familiaridad con flujos de trabajo de gestión de incidentes

Público Objetivo

  • Ingenieros de fiabilidad de sitio (SRE) senior
  • Arquitectos de automatización de TI
  • Líderes de plataformas DevOps y de observabilidad

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas