Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
El panorama de la observabilidad con IA
- De paneles de control a conversaciones: el cambio hacia una observabilidad aumentada por IA
- Capacidades de LLM relevantes para la observabilidad: resumen, razonamiento, coincidencia de patrones
- Patrones de arquitectura: integración de IA en pilas de observabilidad existentes
Consultas de telemetría con lenguaje natural
- De texto a PromQL: traducción de lenguaje natural a consultas de monitoreo
- Consultas en NL para almacenes de registros de Elasticsearch, OpenSearch y Loki
- Generación de SQL a partir de lenguaje natural para telemetría estructurada
- Construcción de un agente asistente de consultas con uso de herramientas y conciencia contextual
Análisis de registros potenciado por LLM
- Parseo automatizado y estructuración de registros mediante LLM
- Detección de anomalías en flujos de registros utilizando similitud de incrustaciones (embeddings)
- Agrupación de registros y descubrimiento de patrones a gran escala
- Generación de explicaciones legibles por humanos a partir de secuencias de registros crudos
Alertas inteligentes y enriquecimiento de incidentes
- Correlación y deduplicación de alertas con comprensión semántica
- Recolección automatizada del contexto del incidente a partir de playbooks, incidentes pasados y documentación
- Ruteo inteligente de alertas basado en la comprensión del contenido y la experiencia del equipo
- Reducción de la fatiga por alertas mediante reducción de ruido impulsada por IA
Análisis de causa raíz asistido por IA
- Generación de hipótesis a partir de la correlación de telemetría multifuente
- Encadenamiento de evidencias: conexión de síntomas entre métricas, registros y trazas
- Solucionar problemas guiados con sesiones de diagnóstico de IA interactivas
- Construcción de un agente de análisis de causa raíz con investigación progresiva
Respuesta automatizada a incidentes y comunicación
- Generación de resúmenes de incidentes y actualizaciones de estado a partir de datos de telemetría
- Borrado automático de informes de causas raíz con reconstrucción cronológica
- Comunicación adaptada para audiencias técnicas y ejecutivas
- Sugerencias de playbooks y recomendaciones de remediación automatizada
ML para observabilidad
- Pronóstico de series temporales para planificación de capacidad y predicción de anomalías
- Modelos fundamentales para la detección de anomalías sin ejemplo previo (zero-shot) en métricas
- Mapeo de dependencias de servicios y descubrimiento de topología basados en incrustaciones (embeddings)
- Entrenamiento e implementación de modelos de ML ligeros junto a los pipelines de observabilidad
Implementación en producción y ética
- Consideraciones de latencia y costo para la observabilidad en tiempo real con IA
- Privacidad de datos: garantizar que los LLM no filtren telemetría sensible
- Vigilancia humana: cuándo el diagnóstico por IA requiere validación por parte del operador
- Medición del impacto: métricas de MTTD, MTTR y experiencia de guardia (on-call)
Requerimientos
- Experiencia con herramientas de observabilidad como Prometheus, Grafana, Datadog u OpenTelemetry.
- Familiaridad con los conceptos de gestión de registros y métricas.
- Conocimientos básicos de scripting en Python para el procesamiento de datos.
Público objetivo
- Ingenieros SRE y de observabilidad que adoptan herramientas mejoradas con IA.
- Ingenieros de plataforma que construyen pipelines de monitoreo de nueva generación.
- Líderes de DevOps que evalúan la integración de LLM en los flujos de trabajo de gestión de incidentes.
14 Horas