Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
El panorama de la observabilidad con IA
- De los tableros a las conversaciones: el cambio hacia una observabilidad aumentada por IA.
- Capacidades de LLM relevantes para la observabilidad: resumir, razonar, hacer coincidir patrones.
- Patrones de arquitectura: integrar IA en pilas de observabilidad existentes.
Consulta de telemetría en lenguaje natural
- De texto a PromQL: traducir el lenguaje natural a consultas de monitoreo.
- Consulta NL para repositorios de registros de Elasticsearch, OpenSearch y Loki.
- Generación de SQL a partir de lenguaje natural para telemetría estructurada.
- Construcción de un agente asistente de consulta con uso de herramientas y conciencia contextual.
Análisis de registros con LLM
- Análisis estructurado automático de registros con LLM.
- Detección de anomalías en flujos de registros mediante similitud de embebidos (embeddings).
- Agrupamiento de registros y descubrimiento de patrones a gran escala.
- Generación de explicaciones legibles por humanos a partir de secuencias de registros sin procesar.
Alertas inteligentes y enriquecimiento de incidentes
- Correlación y deduplicación de alertas con comprensión semántica.
- Recolección automática del contexto del incidente a partir de libros de ejecución (runbooks), incidentes anteriores y documentación.
- Ruteo inteligente de alertas basado en la comprensión del contenido y la experiencia del equipo.
- Reducción de la fatiga de alertas mediante reducción de ruido impulsada por IA.
Análisis de causa raíz asistido por IA
- Generación de hipótesis a partir de la correlación de telemetría multifuente.
- Encadenamiento de evidencia: conectar síntomas entre métricas, registros y trazas.
- Depuración guiada con sesiones de diagnóstico interactivo con IA.
- Construcción de un agente de análisis de causa raíz con investigación progresiva.
Respuesta automatizada a incidentes y comunicación
- Generación de resúmenes de incidentes y actualizaciones de estado a partir de la telemetría.
- Elaboración automatizada del análisis post-mortem con reconstrucción de la línea temporal.
- Comunicación a las partes interesadas adaptada a audiencias técnicas y ejecutivas.
- Sugerencia de libros de ejecución y recomendaciones de remediación automatizada.
ML para observabilidad
- Pronóstico de series temporales para la planificación de capacidad y predicción de anomalías.
- Modelos fundamentales para la detección de anomalías zero-shot en métricas.
- Mapeo de dependencias de servicios basado en embebidos y descubrimiento de topología.
- Entrenamiento e implementación de modelos ligeros de ML junto a los pipelines de observabilidad.
Implementación en producción y ética
- Consideraciones de latencia y costo para la observabilidad en tiempo real con IA.
- Privacidad de datos: asegurar que los LLM no filtren telemetría sensible.
- Supervisión humana: cuándo el diagnóstico de IA requiere validación por un operador.
- Medición del impacto: indicadores MTTD, MTTR y experiencia de guardia (on-call).
Requerimientos
- Experiencia con herramientas de observabilidad como Prometheus, Grafana, Datadog u OpenTelemetry.
- Familiaridad con conceptos de gestión de registros y métricas.
- Escritura básica de scripts en Python para el procesamiento de datos.
Público objetivo
- Ingenieros SRE y de observabilidad que adoptan herramientas mejoradas con IA.
- Ingenieros de plataforma que construyen pipelines de monitoreo de próxima generación.
- Líderes de DevOps que evalúan la integración de LLM en los flujos de trabajo de incidentes.
14 Horas