Ponte en Contacto
 Duración 14 horas

Temario del curso

Diseño de una Arquitectura AIOps Abierta

  • Visión general de los componentes clave en los pipelines de AIOps abiertos.
  • Flujo de datos desde la ingesta hasta las alertas.
  • Comparación de herramientas y estrategia de integración.

Recopilación y Agregación de Datos

  • Ingestión de datos de series temporales con Prometheus.
  • Captura de registros con Logstash y Beats.
  • Normalización de datos para la correlación entre múltiples fuentes.

Creación de Paneles de Observabilidad

  • Visualización de métricas con Grafana.
  • Creación de paneles de Kibana para el análisis de registros.
  • Uso de consultas de Elasticsearch para extraer información operativa.

Detección de Anomalías y Predicción de Incidentes

  • Exportación de datos de observabilidad a pipelines de Python.
  • Entrenamiento de modelos de ML para la detección de valores atípicos y pronósticos.
  • Despliegue de modelos para inferencia en vivo en el pipeline de observabilidad.

Alertas y Automatización con Herramientas Abiertas

  • Creación de reglas de alerta de Prometheus y enrutamiento de Alertmanager.
  • Disparo de scripts o flujos de trabajo de API para la respuesta automática.
  • Uso de herramientas de orquestación de código abierto (p. ej., Ansible, Rundeck).

Consideraciones de Integración y Escalabilidad

  • Manejo de la ingesta de alto volumen y retención a largo plazo.
  • Seguridad y control de acceso en pilas de código abierto.
  • Escalado de cada capa de manera independiente: ingesta, procesamiento, alertas.

Aplicaciones y Extensiones del Mundo Real

  • Estudios de caso: ajuste de rendimiento, prevención de interrupciones y optimización de costos.
  • Extensión de pipelines con herramientas de trazas o grafos de servicios.
  • Mejores prácticas para la ejecución y mantenimiento de AIOps en producción.

Resumen y Próximos Pasos

Requerimientos

  • Experiencia con herramientas de observabilidad como Prometheus o ELK.
  • Conocimientos prácticos de Python y fundamentos de aprendizaje automático (machine learning).
  • Comprensión de las operaciones de TI y flujos de trabajo de alertas.

Público Objetivo

  • Ingenieros de confiabilidad de sitios avanzados (SREs).
  • Ingenieros de datos que trabajan en operaciones.
  • Líderes de plataformas DevOps y arquitectos de infraestructura.

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas