Ponte en Contacto

Temario del curso

Introducción a EXO y clústeres locales de IA

  • Visión general del marco EXO y el ecosistema exo-explore
  • Comparación entre inferencia centralizada en la nube e inferencia local distribuida
  • Arquitectura: descubrimiento de dispositivos libp2p, backend MLX, panel de control y capas API
  • Requisitos de hardware: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, almacenamiento compartido

Instalación de EXO en macOS

  • Configuración de Xcode, el Kit de herramientas de Metal y los requisitos previos de macOS
  • Instalación de uv, Node.js y la cadena de herramientas Rust nightly
  • Instalación del fork macmon fijado para la supervisión de Apple Silicon
  • Clonar el repositorio y compilar el panel de control con npm
  • Ejecutar EXO desde el código fuente y verificar el panel de control en localhost:52415

Instalación de EXO en Linux

  • Instalación de dependencias mediante apt o Homebrew en Linux
  • Configuración de uv, Node.js 18+ y Rust nightly
  • Compilación del panel de control y ejecución de EXO en modo exclusivo de CPU
  • Estructura de directorios: rutas de Directorio Base XDG para configuración, datos, caché y registros

Descubrimiento automático de dispositivos y formación del clúster

  • Comprensión del descubrimiento automático basado en libp2p a través de redes locales
  • Configuración de nombres personalizados con EXO_LIBP2P_NAMESPACE para el aislamiento del clúster
  • Verificación de la membresía de los nodos en la vista del clúster del panel de control
  • Gestión de fallos de descubrimiento y problemas de segmentación de red

Habilitación de RDMA a través de Thunderbolt 5

  • Arquitectura de RDMA y la afirmación de reducción del 99 % en la latencia
  • Habilitación de RDMA en el modo de recuperación de macOS con rdma_ctl
  • Requisitos de cables y limitaciones de topología de puertos en Mac Studio
  • Correspondencia de las versiones de macOS en todos los nodos del clúster
  • Solución de problemas de descubrimiento de RDMA y configuración DHCP

Implementación de modelos de última generación

  • Uso del panel de control para cargar y fragmentar los modelos DeepSeek v3.1, Qwen3-235B y la familia Llama
  • Previsualización de la colocación de instancias con el punto de conexión /instance/previews de la API
  • Creación de instancias de modelos mediante fragmentación por canalización o paralelismo tensorial
  • Configuración de tarjetas de modelo personalizadas desde el hub de HuggingFace

Supervisión y solución de problemas

  • Lectura de registros EXO y comprensión del seguimiento distribuido
  • Interpretación del estado del clúster en la vista del clúster del panel de control
  • Diagnóstico de fallos de nodos de trabajo y comportamiento de reconexión
  • Uso de EXO_TRACING_ENABLED para análisis de puntos críticos de rendimiento

Mantenimiento y actualizaciones del clúster

  • Actualización de los binarios de EXO y procedimientos de reconstrucción del panel de control
  • Migración de cachés de modelos y gestión de modelos pre-descargados a través de NFS
  • Eliminación ordenada de nodos y reequilibrio de cargas de trabajo

Requerimientos

  • Conocimiento de los fundamentos de redes (IP, segmentación de subredes, firewalls)
  • Experiencia en administración de línea de comandos en macOS o Linux
  • Conocimiento del manejo de paquetes de Python (pip/uv) y herramientas Node.js

Público objetivo

  • Administradores de sistemas
  • Ingenieros DevOps
  • Arquitectos de infraestructura de IA responsables de la implementación de LLM en instalaciones locales
 21 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas