Ponte en Contacto

Temario del curso

Fundamentos de Producción de Tencent Hunyuan

  • Visión general de los escenarios de servicios con modelos de Tencent Hunyuan.
  • Características de producción de modelos grandes y MoE.
  • Cuellos de botella comunes en latencia, capacidad de procesamiento y costos.
  • Definición de objetivos de nivel de servicio (SLO) para cargas de trabajo de inferencia.

Arquitectura de implementación y flujo de servicios

  • Componentes principales de un stack de inferencia en producción.
  • Elegir entre modelos de implementación con contenedores, en instalaciones propias y en la nube.
  • Fundamentos de carga de modelos, enrutamiento de solicitudes y asignación de GPU.
  • Diseño para confiabilidad y simplicidad operativa.

Optimización de latencia en la práctica

  • Uso de motores de inferencia optimizados como TensorRT, cuando sea aplicable.
  • Conceptos del KV-cache y ajuste práctico de caché.
  • Reducción del inicio, calentamiento (warmup) y sobrecarga de respuesta.
  • Medición del tiempo hasta el primer token y la velocidad de generación de tokens.

Capacidad de procesamiento, agrupación y eficiencia de GPU

  • Estrategias de agrupamiento continuo y de solicitudes.
  • Gestión de la concurrencia y comportamiento de colas.
  • Mejora del aprovechamiento de la GPU sin afectar la experiencia del usuario.
  • Manejo de solicitudes con contexto largo y cargas de trabajo mixtas.

Cuantización y control de costos

  • Por qué la cuantización es importante para el servicio en producción.
  • Ecuilibrios prácticos entre FP16, INT8 y otras opciones comunes de precisión.
  • Balancear la calidad del modelo, la latencia y el costo de infraestructura.
  • Crear una lista de verificación simple para la optimización de costos.

Operaciones, monitoreo y revisión de preparación

  • Disparadores de escalado automático para servicios de inferencia.
  • Monitoreo de latencia, capacidad de procesamiento, uso de caché y estado de la GPU.
  • Fundamentos de registro de eventos (logging), alertas y respuesta a incidentes.
  • Revisión de una implementación de referencia y creación de un plan de mejora.

Requerimientos

  • Conocimiento básico de implementación y flujos de trabajo de inferencia de modelos de lenguaje grandes (LLM).
  • Experiencia con contenedores, infraestructura en la nube o en instalaciones propias, y servicios basados en API.
  • Conocimientos funcionales de Python o tareas de ingeniería de sistemas.

Público objetivo

  • Ingenieros de ML que despliegan LLM en entornos de producción.
  • Ingenieros de plataforma responsables de servicios de inferencia basados en GPU.
  • Arquitectos de soluciones que diseñan plataformas escalables para servir IA.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas