Volver a la edición
watch42 min

How to Reduce LLM Latency

Título original: How to Reduce LLM Latency

Hamel Husain

Un desglose técnico apropiado de dónde proviene realmente la latencia de LLM, con experimentos en lugar de especulaciones. La lección central: prefill (procesar tu prompt) es paralelo y vinculado a computación, mientras que decode (generar tokens) es secuencial y vinculado a memoria — y decode es casi siempre tu cuello de botella. Si estás construyendo productos de agentes, solo la sección de multiplicación de costos justifica el tiempo.

  • Generar un token de salida cuesta aproximadamente 300x más tiempo que procesar un token de entrada — limita max_tokens antes de gastar semanas optimizando tu pipeline de recuperación.
  • En un bucle de agente de 5 pasos, el costo se multiplicó 11.9x porque cada paso reenviaba el historial completo anterior; la gestión de contexto es la diferencia entre un producto viable y uno eliminado por su factura.
  • Las solicitudes pequeñas desperdician GPU: 143 tokens/seg en 25 tokens vs 2,271 tokens/seg en 1,205 tokens — el continuous batching existe para arreglar exactamente esto.
  • El calentamiento de GPU se omite rutinariamente en producción y los arranques en frío destruyen silenciosamente los SLAs.
Ver en YouTube

Parte de Edición Nº 001: LLMs para el juicio, código para contar: escalando a 500K sensores con 300x menos tokens