vLLM y llm-d: Así Se Está Resolviendo el Problema Real de la IA Generativa (la inferencia a escala)

Todo el mundo habla de entrenar modelos. Pocos hablan de lo que realmente cuesta dinero, tiempo de ingeniería y dolores de cabeza en producción: servir esos modelos a miles de usuarios simultáneos, con baja latencia y sin que la factura de GPUs te quiebre el presupuesto.

Si estás evaluando IA generativa para tu empresa —ya sea un chatbot interno, un agente que conversa con clientes, o un copiloto para tus desarrolladores—, en algún punto te vas a topar con dos nombres: vLLM y llm-d. En este post te explico qué es cada uno, cómo se relacionan, y por qué le estoy dando seguimiento de cerca a estos proyectos.

El problema: servir un LLM no es como servir una API REST

Cuando publicas un modelo de lenguaje para que responda peticiones reales, te enfrentas a restricciones que no existen en una app tradicional:

  • Cada petición consume memoria de GPU de forma variable (depende de la longitud del contexto).
  • El modelo «recuerda» tokens anteriores mediante una caché (KV cache) que hay que gestionar con cuidado para no desperdiciar memoria ni recalcular de más.
  • Una sola GPU, por potente que sea, tiene un techo. Tarde o temprano necesitas repartir la carga entre varias GPUs, varios nodos, e incluso varios tipos de acelerador (GPU, TPU, CPU).

Aquí es donde entran vLLM y llm-d, pero cada uno resuelve una parte distinta del problema.

vLLM: el motor de inferencia

vLLM es un motor de inferencia open source que se volvió el estándar de facto para servir modelos de lenguaje de forma eficiente en una sola máquina (o un solo conjunto de GPUs). Su aporte técnico más conocido es PagedAttention, una forma de gestionar la caché KV que evita el desperdicio de memoria que tenían los motores de inferencia anteriores.

En términos simples: vLLM hace que una misma GPU pueda atender más peticiones simultáneas, con menor latencia, sin cambiar el modelo ni el hardware. Es la pieza que ya usan, directa o indirectamente, la mayoría de plataformas de IA empresarial — incluido Red Hat AI Inference Server, que es básicamente una distribución empresarial, soportada y reforzada de vLLM.

llm-d: cuando una sola máquina ya no alcanza

vLLM resuelve la eficiencia dentro de un nodo. Pero cuando tu carga de trabajo crece —más usuarios, modelos más grandes, requisitos de alta disponibilidad— necesitas distribuir la inferencia entre nodos, GPUs heterogéneas, e incluso entre nubes distintas. Ese es exactamente el problema que ataca llm-d.

llm-d es un proyecto open source, hoy en el sandbox de la CNCF, fundado por Red Hat junto con Google Cloud, IBM Research, CoreWeave y NVIDIA. Es un stack de inferencia distribuida de alto rendimiento, optimizado para despliegues en producción sobre Kubernetes, que extiende lo que ya hace vLLM para que funcione de forma coordinada a través de un clúster completo.

¿Qué resuelve concretamente?

  • Enrutamiento inteligente de peticiones: en lugar de repartir las peticiones de forma ciega (round-robin), llm-d las dirige según qué nodo ya tiene en caché el contexto relevante (prefix-cache aware), reduciendo drásticamente la latencia.
  • Separación de fases prefill/decode: procesar el prompt inicial (prefill) y generar tokens de salida (decode) tienen perfiles de consumo muy distintos. Separarlos en pools heterogéneos de hardware permite afinar costo y rendimiento de forma independiente, aunque para fleets pequeños o medianos seguir usando GPUs homogéneas sigue siendo la opción más simple de operar.
  • Escalado nativo en Kubernetes/OpenShift: llm-d está construido para extender e interoperar con vLLM y corre sobre cualquier clúster de Kubernetes, incluyendo Red Hat OpenShift.

El proyecto avanza rápido. Su versión más reciente incorpora descarga jerárquica de la caché KV, enrutamiento de LoRA consciente de caché, alta disponibilidad activo-activo y autoescalado hasta cero, con benchmarks que muestran mejoras de orden de magnitud en tiempo de primer token frente a estrategias de balanceo tradicionales.

¿Por qué le importa esto a una empresa financiera o de seguros?

Si tu organización ya está evaluando casos de uso de IA generativa en producción (no solo pilotos), esta dupla vLLM + llm-d te da algo que en banca y seguros no es negociable: previsibilidad de costos y de SLOs, corriendo sobre infraestructura propia, sin atarte a un único proveedor de nube ni a un único fabricante de acelerador. Esto encaja directamente con la visión de «cualquier modelo, cualquier acelerador, cualquier nube» que Red Hat viene empujando con Red Hat AI.

Para equipos de plataforma que ya operan OpenShift, esto significa que la inferencia de IA deja de ser un proyecto aislado y se convierte en una carga de trabajo más, gobernada con las mismas herramientas de Kubernetes que ya conocen.

vLLM optimiza la inferencia en una máquina. llm-d la escala a un clúster completo. Juntos forman la base técnica sobre la que se está construyendo buena parte de la infraestructura de IA generativa empresarial en 2026. Si estás en una fase de evaluación de plataformas de inferencia para tu organización, este es un par de proyectos que vale la pena seguir de cerca — y, si usas OpenShift, probablemente ya tengas el camino más corto para llegar a ellos.

Añadir un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *