sábado, 12 de septiembre de 2026 · Madrid
Herramientas· 27 de junio de 2026 · 2 min de lectura

Revisado por Iván Quintas, Editor de IA News

vLLM en HuggingFace Jobs: un endpoint LLM en un comando

HuggingFace permite levantar un servidor vLLM con API compatible OpenAI en un solo comando, pagando por segundo. Ideal para tests y batch generation.

Ilustración de un terminal con el comando hf jobs run sobre fondo oscuro

Qué es

HuggingFace ha añadido soporte para ejecutar vLLM en su plataforma Jobs con un solo comando. El resultado es un endpoint LLM privado, compatible con la API de OpenAI, sin tener que provisionar servidores ni configurar Kubernetes. Facturación por segundo.

Es la forma más rápida de levantar un modelo para tests, evaluaciones o batch generation. Para producción, HuggingFace recomienda seguir usando Inference Endpoints.

Cómo funciona

El comando hf jobs run es básicamente un docker run sobre la infraestructura de HuggingFace. Se usa la imagen oficial vllm/vllm-openai, se pide una GPU con --flavor, y se expone el puerto con --expose:

hf jobs run --flavor a10g-large --expose 8000 --timeout 2h \
  vllm/vllm-openai:latest \
  vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000

El comando devuelve una URL pública accesible desde cualquier sitio:

https://<job_id>--8000.hf.jobs

Una vez que el servidor arranca (descarga de pesos incluida), puedes consultarla con curl:

curl https://<job_id>--8000.hf.jobs/v1/chat/completions \
  -H "Authorization: Bearer $(hf auth token)" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3-4B",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

O desde Python con el cliente de OpenAI:

from huggingface_hub import get_token
from openai import OpenAI

client = OpenAI(
    base_url="https://<job_id>--8000.hf.jobs/v1",
    api_key=get_token(),
)
resp = client.chat.completions.create(
    model="Qwen/Qwen3-4B",
    messages=[{"role": "user", "content": "Hello!"}],
)
print(resp.choices[0].message.content)

Detalles técnicos

¿Para quién es relevante?

HF Jobs vs Inference Endpoints

HuggingFace aclara la diferencia: Jobs es para uso efímero (tests, batch, prototipos). Inference Endpoints es el producto gestionado para producción, con auto-scaling y SLA. La regla simple: si lo necesitas corriendo 24/7, usa Endpoints. Si lo necesitas para una sesión de 2 horas, usa Jobs.

¿Te ha servido? Márcanos como fuente preferida en Google y verás antes nuestros artículos en Noticias destacadas, AI Overviews y AI Mode.

#huggingface#vllm#llm#inferencia#openai-api

📎 Fuente original: HuggingFace Blog ↗

Noticias relacionadas

De la misma familia · ForjaCMS

¿Y si tu próximo cliente no necesitara WordPress?

Dale un panel para gestionar su contenido y quédate tú con una web Astro rápida, segura y fácil de mantener.

Descubre ForjaCMS