martes, 25 de agosto de 2026 · Madrid
Modelos· 20 de agosto de 2026 · 4 min de lectura

Revisado por Iván Quintas, Editor de IA News

FreeToken: modelos de 753B parámetros en tu GPU de casa

UC Berkeley open-sourcea FreeToken: motor MoE edge-native para correr modelos frontier en GPU de consumo. 35B en laptop, 753B en workstation. Apache 2.0.

GPU gaming con luces LED violetas y visualización de red neuronal fluyendo hacia modelos holográficos sobre fondo violeta oscuro

Hasta ahora, correr un modelo de lenguaje de cientos de miles de millones de parámetros localmente era imposible sin hardware de datacenter. Necesitabas 48GB+ de VRAM, múltiples GPUs o resignarte a usar un modelo pequeño. FreeToken cambia esa ecuación.

Un modelo de 20GB corre a ~100 tokens/segundo en una RTX 5080 de 16GB. Un modelo de 35B en una laptop con 8GB de VRAM. Y GLM-5.2 completo (753B parámetros) en una sola workstation GPU. Todo open source, todo en tu máquina.

Qué hace FreeToken

FreeToken es un motor de serving para modelos Mixture-of-Experts (MoE) diseñado desde cero para hardware edge. El proyecto es de FlashML-org, un equipo de investigación de UC Berkeley y UT Austin, con paper publicado en arXiv.

La diferencia con otras soluciones de inferencia local (llama.cpp, vLLM, Ollama) es que FreeToken no intenta meter todo el modelo en la GPU. En su lugar, trata tu máquina entera como una plataforma de inferencia:

El motor usa una política bandwidth-adaptive (q-star) que decide en runtime qué experts van en GPU y cuáles en CPU, optimizando para minimizar la latencia. No es un simple offloading: es un scheduling que se adapta al patrón de acceso del modelo en tiempo real.

Los números

La tabla de soporte es la que llama la atención:

HardwareModeloParámetros
Laptop 8GB GPUQwen3.6-35B-A3B35B
RTX 5080 16GBDeepSeek-V4-Flash20GB de pesos
RTX 5090Modelos MoE frontier284B
Workstation GPUGLM-5.2753B

En el paper muestran que FreeToken consistentemente supera a vLLM, SGLang y llama.cpp en throughput para modelos MoE en hardware edge, con speedups de 2-5x dependiendo del workload.

El truco está en el caching semántico. FreeToken guarda checkpoints de estado recurrente y KV cache entre turnos de agente, de modo que cuando un agente edita su contexto (tool calls, thinking blocks), no recomputa todo el contexto desde cero. Esto es especialmente relevante para agentes de coding como Codex o Claude Code que hacen muchas llamadas secuenciales.

API compatible con OpenAI y Anthropic

FreeToken expone dos APIs:

/v1/chat/completions   (OpenAI compatible)
/v1/responses          (OpenAI compatible)
/v1/models             (OpenAI compatible)
/v1/messages           (Anthropic compatible)
/v1/messages/count_tokens (Anthropic compatible)

Esto significa que puedes apuntar Codex, Claude Code, OpenCode, DeepSeek Harness o cualquier cliente que use OpenAI/Anthropic API directamente a FreeToken cambiando la base URL:

ft serve --model ~/models/Qwen3.6-35B-A3B
# API disponible en http://127.0.0.1:1919/v1/

Luego en tu cliente:

export OPENAI_BASE_URL=http://127.0.0.1:1919/v1
export OPENAI_API_KEY=freetoken

Instalación

Hay dos caminos:

GUI desktop (recomendado para empezar): descarga desde flashml.ai. One-click install en Windows y Linux, con GUI para seleccionar modelo, lanzar chat y tunear el engine.

CLI (para integración y automatización):

uv venv && source .venv/bin/activate
uv pip install "freetoken[accel]"

ft serve --model ~/path/to/GLM-5.2

Los kernels CUDA se compilan JIT en el primer uso. Necesitas CUDA 13 toolkit con nvcc en PATH.

Para compilar desde fuente:

git clone https://github.com/FlashML-org/FreeToken.git
cd FreeToken
uv venv && source .venv/bin/activate
uv pip install -e ".[accel]"

Soporte de modelos y hardware

Modelos soportados (20+): DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2 y otros modelos MoE frontier.

Formatos de cuantización: MXFP4, NVFP4, FP8, BF16.

GPUs NVIDIA: RTX 30, RTX 40 y RTX 50 series. Driver r580+ (CUDA 13).

Apple Silicon: hay un PR en curso para soporte Metal/MLX por parte de Jason Kneen. No mergeado todavía.

CLI reference

ComandoFunción
ft serveArrancar API server (OpenAI + Anthropic)
ft shellChat en terminal
ft ctlGestionar server en caliente
ft launchLanzar agente de coding contra el server
ft checkpointConvertir checkpoint HF a formato FTW
ft bench bwBenchmark bandwidth CPU vs PCIe

Por qué importa

FreeToken cambia la conversación sobre inferencia local. Hasta ahora, si querías correr un modelo grande en casa, la respuesta era “compra más VRAM”. FreeToken dice: el bottleneck no es la capacidad de la GPU, es cómo orquestas los recursos que ya tienes.

Para desarrolladores que usan agentes de coding (Codex, Claude Code, OpenCode) y no quieren pagar API costs, FreeToken abre la puerta a correr modelos frontier sin datacenter. La combinación de MoE sparsity + caching semántico + scheduling adaptativo hace que el hardware de consumo sea suficiente para workloads que antes requerían A100s.

El proyecto tiene 5.400+ estrellas y 138 issues abiertos, indicando adopción activa. La licencia Apache 2.0 permite uso comercial sin restricciones.

La era del “no cabe → no se puede” acaba de morir.

#FreeToken#MoE#GPU#inferencia local#GLM-5.2#DeepSeek#open source#UC Berkeley

📎 Fuente original: X / GitHub ↗

Noticias relacionadas

Preguntas frecuentes

¿Qué es FreeToken?
FreeToken es un motor de inferencia MoE edge-native desarrollado por UC Berkeley que permite correr modelos frontier (hasta 753B parámetros) en hardware de consumo. Trata GPU, CPU y RAM como una plataforma unificada de inferencia con ejecución bandwidth-adaptive y caching semántico.
¿Qué modelos puedo correr con FreeToken?
FreeToken soporta más de 20 modelos MoE incluyendo DeepSeek-V4-Flash, Qwen3.6-35B-A3B y GLM-5.2. Soporta formatos MXFP4, NVFP4, FP8 y BF16.
¿Qué hardware necesito para FreeToken?
FreeToken funciona desde una laptop con GPU de 8GB (corre 35B) hasta una workstation (corre 753B). Soporta NVIDIA RTX 30, 40 y 50 series. También hay PR en curso para Apple Silicon con Metal/MLX.
¿FreeToken es compatible con la API de OpenAI?
Sí. FreeToken expone la API de OpenAI (/v1/chat/completions, /v1/responses, /v1/models) y la de Anthropic (/v1/messages), por lo que funciona con Codex, Claude Code, OpenCode y otros agentes directamente.
¿Cómo instalo FreeToken?
Puedes instalar via pip con uv pip install freetoken[accel] o descargar la GUI desktop desde flashml.ai. También puedes compilar desde el código fuente con git clone y uv pip install -e .[accel].