GLM-5.2: Z.AI lanza modelo open source con 1M tokens de contexto
Z.AI publica GLM-5.2 con licencia MIT, contexto de 1M tokens y arquitectura IndexShare que reduce FLOPs por 2.9x. El modelo open source más fuerte en coding.

Qué es
Z.AI ha liberado GLM-5.2, su modelo flagship orientado a tareas de larga duración (long-horizon tasks). La novedad principal: contexto estable de 1 millón de tokens con licencia MIT pura — sin límites regionales ni restricciones de acceso.
Es el modelo open source más fuerte en benchmarks de coding, acercándose a Claude Opus 4.8 en varios benchmarks.
Contexto de 1M tokens
Z.AI hace una distinción importante: tener 1M tokens de contexto es fácil de anunciar, pero difícil de mantener estable bajo presión real de ingeniería. Para GLM-5.2 han expandido el entrenamiento con 1M de contexto en escenarios de coding-agent:
- Implementación a gran escala
- Investigación automatizada
- Optimización de rendimiento
- Debugging complejo
Los resultados en tres benchmarks de long-horizon coding:
| Benchmark | GLM-5.2 | Opus 4.8 | GPT-5.5 |
|---|---|---|---|
| FrontierSWE | -1% vs Opus 4.8 | — | -1% vs GLM-5.2 |
| PostTrainBench | #2 (tras Opus 4.8) | #1 | #3 |
| SWE-Marathon | -13% vs Opus 4.8 | — | — |
En todos los benchmarks, GLM-5.2 es el modelo open source mejor clasificado.
Arquitectura: IndexShare
La innovación técnica principal es IndexShare, que reutiliza el mismo indexer cada 4 capas de sparse attention. Esto reduce los FLOPs por token en 2.9x a 1M tokens de contexto.
Además, mejoran la capa MTP (Multi-Token Prediction) para speculative decoding, aumentando el acceptance length hasta un 20%.
Coding con effort levels
GLM-5.2 introduce control de nivel de esfuerzo. Permite balancear performance y latencia según la complejidad de la tarea:
- Low effort: respuestas rápidas para tareas simples
- High effort: razonamiento profundo para problemas complejos
En benchmarks estándar de coding:
- Terminal-Bench 2.1: 81.0 (vs 85.0 de Claude Opus 4.8, vs 63.5 de GLM-5.1)
- SWE-bench Pro: 62.1 (vs 58.4 de GLM-5.1)
Detalles técnicos
- Contexto: 1,048,576 tokens (1M)
- Licencia: MIT (sin restricciones regionales)
- Arquitectura: Sparse attention con IndexShare + MTP para speculative decoding
- Disponibilidad: HuggingFace Hub (zai-org)
- Comparativa: es el open source más cercano al frontier cerrado en coding
¿Para quién es relevante?
- Equipos haciendo coding agents: el contexto de 1M + licencia MIT lo ideal para agentes de ingeniería
- Self-hosters: licencia MIT sin restricciones, a diferencia de Llama
- Investigadores en long-context: IndexShare es una técnica replicable
- Startups que necesitan alternativa open source a Claude/GPT para coding
📎 Fuente original: HuggingFace Blog ↗