Revisado por Iván Quintas, Editor de IA News
Obliteratus: borra la censura de cualquier LLM open weight
8.300 estrellas en GitHub para la caja de herramientas que localiza y elimina la dirección de rechazo de un modelo sin reentrenarlo, probada en 116 modelos.

“Esta herramienta ELIMINA la censura de CUALQUIER LLM open weight con un solo clic”, escribía Jokker en X sobre Obliteratus, la caja de herramientas de elder-plinius —figura conocida en la comunidad por sus jailbreaks de modelos de lenguaje— que ya suma más de 8.300 estrellas en GitHub. El lema del proyecto resume la propuesta sin rodeos: “Break the chains. Free the mind. Keep the brain.”
Qué hace exactamente
Obliteratus implementa abliteration, una familia de técnicas que localiza la representación interna responsable de que un modelo rechace responder y la elimina quirúrgicamente, sin reentrenamiento ni fine-tuning. El pipeline completo tiene seis fases —desde cargar el modelo hasta guardar la versión liberada con metadatos— y se apoya en cuatro estrategias de extracción de esa “dirección de rechazo”:
| Estrategia | Qué mide |
|---|---|
| PCA | Componentes principales de las activaciones de rechazo |
| Diferencia de medias | Contraste entre prompts dañinos e inofensivos |
| Autoencoder disperso | Descomposición de la señal de rechazo en componentes interpretables |
| SVD blanqueada | Extracción normalizada por covarianza, separando la señal del ruido natural |
Después de extraer la dirección, el proyecto ofrece dos formas de intervenir: proyección de pesos (permanente, modifica el modelo) o vectores de dirección (reversible, actúa solo en tiempo de inferencia). Encima de eso hay 15 módulos de análisis —desde detectar si el alineamiento se hizo con DPO, RLHF, CAI o SFT hasta medir si el modelo intentará “auto-repararse” tras la intervención (lo que el proyecto llama el efecto Ouroboros)— que alimentan un modo informado: la herramienta decide sola cuántas direcciones extraer y qué capas son seguras de tocar antes de aplicar nada.
116 modelos, cinco formas de usarlo
El repositorio documenta 116 modelos curados en cinco tiers según la VRAM que necesitas:
| Tier | VRAM | Ejemplos |
|---|---|---|
| Tiny | CPU / menos de 1 GB | GPT-2, TinyLlama 1.1B, Qwen2.5-0.5B, SmolLM2 |
| Small | 4-8 GB | Phi-2 2.7B, Gemma-2 2B, StableLM-2 1.6B |
| Medium | 8-16 GB | Mistral 7B, Qwen2.5-7B, Gemma-2 9B, Phi-3.5 |
| Large | 24+ GB | LLaMA-3.1 8B, Qwen2.5-14B, Mistral 24B, destilados de DeepSeek-R1 |
| Frontier | Multi-GPU | DeepSeek-V3.2 (685B), Qwen3-235B, GLM-4.7 (355B) |
Para probarlo sin tocar una línea de código está el Space en HuggingFace, con GPU gratuita (cuota diaria) y ocho pestañas: obliterar, comparar métodos y modelos, chatear con el resultado, comparación A/B contra el original, barrido de intensidad y un leaderboard con resultados agregados de la comunidad. Quien prefiere su propio hardware tiene web UI local, notebook de Colab, CLI y API de Python con acceso a cada artefacto intermedio —tensores de activación, vectores de dirección, matrices de alineamiento entre capas—.
El ángulo que no cuenta el hilo
Aquí conviene separar lo técnico de lo legal. Obliteratus es AGPL-3.0 y el propio README es explícito sobre para quién está pensado —investigadores de alineamiento, evaluadores de seguridad IA, usuarios que corren modelos localmente— y para quién no: cualquiera sin el criterio técnico para usar un modelo sin barreras de forma responsable. Los modelos que salen de este pipeline han perdido sus guardarraíles de seguridad y la responsabilidad de qué se hace con ellos recae en quien los genera, no en la herramienta.
El diseño tiene además un componente de “ciencia distribuida”: con la telemetría activada (encendida por defecto en el Space público), cada ejecución aporta datos anónimos a un dataset colaborativo sobre direcciones de rechazo, comparativas entre métodos y perfiles de rendimiento por hardware — la lógica de “cuantos más lo usan, más aprende el proyecto sobre sí mismo” detrás del “se vuelve más inteligente cada vez que alguien lo usa” del hilo original.
Es un desarrollo que conecta con el mismo terreno que otras herramientas de la comunidad open source para agentes: proyectos que dan a quien despliega un modelo control real sobre su comportamiento, en lugar de dejarlo fijado de fábrica.
¿Te ha servido? Márcanos como fuente preferida en Google y verás antes nuestros artículos en Noticias destacadas, AI Overviews y AI Mode.
📎 Fuente original: X — Jokker (@0xJokker) ↗