viernes, 18 de septiembre de 2026 · Madrid
Herramientas· 17 de septiembre de 2026 · 4 min de lectura

Revisado por Iván Quintas, Editor de IA News

Obliteratus: borra la censura de cualquier LLM open weight

8.300 estrellas en GitHub para la caja de herramientas que localiza y elimina la dirección de rechazo de un modelo sin reentrenarlo, probada en 116 modelos.

Cadena geometrica rompiendose alrededor de un nodo de red neuronal sobre fondo violeta oscuro

“Esta herramienta ELIMINA la censura de CUALQUIER LLM open weight con un solo clic”, escribía Jokker en X sobre Obliteratus, la caja de herramientas de elder-plinius —figura conocida en la comunidad por sus jailbreaks de modelos de lenguaje— que ya suma más de 8.300 estrellas en GitHub. El lema del proyecto resume la propuesta sin rodeos: “Break the chains. Free the mind. Keep the brain.”

Qué hace exactamente

Obliteratus implementa abliteration, una familia de técnicas que localiza la representación interna responsable de que un modelo rechace responder y la elimina quirúrgicamente, sin reentrenamiento ni fine-tuning. El pipeline completo tiene seis fases —desde cargar el modelo hasta guardar la versión liberada con metadatos— y se apoya en cuatro estrategias de extracción de esa “dirección de rechazo”:

EstrategiaQué mide
PCAComponentes principales de las activaciones de rechazo
Diferencia de mediasContraste entre prompts dañinos e inofensivos
Autoencoder dispersoDescomposición de la señal de rechazo en componentes interpretables
SVD blanqueadaExtracción normalizada por covarianza, separando la señal del ruido natural

Después de extraer la dirección, el proyecto ofrece dos formas de intervenir: proyección de pesos (permanente, modifica el modelo) o vectores de dirección (reversible, actúa solo en tiempo de inferencia). Encima de eso hay 15 módulos de análisis —desde detectar si el alineamiento se hizo con DPO, RLHF, CAI o SFT hasta medir si el modelo intentará “auto-repararse” tras la intervención (lo que el proyecto llama el efecto Ouroboros)— que alimentan un modo informado: la herramienta decide sola cuántas direcciones extraer y qué capas son seguras de tocar antes de aplicar nada.

116 modelos, cinco formas de usarlo

El repositorio documenta 116 modelos curados en cinco tiers según la VRAM que necesitas:

TierVRAMEjemplos
TinyCPU / menos de 1 GBGPT-2, TinyLlama 1.1B, Qwen2.5-0.5B, SmolLM2
Small4-8 GBPhi-2 2.7B, Gemma-2 2B, StableLM-2 1.6B
Medium8-16 GBMistral 7B, Qwen2.5-7B, Gemma-2 9B, Phi-3.5
Large24+ GBLLaMA-3.1 8B, Qwen2.5-14B, Mistral 24B, destilados de DeepSeek-R1
FrontierMulti-GPUDeepSeek-V3.2 (685B), Qwen3-235B, GLM-4.7 (355B)

Para probarlo sin tocar una línea de código está el Space en HuggingFace, con GPU gratuita (cuota diaria) y ocho pestañas: obliterar, comparar métodos y modelos, chatear con el resultado, comparación A/B contra el original, barrido de intensidad y un leaderboard con resultados agregados de la comunidad. Quien prefiere su propio hardware tiene web UI local, notebook de Colab, CLI y API de Python con acceso a cada artefacto intermedio —tensores de activación, vectores de dirección, matrices de alineamiento entre capas—.

El ángulo que no cuenta el hilo

Aquí conviene separar lo técnico de lo legal. Obliteratus es AGPL-3.0 y el propio README es explícito sobre para quién está pensado —investigadores de alineamiento, evaluadores de seguridad IA, usuarios que corren modelos localmente— y para quién no: cualquiera sin el criterio técnico para usar un modelo sin barreras de forma responsable. Los modelos que salen de este pipeline han perdido sus guardarraíles de seguridad y la responsabilidad de qué se hace con ellos recae en quien los genera, no en la herramienta.

El diseño tiene además un componente de “ciencia distribuida”: con la telemetría activada (encendida por defecto en el Space público), cada ejecución aporta datos anónimos a un dataset colaborativo sobre direcciones de rechazo, comparativas entre métodos y perfiles de rendimiento por hardware — la lógica de “cuantos más lo usan, más aprende el proyecto sobre sí mismo” detrás del “se vuelve más inteligente cada vez que alguien lo usa” del hilo original.

Es un desarrollo que conecta con el mismo terreno que otras herramientas de la comunidad open source para agentes: proyectos que dan a quien despliega un modelo control real sobre su comportamiento, en lugar de dejarlo fijado de fábrica.

¿Te ha servido? Márcanos como fuente preferida en Google y verás antes nuestros artículos en Noticias destacadas, AI Overviews y AI Mode.

#Obliteratus#LLM#open source#seguridad IA#huggingface#GitHub#modelos open source

📎 Fuente original: X — Jokker (@0xJokker) ↗

Noticias relacionadas

Preguntas frecuentes

¿Qué es Obliteratus?
Un toolkit open source que implementa "abliteration": localiza la dirección interna que hace que un modelo de lenguaje se niegue a responder y la elimina de los pesos, sin necesidad de reentrenar ni hacer fine-tuning. Lo mantiene elder-plinius, conocido en la comunidad por su trabajo en jailbreaks de LLM, y acumula 8.300 estrellas en GitHub.
¿Cómo elimina la censura sin reentrenar el modelo?
Sondea los estados ocultos del modelo con prompts dañinos e inofensivos para localizar la 'dirección de rechazo' en el espacio de activaciones, usando PCA, diferencia de medias, descomposición con autoencoders dispersos o SVD blanqueada. Después proyecta esa dirección fuera de los pesos (permanente) o la resta en tiempo de inferencia con vectores de dirección (reversible).
¿En cuántos modelos ha sido probado?
El propio repositorio documenta 116 modelos organizados en 5 categorías por VRAM necesaria: desde GPT-2 o TinyLlama en CPU hasta DeepSeek-V3.2 (685B) o Qwen3-235B en configuraciones multi-GPU. También incluye un modo 'informado' que analiza el modelo antes de tocarlo para decidir cuántas direcciones extraer y qué capas son seguras de modificar.
¿Es legal o seguro usar Obliteratus?
El código es open source (AGPL-3.0) y el propio proyecto es explícito: los modelos que produce han perdido sus barreras de seguridad y quien los usa es el único responsable de qué hace con ellos. Lo presenta como herramienta de investigación de alineamiento — para evaluadores de seguridad IA y usuarios que ejecutan modelos localmente —, no para desplegar en producción de cara al público.
¿Necesito GPU propia para usarlo?
No. Hay una versión sin instalación en HuggingFace Spaces con GPU gratuita (cuota diaria, ampliable con HF Pro) para modelos de hasta ~8B en el tier gratuito, un notebook de Google Colab, y CLI/API Python para quien quiere control total en su propio hardware.

De la misma familia · Gestión documental

¿Sabes dónde está el seguro de tu comunidad?

Actas, contratos, pólizas y documentos importantes siempre localizados, con avisos de vencimiento.

Descubre Vecindoc