Revisado por Iván Quintas, Editor de IA News
Video Use: editar vídeo desde Claude Code sin línea de tiempo
El equipo de browser-use publica video-use, una skill que deja a un agente de código cortar, subtitular y renderizar vídeo con ffmpeg.

El equipo detrás de browser-use ha publicado video-use, un repositorio que convierte a un agente de código en editor de vídeo. El flujo que propone es dejar el material bruto en una carpeta, describir en lenguaje natural qué quieres, y recibir un final.mp4 en edit/ junto a las fuentes.
Qué es
Es una skill open source en Python que se registra en el directorio de skills del agente y le da un conjunto de scripts de edición sobre ffmpeg. El repositorio lista lo que hace de forma bastante concreta: elimina muletillas (umm, uh, arranques fallidos) y silencios entre tomas, aplica corrección de color por segmento, mete fundidos de audio de 30 ms en cada corte para evitar chasquidos, quema subtítulos en fragmentos de dos palabras en mayúsculas por defecto, y genera animaciones con HyperFrames, Remotion, Manim o PIL.
Cómo lee el vídeo un LLM
Esta es la parte interesante del diseño, y la que explica que sea viable. El modelo no ve el vídeo: lo lee, en dos capas.
La primera es la transcripción. Una llamada a ElevenLabs Scribe por fuente devuelve marcas de tiempo por palabra, diarización de hablantes y eventos de audio ((laughter), (applause)). Todas las tomas se empaquetan en un único takes_packed.md de unos 12 KB, que es la vista principal del modelo.
La segunda capa es visual y bajo demanda: timeline_view genera un PNG con filmstrip, forma de onda y etiquetas de palabras para un rango de tiempo, y solo se invoca en puntos de decisión — pausas ambiguas, comparar tomas, verificar un corte. El README cifra el contraste: el enfoque naíf de meter 30.000 fotogramas serían unos 45 millones de tokens de ruido, frente a 12 KB de texto y unos pocos PNG.
Las animaciones se lanzan en subagentes paralelos, uno por animación, y el sistema se autoevalúa en cada frontera de corte antes de enseñarte nada. Es exactamente el patrón de loop con condición de parada y evaluador que se ha ido consolidando en los agentes de código, aplicado a un dominio donde verificar el resultado es caro.
Instalación
El repositorio ofrece un prompt de instalación para pegar en el agente, pero el camino manual es corto:
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use
cd ~/Developer/video-use
uv sync
brew install ffmpeg
cp .env.example .env # ELEVENLABS_API_KEY=...
Después basta con abrir el agente en la carpeta de las tomas y pedirle el montaje. Distribuir capacidades como un repositorio con su SKILL.md es la misma idea que ya vimos con los archivos de convenciones para agentes de UI: el contexto viaja como Markdown en el repo, no como un plugin.
Detalles técnicos
- Licencia: MIT
- Lenguaje: Python
- Requisitos: ffmpeg obligatorio, yt-dlp opcional, API key de ElevenLabs
- Agentes soportados: Claude Code, Codex, Hermes, Openclaw o cualquiera con acceso a shell
- Memoria de sesión: persiste en
project.mdentre sesiones - Salida: todo se escribe en
<videos_dir>/edit/ - Actividad: 18.888 estrellas y último push el 1 de julio de 2026, según GitHub
Qué conviene mirar antes
La transcripción no es gratis: cada fuente pasa por ElevenLabs, así que un proyecto con muchas tomas largas tiene un coste que conviene estimar antes. Tampoco es un editor visual — si tu montaje depende de decisiones de ritmo finas, el resultado sigue necesitando revisión humana, y el propio repositorio plantea el flujo como “propone estrategia, esperas tu OK, produce”.
Enlaces
- Repositorio: browser-use/video-use
- Animaciones: HyperFrames, Remotion, Manim
📎 Fuente original: browser-use/video-use en GitHub ↗
Noticias relacionadas
Preguntas frecuentes
- ¿Video Use es gratis?
- El código es open source con licencia MIT, pero la transcripción se hace con ElevenLabs Scribe y el propio instalador te pide una API key. El repositorio es gratuito; el uso real tiene coste de API.
- ¿Funciona solo con Claude Code?
- No. El repositorio indica que se registra como skill en Claude Code, Codex, Hermes, Openclaw o cualquier agente con acceso a shell. El paso de instalación se limita a enlazar la carpeta en el directorio de skills del agente.
- ¿Qué necesito instalado?
- ffmpeg es obligatorio y yt-dlp opcional para descargar material online. Las dependencias del proyecto se instalan con uv sync o pip install -e .
- ¿El modelo ve el vídeo?
- No. Según el repositorio, el LLM lee una transcripción con marcas de tiempo por palabra y solo genera una imagen compuesta de la línea de tiempo en puntos de decisión concretos.