miércoles, 5 de agosto de 2026 · Madrid
Repositorios· 04 de agosto de 2026 · 3 min de lectura

Revisado por Iván Quintas, Editor de IA News

Video Use: editar vídeo desde Claude Code sin línea de tiempo

El equipo de browser-use publica video-use, una skill que deja a un agente de código cortar, subtitular y renderizar vídeo con ffmpeg.

Banner del repositorio video-use, herramienta de edición de vídeo para agentes de código

El equipo detrás de browser-use ha publicado video-use, un repositorio que convierte a un agente de código en editor de vídeo. El flujo que propone es dejar el material bruto en una carpeta, describir en lenguaje natural qué quieres, y recibir un final.mp4 en edit/ junto a las fuentes.

Qué es

Es una skill open source en Python que se registra en el directorio de skills del agente y le da un conjunto de scripts de edición sobre ffmpeg. El repositorio lista lo que hace de forma bastante concreta: elimina muletillas (umm, uh, arranques fallidos) y silencios entre tomas, aplica corrección de color por segmento, mete fundidos de audio de 30 ms en cada corte para evitar chasquidos, quema subtítulos en fragmentos de dos palabras en mayúsculas por defecto, y genera animaciones con HyperFrames, Remotion, Manim o PIL.

Cómo lee el vídeo un LLM

Esta es la parte interesante del diseño, y la que explica que sea viable. El modelo no ve el vídeo: lo lee, en dos capas.

La primera es la transcripción. Una llamada a ElevenLabs Scribe por fuente devuelve marcas de tiempo por palabra, diarización de hablantes y eventos de audio ((laughter), (applause)). Todas las tomas se empaquetan en un único takes_packed.md de unos 12 KB, que es la vista principal del modelo.

La segunda capa es visual y bajo demanda: timeline_view genera un PNG con filmstrip, forma de onda y etiquetas de palabras para un rango de tiempo, y solo se invoca en puntos de decisión — pausas ambiguas, comparar tomas, verificar un corte. El README cifra el contraste: el enfoque naíf de meter 30.000 fotogramas serían unos 45 millones de tokens de ruido, frente a 12 KB de texto y unos pocos PNG.

Las animaciones se lanzan en subagentes paralelos, uno por animación, y el sistema se autoevalúa en cada frontera de corte antes de enseñarte nada. Es exactamente el patrón de loop con condición de parada y evaluador que se ha ido consolidando en los agentes de código, aplicado a un dominio donde verificar el resultado es caro.

Instalación

El repositorio ofrece un prompt de instalación para pegar en el agente, pero el camino manual es corto:

git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use

cd ~/Developer/video-use
uv sync
brew install ffmpeg

cp .env.example .env   # ELEVENLABS_API_KEY=...

Después basta con abrir el agente en la carpeta de las tomas y pedirle el montaje. Distribuir capacidades como un repositorio con su SKILL.md es la misma idea que ya vimos con los archivos de convenciones para agentes de UI: el contexto viaja como Markdown en el repo, no como un plugin.

Detalles técnicos

Qué conviene mirar antes

La transcripción no es gratis: cada fuente pasa por ElevenLabs, así que un proyecto con muchas tomas largas tiene un coste que conviene estimar antes. Tampoco es un editor visual — si tu montaje depende de decisiones de ritmo finas, el resultado sigue necesitando revisión humana, y el propio repositorio plantea el flujo como “propone estrategia, esperas tu OK, produce”.

Enlaces

#video-use#browser-use#Claude Code#ffmpeg#agentes

📎 Fuente original: browser-use/video-use en GitHub ↗

Noticias relacionadas

Preguntas frecuentes

¿Video Use es gratis?
El código es open source con licencia MIT, pero la transcripción se hace con ElevenLabs Scribe y el propio instalador te pide una API key. El repositorio es gratuito; el uso real tiene coste de API.
¿Funciona solo con Claude Code?
No. El repositorio indica que se registra como skill en Claude Code, Codex, Hermes, Openclaw o cualquier agente con acceso a shell. El paso de instalación se limita a enlazar la carpeta en el directorio de skills del agente.
¿Qué necesito instalado?
ffmpeg es obligatorio y yt-dlp opcional para descargar material online. Las dependencias del proyecto se instalan con uv sync o pip install -e .
¿El modelo ve el vídeo?
No. Según el repositorio, el LLM lee una transcripción con marcas de tiempo por palabra y solo genera una imagen compuesta de la línea de tiempo en puntos de decisión concretos.