comunidadbóvedaDe videos a skills
de un link de YouTube a una skill instalada

Claude Code no ve videos. Hasta que le pones ojos.

Le pegas el link de un video y te contesta con lo que dice el título, porque el título es todo lo que alcanza a leer. Lo que le falta no es inteligencia: le faltan ojos, vista larga y manos. Son tres piezas, se instalan una vez, y desde ahí cualquier video que te sirva deja de ser una hora perdida y se vuelve una habilidad que Claude conserva.

Guía comunidad · 10 de agosto de 2026

Ver un video no te deja nada. Convertirlo en skill sí.

Aquí está cómo se instala Watch en las tres superficies donde usas Claude, la perilla que decide cuántos cuadros mira y cuánto contexto te cuesta, la llave gratis de Gemini para las conferencias de dos horas, el árbol para no adivinar cuál de las dos abrir, y la forja que arma la habilidad sola: pegas una URL y sale un SKILL.md instalado, probado y con el subagente que lo usa.

Claude Code · la app · la terminal/watch, un solo comandocuatro modos de detalleyt-dlp · ffmpeg · Whisperllave gratis en AI Studio8 horas de video al díasolo videos públicoshasta 10 videos por requestskill-creator como basecero líneas de código

01 · las tres piezas

Los ojos, la vista larga y las manos

Le pegas el link de un tutorial y te contesta en tres segundos. Parece que lo vio. No lo vio: leyó el título, jaló lo que ya sabía del tema y completó el resto con lo que tu propio mensaje le sugirió. Para Claude Code, una URL de YouTube es una cadena de texto y nada más.

Ese hueco no se tapa con un modelo mejor ni con un prompt más largo. Se tapa con piezas. Son tres, se instalan una sola vez, y cada una hace algo que las otras dos no pueden.

Qué es cada una

01

los ojos

Watch, la skill que sí mira

Baja el video, le saca los cuadros y te entrega juntas las dos capas: lo que se dice y lo que se ve. Es un proyecto MIT de la comunidad, escrito en Python, y por dentro es una sola skill con un solo comando, /watch — todo lo demás de esta guía son flags de ese comando. Como quien baja es yt-dlp, no se queda en YouTube: también le entras a un archivo que ya está en tu disco, o a un link de TikTok, Loom o X.

02

la vista larga

Una llave gratis de Gemini

Le pasas la URL de un video público de YouTube y lo mira entero sin descargar nada: sin cuadros ocupándote el disco y sin esperar a que baje el archivo. Es la pieza para la conferencia de dos horas, donde bajarla sería el camino largo. La llave se saca en AI Studio y no te pide tarjeta.

03

las manos

Tu forja

Las dos anteriores extraen; ninguna guarda. La forja es la skill que convierte lo extraído en un SKILL.md instalado, con su subagente y sus pruebas de disparo. Es la única de las tres que no se descarga de ningún lado: la escribes una vez, con el prompt de la sección 07, y se queda viviendo en tu disco.

el malentendido de siempre

Watch no usa Gemini

Se confunden porque las dos «ven videos», pero no se tocan en ningún punto. El recorrido de Watch es suyo de principio a fin: yt-dlp baja el video y, si existen, sus subtítulos; ffmpeg saca los cuadros; la transcripción sale de esos subtítulos nativos cuando el video los trae, y de Whisper cuando no los trae; al final Claude lee los cuadros. Ni una llamada a Google en todo el trayecto.

Gemini es el otro camino, no una tripa de este. Puedes instalar Watch y no sacar nunca una llave de Gemini, o sacar la llave y no instalar nunca Watch. Se combinan cuando tú decides combinarlos, y por eso la sección 06 es un árbol de decisión en vez de una lista de pasos.

Qué resuelve cada pieza, y qué no

Casi todo el tiempo que se pierde en esto viene de pedirle a una pieza lo que le tocaba a otra. Esta es la frontera:

piezapara qué espara qué no es
Watch · los ojosVer lo que pasa en pantalla: a qué menú entra, qué ruta escribe, qué ajuste deja prendido. Y llegar a lo que no está en YouTube: un archivo tuyo, un link de otra plataforma.Guardar. Termina la corrida, se cierra esa conversación, y lo que aprendiste se fue con ella.
La llave de Gemini · la vista largaTragarse un video largo y público entero desde su URL, sin bajarlo, sin ocupar disco y sin partirlo en pedazos.Videos privados o no listados: esos los rechaza. Y archivos que vivan en tu computadora.
Tu forja · las manosConvertir lo extraído en una habilidad instalada, con su subagente y la prueba de que se activa sola cuando toca.Mirar. Sin alguna de las dos primeras, no tiene con qué trabajar.

el orden

Dos se descargan, una se escribe

Watch y la llave se resuelven en las secciones 02 y 05, y las dos juntas te toman menos de lo que dura el video que ibas a ver. Son trámite.

La tercera es la que cambia el resto del año. La forja no existe hasta que la escribes, y una vez escrita cada video que te sirva deja de ser una hora que se evapora y se vuelve una habilidad que Claude conserva.

Qué es una skill por dentro, qué lleva su encabezado y cómo se arma a mano no se explica en esta página: eso ya vive en Skill Creator y en Sistema de Skills, en esta misma bóveda, y las dos están enlazadas al pie. Aquí damos por hecho que la forja te escribe la skill, y nos ocupamos de lo único que ninguna de las dos cubre: cómo le pones ojos.

02 · instala Watch

Tres superficies, tres rutas, una sola skill

Watch se instala una vez y se queda. Lo que cambia es dónde: la terminal de Claude Code, la app de Claude en web o escritorio, y cualquier otro host donde trabajes. Son tres rutas distintas y solo necesitas la tuya — pero mira las otras dos de reojo, porque casi todo el tiempo que se pierde aquí es de gente intentando la ruta de la terminal dentro de la app.

Uses la que uses, lo que queda instalado es lo mismo: una sola skill, con un solo comando, /watch.

01

Claude Code, desde la terminal

Dos líneas: das de alta el marketplace y luego instalas el plugin desde ahí. Es la ruta más corta, y la que te deja el comando disponible en todos tus proyectos.

en el prompt de Claude Code

/plugin marketplace add bradautomates/claude-video

/plugin install watch@claude-video

/plugin update watch@claude-video ← después, cuando salga versión nueva

La tercera no es para hoy: guárdala. Watch se mueve, y esa línea es la que te trae lo que le vayan agregando.

02

La app de Claude, en web o en escritorio

Aquí no hay comandos: hay un archivo que subes. Pero antes de subirlo tienes que prender la ejecución de código, porque lo que hace esta skill es correr programas. Sin eso se instala y no puede hacer absolutamente nada.

El archivo se llama watch.skill y se baja del último release del repo, que hoy es la versión 0.2.0, del 29 de junio de 2026.

la ruta dentro de la app

Ajustes → Capacidades → Code execution and file creation → prendido

Ajustes → Capacidades → Skills → + · sube watch.skill

Si el + no te aparece, no busques más abajo: vuelve al primer renglón, la ejecución de código sigue apagada.

03

Codex, Cursor, Copilot, Gemini CLI y compañía

Watch también se reparte como skill suelta, así que cualquier host que lea skills la puede usar. Una línea y queda.

en tu terminal, fuera de Claude

npx skills add bradautomates/claude-video -g

El -g es lo que la deja global: instalada así la tienes desde cualquier carpeta, sin volver a correr nada.

Lo que Watch necesita en tu máquina

Tres programas, y ninguno te va a pedir armar un entorno de Python:

  • yt-dlp — el que baja el video y, cuando existen, sus subtítulos.
  • ffmpeg y ffprobe — los que sacan los cuadros del video y lo miden.
  • python3 — los scripts de la skill corren con la librería estándar. No hay que instalar paquetes con pip ni crear un entorno virtual: si tienes python3, ya está.
  • En macOS ni siquiera los instalas tú: la primera corrida los pone con brew y sigue de largo.

Antes de mirar nada, Watch se revisa a sí misma. Esa revisión te contesta con un número, y el número es todo el diagnóstico que necesitas:

el preflight

Los cuatro números con los que te contesta

0
Está lista. No falta nada, ya puedes mirar un video.
2
Faltan binarios. Es alguno de yt-dlp, ffmpeg, ffprobe o python3: en macOS deja que la corrida los ponga con brew, en otro sistema instálalos tú antes de seguir.
3
Es tu primera corrida y no hay llave de Whisper. No es un error, es un aviso: la llave solo hace falta cuando el video no trae subtítulos propios.
4
Los dos anteriores a la vez: faltan binarios y falta la llave.

El 3 asusta más de lo que debería. No te detiene: significa que el día que te topes con un video sin subtítulos, ese sí se va a quedar sin transcribir.

las llaves opcionales

Viven en un archivo, no en el perfil de tu terminal

Cuando el video trae subtítulos propios, Watch los usa y no necesita nada más. Cuando no los trae, se va a Whisper, y ahí sí hace falta llave: GROQ_API_KEY para whisper-large-v3, que es la que prefiere, u OPENAI_API_KEY para whisper-1 como alterna.

Las dos van en ~/.config/watch/.env, con permisos 0600 — o sea, que nadie más que tu usuario pueda abrir ese archivo. No las metas en el perfil de tu terminal ni en el .env de un proyecto: ahí acaban en el historial, en una captura de pantalla o en un repo.

Si los videos que ves suelen traer subtítulos, deja esto para después. El preflight te va a contestar 3 y con ese 3 se puede trabajar.

Y ya que estamos: nada de esto lo tienes que hacer tú. Este prompt hace que lo instale él, corra el preflight y te traduzca el número que salga.

Deja Watch instalado y probado

No lo instales tú: que lo instale él y que después te diga qué le falta a tu máquina. El preflight contesta con un número, y ese número es todo el diagnóstico.

Quiero darte ojos. Instala la skill Watch en esta máquina y déjala probada antes de decirme que ya quedó.

El marketplace es bradautomates/claude-video y el plugin se llama watch. Si estamos en Claude Code, agrégalo como marketplace e instala el plugin desde ahí. Si estoy en otro host (Codex, Cursor, Copilot, Gemini CLI), instálala global desde ese mismo repo con el instalador de skills por npx, y dime cuál de las dos rutas usaste.

Después corre el preflight de la skill y tradúceme el código de salida a español:
· 0 — está lista, ya puedo mirar videos.
· 2 — faltan binarios. Dime cuáles de yt-dlp, ffmpeg, ffprobe o python3 no están, y ofrécete a instalarlos antes de tocar nada.
· 3 — es la primera corrida y no hay llave de Whisper. Explícame que solo hace falta cuando el video no trae subtítulos propios.
· 4 — faltan las dos cosas.

Si me toca poner llaves de Whisper, no las metas a mi shell: van en el archivo de configuración de la skill, en ~/.config/watch/.env, con permisos 0600. Dime exactamente qué línea lleva y para qué sirve cada llave.

Cierra diciéndome, en una frase, qué comando escribo yo ahora para probarla.

Cuando el preflight conteste 0, ya tienes ojos. Lo que sigue es la primera corrida.

03 · tu primer /watch

Tu primera corrida, y por qué la pregunta pesa más que la URL

Con Watch instalado, mirar un video es una línea. Le pegas la dirección y, debajo, lo que quieres saber. No hay panel, no hay ventana de configuración, no hay que elegir nada: el comando es uno solo y todo lo demás son flags.

Lo que pasa después no es una caja negra. Son siete cosas, en orden, y vale la pena entenderlas: cuando una corrida sale rara, casi siempre falló una de las siete y se nota cuál.

así se escribe la primera corrida

/watch https://www.youtube.com/watch?v=<id del video>

¿Qué pasos sigue para configurar la herramienta, en orden?

La primera línea es el comando. La segunda es la que decide si la corrida valió la pena.

Los siete pasos que ocurren mientras esperas

1

Va por el video — o ni eso

yt-dlp toma la dirección y lo primero que hace no es descargar: es revisar si el video ya trae subtítulos propios. Si los trae, se los queda tal cual. Es texto que alguien ya escribió, y no cuesta nada.

2

Corta el video en fotos

ffmpeg saca cuadros repartidos a lo largo de lo que dura el video. Cuántos saca no es capricho ni es fijo: depende del modo de detalle y de la duración, y eso se mueve. Es todo el tema de la sección que sigue.

3

Consigue la transcripción

Si hubo subtítulos nativos, esos son la transcripción y aquí no pasa nada más. Si no hubo, se transcribe el audio con Whisper, y ese es el único punto de toda la corrida que depende de un servicio de fuera y de una llave tuya.

4

Te enseña lo que encontró

El script imprime la lista de cuadros que sacó, cada uno etiquetado con el momento del video en que fue tomado, y debajo la transcripción con sus tiempos. A partir de aquí ya no hay video: hay fotos con hora y texto con hora.

5

Claude abre las fotos

Aquí deja de ser un script. Claude lee cada JPEG — todos a la vez, no de uno en uno — igual que leería una imagen que le hubieras pegado tú. Las fotos y la transcripción entran juntas al contexto, y por eso puede decirte qué se estaba diciendo mientras en pantalla pasaba tal cosa.

6

Contesta lo que preguntaste

No te devuelve el video: te devuelve tu pregunta contestada, con el video como fuente. Si la pregunta era floja, la respuesta va a ser floja aunque el video sea excelente. Ese es el punto de la siguiente parte.

7

Limpia lo que dejó tirado

Al terminar te dice en qué carpeta de trabajo dejó lo que descargó y los cuadros que sacó. Si ya no le estás preguntando nada más sobre ese video, Claude la borra y no te deja la basura ahí. Y si prefieres que esos archivos caigan en una carpeta tuya en vez de en una temporal, hay un flag para eso — también en la sección que sigue.

«Resume esto» desperdicia la corrida

Mirar un video cuesta contexto: cada cuadro que entra es espacio que ya no vas a tener para el resto de esa conversación. Y lo que decide si ese gasto rindió no es el video, es lo que le pediste.

«Resúmeme esto» te devuelve algo parecido a la descripción del video, después de haberlo mirado completo. La corrida sirve cuando le preguntas algo que solo se puede contestar viendo — no algo que se contesta leyendo el título.

rinden

Preguntas que solo el video contesta

  • Qué escribe exactamente en cada paso, y en qué orden lo hace.
  • Qué opciones deja prendidas y cuáles apaga en la pantalla de ajustes.
  • En qué minuto cambia de tema, y con qué frase hace el cambio.
  • Qué hace distinto de como yo lo estoy haciendo hoy.
  • Qué se ve en pantalla cuando le sale bien, para que yo sepa si a mí me salió.

no rinden

Preguntas que no necesitaban el video

  • Resume esto.
  • ¿De qué habla?
  • Dame los puntos principales.
  • Explícame el tema.
  • ¿Vale la pena?

Las de la derecha no están mal escritas: están mal dirigidas. Te devuelven algo que suena razonable, que no puedes verificar y que no te deja hacer nada distinto mañana. Escribe la pregunta antes de pegar la URL, no después.

la nota honesta

Mira videos que de todos modos podrías ver

Watch no le da la vuelta a nada: llega al video igual que si le picaras a reproducir, y lo lee por ti. La regla sana es corta — úsalo con videos que tú podrías estar viendo de todos modos: los que ya te ibas a sentar a ver, los tuyos, los de tu equipo, los que te mandaron para que los revisaras. Lo que te ahorra es la hora, no el permiso.

Y si lo único que te importa es lo que se dice, el modo transcripción ni siquiera descarga el video: se queda con los subtítulos y trabaja con eso. Cero cuadros y cero tokens de imagen, que es la corrida más barata que hay aquí.

Dos corridas para hoy, que es donde se aprende esto: una mirando el video y otra sin mirarlo. Pega la primera con un video que ya tengas ganas de ver, y cámbiale nada más la pregunta.

Tu primer video

La primera corrida no es «resúmeme esto». Es una pregunta concreta: mirar un video cuesta tokens, y lo que define el gasto es qué le pediste.

/watch <pega aquí la URL del video>

Míralo y contéstame esto y nada más:

<tu pregunta concreta — por ejemplo: qué pasos exactos sigue para configurar la herramienta, en orden, con lo que aparece en pantalla en cada uno>

Reglas para tu respuesta:
· Contéstame con lo que de verdad dice el video. Si algo lo estás infiriendo y no lo viste, márcalo como inferencia.
· Cita el minuto donde sale cada cosa importante.
· Si el video no contesta mi pregunta, dímelo de frente en la primera línea en vez de rellenar con lo que sí trae.

Solo la transcripción, sin bajar nada

Cuando lo que importa es lo que se dice y no lo que se ve. No descarga el video, no saca cuadros y no gasta un solo token de imagen.

/watch <URL> --detail transcript

Quiero nada más lo que se dice. Con eso:

1. Dame la transcripción limpia, por bloques con su marca de tiempo.
2. Debajo, en cinco viñetas, las ideas que de verdad sostienen el video.
3. Dime si la transcripción salió de los subtítulos del propio video o si hubo que transcribir el audio, porque de eso depende qué tan literal es.

Si en algún punto se nota que lo importante está en pantalla y no en la voz — un menú, un número, un archivo que abre — no lo adivines: dímelo y pídeme correrlo otra vez mirando el video.

04 · la perilla de detalle

Cuatro modos: de cero cuadros a ciento dieciséis

Todo lo que no es el comando son flags, y entre todos hay uno que cambia de verdad lo que te cuesta una corrida: --detail. Decide cuántas fotos del video entran a la conversación, y con eso decide al mismo tiempo cuánto ves y cuánto contexto gastas en verlo.

No es una escala de calidad donde el último es el bueno. Son cuatro puntos del mismo trueque: más cuadros, más detalle visual, menos espacio libre para lo demás. Estos son los cuatro, medidos por el propio proyecto sobre un mismo video.

modocuadrosextraccióntokens de imagen
transcript0 — ni descarga el video~4.5 s0 · y ~26.6k de texto
efficient50~0.5 s~9.8k
balanced · el default100~20.9 s~19.7k
token-burner116~21.0 s~22.8k

La medición es del propio proyecto, sobre un mismo video de 49:08 a 1280×720. La columna de extracción mide nada más el paso de sacar los cuadros: la descarga del video va aparte, ocurre una sola vez y es igual para los tres modos que sí lo bajan.

Las cuentas de tokens de imagen son aproximadas y dependen del tamaño de cada cuadro, así que suben si tú subes la resolución.

lo que dice la tabla

El que se dispara no es el que se llama quemador

En ese video, del segundo al tercero se duplican los cuadros y se duplican los tokens de imagen; del tercero al cuarto solo se agregaron dieciséis cuadros más. O sea que el salto grande no estuvo en el modo con nombre de advertencia: estuvo en el default, que es el que corre cuando tú no dices nada.

Y el primero no está en la misma escala que los otros tres: transcript no gasta un solo token de imagen porque no hay imagen. Cuando lo que buscas se dice en voz alta, ese es el modo correcto, no el modo tacaño.

Cuándo va cada uno

transcriptCuando el valor está en lo que se dice y no en lo que se ve: una entrevista, un podcast, una charla donde la persona habla de frente. No descarga el video y no mira nada, así que es la corrida más barata que existe aquí. Empieza en este modo más seguido de lo que crees, y súbete solo si te falta algo.

efficientCuando quieres el mapa y que la imagen nada más confirme: reconocer en qué secciones está partido, ver si el tutorial sigue siendo el de la versión que tú usas, ubicar en qué minuto empieza lo tuyo. Cincuenta cuadros alcanzan para el mapa; no alcanzan para seguir una secuencia de clics.

balancedEl default, y el que vas a usar casi siempre en tutoriales. Cien cuadros dan para seguir pasos encadenados sin que se pierda la mitad entre foto y foto. Si no tienes una razón para moverlo, este es.

token-burnerSolo cuando balanced ya te falló en ese video en concreto: un movimiento rápido que necesitas ver, una pantalla que aparece y desaparece. Dieciséis cuadros más no arreglan un video mal recortado — casi siempre el problema no era el detalle, era la ventana. Antes de subirle aquí, recorta.

Y si siempre quieres arrancar en otro modo, no lo escribas cada vez: WATCH_DETAIL se deja fijo en el archivo de configuración de la skill, el mismo del que hablamos al instalarla.

Los flags de puntería, que son los que de verdad ahorran

El modo decide cuánto mira. Los flags de puntería deciden dónde mira, y ahí está el ahorro grande: un tutorial de una hora del que te importan cuatro minutos no necesita menos detalle, necesita menos video.

recortar

Cuánto video entra

  • --start y --end: la ventana exacta, en minutos y segundos. Lo que quede fuera no se mira ni se paga.
  • --timestamps: momentos sueltos en vez de un tramo continuo, cuando lo que te importa son tres instantes lejos entre sí.
  • --max-frames: el techo de cuadros, por si quieres apretarlo por debajo de lo que el modo daría.
  • --fps: sobrescribe el muestreo que la skill calcula sola. Súbelo cuando en pantalla cambian cosas rápido — trae su propio tope, así que no crece sin freno.

afinar

Cómo se ve y de dónde sale la voz

  • --resolution 1024: cuadros más grandes para que el texto de la pantalla se lea. Es el flag que salva los tutoriales de interfaz.
  • --whisper groq | openai: cuál de los dos transcribe cuando el video no trae subtítulos propios.
  • --no-whisper: nada de transcribir audio. Si no hay subtítulos, te quedas con lo que se ve.
  • --no-dedup: apaga el descarte de cuadros casi idénticos, para videos donde la escena casi no se mueve.
  • --out-dir: dónde caen los archivos de trabajo, cuando los quieres en una carpeta tuya y no en la temporal que se inventa sola.

El más subestimado de todos es --resolution. Un tutorial de interfaz con los cuadros chicos te devuelve descripciones vagas de menús; con los cuadros grandes te devuelve el nombre exacto del botón, escrito como está escrito.

Cuántos cuadros saca si tú no dices nada

Los cien cuadros del default son un techo, no una cuota fija. Por debajo corre un presupuesto por duración, y en videos cortos ni se acerca:

  • Hasta 30 segundos: unos 30 cuadros.
  • De 30 segundos a un minuto: unos 40.
  • De uno a tres minutos: unos 60.
  • De tres a diez minutos: unos 80.
  • Más de diez minutos: el tope, 100.

el renglón que importa

El tope no crece con el video

Por eso el video medido salió con cien cuadros en el default: dura 49:08, o sea que cayó en el último renglón. Y ahí está el detalle — un video de once minutos y uno de dos horas se llevan los mismos cien cuadros.

De ese punto para arriba el barrido va ralo y entre foto y foto caben cosas enteras. Cuando eso pasa, la salida no es subirle al detalle: es recortar con --start y --end y mirar de cerca el pedazo que te importa.

Tres corridas con puntería, para que no tengas que memorizarte los flags: el tramo, la pantalla y la comparación de dos videos.

Ve nada más este tramo

Un tutorial de una hora donde lo que necesitas dura cuatro minutos. Recortas la ventana y pagas por esos cuatro minutos.

/watch <URL> --start <MM:SS donde empieza lo bueno> --end <MM:SS donde termina>

De ese tramo quiero:

· Qué hace, paso a paso, en el orden en que lo hace.
· Qué escribe o dónde hace clic en cada paso.
· Qué se ve en pantalla cuando le sale bien.

No me resumas el video completo: fuera de esa ventana no te pedí nada. Si el tramo arranca a media explicación y te falta contexto para entenderlo, dime qué minuto anterior habría que incluir en vez de inventar el hueco.

Léeme lo que dice la pantalla

Para tutoriales de interfaz: menús, ajustes, rutas de archivo, texto chiquito. Se suben los cuadros a 1024 de ancho para que el texto sea legible.

/watch <URL> --resolution 1024

Este video es de interfaz, así que lo que me importa está escrito en la pantalla, no dicho en voz alta.

Sácame:
· Cada pantalla por la que pasa, en orden, con el nombre exacto del menú o del botón como aparece escrito.
· Cualquier texto que se lea: rutas, nombres de archivo, valores en un campo, mensajes de error.
· Los ajustes que deja prendidos o apagados.

Copia el texto tal cual se ve, respetando mayúsculas y guiones. Si un cuadro salió borroso y no puedes leerlo con seguridad, dime en qué minuto y márcalo como ilegible — prefiero un hueco declarado que una ruta inventada.

Compara dos videos

Dos tutoriales del mismo tema con seis meses de diferencia. Lo valioso no está en ninguno de los dos: está en qué cambió entre uno y otro.

Vas a mirar dos videos y compararlos. Míralos de uno en uno, con la skill watch, y no me contestes hasta que hayas visto los dos.

Video A (el viejo): <URL>
Video B (el nuevo): <URL>

Después dame:
· Lo que los dos hacen igual.
· Lo que cambió: pasos que ya no existen, pasos nuevos, botones que se llaman distinto, valores que ya no son los mismos.
· Lo que solo aparece en uno de los dos, y en cuál.
· Cuál de los dos seguiría yo hoy, y por qué.

Ordénalo por lo que más me afecta si sigo el viejo sin darme cuenta. Si los dos dicen lo mismo, dímelo en una línea en vez de estirar la comparación.

05 · el ojo largo

Una llave gratis y una conferencia de dos horas

Watch tiene un techo, y no es de calidad: es de tamaño. Cuando de verdad mira, hay que bajar el video y partirlo en cuadros, y todos esos cuadros terminan metidos en el contexto de la conversación. Con quince minutos es cómodo. Con una conferencia de dos horas la cuenta deja de cerrar.

Gemini entra por el otro lado. Entiende URLs de YouTube de fábrica: le pasas el link y él va por el video. No baja nada a tu disco, no saca cuadros y no te llena el contexto de imágenes. Por eso la pieza larga es esta y no la otra.

La llave se saca en AI Studio en menos de un minuto, y el plan gratis ya trae un tope diario de video con el que se puede trabajar de verdad.

Sacar la llave: tres pasos

1

Entra a AI Studio

Con tu cuenta de Google, abre https://aistudio.google.com/apikey. Es la misma página donde después revisas qué llaves tienes vivas, así que vale la pena que se te quede.

2

Create API key

El botón dice eso mismo. Si te pregunta por un proyecto y no tienes ninguno, deja que te cree uno: no hay nada que configurar ahí.

Cópiala en ese momento. Es lo único que necesitas de esta página.

3

Guárdala donde va, no donde caiga

La variable se llama GEMINI_API_KEY. GOOGLE_API_KEY también funciona, y si resulta que tienes las dos puestas, esa segunda es la que gana — revísalo antes de pasarte una tarde peleando con una llave que sí servía.

No la pegues en el chat y no la dejes en un archivo que se suba al repo. Si no sabes dónde ponerla en tu máquina, ese es exactamente el trabajo del primer prompt de abajo.

aviso con fecha

Las llaves estándar dejan de aceptarse después de septiembre de 2026

Las que se crean hoy ya salen como auth keys, así que si acabas de sacar la tuya, no tienes nada que hacer.

El problema es la otra: la que guardaste hace meses en un archivo que ya ni abres. El día que algo que llevaba funcionando empiece a contestarte que no estás autorizado, esta es la primera sospechosa y no tu código. Entra a la misma página de AI Studio y revísala antes de tocar nada más.

Lo que sí y lo que no, antes de que te agarre a media corrida

youtube como entrada

Los límites reales

qué videos
Solo públicos. Los privados y los no listados se rechazan, así que ese video que subiste como oculto para probar no va a entrar.
cuánto al día
El plan gratis topa en ocho horas de video diarias. Suena a muchísimo hasta que empiezas a mandar conferencias completas.
cuántos a la vez
Desde Gemini 2.5 caben hasta diez videos en un mismo pedido. Antes era uno, y por eso los tutoriales viejos te hacen correr uno por uno.
cómo lo mira
Un cuadro por segundo, y los tiempos te los devuelve en minutos y segundos, igual que salen en el reproductor.
qué cuesta
La entrada de video está en preview y hoy no se cobra. Que esté en preview también quiere decir que puede moverse sin avisarte.
límites por minuto
Aquí no vas a encontrar un número: Google quitó la tabla pública. Los de tu cuenta salen en aistudio.google.com/rate-limit.

una nota de plomería

Si acabas metido en la documentación

La forma actual de llamarlo es la Interactions API, donde el video entra como una parte de tipo «video» con su URL adentro. Si te topas con tutoriales que hablan de generateContent y de file_data, no están equivocados: es la generación anterior, sigue funcionando, y es lo que vas a ver en casi todo lo que se escribió antes.

Nada de eso lo escribes tú. Lo digo nada más para que reconozcas cuál de las dos estás leyendo cuando algo no te cuadre con lo que ves aquí.

Dos formas de abrir el ojo largo

Con la llave en la mano hay dos caminos, y no compiten. Uno es para preguntarle a Gemini de frente; el otro es para que Claude Code lo use por ti sin que tú salgas de tu sesión.

la ruta sin código · el cli oficial de google, apache-2.0

npx @google/gemini-cli

brew install gemini-cli

La primera lo levanta sin instalarte nada; la segunda lo deja puesto en tu máquina. Cualquiera de las dos te deja hablando con Gemini desde la terminal, con tu llave ya conectada.

La otra ruta es la que te sirve si ya vives dentro de Claude Code: que él arme la pieza que llama a Gemini, la deje guardada y la pruebe con un video corto antes de que tú la des por buena. No escribes una línea; pegas esto.

Conecta tu llave de Gemini

El ojo largo se abre con una llave gratis de AI Studio. Que él te guíe a sacarla, la guarde donde va y la pruebe antes de que la des por buena.

Quiero conectar Gemini para poder pasarle videos largos de YouTube directo por URL. Guíame de principio a fin.

1. Dime dónde saco la llave: es AI Studio, en https://aistudio.google.com/apikey, con la opción de crear llave. Explícame qué elijo si me pregunta por un proyecto.
2. Dime dónde la guardo en esta máquina para que no quede pegada en el historial de mi terminal ni en un archivo que se suba al repo. La variable se llama GEMINI_API_KEY; si además existe GOOGLE_API_KEY, esa es la que gana, así que avísame si ya tengo una puesta.
3. Haz una prueba de humo con un video corto y público de YouTube, y muéstrame la respuesta cruda para que yo vea que sí lo miró.
4. Si la prueba falla, dime si fue la llave, el video o el límite de la cuenta — y si es límite, mándame a la página de límites de AI Studio en https://aistudio.google.com/rate-limit en vez de adivinarme un número.

Dos cosas que quiero que me digas de una vez:
· Que las llaves estándar dejan de aceptarse después de septiembre de 2026, y qué implica eso para la que acabo de crear.
· Que la forma actual de llamar a Gemini es la Interactions API, y que si encuentro tutoriales viejos hablando de generateContent con file_data no están mal, nada más son de la generación anterior.

Y ya conectado, los dos usos por los que valía la pena todo lo anterior: el video que era imposible de mirar completo, y la tanda que convierte un resumen en una investigación.

Un video largo, entero

Una conferencia de dos horas no se baja: se le pasa la URL a Gemini y él la mira completa. Solo funciona con videos públicos.

Pásale este video de YouTube a Gemini por URL, sin descargarlo: <URL pública de YouTube>

Antes de correrlo, comprueba una cosa y dímela: que el video sea público. Los privados y los no listados se rechazan, y quiero saberlo antes de esperar la respuesta.

De la corrida quiero:
· El índice del video: cada tema con el minuto en que empieza.
· Lo que se dice en cada tema, en dos o tres líneas.
· Las tres partes que me conviene volver a ver yo mismo, con su minuto.

Los tiempos me los das en minutos y segundos, como salen en el reproductor. Y recuérdame antes de arrancar que el plan gratis topa en ocho horas de video al día: si este video se acerca a ese tope, dímelo en vez de estimarme un consumo que tú no puedes ver.

Diez videos de un jalón

Desde Gemini 2.5 caben hasta diez videos en una sola llamada. Ahí es donde deja de ser un resumen y se vuelve una investigación.

Quiero que mires varios videos en una sola corrida de Gemini y me los cruces. Van hasta diez en un mismo pedido; si te paso más, pártelos en tandas y dime cómo los partiste.

Los videos:
<URL 1>
<URL 2>
<URL 3>

Lo que busco: <qué estás investigando — por ejemplo: cómo explican los tres el mismo concepto y en qué se contradicen>

Dame:
· Una tabla con una fila por video: de qué va, cuánto dura, y qué aporta que los otros no.
· En qué coinciden los tres.
· En qué se contradicen, con el minuto de cada versión para que yo vaya a checarlo.
· Qué se quedó sin contestar en los tres.

Cita siempre de qué video sale cada cosa. Si un video no se pudo procesar, dímelo y sigue con los demás en vez de abortar todo.

Ya tienes las dos maneras de mirar. Lo que falta es no dudar cuál abres para cada video, y eso se resuelve con tres preguntas.

06 · ¿Watch o Gemini?

El árbol, para dejar de adivinar

Con las dos piezas puestas, la duda cambia de lugar: ya no es cuál es mejor, es cuál le queda a este video. Y casi siempre se decide con lo que ya sabes antes de abrirlo — dónde vive, cuánto dura, y si lo que buscas se dice o se muestra.

El video está en tu disco, o es un TikTok, un Loom, un video de X — cualquier cosa que no sea un YouTube público.

Watch.

Gemini por URL solo acepta YouTube público: los privados y los no listados se rechazan, y lo que ni siquiera está en YouTube no tiene por dónde entrar. De los dos, Watch es el único que trabaja fuera de ahí.

Lo que necesitas está escrito en la pantalla: el nombre exacto de un menú, una ruta de archivo, un valor en un campo, un mensaje de error.

Watch, con los cuadros a 1024 de ancho.

Gemini mira a un cuadro por segundo y esa perilla no te la presta. Watch sí: --resolution 1024 agranda los cuadros y el texto chiquito se vuelve legible en vez de adivinado.

Es una conferencia larga y pública de YouTube, y lo que quieres es todo lo que se dijo.

Gemini.

No baja nada a tu disco y no te llena el contexto de imágenes. Con Watch, un video de más de diez minutos entra con cien cuadros que se le cargan enteros al contexto. Lo único que hay que cuidar es el tope: el plan gratis deja ocho horas de video al día.

Solo te importa lo que se dijo, y lo que se ve en pantalla te da igual.

Watch, en modo transcripción.

En ese modo ni siquiera descarga el video: no genera un solo cuadro y no te gasta un token de imagen. Si el video trae sus propios subtítulos es casi instantáneo; si no los trae, hay que transcribir el audio y ahí sí se toma su tiempo.

Vas a convertir el video en una skill.

Los dos.

Gemini para el contenido completo, que es lo que sostiene el método; Watch para los cuadros de los momentos donde lo importante está en la pantalla y no en la voz. Primero el panorama, después el acercamiento.

la regla de bolsillo

Si te quedas con una sola línea

Watch mira; Gemini abarca. Cuando lo que buscas es un detalle que se ve, mira. Cuando lo que buscas es entender de qué se habló durante dos horas, abarca.

Y si no te quieres aprender el árbol, no te lo aprendas: descríbele el video y que decida él. Te contesta con la decisión en la primera línea, el motivo en la segunda, y hasta abajo lo que correría.

¿Watch o Gemini?

En vez de memorizar el árbol de decisión, se lo das a él. Le describes el video y te dice por dónde entrarle, con motivo.

Tengo este video y no sé si conviene mirarlo con la skill watch o mandárselo a Gemini por URL. Decide tú y dime por qué.

Lo que tengo: <URL, o la ruta del archivo si está en mi computadora>
Dura: <cuánto>
Es: <público en YouTube / no listado / privado / un archivo local>
Lo que necesito sacarle: <en una frase>

Para decidir, tómalo así:
· Si el archivo está en mi máquina, si el video no es público, o si lo que necesito está escrito en la pantalla y no dicho en voz alta, es watch.
· Si es público, largo, y lo que necesito es entender de qué habló en dos horas, es Gemini.
· Si necesito las dos cosas — la vista general y luego un tramo mirado de cerca — dímelo y encadénalas: primero el panorama, después el acercamiento.

Contéstame con la decisión en la primera línea, el motivo en la segunda, y hasta abajo lo que correrías. Si con lo que te di no alcanza para decidir, pregúntame una sola cosa: la que de verdad cambia la respuesta.

07 · la forja

La tercera pieza la construyes tú

Las dos piezas anteriores te dejan material: la transcripción con sus minutos, las pantallas leídas, el índice de una conferencia de dos horas. Material no es habilidad. Si eso se queda dentro de la conversación, mañana lo vuelves a pedir, pasado también, y cada vez pagas el video otra vez.

La tercera pieza es la que cierra el tubo, y es la única que no se instala: la construyes. Es una skill tuya —la forja— y su único trabajo es agarrar lo que salió del video y escribir otra skill con eso. Ahí está la diferencia con cualquier resumidor: un resumidor te devuelve texto que lees una vez; la forja te devuelve una capacidad que se queda encendida.

No se inventa el formato: se apoya en skill-creator

Antes de escribir nada, la forja abre skill-creator —la skill oficial de creación de skills— y de ahí toma la estructura. No se la saca de la memoria. Si no la tienes instalada, el prompt de abajo se detiene y te lo dice, en vez de improvisar un formato que después no dispara.

Qué es una skill y cómo se arma una a mano no se explica en esta página, a propósito. Si nunca has hecho ninguna, el prerrequisito de esta sección es Skill Creator.

Y si lo que quieres es entender por dentro el archivo que la forja te va a escribir —sus partes, su encabezado, por qué se dispara sin que tú lo llames— eso está desmenuzado en Sistema de Skills.

Los tres trabajos que solo aplican cuando la fuente es un video

1

Separa lo que se dijo de lo que se mostró

En un video son dos fuentes distintas y no valen lo mismo. Lo que se dice es la explicación; lo que aparece en pantalla es el dato exacto: el nombre del menú tal como está escrito, el valor que dejó en el campo, el archivo que abrió. Cuando las dos se mezclan en un solo bloque, la skill termina afirmando como visto algo que en realidad se dedujo del audio.

La forja las guarda aparte y le pone a cada afirmación de dónde salió y en qué minuto. Después, cuando algo no cuadre, sabes a cuál de las dos ir.

2

Tira la parte motivacional y se queda con el procedimiento

Buena parte de un video que funciona está dedicada a convencerte de que el tema importa. Eso hace su trabajo mientras lo ves y estorba adentro de una skill: son frases que no cambian nada de lo que Claude va a hacer y que se comen contexto cada vez que la skill se activa.

La regla con la que corta es sencilla: si una frase no cambia una decisión ni un paso, no entra.

3

Convierte los pasos en instrucciones, no en un resumen

«Primero configura el proyecto» es un resumen. Una instrucción dice qué se hace, en qué orden, con qué criterio se elige cuando hay dos caminos, y qué se evita a propósito.

La prueba es leerlo al revés: si para ejecutar el paso habría que volver al video, todavía es resumen y hay que bajarlo un nivel.

El mismo video, con y sin forja

lo que trae el videoun resumen te dejala forja te deja
Lo que se dijoUn par de párrafos con las ideas principales.El procedimiento con el minuto de cada paso, aparte de lo que se vio.
Lo que se mostróNada. La pantalla no cabe en un resumen de texto.Los nombres exactos de menús, campos y valores, marcados como vistos y no como dichos.
La parte que te motivaCasi todo el espacio, porque es lo que más se repite en el video.Fuera. No es método, es el tono de quien grabó.
Los pasosUna lista de temas en el orden en que salieron.Instrucciones que Claude puede seguir sin ti, con el criterio de cada decisión escrito.
Lo que queda al finalUn texto que lees una vez y se pierde en el historial.Un archivo instalado que se activa solo la próxima vez que hables del tema.

dónde vive

Global o del proyecto: decídelo antes de escribirla

Una skill puede quedar en dos lugares, y el prompt te lo va a preguntar antes de escribir. En ~/.claude/skills es tuya en todos tus proyectos: la forja te sirve igual el lunes en el repo del cliente y el martes en el tuyo. En .claude/skills, adentro del repo, viaja con el equipo: se versiona junto al código y le llega a quien lo clone.

Para la forja lo natural es global, porque no es de un proyecto en particular. Para las skills que la forja escriba, depende: si el método solo aplica a ese repo, ahí se queda.

La regla completa para decidir —y de paso la diferencia entre una skill, una herramienta y un plugin, que casi todo el mundo confunde— está en Global, por proyecto y cómo decidir.

Este es el prompt largo, y es el único de la guía que se pega una sola vez en la vida. Córrelo en el proyecto que quieras: cuando termine, la forja ya vive en tu máquina y de ahí en adelante solo la invocas.

Constrúyeme la forja

El prompt largo que escribe tu skill video-a-skill: la que recibe un video y devuelve otra skill. Se pega una vez; después ya vive en tu máquina.

Vas a construirme una skill propia. Se llama video-a-skill y su trabajo es convertir un video en otra skill.

Antes de escribir nada, abre la skill oficial de creación de skills — skill-creator — y léela completa. Quiero que el formato, el frontmatter y la estructura salgan de ahí, no de tu memoria. Si no la tienes instalada, dímelo y párate: no improvises el formato.

Esto es lo que la skill tiene que hacer cuando yo la invoque:

1. Recibir una entrada, que puede ser una URL de YouTube o la ruta de un archivo de video en mi máquina. Si le doy otra cosa, que me lo diga y se detenga.

2. Decidir sola cómo mirarlo, y decirme qué eligió antes de gastar nada:
   · archivo local, video no público, o información que está escrita en la pantalla → la skill watch.
   · video público y largo, donde lo que importa es entender de qué se habló → Gemini por URL.
   · si necesita las dos, que las encadene: primero el panorama completo, después el acercamiento al tramo que importa.

3. Extraer dos cosas del video: lo que se dice, con marcas de tiempo, y lo que se ve en los momentos donde la pantalla es el contenido. Que no mezcle una cosa con la otra en la salida.

4. Sacar el método, no el resumen: qué se hace, en qué orden, con qué criterio se decide en cada paso, y qué se evita a propósito. Que cite el minuto de cada afirmación.

5. Enseñarme ese método y esperar mi visto bueno antes de escribir la skill. Este alto es obligatorio: es donde yo corrijo lo que entendió mal.

6. Con mi aprobación, escribir la skill nueva: su SKILL.md siguiendo el formato oficial, y la descripción redactada para que dispare sola cuando yo hable de ese tema sin nombrarla.

7. Escribir también sus pruebas de disparo: frases reales con las que debe activarse y frases parecidas del tema de al lado con las que no debe. Correrlas y enseñarme el resultado.

Tres reglas que quiero dentro de la skill, no como recordatorio para ti:

· Antes de escribir un archivo, que revise si ya existe uno con ese nombre. Si existe, que me pregunte si sobrescribo, si guardo aparte o si cancelo. Que nunca sobrescriba sin preguntar.
· Que me pregunte dónde vive la skill nueva: en ~/.claude/skills si la quiero en todos mis proyectos, o en .claude/skills si es solo de este repo.
· Que al terminar me diga la ruta exacta de cada archivo que creó, y qué escribo yo para probarla.

Cuando termines de construir la forja, dime dónde la dejaste tú, cómo la invoco, y hazme una corrida de prueba con un video corto que yo te dé.

08 · la corrida completa

De una URL a una skill instalada, sin escalas

Hasta aquí viste cada pieza por separado: los ojos, la vista larga y las manos. Esta es la corrida entera, que es la que de verdad vas a usar: pegas un link y terminas con una habilidad instalada que se activa sola la próxima vez que hables del tema.

Son siete pasos, y uno solo te interrumpe a media corrida: el cuarto, donde apruebas o corriges lo que entendió. Ese es el que decide si la skill sale buena o sale a medias. No te lo saltes: corregir el método ahí cuesta un mensaje, y corregirlo cuando la skill ya está escrita cuesta rehacerla completa.

1

Le pasas el video y nada más

Una URL de YouTube o la ruta de un archivo que tengas en tu computadora. No le digas cómo mirarlo: esa decisión es del paso 2 y la toma mejor con el video enfrente que tú de memoria.

2

Decide con qué mirarlo, y te lo dice antes de gastar

Watch si el archivo es local, si el video no es público o si lo que importa está escrito en la pantalla. Gemini si es público y largo y lo que necesitas es entender de qué se habló. A veces son los dos, encadenados: primero el panorama completo, después el acercamiento al tramo que importa. Que te enseñe la elección y el motivo antes de correr es lo que te deja pararlo a tiempo.

3

Extrae, separando lo dicho de lo visto

Lo que se dice sale con su minuto. Lo que se ve sale nada más de los momentos donde la pantalla es el contenido. Van en bloques distintos, porque uno es explicación y el otro es dato exacto.

4

Se para y te enseña el método. Este paso es tuyo

Antes de escribir un solo archivo te muestra lo que sacó: qué se hace, en qué orden, con qué criterio se decide, qué se evita. Léelo buscando dos cosas: lo que entendió al revés y lo que era estilo de quien grabó y él tomó como regla. Aquí es donde una skill mediocre se vuelve buena.

5

Escribe la skill, y sus pruebas de disparo junto con ella

El archivo sale con el formato que le dicta skill-creator, y con la descripción redactada para que se active sola cuando hables del tema sin nombrarla. Las pruebas no son un extra: son la mitad del trabajo, y por eso salen en la misma corrida.

6

La instala donde tú le digas

Global si la quieres en todos tus proyectos, del repo si es solo de ese. Te pregunta antes, y si ya existe una con ese nombre se detiene en vez de encimarla.

7

La pruebas tú, hablando normal

No abriendo el archivo para ver si dice cosas ciertas. Hablándole de tu problema como le hablarías cualquier día, sin mencionar la skill, y viendo si aparece sola.

Este es el mismo tubo, pero a mano, en un solo mensaje. Sirve para hacerlo una vez y ver cada paso pasar: si todavía no construiste la forja de la sección anterior, este prompt te deja la skill igual, nada más que sin dejarte la máquina que lo repite.

El prompt maestro: de video a skill

La corrida completa en un solo mensaje: mirar el video, sacar el método, escribir la skill y probar que dispara. Es el prompt que hace todo lo demás innecesario.

Convierte este video en una skill que puedas usar después: <URL o ruta del archivo>

Hazlo en este orden y párate a preguntarme en cualquier punto donde tengas que adivinar algo mío.

1. Decide cómo mirarlo. Si está en mi máquina, si no es público, o si lo importante está escrito en pantalla, úsalo con watch. Si es público y largo, mándalo por URL a Gemini. Dime qué elegiste antes de correrlo.
2. Míralo y sácame el método, no el resumen: qué hace, en qué orden, con qué criterio decide en cada paso, y qué evita. Cita los minutos.
3. Enséñame lo que sacaste y espera mi visto bueno. Aquí es donde yo corrijo lo que entendiste mal, y sale más barato corregirlo ahora.
4. Con eso aprobado, escribe la skill. Usa la skill oficial de creación de skills como guía de formato y no te inventes la estructura.
5. Escríbeme las pruebas de disparo: frases que yo diría de verdad y con las que la skill tiene que activarse sola, y frases parecidas con las que NO debe activarse.
6. Dime dónde la dejaste: en ~/.claude/skills si es para todos mis proyectos, en .claude/skills si es solo para este. Pregúntame cuál antes de escribir.

Si ya existe una skill con ese nombre, no la sobrescribas: dímelo y espera a que yo decida.

Se prueba por disparo, no por contenido

El error de casi todos es abrir el archivo, leerlo, ver que dice cosas ciertas y darla por buena. Que el contenido sea correcto no sirve de nada si Claude nunca la escoge. Una skill que no se activa sola es un documento que escribiste para nadie.

Lo que se prueba es el disparo, y son dos pruebas, no una. Le hablas como hablas de verdad —sin decir el nombre de la skill— y ves si la toma. Y le hablas del tema de al lado para ver si se mete donde no la llamaron. Las dos tienen que salir bien; con la primera sola, lo que tienes es una skill que se activa siempre.

quedó bien

Aparece sola cuando toca

  • Le cuentas tu problema con tus palabras, sin nombrarla, y la toma.
  • Le hablas del tema de al lado y no se mete.
  • Lo que hace se parece al método del video, no a su introducción.
  • Cuando le falta un dato tuyo te lo pregunta, en vez de rellenarlo.
  • La abres en un mes y todavía entiendes por qué cada paso está en ese orden.

quedó mal

Existe en el disco y nunca se usa

  • Tienes que escribir «usa la skill tal» para que pase algo. Eso no es una skill, es un archivo.
  • Se activa en conversaciones que no tienen nada que ver.
  • Repite las frases del video en lugar de decir qué hacer.
  • Trae las manías de quien grabó convertidas en reglas.
  • Dice qué hacer pero no en qué orden ni con qué criterio elegir.

Si algo de la columna derecha te suena conocido, el arreglo casi nunca está en el cuerpo de la skill: está en cómo describiste para qué sirve. Este prompt lo prueba y lo corrige.

Prueba que la skill dispara

Una skill que no se activa sola no existe. Lo que se prueba aquí no es el contenido: es si Claude la escoge cuando toca.

Vamos a probar si la skill <nombre> se activa cuando debe. No quiero que revisemos si está bien escrita: quiero saber si la eliges tú cuando yo hablo normal.

Arma dos listas:
· Diez frases con las que la skill SÍ debe activarse. Escríbelas como yo hablaría de verdad, no con el nombre de la skill adentro. Nada de "usa la skill X".
· Diez frases parecidas con las que NO debe activarse, incluyendo tres que se le acerquen mucho y sean del tema de al lado.

Después córrelas: para cada frase dime qué skill escogerías tú y por qué.

Con el resultado en la mano, dime qué falló:
· Si no dispara cuando debe, el problema casi siempre está en cómo describiste para qué sirve.
· Si dispara cuando no debe, sobra alcance en la descripción.

Propón la corrección exacta, aplícala, y vuelve a correr las veinte. No des la skill por buena mientras alguna falle.

lo honesto

Un video no alcanza para una buena skill

Todo lo de arriba sale de un solo video, y un solo video trae a una sola persona con su forma de trabajar. Lo que salga va a mezclar el método con sus manías, y no hay manera de distinguirlos desde adentro: con una sola fuente, todo parece regla.

El primer video te da el esqueleto. El segundo y el tercero son los que le quitan lo anecdótico: lo que los tres hacen igual es el método, lo que solo hace uno era su estilo. Por eso la última corrida de esta sección no crea nada, mejora lo que ya está.

Cuando tengas el segundo video del mismo tema, no vuelvas a empezar. Pásaselo a la skill que ya existe y deja que se depure sola.

Mejora la skill con un segundo video

La primera versión sale de un solo video, así que sale sesgada. El segundo video es el que separa lo que es el método de lo que era el estilo de esa persona.

La skill <nombre> salió de un solo video, así que trae los tics de esa persona metidos como si fueran ley. Vamos a limpiarla con un segundo video.

El nuevo: <URL o ruta>

Míralo con lo que convenga y luego:
1. Dime en qué coincide con lo que ya está en la skill. Eso es el método de verdad y se queda.
2. Dime en qué se contradicen. Para cada contradicción: qué dice cada uno, y cuál te parece más sólida y por qué.
3. Dime qué trae el nuevo que no estaba, y si vale la pena meterlo o si es cosa suya.
4. Marca lo que en la skill era estilo personal del primer video disfrazado de regla.

Enséñame los cambios propuestos antes de tocar el archivo. Cuando yo apruebe, actualízala y vuelve a correr las pruebas de disparo — si le cambiaste la descripción, es probable que ahora dispare distinto.

Y a la tercera vez, deja de pegarlo

Si ya corriste el tubo dos o tres veces y lo vas a seguir usando, pegar el prompt maestro cada vez es trabajo que puedes dejar de hacer. Un comando propio te deja la corrida entera detrás de una sola palabra, con el alto para aprobar incluido.

El comando que encadena todo

Para no volver a pegar el prompt maestro. Un comando propio que hace la corrida entera: mira el video, saca el método y deja la skill escrita.

Quiero un comando propio para no volver a pegar todo esto. Escríbelo como slash command de este proyecto.

Que se llame video-a-skill y que reciba lo que yo le pase: una URL de YouTube o la ruta de un archivo de video.

Lo que hace, en orden:
1. Mira la entrada y decide con qué mirarla — la skill watch o Gemini por URL — y me dice qué eligió y por qué antes de correr.
2. Saca el método del video, con los minutos citados.
3. Se para y me lo enseña. No sigue hasta que yo apruebe.
4. Con mi aprobación, llama a la forja para que escriba la skill y sus pruebas de disparo.
5. Corre las pruebas y me enseña cuáles pasaron.

Reglas del comando:
· Si no le paso nada, que me pregunte por el video en vez de fallar.
· Si el paso de mirar el video falla — porque no es público, porque falta un binario o porque no hay llave — que me diga cuál de las tres cosas fue y qué hago para arreglarlo. Nada de "hubo un error".
· Que nunca sobrescriba una skill existente sin preguntarme primero.
· Que cierre diciéndome dónde quedó cada archivo.

Cuando lo tengas escrito, dime cómo se invoca y córrelo una vez conmigo mirando, con este video: <URL o ruta>

09 · el agente especializado

Skill, subagente o comando: cuál de los tres necesitas

Ya tienes habilidades saliendo de videos. La pregunta que sigue no es cómo sacar más, es en qué forma guardarlas: hay tres, se parecen mucho desde afuera y no sirven para lo mismo.

Una skill le enseña a Claude a hacer algo, y lo hace ahí mismo, en tu conversación, con todo lo que ya traes cargado. Un subagente le da a ese algo su propio espacio: abre su contexto aparte, trabaja con su criterio y te devuelve el resultado en vez del proceso. Un comando no enseña nada — es el botón que dispara una corrida que tú ya dejaste definida.

formaqué escuándo la eligesdónde vive
SkillUn método escrito que Claude lee solo cuando el tema aparece. Corre dentro de tu conversación.Cuando lo que sacaste del video es una manera de hacer algo y quieres que la aplique sin que se la recuerdes.Con tus demás skills: la carpeta de tu usuario o la del repo, como lo decidiste en la sección 07.
SubagenteAlguien más que trabaja aparte, con su propio contexto y su propio criterio. Te entrega el resultado, no el camino.Cuando el trabajo es largo, cuando te ensucia la conversación, o cuando quieres que lo juzgue alguien con otra cabeza.En la carpeta de agentes del proyecto, .claude/agents/.
ComandoUn atajo que ejecuta los pasos que le escribiste, en orden. No decide: obedece.Cuando ya te cansaste de pegar el mismo prompt largo y siempre haces exactamente lo mismo con él.Con los comandos del proyecto. Lo invocas escribiendo su nombre con diagonal.

Hasta ahí llega esta guía en el tema. Cómo se diseña un agente desde cero, y cómo se reparte y se revisa el trabajo cuando ya tienes varios, ya está contado en otras dos guías de la bóveda y te las dejo en el pie. Lo de aquí es el caso concreto: el agente que no existiría si no hubieras visto esos videos.

Tres agentes que solo existen porque viste esos videos

Ninguno de los tres se descarga hecho. Los tres nacieron de material que ya habías visto y que, si somos honestos, ya se te había olvidado.

01

viralidad

El que sabe por qué explotó

Salió de veinte videos que reventaron: cómo abren, dónde cortan, qué prometen y en qué momento lo cumplen. Le pasas tu guion antes de grabar y te dice qué le falta, no si le gustó.

02

community manager

El que escribe como tú

No aprendió de un manual de marca: aprendió de tu propio canal, del tono con el que ya le hablas a tu gente. Contesta y escribe pies de foto sin que se note que no fuiste tú.

03

copywriter

El que sí se acuerda de las clases

Las clases que compraste, viste una vez y se te fueron. Le das un producto y aplica ese método, no el promedio de lo que hay en internet.

la tesis

El mejor agente es el que tú armas

Dos personas ven el mismo video y salen con dos skills distintas. No es que una haya entendido mal: es que cada quien hace las cosas distinto, le pesa otra parte del método y lo aterriza en un trabajo que no se parece al del otro.

Por eso el agente genérico que te bajas sirve para lo genérico. El tuyo trae adentro el criterio con el que tú decides, y ese no lo puede copiar nadie porque nadie lo tiene escrito. Que dos personas salgan con cosas distintas del mismo video no es el defecto del sistema: es toda la ventaja.

Este prompt escribe el subagente con lo que ya sacaste del video. Fíjate en cómo abre: lo primero que le pides es que te diga si esto de verdad va como subagente. Si le parece que era skill, prefieres enterarte antes de que escriba el archivo.

Genera el agente especializado

Una skill es una capacidad; un subagente es alguien más que trabaja aparte, con su propio contexto. Este prompt escribe el segundo a partir de lo que sacaste del video.

De lo que sacamos de este video quiero un subagente, no una skill. Escríbelo en .claude/agents/ de este proyecto.

En qué se especializa: <por ejemplo: analizar la viralidad de un guion antes de grabarlo / escribir el calendario de contenido de la semana / revisar copy contra la voz de mi marca>

Antes de escribirlo, dime en una línea por qué esto va como subagente y no como skill. Si te parece que en realidad debería ser skill, dímelo y no lo escribas: prefiero la forma correcta a la que te pedí.

El agente tiene que traer:
· Un nombre y una descripción que digan cuándo tomarlo, escritos para que se elija solo cuando el trabajo es suyo.
· El método que sacamos del video, escrito como instrucciones que él sigue, no como un resumen de lo que dijo el video.
· Los criterios con los que decide, incluyendo qué hace cuando la respuesta honesta es "con esto no alcanza".
· Qué NO le toca: el trabajo del que se tiene que salir y devolverme a mí.
· El formato de lo que entrega, para que su respuesta llegue siempre igual.

Dale solo las herramientas que de verdad ocupa, y dime cuáles le diste y por qué. Si no necesita escribir archivos, que no pueda escribirlos.

Al final:
· Si ya hay un agente con ese nombre, pregúntame antes de sobrescribirlo.
· Dime la ruta del archivo que creaste.
· Pruébalo con un caso mío de verdad y enséñame la salida antes de que yo lo dé por bueno.

10 · el arranque

Quince minutos hoy, y la librería completa aquí abajo

Todo lo de arriba se instala una sola vez, y se instala rápido. Lo que sigue son cuatro pasos en orden: no los saltes, cada uno deja lista la entrada del siguiente.

01

Instala Watch y no sigas hasta que el preflight conteste 0

Pega el primer prompt de la librería y deja que él instale, corra el preflight y te traduzca el número que salga. Si faltan binarios, que los ponga antes de tocar cualquier otra cosa.

Sales de aquí con /watch respondiendo en la superficie donde de verdad trabajas.

02

Córrelo contra un video que ya viste

No estrenes los ojos con un video que no conoces: no vas a poder calificar la respuesta. Escoge uno que ya viste y hazle una pregunta cuya respuesta tú ya sepas.

Eso es calibrar. Aquí descubres qué tan literal te contesta, en qué momento te está infiriendo, y cuánto detalle necesitas pedirle de verdad.

03

Saca la llave de Gemini antes de necesitarla

Es la parada más corta de las cuatro: se crea en AI Studio y se prueba con un video público y corto.

La vas a querer el día que te llegue una conferencia de dos horas, y ese día no vas a tener ganas de andar creando cuentas.

04

Arma la forja y hazla parir su primera skill

El prompt de la sección 07 se pega una sola vez. Cuando termine, dale el video que te dio flojera volver a ver y deja que salga con su SKILL.md escrito y con sus pruebas de disparo corridas.

De aquí en adelante ya no pegas prompts largos: invocas lo que construiste.

al minuto quince

Qué tienes puesto cuando terminas

Un comando que mira videos, una llave para los que no vale la pena bajar, y una habilidad tuya que convierte lo primero en lo segundo sin que tú escribas una línea.

Lo que sigue ya no se instala: es la costumbre de no volver a ver un video bueno sin pasarlo por aquí.

La librería completa

Los catorce prompts de uso diario, agrupados por el momento en que los vas a necesitar. Guarda esta sección: es el índice, y con esto ya no tienes que volver a subir a buscarlos. Los tres largos —la forja, el subagente y el comando— se quedan arriba, en sus secciones, porque se pegan una vez y no se andan repitiendo.

Para dejarlo listo

Se corren una vez en la vida. El primero te pone los ojos; el segundo, la vista larga.

Deja Watch instalado y probado

No lo instales tú: que lo instale él y que después te diga qué le falta a tu máquina. El preflight contesta con un número, y ese número es todo el diagnóstico.

Quiero darte ojos. Instala la skill Watch en esta máquina y déjala probada antes de decirme que ya quedó.

El marketplace es bradautomates/claude-video y el plugin se llama watch. Si estamos en Claude Code, agrégalo como marketplace e instala el plugin desde ahí. Si estoy en otro host (Codex, Cursor, Copilot, Gemini CLI), instálala global desde ese mismo repo con el instalador de skills por npx, y dime cuál de las dos rutas usaste.

Después corre el preflight de la skill y tradúceme el código de salida a español:
· 0 — está lista, ya puedo mirar videos.
· 2 — faltan binarios. Dime cuáles de yt-dlp, ffmpeg, ffprobe o python3 no están, y ofrécete a instalarlos antes de tocar nada.
· 3 — es la primera corrida y no hay llave de Whisper. Explícame que solo hace falta cuando el video no trae subtítulos propios.
· 4 — faltan las dos cosas.

Si me toca poner llaves de Whisper, no las metas a mi shell: van en el archivo de configuración de la skill, en ~/.config/watch/.env, con permisos 0600. Dime exactamente qué línea lleva y para qué sirve cada llave.

Cierra diciéndome, en una frase, qué comando escribo yo ahora para probarla.

Conecta tu llave de Gemini

El ojo largo se abre con una llave gratis de AI Studio. Que él te guíe a sacarla, la guarde donde va y la pruebe antes de que la des por buena.

Quiero conectar Gemini para poder pasarle videos largos de YouTube directo por URL. Guíame de principio a fin.

1. Dime dónde saco la llave: es AI Studio, en https://aistudio.google.com/apikey, con la opción de crear llave. Explícame qué elijo si me pregunta por un proyecto.
2. Dime dónde la guardo en esta máquina para que no quede pegada en el historial de mi terminal ni en un archivo que se suba al repo. La variable se llama GEMINI_API_KEY; si además existe GOOGLE_API_KEY, esa es la que gana, así que avísame si ya tengo una puesta.
3. Haz una prueba de humo con un video corto y público de YouTube, y muéstrame la respuesta cruda para que yo vea que sí lo miró.
4. Si la prueba falla, dime si fue la llave, el video o el límite de la cuenta — y si es límite, mándame a la página de límites de AI Studio en https://aistudio.google.com/rate-limit en vez de adivinarme un número.

Dos cosas que quiero que me digas de una vez:
· Que las llaves estándar dejan de aceptarse después de septiembre de 2026, y qué implica eso para la que acabo de crear.
· Que la forma actual de llamar a Gemini es la Interactions API, y que si encuentro tutoriales viejos hablando de generateContent con file_data no están mal, nada más son de la generación anterior.

Para mirar un video

El mismo video, cuatro maneras de entrarle según lo que necesites sacarle y cuánto contexto estés dispuesto a gastar.

Tu primer video

La primera corrida no es «resúmeme esto». Es una pregunta concreta: mirar un video cuesta tokens, y lo que define el gasto es qué le pediste.

/watch <pega aquí la URL del video>

Míralo y contéstame esto y nada más:

<tu pregunta concreta — por ejemplo: qué pasos exactos sigue para configurar la herramienta, en orden, con lo que aparece en pantalla en cada uno>

Reglas para tu respuesta:
· Contéstame con lo que de verdad dice el video. Si algo lo estás infiriendo y no lo viste, márcalo como inferencia.
· Cita el minuto donde sale cada cosa importante.
· Si el video no contesta mi pregunta, dímelo de frente en la primera línea en vez de rellenar con lo que sí trae.

Solo la transcripción, sin bajar nada

Cuando lo que importa es lo que se dice y no lo que se ve. No descarga el video, no saca cuadros y no gasta un solo token de imagen.

/watch <URL> --detail transcript

Quiero nada más lo que se dice. Con eso:

1. Dame la transcripción limpia, por bloques con su marca de tiempo.
2. Debajo, en cinco viñetas, las ideas que de verdad sostienen el video.
3. Dime si la transcripción salió de los subtítulos del propio video o si hubo que transcribir el audio, porque de eso depende qué tan literal es.

Si en algún punto se nota que lo importante está en pantalla y no en la voz — un menú, un número, un archivo que abre — no lo adivines: dímelo y pídeme correrlo otra vez mirando el video.

Ve nada más este tramo

Un tutorial de una hora donde lo que necesitas dura cuatro minutos. Recortas la ventana y pagas por esos cuatro minutos.

/watch <URL> --start <MM:SS donde empieza lo bueno> --end <MM:SS donde termina>

De ese tramo quiero:

· Qué hace, paso a paso, en el orden en que lo hace.
· Qué escribe o dónde hace clic en cada paso.
· Qué se ve en pantalla cuando le sale bien.

No me resumas el video completo: fuera de esa ventana no te pedí nada. Si el tramo arranca a media explicación y te falta contexto para entenderlo, dime qué minuto anterior habría que incluir en vez de inventar el hueco.

Léeme lo que dice la pantalla

Para tutoriales de interfaz: menús, ajustes, rutas de archivo, texto chiquito. Se suben los cuadros a 1024 de ancho para que el texto sea legible.

/watch <URL> --resolution 1024

Este video es de interfaz, así que lo que me importa está escrito en la pantalla, no dicho en voz alta.

Sácame:
· Cada pantalla por la que pasa, en orden, con el nombre exacto del menú o del botón como aparece escrito.
· Cualquier texto que se lea: rutas, nombres de archivo, valores en un campo, mensajes de error.
· Los ajustes que deja prendidos o apagados.

Copia el texto tal cual se ve, respetando mayúsculas y guiones. Si un cuadro salió borroso y no puedes leerlo con seguridad, dime en qué minuto y márcalo como ilegible — prefiero un hueco declarado que una ruta inventada.

Para mirar varios

Cuando el material no es un video sino tres, o es una conferencia que ninguno de los dos va a ver completa.

Compara dos videos

Dos tutoriales del mismo tema con seis meses de diferencia. Lo valioso no está en ninguno de los dos: está en qué cambió entre uno y otro.

Vas a mirar dos videos y compararlos. Míralos de uno en uno, con la skill watch, y no me contestes hasta que hayas visto los dos.

Video A (el viejo): <URL>
Video B (el nuevo): <URL>

Después dame:
· Lo que los dos hacen igual.
· Lo que cambió: pasos que ya no existen, pasos nuevos, botones que se llaman distinto, valores que ya no son los mismos.
· Lo que solo aparece en uno de los dos, y en cuál.
· Cuál de los dos seguiría yo hoy, y por qué.

Ordénalo por lo que más me afecta si sigo el viejo sin darme cuenta. Si los dos dicen lo mismo, dímelo en una línea en vez de estirar la comparación.

Un video largo, entero

Una conferencia de dos horas no se baja: se le pasa la URL a Gemini y él la mira completa. Solo funciona con videos públicos.

Pásale este video de YouTube a Gemini por URL, sin descargarlo: <URL pública de YouTube>

Antes de correrlo, comprueba una cosa y dímela: que el video sea público. Los privados y los no listados se rechazan, y quiero saberlo antes de esperar la respuesta.

De la corrida quiero:
· El índice del video: cada tema con el minuto en que empieza.
· Lo que se dice en cada tema, en dos o tres líneas.
· Las tres partes que me conviene volver a ver yo mismo, con su minuto.

Los tiempos me los das en minutos y segundos, como salen en el reproductor. Y recuérdame antes de arrancar que el plan gratis topa en ocho horas de video al día: si este video se acerca a ese tope, dímelo en vez de estimarme un consumo que tú no puedes ver.

Diez videos de un jalón

Desde Gemini 2.5 caben hasta diez videos en una sola llamada. Ahí es donde deja de ser un resumen y se vuelve una investigación.

Quiero que mires varios videos en una sola corrida de Gemini y me los cruces. Van hasta diez en un mismo pedido; si te paso más, pártelos en tandas y dime cómo los partiste.

Los videos:
<URL 1>
<URL 2>
<URL 3>

Lo que busco: <qué estás investigando — por ejemplo: cómo explican los tres el mismo concepto y en qué se contradicen>

Dame:
· Una tabla con una fila por video: de qué va, cuánto dura, y qué aporta que los otros no.
· En qué coinciden los tres.
· En qué se contradicen, con el minuto de cada versión para que yo vaya a checarlo.
· Qué se quedó sin contestar en los tres.

Cita siempre de qué video sale cada cosa. Si un video no se pudo procesar, dímelo y sigue con los demás en vez de abortar todo.

Para decidir sin adivinar

El árbol de la sección 06, pero contestado por él en vez de memorizado por ti.

¿Watch o Gemini?

En vez de memorizar el árbol de decisión, se lo das a él. Le describes el video y te dice por dónde entrarle, con motivo.

Tengo este video y no sé si conviene mirarlo con la skill watch o mandárselo a Gemini por URL. Decide tú y dime por qué.

Lo que tengo: <URL, o la ruta del archivo si está en mi computadora>
Dura: <cuánto>
Es: <público en YouTube / no listado / privado / un archivo local>
Lo que necesito sacarle: <en una frase>

Para decidir, tómalo así:
· Si el archivo está en mi máquina, si el video no es público, o si lo que necesito está escrito en la pantalla y no dicho en voz alta, es watch.
· Si es público, largo, y lo que necesito es entender de qué habló en dos horas, es Gemini.
· Si necesito las dos cosas — la vista general y luego un tramo mirado de cerca — dímelo y encadénalas: primero el panorama, después el acercamiento.

Contéstame con la decisión en la primera línea, el motivo en la segunda, y hasta abajo lo que correrías. Si con lo que te di no alcanza para decidir, pregúntame una sola cosa: la que de verdad cambia la respuesta.

Para convertirlo en habilidad

La corrida completa, la prueba de que la skill dispara sola, y la segunda pasada que le quita el sesgo del primer video.

El prompt maestro: de video a skill

La corrida completa en un solo mensaje: mirar el video, sacar el método, escribir la skill y probar que dispara. Es el prompt que hace todo lo demás innecesario.

Convierte este video en una skill que puedas usar después: <URL o ruta del archivo>

Hazlo en este orden y párate a preguntarme en cualquier punto donde tengas que adivinar algo mío.

1. Decide cómo mirarlo. Si está en mi máquina, si no es público, o si lo importante está escrito en pantalla, úsalo con watch. Si es público y largo, mándalo por URL a Gemini. Dime qué elegiste antes de correrlo.
2. Míralo y sácame el método, no el resumen: qué hace, en qué orden, con qué criterio decide en cada paso, y qué evita. Cita los minutos.
3. Enséñame lo que sacaste y espera mi visto bueno. Aquí es donde yo corrijo lo que entendiste mal, y sale más barato corregirlo ahora.
4. Con eso aprobado, escribe la skill. Usa la skill oficial de creación de skills como guía de formato y no te inventes la estructura.
5. Escríbeme las pruebas de disparo: frases que yo diría de verdad y con las que la skill tiene que activarse sola, y frases parecidas con las que NO debe activarse.
6. Dime dónde la dejaste: en ~/.claude/skills si es para todos mis proyectos, en .claude/skills si es solo para este. Pregúntame cuál antes de escribir.

Si ya existe una skill con ese nombre, no la sobrescribas: dímelo y espera a que yo decida.

Prueba que la skill dispara

Una skill que no se activa sola no existe. Lo que se prueba aquí no es el contenido: es si Claude la escoge cuando toca.

Vamos a probar si la skill <nombre> se activa cuando debe. No quiero que revisemos si está bien escrita: quiero saber si la eliges tú cuando yo hablo normal.

Arma dos listas:
· Diez frases con las que la skill SÍ debe activarse. Escríbelas como yo hablaría de verdad, no con el nombre de la skill adentro. Nada de "usa la skill X".
· Diez frases parecidas con las que NO debe activarse, incluyendo tres que se le acerquen mucho y sean del tema de al lado.

Después córrelas: para cada frase dime qué skill escogerías tú y por qué.

Con el resultado en la mano, dime qué falló:
· Si no dispara cuando debe, el problema casi siempre está en cómo describiste para qué sirve.
· Si dispara cuando no debe, sobra alcance en la descripción.

Propón la corrección exacta, aplícala, y vuelve a correr las veinte. No des la skill por buena mientras alguna falle.

Mejora la skill con un segundo video

La primera versión sale de un solo video, así que sale sesgada. El segundo video es el que separa lo que es el método de lo que era el estilo de esa persona.

La skill <nombre> salió de un solo video, así que trae los tics de esa persona metidos como si fueran ley. Vamos a limpiarla con un segundo video.

El nuevo: <URL o ruta>

Míralo con lo que convenga y luego:
1. Dime en qué coincide con lo que ya está en la skill. Eso es el método de verdad y se queda.
2. Dime en qué se contradicen. Para cada contradicción: qué dice cada uno, y cuál te parece más sólida y por qué.
3. Dime qué trae el nuevo que no estaba, y si vale la pena meterlo o si es cosa suya.
4. Marca lo que en la skill era estilo personal del primer video disfrazado de regla.

Enséñame los cambios propuestos antes de tocar el archivo. Cuando yo apruebe, actualízala y vuelve a correr las pruebas de disparo — si le cambiaste la descripción, es probable que ahora dispare distinto.

Y el que se queda con la forma

Si te llevas un solo prompt de toda la guía, que sea este. Lo que sirve de un video casi nunca es lo que dijo: es cómo estaba armado.

Sácame el esqueleto reutilizable

No el resumen: la estructura. Qué hace este video que funciona y que yo podría repetir con mi propio tema.

Mira este video y sácame su esqueleto, no su contenido: <URL>

Quiero la forma, no el tema:
· Cómo abre, y cuántos segundos dura antes de entrar en materia.
· Los bloques en los que está armado, en orden, y qué función cumple cada bloque.
· Qué hace en las transiciones para que no me vaya.
· Cómo cierra y qué me pide al final.

Escríbelo como una plantilla que yo pueda llenar con otro tema: en cada bloque, qué va ahí y cuánto dura. Nada de "aquí cuenta una historia" — dime qué tipo de historia y en qué lugar del video.

Al final, dime qué de este esqueleto depende del tema y no se puede reutilizar.

Guía de la comunidad

Esta guía es parte de la bóveda abierta de tododeia.

Las fuentes · todo lo de aquí está verificado

Cada comando, cada flag y cada límite de esta página salió del repo de la skill o de la documentación oficial de Google, verificados el 10 de agosto de 2026. Los números de cuadros, tiempo y tokens de la sección 04 son mediciones del propio repo sobre un video de 49:08 a 1280×720: en tu video van a dar distinto, la proporción entre modos es lo que importa. Y los límites por minuto de Gemini no los vas a encontrar aquí porque Google quitó la tabla — los tuyos los ves en aistudio.google.com/rate-limit.

Sigue por aquí

Una nota honesta

Dos de las tres piezas son prestadas y se mueven sin avisarte. Watch es un proyecto MIT de la comunidad, no de Anthropic, y su pipeline no toca Gemini: baja el video, saca los cuadros y transcribe con los captions o con Whisper. La llave de Gemini es de Google, YouTube como entrada sigue en preview, y las llaves estándar dejan de aceptarse después de septiembre de 2026 — las nuevas ya se crean como auth keys. Si mañana alguna de las dos cambia, revisa el repo y la documentación antes que esta página. La tercera pieza, la forja, sí es tuya: vive en tu disco y esa no la puede apagar nadie.