IVP · Informe de investigación
Publicado el
Semana 1: investigación externa y 8 experimentos
Dos partes. La primera es lo que se aprendió leyendo a otros: qué está resolviendo la industria y la academia en generación de video con IA, en lectura de video por IA, y en transferencia eficiente de datos visuales. La segunda son ocho experimentos propios, corridos y medidos esta semana, cada uno con su evidencia visual.
Parte 1
Investigación externa
Qué está resolviendo la industria y la academia en generación de video con IA, lectura de video por IA, y transferencia eficiente de datos visuales.
1.1
El estado del arte en generación de video con IA
Los modelos líderes y sus arquitecturas. Google Imagen Video genera video de unos 5 segundos en cascada: un modelo base de baja resolución seguido de redes de super-resolución espacial y temporal hasta alcanzar 1280×768 a 24 fotogramas por segundo. OpenAI Sora extiende esto a clips de hasta un minuto con escenas complejas y múltiples personajes. Stable Video Diffusion (código abierto) y las herramientas comerciales Runway Gen-2 y Gen-3 añaden control de fotogramas clave (fijar el primer y el último) y sincronización labial. En paralelo, los NeRF dinámicos (ST-NeRF, DyNeRF) sintetizan escenas 4D desde captura multicámara real, con la ventaja de que cada elemento se puede editar por separado, a un costo de entrenamiento estimado de 900 a 3,000 USD en GPU, frente a los cerca de 30,000 USD reportados para modelos difusivos comparables como DVD-GAN.
Los siete problemas que persisten, con sus métricas de medición
| Problema | Causa técnica | Cómo se mide |
|---|---|---|
| Calidad visual pobre (borrosidad, artefactos) | Resolución baja para economizar cómputo, más difuminado del ruido | FID, LPIPS, SSIM/PSNR |
| Parpadeo e incoherencia temporal | Cada fotograma se genera casi independiente, atención temporal insuficiente | FVD, FVMD, diferencia entre fotogramas adyacentes |
| Inconsistencia de identidad | Sin embedding persistente por personaje entre fotogramas | Distancia de embeddings faciales entre fotogramas |
| Desajuste labial | Pocos modelos integran audio en el proceso generativo | LSE-D, LSE-C |
| Latencia alta | Cientos de pasos de difusión más procesamiento 3D o temporal | Segundos por fotograma generado |
| Costo computacional | GPUs de alto rendimiento (A100 o superior), decenas de miles de USD para entrenar | GPU-horas, TFLOPs |
| Sesgos de datos | Datasets de entrenamiento desiguales en geografía, género, etnia | Análisis demográfico de salidas frente a datos reales |
Las técnicas de corrección selectiva que ya existen, sin regenerar todo el video: segmentación espacial y temporal para aislar la región con error; edición en espacio latente (ajustar pesos de difusión a un solo video, técnica Tune-A-Video); inpainting condicional guiado por texto sobre la región enmascarada (VideoPainter, con doble rama que separa fondo estable de primer plano generado); re-render parcial en pipelines híbridos 3D e IA; y cacheo de representaciones intermedias. HetCache identifica qué partes de la atención de un video-transformer son redundantes (un fondo estable, por ejemplo) y las congela en vez de recalcularlas en cada paso de denoising, con una aceleración medida de aproximadamente 2.7×, con pérdida mínima de fidelidad.
El vacío real que deja este panorama: casi toda la investigación de 2025 y 2026 mejora la composicionalidad dentro de la red neuronal (grafos de escena como condicionamiento de entrada, mejoras en atención y decodificación VAE). No le da al usuario una representación externa, editable, con costo de re-render medido por elemento. Ahí es exactamente donde vive la propuesta de IVP.
1.2
Proxy workflows: la industria ya resolvió esto, pero sin medirlo
DaVinci Resolve y Premiere Pro generan copias de baja resolución para editar fluido y reenlazan al original en la exportación, el mismo principio detrás de la hipótesis H37 de este proyecto (bocetar barato, exportar caro). La diferencia real es que la industria no calcula un punto de equilibrio numérico. Un caso documentado dice literalmente que, para una entrega de un día, generar proxies puede costar más de lo que ahorra: es juicio de editor experimentado, no una curva de costo medida.
En gráficos de tiempo real, el mismo principio aparece en dynamic resolution scaling y en upscalers como AMD FSR: renderizar a resolución reducida y reconstruir le gana al render directo precisamente porque el compositing de múltiples capas escala peor que el rasterizado simple, validado en un paper reciente de renderizado de transparencia (STAR-NT, arXiv 2606.16747). Este es un hallazgo que este proyecto obtuvo de forma incidental en la propia hipótesis H39, y que resulta ser un principio ya conocido en esa comunidad: una señal de que el modelo de costo usado aquí no está inventando física falsa.
Lo que sí es poco común es la combinación específica de una representación editable con costo de re-render medido explícitamente por elemento, más un punto de equilibrio K* formal, más evidencia visual honesta del límite de la aproximación. Casi nadie construye video generativo sobre una representación estructurada externa al modelo: la mayoría edita dentro de la red (latentes, atención, fine-tuning).
El comparativo económico que hay que citar con cuidado: lograr control determinístico fotograma a fotograma en un modelo de difusión hoy suele requerir fine-tuning de un modelo personalizado. Guías de industria agregadas, sin fuente primaria verificada, hablan de 5,000 a 20,000 USD y de 2 a 4 semanas de trabajo. Frente a eso, la corrección quirúrgica por elemento de este proyecto cuesta milisegundos, pero es una comparación de peras con manzanas (un lado genera fotorrealismo, el otro hoy genera rectángulos deterministas) y debe presentarse con esa salvedad explícita.
1.3
Cómo leen video hoy los modelos de IA, y dónde fallan
La sección con más cifras verificadas de las cuatro fuentes de investigación externa.
Los modelos de visión-lenguaje que ingieren video hoy
| Modelo | Ingesta nativa | Tokenización | Límite / costo aprox. |
|---|---|---|---|
| Gemini 1.5 / 2.5 / 3 Pro | Sí (File API, YouTube) | 258 tok/fotograma (66 en baja res.) [Gemini docs] | 1h en resolución media, 3h en baja · ~$0.005/min (Flash) [Gemini pricing] |
| GPT-4o / 4.1 / 5 | No: requiere 2 a 4 fps manual, máx. 100 imágenes | N/D | N/D |
| Claude (Anthropic) | No: máx. 100 imágenes | N/D | N/D |
| Qwen 2.5 / 3 / 3.5-VL | Sí, con FPS dinámico | mRoPE | N/D |
| Amazon Nova | Sí (Bedrock) | 1 fps, tope ~960 fotogramas, reescala a 672×672 [AWS Nova docs] | ~1h · Por tier de Bedrock |
Los benchmarks, y por qué son la cifra más importante del documento
- Video-MME (CVPR 2025, 900 videos, 254 horas): Gemini 2.5 Pro acertó 84.8% frente a 71.9% de GPT-4o [Video-MME, CVPR 2025].
- Video-MME-v2 (2026, más exigente): Gemini 3 Pro obtuvo 49.4 frente a 39.1 del mejor modelo abierto (Qwen3.5) [Video-MME v2, 2026]. La caída de números absolutos entre v1 y v2 muestra que v1 ya estaba saturada.
- VideoZeroBench (2026, verificación estricta espacio-temporal de punta a punta): Gemini 3 Pro, el modelo frontera, respondió correctamente menos del 17% de las veces [VideoZeroBench, 2026]. Este es el hallazgo que debería reordenar cualquier plan de lectura de video con IA: incluso el mejor modelo general del mundo falla en decir dónde está algo con precisión.
- EgoTempo: con un solo fotograma suelto, Gemini Flash acertó 9.1%, casi lo mismo que sin ver nada (10.0% en modo solo texto) [EgoTempo, CVPR 2025]. Un fotograma aislado no aporta casi nada.
- 1H-VideoQA: muestrear 16 fotogramas dio 45.2% de acierto; muestrear todos los fotogramas a 1 fps subió a 72.2% [1H-VideoQA, 2025]. Más fotogramas ayudan, pero la curva se aplana mientras el costo sigue subiendo.
La pieza que resuelve la geometría: SAM 3 y SAM 3.1, de Meta
SAM 3 (19 de noviembre de 2025) introduce Promptable Concept Segmentation: acepta una frase corta (por ejemplo, "pelota roja") o un ejemplar visual y devuelve máscaras con identidad estable para todas las instancias que coincidan, en imagen y video. Tiene 848 millones de parámetros, entrenado sobre 270 mil conceptos únicos, más de 50 veces el vocabulario de benchmarks anteriores [SAM 3, Meta, 2025]. Meta lo diseña explícitamente para usarse como herramienta de percepción dentro de un LLM multimodal: el LLM genera la descripción larga, SAM 3 la traduce a máscara.
SAM 3.1 (27 de marzo de 2026) es un reemplazo directo, sin cambiar la API, enfocado en eficiencia de video: introduce Object Multiplex, una memoria compartida que rastrea hasta 16 objetos en un solo forward pass, en vez de una pasada por objeto. El resultado medido pasó de 16 a 32 fps en H100 con conteo medio de objetos, y llegó a ser hasta 7 veces más rápido con 128 objetos, sin pérdida de precisión de segmentación [SAM 3.1, Meta, 2026].
La cifra más contundente de todo el corpus de investigación: SAM 3.1, un modelo abierto de 848 millones de parámetros, supera a Gemini 2.5 Pro y a OWLv2 en precisión, en escenas concurridas y tareas interactivas de detección y seguimiento [SAM 3.1, Meta, 2026]. Traducido: un modelo abierto y relativamente pequeño le gana a un modelo frontera de propósito general en la tarea exacta que la percepción de video necesita. La geometría no debe pedírsele al VLM generalista, debe venir de un modelo determinista especializado.
Qué formato usar para representar lo percibido
Ningún formato existente cubre las cuatro cosas que un video necesita: identidad, geometría, eventos en el tiempo, y posibilidad de edición.
| Formato | Identidad | Geometría | Eventos | Editable |
|---|---|---|---|---|
| MOT / MOTChallenge | ✅ | ✅ | ❌ | N/D |
| COCO / CVAT | ⚠️ parcial | ⚠️ parcial | ❌ | no pensado para eso |
| Scene graphs (VidSGG) | ✅ | ⚠️ parcial | ✅ | vocabulario cerrado |
| Dense captioning | ❌ | ❌ | ✅ | prosa, no estructura |
| Embeddings (TwelveLabs) | ✅ | ✅ | ✅ | opaco por diseño |
El caso TwelveLabs es la validación de mercado más fuerte encontrada: un jugador comercial (Marengo 3 más Pegasus) convergió de forma independiente al mismo principio de construir el índice una vez y consultarlo muchas, con Pegasus razonando sobre arcos temporales de hasta 2 horas y Marengo con 78.5% de exactitud compuesta en 47 idiomas [TwelveLabs Marengo 3.0]. Cobran cerca de 8 veces más por minuto que una llamada nativa a Gemini y aun así tienen negocio: la amortización funciona. Pero su índice son vectores, no se puede inspeccionar, diferenciar en git, ni editar quirúrgicamente. Ese es exactamente el hueco que un formato simbólico y editable como IVP viene a llenar.
El formato de salida en sí: JSON, TOON o estructurado
- TOON frente a JSON minificado (el benchmark real, no contra JSON con sangría): ahorro real de 20 a 35% en arreglos uniformes (tracklets, registros), pero sobrecosto de 15 a 20% en estructuras profundamente anidadas [Experimento E4, IVP]. Esto es exactamente lo que el propio experimento E4 de este proyecto confirmó con contenido IVP real.
- Las restricciones de formato degradan el razonamiento: un paper de EMNLP 2024 (Tam et al.) midió que forzar salida estructurada estricta cuesta 10 a 15% de degradación en la calidad del razonamiento del modelo, comparado con dejarlo razonar libre y estructurar después [Tam et al., EMNLP 2024].
- El hallazgo incómodo sobre "estructura válida no es lo mismo que valores correctos": un benchmark de salida estructurada de 2026 midió exactitud de valores dentro de estructura sintácticamente válida: 83% con entrada de texto, 67.2% con imagen, apenas 23.7% con audio [Structured Output Benchmark, 2026]. La estructura puede estar perfecta y el contenido mal, un error silencioso que ningún validador de esquema detecta.
La economía real: por qué "100 veces" no es la cifra correcta
Este es el hallazgo más honesto de toda la investigación externa. La intuición inicial de comparar IVP contra leer 20 o 30 fotogramas sueltos es un hombre de paja: el competidor real en 2026 es una sola llamada nativa de video a Gemini, que cuesta cerca de $0.005 por minuto [Gemini pricing], y Google ya ofrece 90% de descuento en caché de contexto reutilizado [Google Context Caching]. En la práctica, es un índice persistente que el proveedor ya vende.
Contra ese competidor bien configurado, el punto de equilibrio K* de un formato como IVP se calcula así: K* = costo de construcción ÷ (costo de una pasada completa − costo de una consulta de texto). Sin caché del proveedor, K* es bajo (2 a 3 consultas) e IVP gana rápido. Con caché del proveedor activado, K* sube considerablemente (entre 20 y 40 consultas aproximadamente) e IVP puede no ganar por costo puro.
La conclusión que vale la pena citar textualmente: "Frente a un competidor bien configurado, IVP no se justifica por costo. Se justifica por lo que el caché no puede hacer: ser inspeccionable, diferenciable, versionable en git, editable quirúrgicamente, y durable más allá del tiempo de vida de un caché de proveedor." El 100× real no vive en la primera lectura, vive en la consulta número K y en la edición quirúrgica.
1.4
Transferencia visual de datos: seis proyectos activos en 2026
Investigación disparada por una pregunta simple: si una imagen puede ser un canal de datos (pantalla a cámara, sin red), ¿puede un video IVP ser su propio contenedor de especificaciones?
| Proyecto | Qué demuestra | Cifra destacada |
|---|---|---|
| txqr (divan, 3.2k★) | QR animados y fountain codes, pantalla a cámara | Primer proyecto en demostrarlo, app iOS funcional |
| cimbar (sz3, 546★) | Matriz de íconos coloreados, mayor densidad que QR | ~10 KB/imagen, más de 100 KB/s |
| heliogram (nuevo) | Transferencia sin instalar nada, geometría autocalibrada | 229.7 KB/s, bit-exacto |
| omd (nuevo) | Módem óptico con modulación adaptativa por región | 33.2 KB/s, 22 de 22 transferencias exitosas |
| meow-decoder | Esteganografía de 6 canales más criptografía poscuántica | 1,084 commits, el más maduro en seguridad |
| cimbar-bigfile | Múltiples streams de fountain codes en paralelo | Más de 100 MB a 106 KB/s |
Los tres principios técnicos con analogía directa a IVP
- No confiar en marcadores ni pilotos: heliogram descubrió que los pilotos tradicionales (bordes, esquinas) pierden el 87.3% de los datos por sesgo estructural; usar los datos ya decodificados y verificados por CRC como referencia es más confiable.
- Los errores concentrados le ganan a los errores dispersos por 7.7 veces: distribuir errores entre fotogramas (interleaving) es contraproducente, heliogram lo midió directamente. Esta es la validación externa más fuerte de que la corrección quirúrgica por elemento, en vez de parchear un poco de todo, es la estrategia correcta.
- Umbral local, no global: cambiar un umbral único por ventanas de 15×15 celdas duplicó el rendimiento de heliogram, de 19.8% a 39.2% de codewords recuperados.
1.5
La pregunta de fondo: ¿leer estructura es más barato que leer píxeles?
Esta es la hipótesis que amarra toda la investigación de lectura de este proyecto. La apuesta es que un modelo que recibe una escena ya descrita como datos (quién, dónde, cuándo) no necesita redescubrir esa estructura mirando cada píxel de cada fotograma. La ganancia de eso crece más que linealmente con la duración del video, porque adivinar desde píxeles crudos se encarece con cada fotograma nuevo, mientras que leer estructura ya resuelta no.
La condición que decide si esto es cierto o es una ilusión contable: la ganancia solo existe si construir esa estructura, de píxel a IVP, es en sí misma barata (lineal). Si construirla exige una pasada de atención global sobre los píxeles crudos, el costo no desaparece, solo cambia de lugar. Por eso el sistema de seguimiento clásico SORT/DeepSORT es la referencia correcta: mantiene estado persistente por objeto y lo actualiza fotograma a fotograma en tiempo lineal, sin releer todo el historial cada vez, el mismo principio detrás de la compuerta H28 de este proyecto.
Parte 2
Resultados de la Semana 1
Ocho experimentos propios, corridos y medidos esta semana. Cada pestaña es un hallazgo con su evidencia visual.
¿Se puede leer una imagen generada y reconstruir su descripción?
La pregunta: Dada una imagen generada por IA a partir de una descripción conocida, ¿el sistema puede leerla de vuelta (color, forma, posición) y reconstruir esa descripción?
El resultado: La primera corrida dio solo 35% de acierto, pero investigar por qué reveló que dos tercios del problema eran errores propios del código, ya corregidos, no límites del modelo de IA. Sobre entradas limpias, la mitad determinista del sistema reconstruye con precisión perfecta (color 5 de 5, posición 5 de 5). Generando la imagen a partir de un boceto propio en vez de solo texto, el acierto subió a 85%, superando el objetivo fijado.
¿Se puede leer video real y extraer su identidad, sin modelos de pago?
La pregunta: ¿Un video corto real se puede convertir en datos (qué objeto es, dónde está, cuánto dura) usando solo modelos pequeños ya entrenados por terceros?
El resultado: El costo de procesar cada bloque de 10 segundos se mantuvo estable: no crece con la duración ya procesada, confirmado en dos videos distintos. La identidad se perdía con más de un sujeto en escena y por temblor de la máscara de segmentación entre fotogramas, ambas causas reales, encontradas y corregidas esta semana.
Una compuerta barata antes del análisis costoso
La pregunta: ¿Medir un cambio simple entre fotogramas (aritmética pura, sin IA) permite decidir cuándo reutilizar el análisis anterior en vez de recalcularlo?
El resultado: 90% de ahorro sobre una secuencia sintética, sin perder ningún cambio real; 69.6% de ahorro (71.2% en tiempo) sobre video real. Un límite real apareció con movimiento continuo (ver exp_H34), que forzó a medir por regiones en vez de un promedio global. Ese ajuste es, sin haberlo buscado, un umbral de calidad local.
El costo de renderizar escala con la resolución, no con la "calidad"
La pregunta: ¿Generar la misma escena a distintas resoluciones cuesta proporcionalmente a los píxeles pedidos, o hay un costo oculto?
El resultado: La relación tiempo por píxel varió solo 21.1% entre la resolución más chica y la más grande (HD), dentro del margen esperado, confirmado también sobre un video completo (previsualización frente a exportación), no solo un fotograma suelto.
Movimiento físico continuo, sin inteligencia artificial
La pregunta: ¿Una trayectoria simple (una pelota rebotando) se puede describir con puntos clave y reproducirse de forma continua y físicamente creíble, sin generar ningún fotograma con IA?
El resultado: Confirmado directamente sobre los píxeles del video renderizado: 3 rebotes con decaimiento realista (30px, luego 18px, luego 10.8px). De paso, este experimento destapó el límite real de la compuerta del experimento H28 y permitió corregirlo en la misma sesión.
El punto de equilibrio K* del boceto barato
La pregunta: ¿A partir de cuántas iteraciones de edición conviene bocetar en baja resolución y exportar en alta al final, en vez de trabajar siempre en alta resolución?
El resultado: K* de 2 sin corrección quirúrgica, K* de 1 con ella. A 30 iteraciones, el flujo combinado resultó 56.7 veces más barato. Expandir una imagen chica en vez de renderizarla directo en grande también gana (2.77 veces), con una pérdida de calidad pequeña y real en los bordes cuando la posición no coincide exactamente con el factor de escala.
¿Ahorra espacio guardar los datos en tablas en vez de anidados?
La pregunta: Sobre contenido realista de un proyecto IVP, ¿guardar los datos como tabla (encabezado declarado una vez más filas) ocupa menos espacio que guardarlos anidados o en JSON minificado?
El resultado: A partir de 3 elementos en la escena, la tabla gana: 13.9% menos que JSON minificado con 3 elementos, hasta 24.8% menos con 30 elementos. Con un solo elemento, la tabla no gana (esperado: el encabezado no se compensa). Confirma, con datos propios, lo que el benchmark TOON externo predice para arreglos uniformes.
Detectar dónde hay texto, sin inteligencia artificial
La pregunta: ¿Una técnica simple (contraste local) puede ubicar en qué parte de un fotograma probablemente hay texto, sin un modelo de reconocimiento?
El resultado: Sobre un caso sintético controlado, cero falsos positivos y precisión perfecta en la ubicación, en menos de 2 milisegundos. Pendiente: probarlo sobre texto real, no sintético, y compararlo formalmente contra un modelo de IA.
Preguntas sobre esta semana
Si algo de este informe no queda claro, o si encuentras un error en una medición, escríbenos.