ByteDance prepara un modelo de vídeo espacial en tiempo real basado en Seedance para crear mundos virtuales interactivos
ByteDance ha decidido que el vídeo generativo ya no es suficiente. El gigante tecnológico chino, propietario de TikTok, está preparando un modelo de inteligencia artificial diseñado para la generación de vídeo espacial en tiempo real, una tecnología que permitirá a los usuarios crear y habitar mundos virtuales interactivos en lugar de limitarse a contemplar clips pregrabados. El proyecto, supervisado personalmente por el fundador de la compañía, Zhang Yiming, está basado en Seedance, el modelo de generación de vídeo cinematográfico que ya utilizan creadores de todo el mundo, y su lanzamiento podría producirse el próximo mes de octubre, aunque las fuentes consultadas advierten que los planes aún podrían sufrir cambios.
La diferencia entre Seedance y este nuevo modelo es conceptual, no solo técnica. Seedance genera vídeos de alta calidad a partir de prompts de texto o imagen, pero el resultado es una pieza cerrada, un archivo que se reproduce de principio a fin. El nuevo modelo, en cambio, genera entornos tridimensionales que responden a la voz y el movimiento del usuario en tiempo real, con una latencia de apenas 0,05 segundos y una reproducción de 20 fotogramas por segundo. La experiencia que promete es la de "entrar" en el vídeo, no la de verlo. Y los ámbitos de aplicación que ByteDance está explorando son tres: retransmisiones en directo, series de formato breve y videojuegos.
Para entender la magnitud de lo que ByteDance está construyendo, basta con mirar la arquitectura que hay detrás. Zhang Yiming no solo está coordinando el desarrollo del modelo, sino que ha movilizado recursos de todas las unidades de negocio de la compañía para integrar tres piezas que hasta ahora funcionaban por separado: los modelos de IA de ByteDance, su infraestructura de computación en la nube y Pico, su división de hardware de realidad virtual y aumentada. El objetivo es crear un ciclo cerrado en el que la IA genera los mundos, la nube los procesa y el visor Pico los hace accesibles al usuario. Es una apuesta por el ecosistema completo, no por una tecnología aislada.
El precedente más cercano a lo que ByteDance está desarrollando es Genie, el modelo de Google DeepMind que permite a los usuarios interactuar con un mundo renderizado en tiempo real. Genie se lanzó a principios de 2026 y fue recibido como una revolución: por primera vez, una IA podía generar entornos dinámicos con interacción en tiempo real durante varios minutos. La diferencia es que Genie es un prototipo de investigación, mientras que ByteDance parece estar construyendo algo con vocación de producto comercial, integrado en su ecosistema de plataformas de contenido y hardware. La compañía ya ha demostrado con Seedance que puede llevar modelos de vanguardia al mercado masivo, y todo apunta a que este nuevo modelo seguirá la misma estrategia.
La decisión de ByteDance de entrar en el terreno de los "world models" no es improvisada. Según reportes internos, la compañía lleva desde 2025 explorando el enfoque VLA (visión-lenguaje-acción), una arquitectura que combina la percepción visual, el procesamiento del lenguaje y la generación de acciones para simular la interacción con entornos físicos. A principios de 2026, el responsable de IA de ByteDance, Wu Yonghui, estableció un objetivo explícito para el equipo de Seed: lanzar al menos una versión de un world model antes de final de año, con un rendimiento comparable al de Genie 3 de Google. Los world models fueron designados como una de las cuatro prioridades estratégicas de ByteDance para el año, junto con mantener el liderazgo en modelos de vídeo, mejorar la codificación con IA y comercializar su asistente Doubao.
La supervisión personal de Zhang Yiming es un indicador de la importancia que la compañía otorga a este proyecto. No es habitual que el fundador de una empresa del tamaño de ByteDance se involucre directamente en el desarrollo técnico de un producto. Las fuentes consultadas por Bloomberg señalan que Zhang ha estado coordinando esfuerzos entre unidades de negocio y destinando recursos de cómputo a un proyecto que, según los reportes internos, aún no ha alcanzado los resultados esperados. Esa brecha entre expectativas y realidad podría ser precisamente la razón por la que el fundador ha decidido supervisar el trabajo de cerca.
Si el modelo llega a buen puerto, el impacto en la industria audiovisual podría ser tan profundo como el que tuvo la propia Seedance. Los creadores de TikTok tendrían acceso a una herramienta que les permitiría construir escenarios virtuales en los que sus seguidores podrían interactuar en tiempo real, no solo comentar. Las series de formato breve, ese género híbrido que ya está transformando el consumo de ficción en móviles, podrían convertirse en experiencias inmersivas donde el espectador elige qué camino toma la historia. Y los videojuegos, que ya utilizan IA generativa para crear contenido procedural, tendrían un motor capaz de generar mundos completos a partir de una descripción textual.
Pero más allá de las aplicaciones inmediatas, lo que ByteDance está construyendo es una infraestructura para lo que algunos llaman "AGI visual". Los world models no solo generan imágenes bonitas; aprenden a simular las reglas físicas del mundo real, desde la gravedad hasta la interacción entre objetos. Esa capacidad tiene aplicaciones que van mucho más allá del entretenimiento: robótica, vehículos autónomos, simulación científica. Zhang Yiming lo ha expresado en términos de "flywheel": el modelo de vídeo espacial actúa como un motor que conecta los modelos de IA y la nube de ByteDance con sus plataformas de contenido y su hardware Pico, generando un ciclo de retroalimentación que acelera el desarrollo de todos los componentes. Es la misma lógica que ha llevado a Google a desarrollar Genie y a Meta a invertir miles de millones en sus Quest.
La IA - Inteligencia Audiovisual, como marco conceptual, encuentra en este proyecto un ejemplo de manual. No se trata de una IA que sustituye al creador humano, sino de una herramienta que amplía radicalmente su paleta expresiva. Un director de series cortas que hasta ahora solo podía elegir entre planos fijos y movimientos de cámara tiene ahora la posibilidad de invitar al espectador a caminar por la escena, explorar los rincones de un decorado o desbloquear tramas alternativas mediante sus decisiones. La frontera entre autor y audiencia se difumina, y en ese difuminado emerge un nuevo lenguaje narrativo que aún no tiene nombre.
ByteDance no ha confirmado oficialmente la fecha de lanzamiento ni las especificaciones finales del modelo. Un portavoz de la compañía declinó hacer comentarios cuando fue contactado por Bloomberg. Pero la información filtrada es consistente en varios medios internacionales y apunta a un lanzamiento inminente. Si se confirma, ByteDance se unirá a Google y Meta en la carrera por los world models, un territorio que Fei-Fei Li y Yann LeCun, dos de los científicos más influyentes de la IA, consideran crucial para el futuro de la inteligencia artificial. La pregunta ya no es si los mundos virtuales generados por IA llegarán a ser viables. La pregunta es quién controlará las plataformas en las que se construirán, y qué tipo de experiencias viviremos dentro de ellas.
Encuentra los detalles del proyecto y las declaraciones de las fuentes en el artículo original de Bloomberg Línea: https://www.bloomberglinea.com/negocios/bytedance-duena-de-tiktok-prepara-una-ia-de-video-espacial-en-tiempo-real-para-retar-a-meta-y-google/