Contenidos
- El problema habitual del vídeo generado por IA
- Qué es Referencia Omni de DomoAI
- Escena 1: el ultimátum del sistema
- Escena 2: acorralado dentro del portal
- Escena 3: el despertar y la voz sincronizada
- Los límites reales de Referencia Omni
- Precios, Relax Mode y primeras pruebas de Referencia Omni
- Preguntas Frecuentes
Crear una historia de acción con inteligencia artificial ya no consiste solo en escribir una frase y esperar un milagro. El gran problema aparece cuando quieres unir varias escenas: cambias de cámara, cambia el plano, cambia el entorno y, de repente, el protagonista deja de parecerse a sí mismo. Eso es justo lo que he querido poner a prueba con DomoAI y su función Referencia Omni, disponible con el modelo Seedance 2.5. El objetivo era muy sencillo de explicar, aunque no tanto de conseguir: crear una historia corta de tres escenas, manteniendo mi cara, mi ropa y mi identidad desde el primer fotograma hasta el último.
El resultado es una secuencia de entre 60 y 90 segundos completamente generada por IA. Sin Photoshop, sin editar manualmente caras entre planos y sin tener que ser experto en arte, porque en eso soy un desastre. La historia tiene ultimátum, persecución, derrota y despertar final. Y sí, el protagonista soy yo durante todo el vídeo.
El problema habitual del vídeo generado por IA
Las herramientas de generación de vídeo con IA han mejorado muchísimo, pero todavía hay un punto donde muchas se rompen: la consistencia del personaje.
Puedes lograr un clip espectacular de una persona corriendo, luchando o hablando. Pero, cuando intentas generar el siguiente plano, esa persona puede cambiar de rostro, de ropa, de edad o incluso de estilo visual. Si quieres hacer una historia con varios clips conectados, eso mata completamente la sensación de continuidad.
Antes, la solución habitual consistía en escribir prompts larguísimos. Había que describir una y otra vez:
- La apariencia física del personaje.
- La ropa y los detalles visuales.
- El tipo de plano y el movimiento de cámara.
- La acción que sucede.
- El ambiente, la luz y el estilo de la escena.
Y luego tocaba regenerar muchas veces hasta obtener algo mínimamente usable. Aun así, que el personaje mantuviera su identidad durante movimientos bruscos de cámara era una lotería.
Referencia Omni ataca el problema desde otro enfoque: en lugar de pedirle a la IA que imagine todo a partir de texto, le das materiales de referencia reales. Imágenes, vídeos y audios pueden entrar juntos en una misma generación.
Qué es Referencia Omni de DomoAI
La función Referencia Omni de DomoAI permite combinar varias fuentes de información en un único vídeo generado. Puedes subir imágenes para definir la identidad de un personaje, un vídeo para transmitir el movimiento de cámara o la acción, y un audio para controlar la voz y la sincronización labial.
La idea es muy potente: cada referencia cumple una función concreta y la IA combina todo en lugar de obligarte a describirlo todo con palabras.
En una producción como esta, las referencias se utilizan así:
- Imágenes: sirven para conservar la cara, el cuerpo, la ropa y la identidad visual del personaje.
- Vídeo: marca el tipo de movimiento, la cámara y el ritmo de la acción.
- Audio: permite sincronizar voz, labios y timing en el mismo clip.
Esto es especialmente útil para crear cortos, escenas cinemáticas, anuncios, reels narrativos o cualquier proyecto en el que un mismo personaje deba aparecer en distintos lugares sin transformarse en otra persona cada dos segundos.
Escena 1: el ultimátum del sistema
La primera escena debía establecer el personaje y el conflicto. La historia comienza con un chico en su rutina habitual que recibe un mensaje de sistema con dos opciones bastante poco agradables: entrar en un portal o morir.
Para generar este primer momento, subí varias fotos mías tomadas desde ángulos distintos. Fotos de frente, de perfil, de espaldas, desde arriba y desde abajo. También preparé referencias de ropa, postura y expresión.
Este detalle es importante. Si solo aportas una imagen frontal, la IA tiene menos información para reconstruir a la persona cuando cambia la perspectiva. Al proporcionar varias referencias, entiende mucho mejor cómo es el personaje desde diferentes posiciones.
El prompt de esta escena se centraba en una situación muy concreta: una persona recibe un ultimátum repentino durante su vida cotidiana. No hacía falta convertirlo en una descripción interminable. Las imágenes ya aportaban gran parte de la información visual.
El punto delicado era controlar dos elementos:
- La ventana del sistema, para evitar texto confuso o ilegible.
- El timing del zoom y de la reacción, para que el miedo del personaje no resultara plano.
El clip generado mantiene mi cara y mi ropa mientras reacciono al mensaje. Esa expresión de miedo se convierte en el puente hacia las siguientes escenas. Y ahí está precisamente la gracia: no es un personaje nuevo inspirado en mí, sino el mismo personaje que sigue dentro de la historia.
Escena 2: acorralado dentro del portal
La segunda escena eleva la acción. El personaje ya ha cruzado el portal y aparece rodeado, sin fuerzas y cada vez más cerca de caer derrotado.
Aquí entran en juego dos referencias simultáneas. Por un lado, las mismas imágenes del personaje utilizadas antes. Por otro, un vídeo de referencia con el movimiento de cámara que quería recrear. En este caso, se utilizó un vídeo de stock de Canva con una cámara inestable, como si alguien estuviera huyendo.
El prompt indicaba que el resultado debía combinar ese movimiento errático de cámara con la identidad del protagonista de la primera escena. Es decir, la IA debía conservar quién era el personaje mientras adaptaba el comportamiento visual del vídeo de referencia.
Este tipo de plano es una prueba bastante seria. Cuando la cámara se mueve de forma brusca, hay cambios de perspectiva y el personaje pasa de primera a tercera persona, muchas herramientas fallan. La cara cambia, el cuerpo se deforma o la ropa deja de coincidir.
En este caso, la referencia visual y la referencia de movimiento se combinan para crear dos momentos conectados:
- Una sensación de persecución y amenaza desde una cámara cercana.
- El personaje ya rodeado, perdiendo sus fuerzas y cayendo de rodillas.
La escena no necesita explicar demasiado. Se entiende perfectamente: el protagonista está perdido. Su energía se agota, no tiene salida aparente y el conflicto llega al punto más bajo antes del desenlace.
Escena 3: el despertar y la voz sincronizada
La última escena necesitaba algo más que continuidad visual. El personaje tenía que hablar. Y no valía con poner una voz por encima y cruzar los dedos para que encajara.
Normalmente, el vídeo y el audio se generan o editan por separado. Después toca sincronizar labios, voz y movimiento manualmente. El problema es que, si la frase no encaja con el giro de cámara, con la expresión facial o con el momento de la acción, se nota muchísimo.
Para esta escena grabé una frase de activación con mi propia voz: “Sistema, actívate”. Ese audio se sube como referencia junto con los materiales visuales del personaje.
La inteligencia artificial genera el clip sincronizando la voz, el movimiento de labios y el ritmo de la escena a la vez. El personaje pasa de estar de rodillas y prácticamente derrotado a recuperar el control de la pelea con una sola frase.
Es el cierre de la historia: ultimátum, caída y despertar. Tres escenas distintas, varios clips y un mismo protagonista de principio a fin.
Los límites reales de Referencia Omni
Conviene ser realistas con las capacidades de la herramienta. Referencia Omni no elimina la necesidad de pensar una escena ni convierte cualquier idea en una película perfecta con un clic. Pero sí da un nivel de control muy superior al de una generación basada únicamente en texto.
Cada generación admite hasta:
- 30 imágenes de referencia.
- 10 vídeos de referencia.
- 10 audios de referencia.
- 50 recursos en total para orientar el resultado.
Además, en Referencia Omni se puede especificar el primer y el último fotograma. Esto permite controlar cómo empieza y cómo termina cada clip, algo muy útil si quieres enlazar varias escenas y evitar cortes que parezcan aleatorios.
Si vas a trabajar una historia con continuidad, mi recomendación es clara: prepara buenas referencias antes de generar. Haz fotos del personaje desde varios ángulos, mantén consistente la ropa si eso importa para la historia y usa vídeos de movimiento cuando necesites cámaras complejas o acciones concretas.
Precios, Relax Mode y primeras pruebas de Referencia Omni
DomoAI ofrece tres planes de precio y se posiciona como una alternativa más económica que otras herramientas parecidas. En los planes Standard y Pro, algunas funciones disponen de Relax Mode.
Las funciones compatibles con ese modo no consumen créditos, por lo que se pueden hacer generaciones sin límite dentro de esas opciones concretas. Ojo, eso no significa que absolutamente todo sea ilimitado, pero sí es una forma interesante de experimentar sin que cada prueba adicional suponga gastar más créditos.
Si quieres probar la generación de vídeo con imágenes, vídeo y audio de referencia en una misma creación, puedes crear tu primer vídeo con DomoAI.
Y si quieres ir más allá de usar herramientas sueltas y aprender a aplicar inteligencia artificial en proyectos reales, tienes disponibles cursos de inteligencia artificial y formación práctica para construir una base mucho más sólida.
La conclusión es sencilla: generar vídeo con IA deja de ser una colección de clips desconectados cuando puedes controlar identidad, movimiento y voz con referencias reales. Ahí es donde una idea empieza a parecer una historia.
Preguntas Frecuentes
¿Qué es Referencia Omni de DomoAI?
Es una función que permite combinar imágenes, vídeos y audios como referencias para generar vídeos con mayor control y consistencia.
¿Referencia Omni permite mantener el mismo personaje entre escenas?
Sí. Puedes usar varias imágenes del personaje para conservar su rostro, cuerpo, ropa e identidad visual en diferentes planos.
¿Puedo usar mi propia voz en los vídeos generados?
Sí. Puedes añadir un audio de referencia para sincronizar la voz con los labios y el ritmo de la escena.
¿Cuántas referencias se pueden utilizar?
Hasta 30 imágenes, 10 vídeos y 10 audios, con un máximo de 50 recursos por generación.
¿Para qué tipo de proyectos sirve Referencia Omni?
Es especialmente útil para cortos, escenas de acción, anuncios, reels y vídeos narrativos que necesitan continuidad entre diferentes escenas.