Alibaba presenta Wan 3.0, una IA capaz de convertir presentaciones y documentos en vídeos ultrarrealistas
Alibaba ha presentado Wan 3.0, su nuevo modelo de inteligencia artificial para generar vídeos a partir de instrucciones escritas, imágenes, clips, audios y documentos. La herramienta puede producir escenas de hasta 30 segundos con movimiento de cámara, diálogos, efectos sonoros y personajes sincronizados con el audio.
Una de sus funciones más llamativas permite transformar una presentación, un PDF o una página web en un vídeo narrado. De este modo, una presentación de PowerPoint puede convertirse en una pieza audiovisual con explicaciones habladas, animaciones y una puesta en escena creada automáticamente por la IA.
Vídeos de hasta 30 segundos a partir de múltiples referencias
Wan 3.0 amplía de forma notable las posibilidades de generación respecto a su predecesor. El modelo puede combinar en una misma petición hasta diez imágenes, cinco vídeos y cinco archivos de audio, además de un documento o una página web que sirvan como contexto.
El usuario solo tiene que escribir un prompt, es decir, una instrucción en lenguaje natural que describe lo que quiere obtener, y adjuntar los materiales de referencia. La IA analiza esos elementos y construye un clip que intenta mantener la coherencia entre el contenido, el movimiento y el sonido.
La duración máxima se ha duplicado frente a la generación anterior, aunque no todos los vídeos tienen que llegar a los 30 segundos. Wan 3.0 permite seleccionar la extensión de forma manual, segundo a segundo, o dejar que el sistema recomiende una duración adecuada según la complejidad de la instrucción.
Audio generado automáticamente y sincronizado
Una de las principales novedades de Wan 3.0 es que el audio se genera por defecto. Los personajes pueden hablar o cantar, mientras la herramienta incorpora sonidos ambientales que tratan de encajar con lo que sucede en pantalla.
Esta capacidad permite crear, en una sola generación, una escena con diálogos, música o efectos de ambiente. También es posible solicitar el vídeo sin sonido cuando el usuario prefiera añadir posteriormente una locución, una banda sonora o efectos editados de forma manual.
La sincronización entre imagen y audio es especialmente relevante en vídeos explicativos y anuncios breves. En este contexto, el modelo no solo debe producir imágenes atractivas, sino también coordinar el movimiento de los labios, las acciones de los personajes y los sonidos asociados a cada escena.
De un PowerPoint a una presentación audiovisual
Wan 3.0 puede leer el contenido de un PDF, una presentación o una página web para utilizarlo como base de un vídeo. Esta función abre la puerta a convertir documentos técnicos, materiales formativos o presentaciones corporativas en piezas narradas con una intervención mínima del usuario.
Por ejemplo, una presentación con varias diapositivas puede servir como referencia para crear un vídeo que explique sus puntos principales mediante escenas, textos en pantalla y voz. La herramienta no se limita a reproducir las diapositivas: interpreta la información y la utiliza para plantear una secuencia audiovisual.
Existe, eso sí, una limitación importante: en cada generación solo se puede introducir un documento o una página web. No es posible combinar ambos tipos de fuente al mismo tiempo dentro de una única petición.
Más estabilidad en textos, interfaces y gráficos
Alibaba también ha mejorado la representación de elementos digitales, como interfaces de programas, gráficos en movimiento y textos integrados en la imagen. Este tipo de contenido suele ser uno de los más difíciles para los generadores de vídeo, ya que las letras y los controles pueden cambiar o deformarse entre fotogramas.
Con Wan 3.0, la compañía asegura que los rostros y los textos presentan menos inconsistencias que en la versión anterior. El objetivo es facilitar la creación de videotutoriales, demostraciones de software y contenidos formativos en los que la precisión visual resulta esencial.
Resolución configurable y acceso en fase beta
Los vídeos se pueden generar en resoluciones de 480p, 720p y 1080p. También es posible escoger entre relaciones de aspecto fijas o adaptables, una opción útil para preparar contenidos destinados a distintas plataformas, como vídeos verticales para redes sociales o piezas panorámicas para una web.
Wan 3.0 ya está disponible en beta pública a través de Model Studio, la plataforma de desarrollo de inteligencia artificial de Alibaba Cloud. Al encontrarse todavía en fase de pruebas, el rendimiento, los tiempos de generación y la disponibilidad pueden variar.
Alibaba orienta el modelo a profesionales que necesitan producir anuncios cortos, materiales de formación, vídeos técnicos o contenidos para redes sociales. La compañía también contempla su uso en el entrenamiento de robots, donde los vídeos generados pueden ayudar a representar acciones y escenarios concretos.
El lanzamiento se produce pocas semanas después de la presentación de Qwen 3.8-Max, el modelo de lenguaje de Alibaba con el que la empresa busca competir en la gama alta frente a sistemas como Claude y ChatGPT. Con Wan 3.0, su estrategia amplía el foco desde el texto hacia la generación multimedia, con una herramienta capaz de integrar documentos, imágenes, vídeo y audio en una misma creación.
