๐๐น๐๐ ๐ฏ – ๐ฉรญ๐ฑ๐ฒ๐ผ๐ ๐ฐ๐ผ๐ป ๐ฎ๐๐ฑ๐ถ๐ผ๐ ๐๐ถ๐ป๐ฐ๐ฟ๐ผ๐ป๐ถ๐๐ฎ๐ฑ๐ผ๐
Presentan FLUX 3, y no es “otro generador de vรญdeo” mรกs. Es un modelo multimodal entrenado desde cero con imagen, vรญdeo Y audio a la vez, en una sola arquitectura.
ยฟQuรฉ significa esto en la prรกctica?
โ Genera clips de hasta 20 segundos con audio nativo sincronizado: pasos, golpes, diรกlogo, todo cae exactamente donde toca la acciรณn en pantalla
โ Soporta texto a vรญdeo, imagen a vรญdeo, vรญdeo a vรญdeo y transiciones por keyframes
โ Diรกlogo multilingรผe y expresiones faciales mรกs naturales
โ Se pueden encadenar varios clips para crear secuencias mรกs largas
Lo mรกs curioso: el mismo “cerebro” que genera vรญdeo tambiรฉn estรก entrenando robots. Audi ya lo estรก probando en producciรณn para tareas de manipulaciรณn fรญsica.
Por ahora, FLUX 3 Video y Action estรกn en acceso anticipado (API y partners). La parte de imagen llega en las prรณximas semanas, y habrรก una versiรณn “Dev” de pesos abiertos mรกs adelante este aรฑo.
ยฟYa has probado algรบn generador de vรญdeo con audio sincronizado? ยฟCuรกl te ha sorprendido mรกs este aรฑo?