๐ข๐บ๐ป๐ถ: ๐น๐ฎ ๐๐ ๐พ๐๐ฒ ๐พ๐๐ถ๐ฒ๐ฟ๐ฒ ๐ต๐ฎ๐ฐ๐ฒ๐ฟ๐น๐ผ ๐ง๐ข๐๐ข
Google estรก a punto de soltar Gemini Omni, su nuevo modelo de generaciรณn de vรญdeos. Todavรญa no lo ha anunciado oficialmente (la presentaciรณn esperada es en Google I/O, 19-20 de mayo), pero las filtraciones ya nos muestran quรฉ se trae entre manos. Y sinceramente, tiene pinta de ser bastante increรญble:
๐ Audio nativo en una pasada: Se acabรณ grabar vรญdeo y luego meter sonido por separado. Omni genera imagen y audio sincronizado todo junto.
๐ Ediciรณn conversacional: Le dices quรฉ cambiar y listo: “cambia el coche rojo por uno negro”, “suaviza ese diรกlogo”. El modelo reescribe solo esa parte, fotograma a fotograma. Sin volver a generar todo.
๐Memoria larga: Omni mantiene todo un cortometraje en memoria de trabajo. Esto significa que los personajes mantienen su cara, su ropa, su estilo entre escenas.
๐ Texto que funciona: Omni genera texto legible en vรญdeos. Un profesor escribiendo ecuaciones en una pizarra, signos en una tienda, diรกlogos subtitulados. Funciona realmente bien. La mayorรญa de IA aรบn falla en esto.
No serรก solo un generador de vรญdeos especializados como el resto. Omni podrรญa manejar imagen, vรญdeo y audio en una sola arquitectura.
Google tenรญa sus modelos divididos: Veo para vรญdeo, otros para imรกgenes, Gemini para texto. Con Omni, apuesta por la unificaciรณn. Un solo modelo para todo. Si funciona como esperan, es el cambio mรกs importante que ha hecho Google en generaciรณn de contenido en aรฑos.
๐ฅ Esperemos que las filtraciones sean ciertas y que en mayo tengamos esta bomba disponible. Si funciona como promete, va a ser increรญble para trabajar con vรญdeos.