Meta acaba de dar un importante golpe en la mesa con el lanzamiento de Muse Image y la presentación de la versión preliminar de Muse Video, sus primeros modelos de generación de contenido multimedia con IA desarrollados por su división Meta Superintelligence Labs.
Introducing Muse Image and Muse Video, the first media generation models developed by Meta Superintelligence Labs. Muse Image is our most advanced image generation model yet. It follows instructions faithfully, edits with precision, composes from multiple references, and draws… pic.twitter.com/byNpQZO1RW — AI at Meta (@AIatMeta) July 7, 2026
Introducing Muse Image and Muse Video, the first media generation models developed by Meta Superintelligence Labs.
Muse Image is our most advanced image generation model yet. It follows instructions faithfully, edits with precision, composes from multiple references, and draws… pic.twitter.com/byNpQZO1RW
— AI at Meta (@AIatMeta) July 7, 2026
Muse Image se trata del modelo de generación de imágenes más avanzado de Meta hasta la fecha. Según ha explicado la compañía: “sigue las instrucciones al pie de la letra, edita con precisión, compone a partir de múltiples referencias y utiliza Instagram para crear contexto social.“.
Uno de los atributos principales de Muse Image es el hecho de que funciona como un agente, ya que es capaz de utilizar herramientas de búsqueda y codificación para crear imágenes más precisas, posee capacidades de autoperfeccionamiento y es capaz de optimizar su propio rendimiento.
Sumado a esto, Muse Image también se integra con Muse Spark, pudiendo compartir herramientas y planificar de forma conjunta para crear contenido multimedia con capacidad de interacción.
Ahora que ya conocemos el contexto general del nuevo modelo de IA generadora de imágenes de Meta, ahondemos en sus capacidades:
Esta IA puede realizar búsquedas en la web para acceder a información e imágenes en tiempo real, favoreciendo la generación de contenido veraz y realista.
Así mismo, Meta indica que “la función de búsqueda mejora la precisión de la información en preguntas que requieren un alto nivel de conocimiento, especialmente aquellas relacionadas con eventos actuales y hechos reales“.
Meta Image se basa en el aprendizaje por refuerzo para escribir y ejecutar código para crear gráficos, códigos QR precisos e imágenes optimizadas a partir de figuras renderizadas.
Además, se integra con Muse Spark para combinar generación de código y contenido multimedia. Esta fusión permite desarrollar de forma automatizada e interactiva GIF animados, sitios web con imágenes incrustadas y juegos visuales interactivos.
Muse Image es capaz de seguir las instrucciones del usuario o usuaria de forma precisa para editar una imagen existente, modificando solamente los elementos indicados.
Además, permite ejecutar varias fases de edición sobre una misma imagen, ya que mantiene la coherencia y consistencia de todo lo que no se haya solicitado variar.
Este modelo de IA es capaz de procesar diversas imágenes de referencia aportadas por el usuario o usuaria y generar obras en las que se incluyan los elementos indicados de cada una (personajes, objetos, ropa, escenarios, estilos de diseño, etc.). Durante la redacción del prompt puedes alternar texto e imágenes adjuntas para mayor precisión en las instrucciones.
Muse Image reflexiona y perfecciona su trabajo de forma autónoma dentro de su cadena de pensamiento. Este autorrefinamiento se adapta según el error: realiza ediciones locales para corregir detalles pequeños, genera una imagen desde cero si los fallos son mayores, o recurre a herramientas para mejorar la precisión.
Cabe señalar que este comportamiento no fue diseñado de forma deliberada por Meta. Surgió espontáneamente durante el entrenamiento con aprendizaje por refuerzo, ya que el sistema descubrió que autocorregirse producía imágenes de mayor calidad y, por lo tanto, una recompensa más alta.
Al igual que los modelos de lenguaje, Muse Image mejora al procesar más información durante la inferencia. Un mayor cómputo en tiempo de prueba le permite razonar más, usar herramientas y auto-refinarse. Este incremento en la capacidad de razonamiento mejora las puntuaciones Elo de preferencia humana siguiendo una relación log-lineal, donde la calidad final depende del procesamiento total combinado de tokens de texto y visuales.
Optimizar este presupuesto de tokens es crucial. Mientras que el método Best-of-N (generar varias opciones y elegir la mejor) se satura rápido, invertir ese cómputo en un razonamiento deliberado ofrece una escalabilidad superior. Además, el razonamiento y las herramientas se potencian mutuamente: estas permiten al modelo buscar referencias externas o escribir código, cubriendo lagunas lógicas con precisión.
Por el momento, Muse Image ha comenzado a desplegarse en la app Meta AI y en la web meta.ai, en Instagram Stories en Estados Unidos y en WhatsApp en varios países (aunque la compañía no ha especificado cuáles).
Sin embargo, la ambición de la tecnológica no se frena ahí, pues su intención es expandir próximamente Muse Image al resto de su ecosistema (Facebook y Messenger), además de ponerla al servicio de los anunciantes a través de Meta Advantage+ Creative.
Además de lanzar oficialmente Muse Image, Meta ha aprovechado para compartir una vista previa de Muse Video, su IA de vídeo que también integra soporte nativo de audio.
Para desarrollar Muse Video, la tecnológica partió de la misma base de preentrenamiento sobre la que se construyó Muse Image. El modelo destaca por su precisión, fidelidad visual y coherencia temporal, y Meta está invirtiendo para optimizar todavía más la sincronización de audio y vídeo y la reproducción de movimiento rápido con precisión física.
La compañía no ha dado una fecha concreta para el lanzamiento oficial de Muse Video, lo único que sabemos por ahora es que “estará disponible próximamente para creadores y Meta AI“.
Para permitir a los usuarios y usuarias verificar si una imagen ha sido generada por IA, Muse Image incorpora Content Seal, un sistema de marca de agua invisible similar al SynthID de Google. Las imágenes creadas en la app Meta AI y en meta.ai incluyen esta señal oculta de procedencia, la cual permanece intacta a pesar de recortes, compresiones, redimensionamientos o capturas de pantalla. Próximamente, esta tecnología se extenderá a los vídeos.
Además, se está presentando una herramienta de detección que permite comprobar si un archivo lleva dicha marca de agua, facilitando la identificación de contenidos creados con Meta AI.
Foto: Muse Image
Your email address will not be published. Required fields are marked *
Δ