Google ha dado un paso más en el desarrollo de su inteligencia artificial con el lanzamiento de Gemini 2.0, un modelo diseñado para revolucionar la manera en que interactuamos con la tecnología.
El lanzamiento de Gemini 2.0 marca una nueva etapa en la familia de modelos de IA de Google. Mientras que Gemini 1.0 y 1.5 se destacaron por su capacidad multimodal para procesar texto, imágenes, audio, vídeo y código, el nuevo modelo va más allá.
Ahora, Gemini 2.0 no solo comprende estas entradas, sino que también genera salidas multimodales, como imágenes nativas y audio sintetizado. Esto supone un avance clave para aplicaciones como la generación de informes complejos o el uso de asistentes virtuales en tareas avanzadas.
«Hoy estamos muy contentos de lanzar nuestra próxima era de modelos diseñados para esta nueva era de agentes de IA: presentamos Gemini 2.0, nuestro modelo más capaz hasta la fecha. Los nuevos avances en multimodalidad -como la generación nativa de imágenes y audio y el uso nativo de herramientas- nos permitirán construir nuevos agentes de IA que nos acerquen a nuestra visión de un asistente universal». Ha explicado Sundar Pichai, CEO de Google, en un comunicado de la compañía.
Desde Google han presentado el primer modelo de la familia Gemini 2.0: una versión experimental de Gemini 2.0 Flash. Este se trata de un modelo de referencia con baja latencia y rendimiento mejorado.
«Además de admitir entradas multimodales como imágenes, vídeo y audio, Flash 2.0 admite ahora salidas multimodales, como imágenes generadas de forma nativa mezcladas con texto y audio multilingüe sintetizado a partir de texto (TTS). También está integrado de forma nativa con herramientas como la Búsqueda de Google o la ejecución de código, así como funciones de terceros definidas por el usuario», explica la tecnológica.
El modelo experimental Gemini 2.0 Flash se basa en el éxito de Gemini 1.5 Flash y ya está disponible para desarrolladores a través de plataformas como Google AI Studio y Vertex AI. Además, ofrece soporte para nuevas herramientas como la API Multimodal Live, que permite entrada de vídeo en tiempo real y audio en streaming.
Google también ha anunciado que, a partir de hoy, los usuarios y usuarias de la versión web de ordenador y móvil de Gemini podrán acceder a una versión optimizada para chat de Gemini 2.0 Flash. Para ello solo tendrán que seleccionarla desde el menú desplegable de modelos. La integración de este modelo en su app móvil está prevista para realizarse próximamente.
Gemini 2.0 permite experiencias avanzadas con agentes de IA, ofreciendo soluciones que pueden anticiparse a las necesidades del usuario y realizar acciones en su nombre de manera eficiente y supervisada. Para demostrar el potencial de este modelo, Google ha presentado varios prototipos que muestran el potencial de Gemini 2.0 para transformar la interacción entre humanos y máquinas:
El desarrollo de Gemini 2.0 está acompañado de un compromiso con la seguridad y la ética. Google ha implementado estrictos protocolos de evaluación de riesgos, incluyendo medidas para evitar el uso indebido de la IA y garantizar la privacidad de los usuarios. Por ejemplo:
Foto: Google
No se han encontrado artículos relacionados.
Your email address will not be published. Required fields are marked *
Δ