
Google ha actualizado Gemini Live con el modelo Gemini 3.5 Live, prometiendo mejoras significativas en la gestión de interrupciones, procesamiento de visuales en vivo y compatibilidad multilingüe. Este avance marca un paso importante hacia conversaciones más naturales y una mayor capacidad para acceder y activar herramientas en segundo plano, aspecto que hasta ahora presentaba limitaciones en Gemini Live.
El nuevo modelo 3.5 ofrece una mejor respuesta ante interrupciones durante el habla, permite procesar imágenes en tiempo real y facilita la mezcla de varios idiomas sobre la marcha. Estas mejoras se sitúan en un contexto donde Gemini Live ya destacaba por su interacción cercana y similar a la humana, pero con fallos que a veces traducíanse en errores o desajustes en el reconocimiento del idioma del usuario. En particular, algunas voces pueden generar confusiones entre idiomas, y respuestas interrumpidas podrían provocar un reinicio a la voz predeterminada. La expectativa es que Gemini 3.5 Live reduzca estos fallos y ofrezca una experiencia más fluida.
Además de la experiencia conversacional, Google presenta dos modelos para desarrolladores: Gemini 3.5 Live Experimental y Gemini 3.5 Transcribe, disponibles en Gemini API, Google AI Studio y Gemini Enterprise Agent Platform. Entre las capacidades transcritas, destaca Rambler en Gboard para Android, que convierte el habla en texto bien formateado y elimina palabras de relleno, con la posibilidad de corregir errores o adaptar el estilo de escritura mediante la voz. Estas herramientas ya están permeando en productos de consumo y muestran una estrategia clara de integración transversal.
En macOS, la app Gemini combina entrada de voz natural con conciencia del contenido en pantalla, permitiendo invocar otros modelos de Gemini en segundo plano para resumir archivos locales, reutilizar texto entre aplicaciones o generar imágenes en el cursor, todo a través de instrucciones habladas. Mirando hacia el futuro, se anticipa que esta tecnología llegue a Chrome, permitiendo hablar para escribir en cualquier campo de texto en la web, ya sea para responder correos, redactar publicaciones o generar prompts para Gemini.
Con Gemini 3.5 Live, Gemini 3.5 Live Experimental y Gemini 3.5 Transcribe anunciados, Google propone un ecosistema más cohesionado que busca ampliar la interacción por voz y la accesibilidad de herramientas útiles en contextos cotidianos. Aunque aún no hay una fecha de implementación global definitiva, la expectativa señala a una adopción gradual en los próximos días, acercando a los usuarios a una experiencia de inteligencia artificial más integrada y con mayor capacidad de acción.
Imagen: Gemini Live en un iPhone (crédito de la imagen: Google).
from Latest from TechRadar https://ift.tt/txWkubw
via IFTTT IA