Noticias IA Google DeepMind

Google lanza gemini 3.8 live para agentes de voz profesionales y diálogos avanzados

Equipo AIexperts 16 Sep 2026 2 horas atrás 3 min lectura
Google lanza gemini 3.8 live para agentes de voz profesionales y diálogos avanzados

Google DeepMind ha presentado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, sus modelos de diálogo en tiempo real más avanzados. Estos modelos están diseñados para alimentar agentes de voz profesionales, mejorando la capacidad de las IA para manejar interacciones conversacionales complejas y multimodales.

Qué está pasando

Google ha lanzado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos diseñados para el procesamiento de diálogo en vivo. Estos modelos representan la cúspide de la capacidad de Google en interacciones de voz y conversación. Sus capacidades incluyen ejecutar llamadas a herramientas y API en segundo plano mientras el diálogo fluye, procesar entradas visuales en tiempo real y gestionar cambios de idioma en el transcurso de una misma conversación, llegando a soportar 97 lenguajes. Ambos modelos están disponibles inmediatamente a través de la API de Gemini y Google AI Studio.

Por qué importa

El lanzamiento subraya la intención de Google de posicionarse en el segmento de agentes de voz de nivel profesional. La disponibilidad de Extended Thinking, que según Artificial Analysis ocupa el primer lugar en su Índice de Calidad de Voz a Voz, y su alto puntaje en Big Bench Audio (97.7%), resalta el enfoque en la calidad acústica y el realismo conversacional. Además, el modelo ofrece una estructura de costes competitiva, con un precio de $0.005 por minuto de entrada de audio, lo que lo hace atractivo para la integración en flujos de trabajo comerciales.

Qué cambia en la práctica

Para los desarrolladores, estos modelos permiten construir agentes de voz con un nivel de sofisticación sin precedentes. La capacidad de ejecutar lógica de negocio (llamadas a API) de manera invisible durante la conversación, junto con el manejo multilingüe y visual, permite crear experiencias de usuario mucho más ricas y autónomas. La implementación de la marca de agua SynthID en todo el audio generado garantiza la trazabilidad y autenticidad del contenido de voz generado por Google DeepMind.

Qué vigilar

La atención se centrará en la adopción de estos modelos en la industria de los asistentes de voz y la automatización de servicios. La competencia en este espacio es intensa, por lo que es crucial monitorear la respuesta de rivales como OpenAI y cómo sus modelos de diálogo en tiempo real se comparan con las capacidades de Gemini 3.8. Los desarrolladores deben evaluar cómo la combinación de bajo coste y alta funcionalidad impactará los estándares de la industria para agentes conversacionales.

Más sobre este tema: Modelos de IA

Fuente de esta noticia: consultar el anuncio o artículo original.