Saltar al contenido

Gemini 3.8 Live: la IA que piensa y actúa mientras habla

septiembre 20, 2026
Núcleo de IA multimodal procesa voz, imágenes y herramientas en paralelo durante una conversación en directo

Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking el 15 de septiembre de 2026, y actualizó el anuncio dos días después. La novedad no consiste solo en hablar con una IA con menos retraso. Estos modelos pueden recibir voz, imagen, vídeo y texto, mantener el diálogo mientras ejecutan herramientas en segundo plano y, en la versión Extended Thinking, razonar sobre tareas complejas sin obligar al usuario a esperar en silencio.

El cambio parece pequeño hasta que se observa desde la experiencia de uso. Los asistentes de voz tradicionales suelen alternar entre escuchar, procesar y responder. Gemini 3.8 Live intenta convertir esos turnos rígidos en una interacción continua: puede reconocer una petición, seguir conversando, consultar una herramienta y comunicar el progreso mientras completa el trabajo.

En este artículo explicamos qué es Gemini 3.8 Live, cómo funciona, qué diferencias hay entre sus dos versiones, qué significan sus resultados de evaluación y qué límites conviene tener presentes. Los datos proceden del anuncio, la documentación y la ficha técnica publicados por Google; las implicaciones y predicciones se presentan como análisis, no como hechos confirmados.

Índice

Qué es Gemini 3.8 Live

Gemini 3.8 Live es un modelo multimodal de conversación en tiempo real. Su entrada puede combinar audio, imágenes, vídeo y texto, y su salida puede ser voz o texto. Según la ficha técnica de Google DeepMind, admite una ventana de contexto de hasta 128.000 tokens y una salida máxima de 64.000 tokens. Está basado en Gemini 3 Pro y fue optimizado para tareas con gran volumen y sensibilidad a la latencia.

Google lanzó dos variantes:

  • Gemini 3.8 Live: prioriza fluidez, baja latencia y escalabilidad para conversaciones y agentes de voz.
  • Gemini 3.8 Live Extended Thinking: aumenta el razonamiento de varios pasos para tareas complejas, aunque puede consumir más tiempo y recursos.

La diferencia práctica no es simplemente “rápido frente a inteligente”. El modelo Live también razona de forma intercalada, pero está orientado a que la conversación no pierda ritmo. Extended Thinking reserva más capacidad para analizar, planificar y coordinar acciones largas mientras mantiene informado al usuario. Sobre el diseño de estos flujos, véase nuestro análisis del Diplomado IA Lab sobre agentes de IA.

La novedad clave: hablar mientras la IA trabaja

La característica más interesante es la ejecución asíncrona de herramientas. En la documentación del modelo, Google indica que las llamadas a funciones no bloqueantes son ahora el comportamiento predeterminado. Una aplicación puede enviar una tarea a una API y mantener la conversación activa en vez de detenerla hasta recibir el resultado.

Imaginemos un asistente que busca una reserva, compara horarios y consulta el calendario. En un sistema convencional, la conversación puede quedar suspendida en cada paso. Con un flujo asíncrono, el agente puede confirmar que está revisando opciones, pedir una preferencia adicional y comunicar avances mientras las consultas se resuelven.

Esta idea conecta con la evolución de los agentes de voz en tiempo real que ya analizamos con GPT‑Live‑1, pero Google pone un énfasis especial en combinar diálogo, visión y razonamiento paralelo. La competencia ya no se limita a quién genera una voz más natural: importa quién conserva el contexto, usa herramientas con fiabilidad y completa una tarea sin romper la conversación.

Razonar y hablar de forma simultánea

Gemini 3.8 Live Extended Thinking puede reconocer la petición con frases breves, continuar razonando y narrar el progreso de una tarea de varios pasos. Google mostró ejemplos en los que transforma un boceto en componentes de React mediante instrucciones de voz, coordina reservas y modifica materiales de trabajo mientras el usuario sigue hablando.

Eso no significa que el modelo revele una cadena de pensamiento interna completa. Lo que ofrece es una explicación de progreso orientada al usuario: qué está comprobando, qué dato necesita o qué acción ejecutará después. Esta distinción es importante porque “hablar mientras piensa” describe la experiencia observable, no una ventana literal al proceso interno del modelo.

Visión en tiempo casi real

El sistema también puede utilizar imágenes y vídeo como contexto. Un usuario podría enfocar una máquina averiada, una interfaz o un dibujo y hacer preguntas por voz. La guía de la Live API especifica que las imágenes se envían como JPEG a un máximo de un fotograma por segundo. Por tanto, no debe confundirse con una comprensión perfecta de vídeo continuo: recibe una secuencia limitada de imágenes junto con audio y texto.

Aun con esa limitación, la combinación resulta útil para soporte técnico, formación, accesibilidad, comercio, videojuegos, vehículos y robótica. El valor surge cuando el agente no solo describe lo que ve, sino que puede consultar documentación, ejecutar una función o guiar al usuario durante el proceso.

Qué dicen los resultados publicados

En el anuncio oficial, Google atribuye a Gemini 3.8 Live Extended Thinking los siguientes resultados:

  • 82,6 puntos y primera posición general en el Speech to Speech Quality Index de Artificial Analysis.
  • 68,6 % en τ‑Voice, una evaluación de tareas de agentes mediante voz.
  • 35,1 % en la variante bancaria de Sierra τ‑Voice.
  • 97,7 % en Big Bench Audio, centrado en razonamiento sobre información sonora.

La metodología de evaluación aclara que los resultados de Artificial Analysis fueron ejecutados por esa organización, que las pruebas de ServiceNow se realizaron sobre Gemini Enterprise Agent Platform y que, salvo indicación contraria, los resultados de Gemini se presentan como pass@1: un único intento, sin votación mayoritaria ni ejecuciones paralelas.

Los benchmarks son útiles para comparar capacidades bajo condiciones controladas, pero no garantizan el mismo rendimiento en una llamada real. Ruido, acentos, conexión, diseño de herramientas, calidad de la base de conocimiento y complejidad del proceso pueden cambiar el resultado. Una tasa del 68,6 % también implica que todavía existe un margen considerable de error en tareas agenticas de voz.

Una discrepancia que conviene explicar: 97 idiomas o más de 70

El anuncio de lanzamiento afirma que Gemini 3.8 Live detecta y cambia automáticamente entre 97 idiomas durante una conversación. Sin embargo, la guía general de la Live API enumera conversación en 70 idiomas y traducción de voz en más de 70.

Ambas cifras proceden de Google, pero parecen medir alcances distintos o reflejar documentación que todavía no está completamente sincronizada. La interpretación prudente es esta: el nuevo modelo amplía el soporte multilingüe, pero los desarrolladores deberían consultar la lista concreta de funciones e idiomas antes de prometer cobertura en producción. No sería correcto convertir la cifra de 97 en garantía de idéntica calidad para conversación, traducción, transcripción y uso de herramientas.

Cómo se integra en una aplicación

La Live API utiliza una conexión WebSocket con estado. El audio de entrada se transmite como PCM de 16 bits a 16 kHz y la salida como PCM a 24 kHz. El desarrollador puede conectar el backend con Google o permitir una conexión directa desde el cliente. Para aplicaciones en producción, Google recomienda tokens efímeros en lugar de exponer una clave de API estándar.

Entre las funciones disponibles están la interrupción del modelo por parte del usuario, llamadas a funciones, transcripciones, audio proactivo y búsqueda. La documentación también señala algunas ausencias: Gemini 3.8 Live no admite ejecución de código, búsqueda de archivos, contexto de URL, salidas estructuradas ni generación de imágenes dentro de ese modelo.

Cambios para quienes migran desde Gemini 3.1 Flash Live

Google pide cambiar el identificador al modelo estable gemini-3.8-live. Las llamadas asíncronas pasan a ser el modo predeterminado; el audio proactivo queda activado permanentemente; desaparece la opción de diálogo afectivo de la API; y la respuesta compatible es audio, aunque puede solicitarse una transcripción textual.

También hay una advertencia práctica: los fotogramas de vídeo se incluyen de forma predeterminada en la cobertura del turno. Enviar imágenes innecesarias puede consumir contexto y aumentar el coste. Diseñar un buen agente de voz requiere decidir qué información visual aporta valor, no transmitir todo de manera indiscriminada.

Disponibilidad: dónde puede utilizarse

Gemini 3.8 Live está disponible mediante Gemini API, Google AI Studio y Vertex AI, además de experiencias de Google como Gemini y Search Live. Extended Thinking también se integra en funciones de Workspace para Gmail, Docs y Keep, según el anuncio de la compañía.

La existencia del modelo en varios productos no significa que todas las funciones sean idénticas. Una aplicación creada con la API tiene herramientas, permisos y límites definidos por el desarrollador, mientras que una función de Workspace opera dentro del entorno y las políticas de Google. La disponibilidad regional, el plan contratado y los permisos de una organización pueden modificar lo que cada usuario ve.

Casos de uso con valor real

Atención al cliente sin pausas artificiales

Un agente podría consultar pedidos, gestionar incidencias y confirmar cambios mientras mantiene la conversación. Como explicamos en nuestro análisis del Máster en Inteligencia Artificial: agentes y asistentes telefónicos, el reto no es solo la voz: debe autenticar al cliente, respetar permisos, evitar acciones duplicadas y saber cuándo transferir el caso a una persona.

Formación y soporte visual

En una sesión de aprendizaje, el usuario puede mostrar su pantalla o un objeto y recibir indicaciones adaptadas al paso actual. La interacción continua reduce la fricción de describir por escrito cada detalle, aunque una recomendación de la IA no sustituye una comprobación profesional en ámbitos de riesgo.

Interfaces para robótica, gafas y vehículos

Voz y visión en tiempo real pueden convertirse en una capa de control para dispositivos físicos. El modelo interpreta la intención; otras herramientas verifican el estado y ejecutan acciones. Esta separación recuerda la arquitectura de un Sistema Operativo Cognitivo con memoria, agentes, ejecución y verificación: el diálogo es la interfaz, pero la fiabilidad depende de todo el sistema que opera debajo.

Límites, privacidad y seguridad

La ficha técnica reconoce que Gemini 3.8 Live puede alucinar y sufrir lentitud o tiempos de espera. Su corte de conocimiento general se sitúa en enero de 2025, por lo que no debe asumirse que conoce hechos recientes si no utiliza una fuente actualizada.

Un agente que escucha, ve y ejecuta herramientas concentra riesgos adicionales:

  • Privacidad: audio, vídeo y pantalla pueden contener datos personales o confidenciales.
  • Autorización: una conversación ambigua no debería activar pagos, reservas o cambios irreversibles.
  • Suplantación: una voz natural puede inducir al usuario a confiar más de lo que permite la precisión real.
  • Errores encadenados: una interpretación incorrecta puede propagarse a varias herramientas.
  • Dependencia del entorno: ruido, mala conexión o imágenes incompletas degradan la calidad.

La respuesta responsable consiste en aplicar confirmaciones proporcionales al riesgo, registros de acciones, límites de permisos y vías claras de intervención humana. La fluidez no debe eliminar controles: cuanto más natural parece el agente, más importante resulta mostrar qué sabe, qué supone y qué acción va a ejecutar.

Qué puede significar en los próximos meses y años

Hecho confirmado

Google ya distribuye modelos capaces de combinar voz, visión, razonamiento y llamadas asíncronas a herramientas en una sesión continua. La documentación pública define límites técnicos, canales de acceso y resultados de evaluación.

Hipótesis razonable

Las empresas empezarán a sustituir parte de los menús, formularios y árboles telefónicos por conversaciones que ejecutan procesos. La adopción será más rápida en tareas reversibles y bien delimitadas, como consultar información o preparar una solicitud, que en operaciones sensibles sin supervisión.

Predicción

Durante los próximos uno o dos años, la voz puede pasar de ser una modalidad secundaria a convertirse en una interfaz principal para agentes multimodales. El indicador decisivo no será cuánto se parecen a una persona, sino cuánto tiempo pueden completar tareas reales sin perder contexto, inventar datos ni requerir correcciones.

Si esa fiabilidad mejora, hablar con un agente mientras observa una pantalla y coordina herramientas se parecerá menos a dictar comandos y más a colaborar con un operador digital. Si no mejora, la naturalidad de la voz solo hará más convincentes los mismos errores de siempre.

Conclusión

Gemini 3.8 Live representa un avance importante porque une conversación, visión y acción asíncrona. Extended Thinking añade capacidad para tareas largas sin abandonar el diálogo. Los resultados publicados son competitivos y la integración en API, Workspace, Search y Gemini amplía su alcance.

Pero el lanzamiento no elimina las limitaciones fundamentales: alucinaciones, tiempos de espera, conocimiento desactualizado y errores en procesos complejos. La prueba definitiva llegará cuando estos agentes puedan completar tareas reales con controles claros y una tasa de fallos suficientemente baja. La voz más natural mejora la interfaz; la fiabilidad del sistema completo decidirá si mejora también el trabajo.