Google a présenté le 15 septembre 2026 Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles audio natifs pensés pour la conversation en temps quasi réel. L’enjeu n’est plus seulement de répondre à la voix : les modèles peuvent enchaîner des appels d’outils en arrière-plan, garder le fil de la discussion et s’appuyer sur ce que la caméra filme. L’annonce figure sur le blog Google et dans la fiche développeurs.
Gemini 3.8 Live vise le volume et le coût. Extended Thinking ajoute un raisonnement multi-étapes plus poussé tout en continuant de parler. Google revendique pour cette seconde version la première place de l’indice Speech to Speech Quality d’Artificial Analysis (82,6), 68,6 % sur τ-Voice, 35,1 % sur τ-Voice-banking (Sierra) et 97,7 % sur Big Bench Audio. La version « Live » classique est présentée comme plus économique et se place deuxième du Speech Agent Arena du même cabinet.
Parler, voir, et laisser tourner les API
Le point technique le plus net, c’est l’appel de fonctions asynchrone. Le modèle peut accuser réception, poursuivre la conversation, puis récupérer le résultat d’une opération parallèle. Extended Thinking pousse la même logique plus loin : indices verbaux du type « laissez-moi vérifier », narration de l’avancement pendant qu’un workflow tourne en fond. Côté vision, Gemini 3.8 Live traite des flux vidéo en quasi temps réel (exemples cités : onboarding d’un poste de travail, partie d’échecs filmée). Google annonce aussi le basculement automatique entre 97 langues au cours d’une même conversation.
Pour les développeurs, les modèles passent par la Live API dans le Gemini API et Google AI Studio. Les codes stables sont gemini-3.8-live et gemini-3.8-live-extended-thinking, avec une fenêtre d’entrée annoncée à 131 072 tokens et une sortie à 65 536 pour le modèle Live (documentation Google AI). Tarification audio indiquée : 0,005 $ par minute en entrée et 0,018 $ par minute en sortie. Des partenaires d’infra temps réel (LiveKit, Agora, Pipecat, Vercel, LangChain, notamment) sont listés pour le streaming média.
Search, Gemini Live, Gmail et Docs
Le déploiement produit démarre le jour de l’annonce. Gemini 3.8 Live arrive dans Search Live, l’API et AI Studio, plus une préversion privée Gemini Enterprise. Extended Thinking alimente Gemini Live côté grand public, Docs Live pour les abonnés Google AI Pro et Ultra, ainsi que Gmail Live et Keep Live pour les abonnés Google AI. Les contenus audio générés par les produits d’IA Google restent marqués avec SynthID, le filigrane imperceptible déjà utilisé ailleurs dans la gamme.
À noter pour qui migre depuis Gemini 3.1 Flash Live : l’appel de fonctions non bloquant devient le mode par défaut, l’audio proactif est forcé, et le dialogue « affectif » disparaît de l’API. Ce n’est plus seulement un chatbot vocal. C’est une couche d’agent qui parle, regarde et travaille en parallèle, avec un ticket d’entrée développeur déjà chiffré à la minute.
Sources : Google Blog, Google Developers Blog, Gemini API, Le Monde Informatique.

