Aller au contenu
X

Gemini 3.8 Live : deux modèles vocaux qui travaillent pendant que vous parlez

Par Thomas DuvillardAucun commentaire3 min de lectureActu
Visuel officiel Google Gemini 3.8 Live, modèles de dialogue vocal

Google a présenté le 15 septembre 2026 Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles audio natifs pensés pour la conversation en temps quasi réel. L’enjeu n’est plus seulement de répondre à la voix : les modèles peuvent enchaîner des appels d’outils en arrière-plan, garder le fil de la discussion et s’appuyer sur ce que la caméra filme. L’annonce figure sur le blog Google et dans la fiche développeurs.

Gemini 3.8 Live vise le volume et le coût. Extended Thinking ajoute un raisonnement multi-étapes plus poussé tout en continuant de parler. Google revendique pour cette seconde version la première place de l’indice Speech to Speech Quality d’Artificial Analysis (82,6), 68,6 % sur τ-Voice, 35,1 % sur τ-Voice-banking (Sierra) et 97,7 % sur Big Bench Audio. La version « Live » classique est présentée comme plus économique et se place deuxième du Speech Agent Arena du même cabinet.

À lire aussi : Gemini : Google confirme que son IA a pénétré trois systèmes externes

Parler, voir, et laisser tourner les API

Le point technique le plus net, c’est l’appel de fonctions asynchrone. Le modèle peut accuser réception, poursuivre la conversation, puis récupérer le résultat d’une opération parallèle. Extended Thinking pousse la même logique plus loin : indices verbaux du type « laissez-moi vérifier », narration de l’avancement pendant qu’un workflow tourne en fond. Côté vision, Gemini 3.8 Live traite des flux vidéo en quasi temps réel (exemples cités : onboarding d’un poste de travail, partie d’échecs filmée). Google annonce aussi le basculement automatique entre 97 langues au cours d’une même conversation.

Pour les développeurs, les modèles passent par la Live API dans le Gemini API et Google AI Studio. Les codes stables sont gemini-3.8-live et gemini-3.8-live-extended-thinking, avec une fenêtre d’entrée annoncée à 131 072 tokens et une sortie à 65 536 pour le modèle Live (documentation Google AI). Tarification audio indiquée : 0,005 $ par minute en entrée et 0,018 $ par minute en sortie. Des partenaires d’infra temps réel (LiveKit, Agora, Pipecat, Vercel, LangChain, notamment) sont listés pour le streaming média.

Search, Gemini Live, Gmail et Docs

Le déploiement produit démarre le jour de l’annonce. Gemini 3.8 Live arrive dans Search Live, l’API et AI Studio, plus une préversion privée Gemini Enterprise. Extended Thinking alimente Gemini Live côté grand public, Docs Live pour les abonnés Google AI Pro et Ultra, ainsi que Gmail Live et Keep Live pour les abonnés Google AI. Les contenus audio générés par les produits d’IA Google restent marqués avec SynthID, le filigrane imperceptible déjà utilisé ailleurs dans la gamme.

À noter pour qui migre depuis Gemini 3.1 Flash Live : l’appel de fonctions non bloquant devient le mode par défaut, l’audio proactif est forcé, et le dialogue « affectif » disparaît de l’API. Ce n’est plus seulement un chatbot vocal. C’est une couche d’agent qui parle, regarde et travaille en parallèle, avec un ticket d’entrée développeur déjà chiffré à la minute.

Sources : Google Blog, Google Developers Blog, Gemini API, Le Monde Informatique.

Ajouter Geek Actu à mes sources préférées sur Google

Site web de Thomas Duvillard

Thomas Duvillard est rédacteur en chef de Geek Actu. Il couvre les jeux vidéo, le high-tech et la pop culture, tests et analyses à l’appui.