„Finde eine passende Bahnverbindung nach Hamburg, lege meinen Nachmittagstermin auf einen anderen Zeitpunkt und gib dem Team Bescheid.“ Noch vor einiger Zeit wären Sprachassistenten bei einem solchen Auftrag schnell an ihre Grenzen gestoßen. Vielleicht hätten sie eine Fahrplansuche geöffnet, den Kalender angezeigt oder Schritt für Schritt erklärt, was anschließend manuell zu erledigen ist. Die neue Generation sprachbasierter KI-Systeme soll wesentlich weiter gehen: Sie erfasst das eigentliche Ziel, zerlegt den Auftrag selbstständig in einzelne Aufgaben, bindet dafür externe Dienste ein und hält währenddessen den Dialog mit dem Nutzer aufrecht.
Das Gespräch verstummt nicht, nur weil die Technik alle Hände voll zu tun hat.
Google hat am 15. September 2026 zwei neue Audio-zu-Audio-Modelle vorgestellt: Gemini 3.8 Live für Echtzeitdialoge und Gemini 3.8 Live Extended Thinking für komplexere Aufgaben. Die zweite Variante kann in einem laufenden Sprachdialog weiterdenken und asynchrone Werkzeuge verwenden. Wartet das System auf die Antwort einer Buchungsdatenbank oder durchsucht es einen Kalender, soll der Assistent den Nutzer nicht mehr in einer jener Pausen zurücklassen, in denen unklar bleibt, ob die Technik noch arbeitet oder längst aufgegeben hat. Recherchequelle: blog.google
Was wie eine kleine Verbesserung der Gesprächsführung wirkt, verändert eine grundlegende Regel digitaler Unterhaltungen: Das Ende einer gesprochenen Antwort bedeutet nicht länger, dass der Auftrag abgeschlossen ist.
Die Stimme wird zur Benutzeroberfläche
Bei klassischen Chatbots folgt die Arbeit einem vertrauten Takt: Der Nutzer stellt eine Frage, das Modell verarbeitet sie, dann erscheint die Antwort. Ob dabei eine Suchmaschine oder ein anderes Werkzeug zum Einsatz kommt, bleibt meist unsichtbar. Der Ablauf wirkt wie eine Reihe sauber voneinander getrennter Schritte.
Bei einem Sprachassistenten, der selbstständig Aufgaben erledigt, funktioniert diese klare Trennung nicht. Gespräche sind sprunghaft und bisweilen chaotisch. Menschen unterbrechen sich, ergänzen halbe Sätze, ändern ihre Meinung und erwarten dennoch eine erkennbare Reaktion. Schweigt die Maschine mehrere Sekunden, klingt das nicht nach gründlichem Nachdenken, sondern eher nach einer abgebrochenen Telefonverbindung.
Gemini 3.8 Live Extended Thinking soll deshalb Gespräch und Aufgabenbearbeitung voneinander entkoppeln. Für den Nutzer geht der Dialog weiter; zugleich ruft das System Daten ab, vergleicht Ergebnisse oder setzt weitere Werkzeuge ein. So kann der Assistent bereits ankündigen, dass er Flugverbindungen prüft, obwohl die entsprechenden Schnittstellen noch arbeiten. Google bezeichnet dieses Prinzip als Hintergrunddenken. Es setzt bei dieser Modellvariante nicht blockierende, asynchrone Werkzeugaufrufe voraus. Recherchequelle: ai.google.dev
Aus einer gesprochenen Anweisung wird damit ein laufender Arbeitsauftrag. Der Nutzer muss nicht mehr für jeden Zwischenschritt einen neuen Befehl formulieren. Er kann nachfragen, eine Bedingung ergänzen oder die Richtung ändern, während der Vorgang bereits läuft.
Wenn „fertig gesprochen“ nicht „fertig gearbeitet“ heißt
Wie grundlegend dieser Umbau ist, zeigt ein unscheinbares technisches Detail. In herkömmlichen Live-Sitzungen signalisiert turnComplete, dass der Assistent seinen Gesprächsbeitrag beendet hat und wieder auf den Nutzer wartet. Bei Extended Thinking gilt das nicht mehr zwingend: Eine Äußerung kann abgeschlossen sein, obwohl das Modell weiterdenkt oder noch auf die Antwort eines Werkzeugs wartet.
Entwickler müssen deshalb einen zusätzlichen Status beachten. IN_PROGRESS bedeutet, dass das System rechnet, plant oder auf einen externen Dienst wartet. Erst IDLE zeigt an, dass der gesamte Vorgang beendet ist. Nach einem Satz, der bereits wie ein Schlusspunkt klingt, können also weitere Werkzeugaufrufe, Zwischenmeldungen oder Audioausgaben folgen. Recherchequelle: ai.google.dev
Für den Nutzer bleibt diese technische Choreografie unsichtbar. Er hört lediglich eine Stimme, die sagt: „Ich prüfe das kurz.“ Hinter diesem beiläufigen Satz kann jedoch ein mehrstufiger Prozess liegen – etwa die Suche nach Flügen, der Abgleich mit dem Kalender und die Vorbereitung einer E-Mail. Gerade weil der Nutzer davon nichts sieht, ist die Gestaltung solcher Assistenten anspruchsvoll. Recherchequelle: ai.google.dev
Eine höfliche Zwischenmeldung darf dabei nicht mit einer Bestätigung verwechselt werden. „Ich kümmere mich darum“ ist etwas anderes als „Der Termin wurde verschoben“. Was im menschlichen Gespräch selbstverständlich erscheint, muss eine Anwendung technisch und sprachlich klar unterscheiden.
Der Charme der Stimme kann Fehler verdecken
Google nennt technische Unterstützung, Reiseplanung, Buchungsprozesse sowie Lern- und Programmierhilfen als mögliche Einsatzfelder. Extended Thinking soll auch in Gmail, Docs und Keep verfügbar werden. Hinzu kommen Gemini Live, Search Live, die Gemini API und Google AI Studio. Damit verlässt der Sprachassistent die in sich geschlossene Chatoberfläche und zieht in Anwendungen ein, in denen seine Aktionen reale Folgen haben.
Im Kundendienst könnte er beispielsweise nicht nur eine Rechnung erklären, sondern auch Kundendaten prüfen, einen Tarif ändern oder eine Erstattung vorbereiten. Ein persönlicher Assistent könnte Termine koordinieren und Nachrichten versenden. Die Stimme wäre dann nicht bloß eine bequemere Tastatur, sondern die Oberfläche eines Systems, das eigenständig mehrere Softwarewerkzeuge miteinander verbindet.
Der kritische Punkt liegt ausgerechnet in dieser Natürlichkeit. Eine flüssige Stimme schafft schnell Vertrauen. Sie klingt präsent, aufmerksam und entschlossen – selbst wenn ein aufgerufenes Werkzeug kein Ergebnis liefert oder das Modell eine Information falsch verstanden hat. Je souveräner der Ton, desto leichter gerät aus dem Blick, dass dahinter weiterhin eine fehleranfällige technische Kette arbeitet.
Google weist in der Modellbeschreibung darauf hin, dass auch Gemini 3.8 Audio halluzinieren kann. Zudem seien gelegentliche Verzögerungen und Zeitüberschreitungen möglich. Neben Sprache verarbeitet das Modell auch Text, Bilder und Video; die Extended-Thinking-Version verfügt über ein Eingabefenster von bis zu 128.000 Token. Doch selbst ein großes Kontextfenster verhindert nicht, dass der Assistent den falschen Termin auswählt oder aufgrund eines missverstandenen Namens einen fehlerhaften Datenbankaufruf erzeugt. Recherchequelle: deepmind.google
Für Systeme, die selbstständig Aufgaben erledigen, reicht eine glaubwürdig klingende Stimme daher nicht aus. Sie müssen ihren Arbeitsstatus verständlich anzeigen, riskante Aktionen bestätigen lassen, Fehler transparent melden und in einen sicheren Zustand zurückkehren können. Sonst wird aus dem charmanten Assistenten schnell ein höflicher Unruhestifter.
Gute Gespräche sind noch keine erledigten Aufgaben
Im Speech-to-Speech-Index von Artificial Analysis erreicht Gemini 3.8 Live Extended Thinking einen Gesamtwert von 82,6. Bei der dort erfassten agentischen Leistung, also der Fähigkeit, Aufgaben selbstständig mithilfe von Werkzeugen zu erledigen, kommt das Modell auf 68,6 Prozent. Der Index bündelt Sprachverständnis, Gesprächsverhalten, Nutzerpräferenzen und den Erfolg bei Aufgaben mit Werkzeugaufrufen. Die Werte wirken beachtlich, garantieren aber keine Fehlerfreiheit. Recherchequelle: artificialanalysis.ai
Wie gut ein Sprachagent arbeitet, lässt sich nur schwer zuverlässig bewerten. Ein System kann freundlich reagieren, Unterbrechungen geschickt aufnehmen und dennoch den eigentlichen Auftrag verfehlen. Umgekehrt kann es den richtigen Eintrag in der Datenbank ändern, den Nutzer aber mit langen Pausen, unpassenden Einwürfen oder Verständnisproblemen bei einem ungewohnten Akzent zur Verzweiflung bringen. Ein angenehmes Gespräch und eine korrekt erledigte Aufgabe sind eben nicht dasselbe.
Der von Sierra entwickelte Benchmark τ-Voice verbindet deshalb 278 überprüfbare Kundendienstaufgaben mit realistisch klingenden Gesprächen, Hintergrundgeräuschen, verschiedenen Sprechweisen und Unterbrechungen durch beide Gesprächspartner. Bewertet wird nicht allein, was ein Assistent sagt. Entscheidend ist, ob am Ende tatsächlich die richtige Änderung im zugrunde liegenden System vorgenommen wurde. Recherchequelle: sierra.ai
Ob Sprach-KI mehr leistet als eine eindrucksvolle Vorführung, zeigt sich erst im unaufgeräumten Alltag. Sie muss Namen trotz Straßenlärm verstehen, nach einer Unterbrechung zum richtigen Arbeitsschritt zurückfinden und erkennen, ob ein beiläufiges „Moment, doch lieber morgen“ den gesamten Auftrag verändert.
Der Assistent bekommt eine zweite Ebene
Gemini 3.8 Live Extended Thinking markiert daher weniger den Durchbruch einer besonders schönen Computerstimme als den Beginn einer neuen Benutzeroberfläche. An der Oberfläche läuft das Gespräch; darunter arbeitet ein kleiner Apparat aus Planung, Statusmeldungen und Werkzeugen.
Die entscheidende Frage lautet künftig nicht mehr nur: Hat die KI mich verstanden? Ebenso wichtig ist: Was tut sie gerade, was hat sie bereits getan – und was davon kann ich noch stoppen?
Der Assistent der nächsten Generation wird seine Intelligenz nicht allein durch gute Antworten beweisen. Er muss nachvollziehbar handeln. Darin liegt die schwierigste Lektion der Sprach-KI: Ein Assistent, der während des Gesprächs weiterarbeitet, muss auch verständlich mitteilen können, wann die Arbeit wirklich beendet ist.
Weiterführende Informationen
Quellenhinweis: Einzelne Fakten, Einschätzungen und Prognosen dieses Beitrags stützen sich auf Veröffentlichungen der nachfolgend genannten Unternehmen und Institutionen. Die Links dienen zugleich der weiterführenden Information.
Google AI for Developers – Thinking in der Live API
Der technische Leitfaden zeigt, wie Gemini 3.8 Live Extended Thinking während des Sprachdialogs weiterdenkt, Zwischenmeldungen ausgibt und Werkzeuge asynchron aufruft.
https://ai.google.dev/gemini-api/docs/live-api/thinking?hl=de
Google AI for Developers – Leitfaden zu den Live-API-Funktionen
Die Dokumentation erklärt, warum turnComplete bei asynchronem Denken keinen Aufgabenabschluss signalisiert und stattdessen IN_PROGRESS und IDLE ausgewertet werden müssen.
https://ai.google.dev/gemini-api/docs/live-api/capabilities?hl=de
Gist.Science – τ-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains
Die deutschsprachige Vertiefung erläutert die 278 Kundendienstaufgaben sowie Tests mit Hintergrundgeräuschen, Akzenten, Unterbrechungen und überprüfbaren Datenbankänderungen.
https://gist.science/de/paper/2603.13686



