Eine Aufnahme von 30 Sekunden genügt Googles neuem Sprachmodell, um eine vorhandene Stimme nachzubilden, und ausgerechnet diese Funktion ist im Europäischen Wirtschaftsraum nicht verfügbar.

Erst kostenlos reinschnuppern, dann entscheiden

Bevor du dich für eine Weiterbildung entscheidest, sieh dir kostenlos an, wie sie läuft, fünf Lektionen plus Live-Demo, ohne Verpflichtung. Passt es, ist der Digitalisierungsmanager bei bewilligtem Bildungsgutschein für dich kostenlos.

Kostenlos reinschnuppern

Der Schnupperkurs ist gratis. Ob die Weiterbildung über den Bildungsgutschein gefördert wird, entscheidet die Agentur für Arbeit im Einzelfall.

Zwei Modelle für verschiedene Zwecke

Vorgestellt hat Google die beiden Modelle am 23. September 2026. TTS steht für Text to Speech, die Modelle machen also aus geschriebenem Text gesprochene Sprache. Gemini 3.8 Flash TTS ist nach Angaben von Google für kreative Anwendungen gedacht, genannt werden Spiele, Hörbücher, Podcasts und Figurenstimmen. Gemini 3.8 Flash-Lite TTS zielt laut The Next Web auf kostengünstige Anwendungen in großer Menge wie Synchronisation und Sprachagenten.

Um Sprachagenten, die live am Telefon antworten, ging es in unserem Beitrag zu Gemini 3.8 Live für Sprachagenten am Telefon. Die neuen TTS-Modelle setzen bei der Sprachausgabe selbst an.

Beide nehmen laut The Next Web Regieanweisungen Zeile für Zeile entgegen, etwa zu Gefühl und Tempo. Szenen mit zwei Sprechern sind möglich, ebenso lange Aufnahmen über Stunden. Zur Zahl der Sprachen nennt der Google-Blog mehr als 100. In einzelnen Berichten kursiert eine höhere Zahl; maßgeblich ist hier die Angabe von Google.

Preise nennen die gelesenen Quellen nicht.

Entwerfen, auswählen, nachbilden

Google bietet drei Wege zu einer Stimme. Der erste ist eine Beschreibung in Textform, aus der das Modell eine neue Stimme entwirft. Der zweite ist eine Bibliothek mit mehr als 2.000 fertigen Stimmen, darunter auch regionale Varianten. Der dritte ist das Nachbilden einer vorhandenen Stimme aus einer Aufnahme von 30 Sekunden. Für diesen dritten Weg hat Google eine Hürde eingebaut. Die Person, deren Stimme nachgebildet wird, muss eine gesprochene Einwilligung aufnehmen, The Next Web spricht von einer verpflichtenden mündlichen Einwilligungsprüfung. Im Google-Blog heißt es entsprechend, die Nachbildung laufe mit Einwilligungsprüfung. Hinzu kommt die Kennzeichnung: Alle erzeugten Aufnahmen tragen laut Google ein SynthID-Wasserzeichen, geklonte Stimmen laut The Next Web zusätzlich C2PA-Herkunftsangaben.

Hören kann man dieses Wasserzeichen nicht.

Was Betriebe in Deutschland davon nutzen können

Laut Google-Blog ist das Nachbilden einer Stimme in mehreren Regionen nicht verfügbar: in Illinois, Texas, dem Europäischen Wirtschaftsraum, Großbritannien, der Schweiz und Indien. Deutschland gehört zum EWR. Für das Entwerfen per Beschreibung und die Bibliothek nennt der Google-Blog keine solche Einschränkung.

Beim Zugang unterscheiden sich die Modelle. Flash TTS steht seit dem 23. September in der Gemini API, in Google AI Studio und in Gemini Notebook bereit. Flash-Lite TTS ist laut Google über die Gemini API, Google AI Studio und Google Vids erreichbar. In Gemini Enterprise sollen beide demnächst folgen, ein Datum nennt der Blog dafür nicht.

Zur Qualität verweist Google auf einen fremden Vergleich. Nach Angaben von Google belegt Flash TTS Platz 1 in Hume AIs Voice Design Benchmark mit 71,4 Punkten und ebenso im Gesamt-Qualitätsindex. Das ist eine Anbieterangabe, eine Messung Dritter dazu liegt in den Quellen nicht vor. Als Partner, die die Modelle einbauen, nennt Google unter anderem Figma und HeyGen.

Unsere Einschätzung

Aus unserer Sicht liegt der praktische Wert für einen Betrieb bei den fertigen und den entworfenen Stimmen. Eine Ansage für die Telefonanlage, die Tonspur zu einem Erklärvideo, ein Schulungsaudio in mehreren Sprachen: Das lässt sich damit umsetzen, ohne einen Sprecher zu buchen.

Wir würden dabei zwei Fälle strikt auseinanderhalten. Eine entworfene Kunststimme gehört niemandem, sie ist ein Werkzeug wie eine Schriftart. Die Stimme eines echten Menschen ist etwas anderes, ganz gleich, ob sie dem Chef gehört oder einem Mitarbeiter am Empfang. Sie ist ein persönliches Merkmal, und ohne Einwilligung lässt man die Finger davon. Mit diesem Werkzeug stellt sich die Frage in der EU ohnehin nicht, weil das Nachbilden hier nicht angeboten wird. Wir halten das für keinen Nachteil. Eine Kunststimme bleibt dem Betrieb auch dann erhalten, wenn ein Mitarbeiter geht, und niemand muss die Ansagen neu aufnehmen lassen.

Offen damit umgehen sollte man trotzdem. Wer eine KI-Stimme nach außen einsetzt, sagt aus unserer Sicht dazu, dass es eine KI-Stimme ist, auch wenn das Wasserzeichen unhörbar bleibt.

Welches der beiden Modelle passt, hängt vom Zweck ab. Ein Erklärvideo mit ausgearbeiteter Sprecherrolle entspricht dem, wofür Google Flash TTS vorsieht. Viele kurze Ansagen in großer Menge liegen näher an dem, was The Next Web für Flash-Lite TTS beschreibt, also kostengünstige Anwendungen. Wie groß der Unterschied in den Kosten ausfällt, lässt sich ohne Preisangaben nicht sagen.

Bevor ein Betrieb Zeit in Ansagen steckt, lohnt ein Blick auf den Zugang. Flash TTS läuft vorerst über die Gemini API, Google AI Studio und Gemini Notebook, die Einbindung in Gemini Enterprise ist angekündigt, aber noch nicht da. Zu den Kosten sagen die Quellen nichts. Wer das Werkzeug testen will, beginnt am besten mit einer einzelnen Ansage und hört sie sich im Team an, bevor sie Kunden erreicht.

Quellen

Die genannten Angaben stützen sich auf folgende öffentlich zugängliche Quellen (Stand der Recherche: 24. September 2026):

Häufige Fragen

Was ist Gemini 3.8 Flash TTS?

Gemini 3.8 Flash TTS ist ein Sprachausgabe-Modell von Google, das am 23. September 2026 zusammen mit Gemini 3.8 Flash-Lite TTS vorgestellt wurde. Es wandelt Text in gesprochene Sprache um und ist laut Google für kreative Anwendungen wie Spiele, Hörbücher und Podcasts gedacht. Der Google-Blog nennt mehr als 100 unterstützte Sprachen.

Kann man mit Gemini 3.8 Flash TTS in Deutschland Stimmen klonen?

Nein. Das Nachbilden einer vorhandenen Stimme ist laut Google-Blog im Europäischen Wirtschaftsraum nicht verfügbar, ebenso in Großbritannien, der Schweiz, Indien, Illinois und Texas. Für die Bibliothek mit mehr als 2.000 fertigen Stimmen und das Entwerfen einer Stimme per Textbeschreibung nennt der Google-Blog keine solche Einschränkung.

Wie kennzeichnet Google die erzeugten Aufnahmen?

Alle mit den Modellen erzeugten Aufnahmen tragen laut Google ein SynthID-Wasserzeichen. Geklonte Stimmen erhalten laut The Next Web zusätzlich C2PA-Herkunftsangaben. Das Wasserzeichen ist nicht hörbar.

Was sollte ein Betrieb jetzt regeln, bevor er KI-Stimmen einsetzt?

Aus unserer Sicht sollte ein Betrieb festlegen, dass für Ansagen und Erklärvideos entworfene oder fertige Stimmen genutzt werden und keine Stimmen echter Mitarbeiter. Nach außen sollte offen gesagt werden, dass eine KI-Stimme spricht. Da Preise in den Quellen fehlen und die Einbindung in Gemini Enterprise erst angekündigt ist, lohnt zunächst ein kleiner Test mit einer einzelnen Ansage.

Welche Ansagen im Betrieb könnte eine entworfene KI-Stimme übernehmen?

Im kostenlosen KI-Schnupperkurs zeigen wir in fünf Lektionen, wie kleine und mittlere Firmen KI im Alltag einsetzen. Tiefer und praxisnah geht es im Vollkurs Digitalisierungsmanager, DEKRA-zertifiziert und förderfähig über den Bildungsgutschein.


Zuletzt aktualisiert: 24. September 2026. Stand der Recherche: 24. September 2026.