Eine einzige synthetische Stimme soll Deutsch und 22 weitere Sprachen sprechen, jeweils mit dem passenden Akzent.

Erst kostenlos reinschnuppern, dann entscheiden

Bevor du dich für eine Weiterbildung entscheidest, sieh dir kostenlos an, wie sie läuft, fünf Lektionen plus Live-Demo, ohne Verpflichtung. Passt es, ist der Digitalisierungsmanager bei bewilligtem Bildungsgutschein für dich kostenlos.

Kostenlos reinschnuppern

Der Schnupperkurs ist gratis. Ob die Weiterbildung über den Bildungsgutschein gefördert wird, entscheidet die Agentur für Arbeit im Einzelfall.

Drei Modelle für Sprachagenten

So beschreibt Microsoft AI die neue Sprachausgabe MAI-Voice-2.1, die das Unternehmen am 1. Oktober 2026 zusammen mit der schnelleren MAI-Voice-2.1-Flash vorgestellt hat. Laut Microsoft decken die Stimmen 23 Sprachen und 26 Sprachvarianten ab, und eine Stimme spricht alle davon. Deutsch nennt der Anbieter ausdrücklich. Slator beschreibt das als Ausweitung von 15 auf 23 Sprachen.

Das dritte Modell hört zu. MAI-Transcribe-2-Streaming schreibt laut Microsoft in Echtzeit in 60 Sprachen mit und erkennt dabei fortlaufend und automatisch, welche Sprache gerade gesprochen wird. Die Batch-Fassung, die fertige Aufnahmen abschreibt, haben wir bereits im Artikel MAI-Transcribe-2: zehn Cent je Stunde Audio vorgestellt. Hier geht es um die Stimmen und um die Abschrift, die läuft, während jemand noch spricht.

Wofür das Paket gedacht ist, sagt Microsoft selbst: für Kundenservice-Agenten, die mitschreiben, während der Anrufer spricht, schon vor dem Ende seiner Frage mit der Bearbeitung beginnen und dann mit natürlicher Stimme antworten. Angeboten werden die Modelle über Microsoft Foundry, den MAI Playground, Vercel und Azure Voice Live, die Stimmen zusätzlich über OpenRouter.

Preise und Tempo laut Microsoft

Abgerechnet wird die Sprachausgabe nach Zeichen. MAI-Voice-2.1 kostet nach Angaben von Microsoft 22 US-Dollar je 1 Million Zeichen, die Flash-Variante 15 US-Dollar je 1 Million Zeichen. Für die Echtzeit-Abschrift gilt bis Jahresende ein Einführungspreis von 0,54 US-Dollar je Audiostunde. Was danach gilt, steht in keiner der Quellen. Runtime Wire hat nachgerechnet: Der Echtzeitpreis liegt beim 5,4-Fachen des Batch-Preises. Das Magazin weist selbst darauf hin, dass dabei unterschiedliche Arbeitslasten verglichen werden.

Zum Tempo nennt Microsoft zwei Werte. Erste Teilergebnisse der Abschrift sollen gut 100 Millisekunden nach Eingang des Tons vorliegen. Flash erzeuge 45 Sekunden Audio mit 150 Millisekunden Ende-zu-Ende-Latenz. Beides sind Anbieterangaben. Runtime Wire ordnet sie ein: Eine Garantie für die Antwortzeit eines fertig eingerichteten Sprachagenten sind sie nicht.

Wie die Stimmen wirken, beschreibt The Decoder. In einem Test hielt rund die Hälfte von 4.000 Teilnehmern sie für die Stimme einer echten Person.

Stimmklon mit Einwilligungsschranke

Beide Stimmmodelle können laut Microsoft eine Stimme aus wenigen Sekunden Referenzaudio nachbilden. Gegen Missbrauch hat der Anbieter nach eigenen Angaben Einwilligungsschranken eingebaut. Slator wird konkreter und nennt 5 bis 60 Sekunden Aufnahme, einen beschränkten Zugang und eine aufgezeichnete Einwilligung als Voraussetzung. Wie diese Einwilligung praktisch nachgewiesen und geprüft wird, beschreibt keine der Quellen genauer. Ob die Schranken im Alltag halten, lässt sich aus den Angaben des Herstellers allein nicht beurteilen.

Was offen bleibt

Für Betriebe in Deutschland fehlt eine wichtige Angabe. Keine der Quellen sagt, in welchen Azure-Regionen die Modelle laufen oder ob Daten in der EU verarbeitet werden. Wer Telefonate mit Kunden durch ein solches Modell schicken will, braucht diese Antwort, bevor die erste echte Stimme hindurchläuft.

Hinzu kommt der Status. Echtzeit- und Stimmmodelle sind laut Slator, das sich auf Microsofts Dokumentation beruft, eine öffentliche Vorschau ohne SLA und für den Produktivbetrieb nicht empfohlen. Wer in diesem Stadium eine Hotline darauf aufbaut, hat keine zugesagte Verfügbarkeit im Rücken.

Unsere Einschätzung

Telefonassistenten und Bandansagen auf Deutsch rücken mit solchen Preisen für kleinere Betriebe näher, und wenn die Tempoangaben in der Praxis halten, auch schneller ans Ohr des Anrufers. Den heiklen Teil sehen wir beim Stimmklon. Wer die Stimme eines Mitarbeiters für die Hotline nutzen möchte, sollte aus unserer Sicht dessen ausdrückliche Einwilligung einholen, und zwar schriftlich. Ebenso würden wir Anrufern offen sagen, dass am anderen Ende eine KI spricht. Wenn rund die Hälfte der Teilnehmer in dem Test, über den The Decoder berichtet, die Stimmen für echt hielt, wird ein Teil der Anrufer den Unterschied nicht von selbst bemerken. Ob und welche rechtlichen Pflichten im Einzelfall gelten, klärt ein Betrieb mit seinem Datenschutzbeauftragten. Unsere Empfehlung geht unabhängig davon in Richtung Offenheit, weil Vertrauen am Telefon schnell verspielt ist.

Solange die Modelle laut Slator als Vorschau ohne Zusagen laufen, gehören sie aus unserer Sicht in den Test.

Beim Rechnen würden wir vorsichtig bleiben. Der Preis der Echtzeit-Abschrift ist ein Einführungspreis bis Jahresende, und was danach kommt, hat Microsoft in den Quellen nicht genannt. Wer heute eine Kalkulation für einen Telefonassistenten aufstellt, sollte die 0,54 US-Dollar deshalb nur für die Zeit bis Jahresende ansetzen und die Zahl neu prüfen, sobald Microsoft den späteren Preis nennt.

Für diesen Test würden wir fünf typische Anrufe aus dem eigenen Alltag nehmen, etwa eine Terminanfrage und eine Reklamation, und die Antworten von der Stimme vorlesen lassen. Dann hört man genau hin, wie sie Fachbegriffe aus der eigenen Branche, Ortsnamen aus der Umgebung und Zahlen wie Kundennummern oder Beträge ausspricht.

Quellen

Die genannten Angaben stützen sich auf folgende öffentlich zugängliche Quellen (Stand der Recherche: 7. Oktober 2026):

Häufige Fragen

Was hat Microsoft am 1. Oktober 2026 vorgestellt?

Microsoft AI hat drei Modelle vorgestellt: die Sprachausgabe MAI-Voice-2.1, die schnellere Variante MAI-Voice-2.1-Flash und die Echtzeit-Abschrift MAI-Transcribe-2-Streaming. Gedacht sind sie laut Microsoft unter anderem für Kundenservice-Agenten, die mitschreiben, während der Anrufer spricht, und mit natürlicher Stimme antworten.

Spricht MAI-Voice-2.1 Deutsch, und was kostet es?

Laut Microsoft decken die Stimmen 23 Sprachen und 26 Sprachvarianten ab, Deutsch wird ausdrücklich genannt, und eine Stimme spricht alle Sprachen mit passendem Akzent. Nach Angaben von Microsoft kostet MAI-Voice-2.1 22 US-Dollar je 1 Million Zeichen, die Flash-Variante 15 US-Dollar je 1 Million Zeichen. Für die Echtzeit-Abschrift gilt bis Jahresende ein Einführungspreis von 0,54 US-Dollar je Audiostunde.

Wie funktioniert der Stimmklon und welche Schranken gibt es?

Beide Stimmmodelle können laut Microsoft eine Stimme aus wenigen Sekunden Referenzaudio nachbilden, mit eingebauten Einwilligungsschranken gegen Missbrauch. Slator nennt 5 bis 60 Sekunden Aufnahme, einen beschränkten Zugang und eine aufgezeichnete Einwilligung als Voraussetzung. Wie die Einwilligung praktisch nachgewiesen wird, beschreibt keine der Quellen genauer.

Sollte ein Betrieb seine Telefon-Hotline jetzt auf MAI-Voice-2.1 umstellen?

Aus unserer Sicht noch nicht. Laut Slator laufen die Echtzeit- und Stimmmodelle als öffentliche Vorschau ohne SLA und sind für den Produktivbetrieb nicht empfohlen, außerdem nennen die Quellen keine Azure-Regionen und keine Datenverarbeitung in der EU. Für einen Test würden wir fünf typische Anrufe aus dem eigenen Alltag nehmen und prüfen, wie die Stimme Fachbegriffe, Ortsnamen und Zahlen ausspricht.

Wie klingt die eigene Hotline, wenn eine KI-Stimme die Fachbegriffe des Betriebs vorliest?

Im kostenlosen KI-Schnupperkurs zeigen wir in fünf Lektionen, wie kleine und mittlere Firmen KI im Alltag einsetzen. Tiefer und praxisnah geht es im Vollkurs Digitalisierungsmanager, DEKRA-zertifiziert und förderfähig über den Bildungsgutschein.


Zuletzt aktualisiert: 7. Oktober 2026. Stand der Recherche: 7. Oktober 2026.