Eine Stunde Besprechung maschinell verschriften zu lassen, kostet bei diesem Anbieter weniger als ein Kaffee.
Erst kostenlos reinschnuppern, dann entscheiden
Bevor du dich für eine Weiterbildung entscheidest, sieh dir kostenlos an, wie sie läuft, fünf Lektionen plus Live-Demo, ohne Verpflichtung. Passt es, ist der Digitalisierungsmanager bei bewilligtem Bildungsgutschein für dich kostenlos.
Kostenlos reinschnuppernDer Schnupperkurs ist gratis. Ob die Weiterbildung über den Bildungsgutschein gefördert wird, entscheidet die Agentur für Arbeit im Einzelfall.
Zehn Cent mit Verfallsdatum
Die Zahl aus der Mitteilung vom 3. September 2026 lautet 0,10 US-Dollar je Stunde Audio. Sie steht dort mit einer Einschränkung, die in der Berichterstattung leicht untergeht: Zugesagt ist dieser Preis bis zum 31. Dezember 2026. Was das Modell ab Januar kostet, hat Microsoft nicht mitgeteilt.
Wer heute damit kalkuliert, rechnet also mit einem Wert, der ein Ablaufdatum trägt.
Als Vergleichsmaßstab nennt Microsoft den eigenen Vorgänger. MAI-Transcribe-1 startete bei 0,36 US-Dollar je Stunde. Beide Zahlen kommen aus demselben Haus, es handelt sich um eine Angabe des Anbieters über sein eigenes Sortiment und nicht um die Erhebung eines Dritten.
Was Microsoft dem Modell zuschreibt
Der Funktionsumfang, wie ihn die Mitteilung beschreibt, geht über reines Abtippen hinaus. 60 Sprachen sind abgedeckt, die Sprache erkennt das Modell selbst, und auch eine Aufnahme, in der zwischen zwei Sprachen gewechselt wird, soll es verarbeiten. Mehrere Sprecher werden voneinander getrennt, sodass in der fertigen Datei steht, wer wann etwas gesagt hat. Zeitstempel setzt das Modell auf Wortebene. Fachbegriffe lassen sich vorgeben, damit ein Produktname oder eine Bauteilbezeichnung nicht bei jedem Vorkommen anders geschrieben wird. Die Verschriftung gibt es wahlweise wortgetreu oder geglättet, also mit oder ohne Räuspern, Versprecher und halbe Sätze. Für ein Protokoll ist die geglättete Fassung die brauchbarere, für eine Übergabe, bei der es auf den genauen Wortlaut ankommt, die wortgetreue.
In derselben Mitteilung nennt Microsoft das Modell das schnellste, genaueste und günstigste Spracherkennungsmodell der Welt und verweist auf einen Spitzenplatz im Vergleichstest FLEURS über 60 Sprachen. Das ist die Werbeaussage eines Herstellers über sein eigenes Produkt, und genau so gehört sie gelesen.
Wie das Modell im Deutschen abschneidet, geht aus den geprüften Angaben nicht hervor.
Wo in einem Betrieb ohnehin gesprochen wird
Bei diesem Preis kippt eine Rechnung, die vorher nicht aufging. Verschriften lohnte sich für die eine wichtige Sitzung, für die jemand ohnehin ein Protokoll schreiben musste. Alles andere blieb ungeschrieben, weil der Aufwand in keinem Verhältnis zum Ergebnis stand.
Gesprochen wird in einem kleinen Betrieb aber den ganzen Tag: das Übergabegespräch auf der Baustelle, das Telefonat mit dem Lieferanten, die Einweisung eines neuen Kollegen. Dieses Material verschwindet bisher, und mit ihm die Begründung, warum eine Entscheidung so und nicht anders gefallen ist. Wie sich gesprochene Sprache im Arbeitsalltag in verwertbare Dokumentation verwandeln lässt, haben wir im Artikel KI-Diktat und Spracheingabe im Betrieb beschrieben.
Die Sprechertrennung ist dabei der Teil, der aus einer Tonspur ein benutzbares Dokument macht. Ein Protokoll, in dem alle Beiträge zu einem Block verschmelzen, hilft niemandem weiter.
Bevor jemand auf Aufnahme drückt
Eine Aufnahme, auf der Dritte zu hören sind, ist kein Selbstläufer. Wer mitschneidet, klärt vorher, wer davon weiß, und er klärt, wo die Datei anschließend liegt und wer sie öffnen darf. Für das Kundengespräch gilt das genauso wie für die Runde im eigenen Team. Eine Rechtsberatung ist dieser Hinweis nicht, wohl aber die Reihenfolge, in der ein Betrieb die Fragen abarbeiten sollte, bevor die erste Aufnahme läuft.
Unsere Einschätzung
In unseren Kursen bleibt Transkription regelmäßig als erstes KI-Werkzeug hängen, weil das Ergebnis sofort sichtbar ist und niemand dafür ein Prompt-Training braucht. Der Preis war bisher trotzdem das Argument, mit dem der Chef die Sache vertagt hat.
Dieses Argument fällt weg, und damit rückt die zweite Frage nach vorn. Sie lautet nicht, ob die Verschriftung bezahlbar ist, sondern was mit den entstehenden Dateien passiert. Aus einer Stunde Ton wird ein durchsuchbares Dokument, und wer viele davon anlegt, hat nach wenigen Monaten ein Archiv, in dem jedes gesprochene Wort steht. Das ist nützlich und unangenehm zugleich, weil sich ein solches Archiv auch gegen den lesen lässt, der es angelegt hat. Wer solche Abläufe einführt, sollte deshalb klein anfangen, an einem wiederkehrenden Termin, mit einer festen Ablage und einer Aufbewahrungsfrist, die jemand vorher festgelegt hat.
Die Kalkulation bekommt zusätzlich ein Ablaufdatum mit auf den Weg. Der zugesagte Preis endet zum Jahreswechsel, und was danach gilt, ist offen. Wer den Ablauf jetzt aufbaut, sollte wissen, wie viele Stunden Ton im Monat zusammenkommen. Dann bleibt die Rechnung im Januar nachvollziehbar, welche Zahl dann auch in der Preisliste steht.
Quellen
Die genannten Angaben stützen sich auf folgende öffentlich zugängliche Quellen (Stand der Recherche: 4. September 2026):
- Microsoft AI: MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world
- VentureBeat: Microsoft AI's MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed
- Neowin: Microsoft's MAI-Transcribe-2 model beats OpenAI and Google while costing just 0.10 per hour
Häufige Fragen
Was kostet MAI-Transcribe-2 je Stunde Audio?
Microsoft nennt 0,10 US-Dollar je Stunde Audio. Dieser Preis ist bis zum 31. Dezember 2026 zugesagt, was ab 2027 berechnet wird, hat Microsoft nicht mitgeteilt. Der Vorgänger MAI-Transcribe-1 startete nach Angaben des Anbieters bei 0,36 US-Dollar je Stunde.
Welche Funktionen bringt das Modell mit?
Es deckt 60 Sprachen ab und erkennt die gesprochene Sprache automatisch, auch wenn innerhalb einer Aufnahme zwischen Sprachen gewechselt wird. Mehrere Sprecher werden voneinander getrennt, Zeitstempel setzt das Modell auf Wortebene. Vorgegebene Fachbegriffe werden bevorzugt, und die Verschriftung gibt es wahlweise wortgetreu oder geglättet.
Ist das Modell wirklich das beste der Welt?
Microsoft bezeichnet es in der eigenen Mitteilung als das schnellste, genaueste und günstigste Spracherkennungsmodell der Welt und verweist auf einen Spitzenplatz im Vergleichstest FLEURS über 60 Sprachen. Das ist die Werbeaussage des Herstellers über sein eigenes Produkt und keine Messung eines unabhängigen Dritten. Wie das Modell im Deutschen abschneidet, geht aus den geprüften Angaben nicht hervor.
Was sollte ein Betrieb regeln, bevor er Gespräche mitschneidet?
Eine Aufnahme, auf der Dritte zu hören sind, will vorbereitet sein. Vor dem ersten Mitschnitt gehört geklärt, wer von der Aufnahme weiß, wo die Datei anschließend liegt, wer sie öffnen darf und wie lange sie aufbewahrt wird. Der zweite Punkt betrifft die Kalkulation: Der genannte Preis endet am 31. Dezember 2026, und was danach gilt, ist offen.
Wie viele Stunden Gespräch fallen im Betrieb an, die heute niemand festhält?
Im kostenlosen KI-Schnupperkurs zeigen wir in fünf Lektionen, wie kleine und mittlere Firmen KI im Alltag einsetzen. Tiefer und praxisnah geht es im Vollkurs Digitalisierungsmanager, DEKRA-zertifiziert und förderfähig über den Bildungsgutschein.
Zuletzt aktualisiert: 4. September 2026. Stand der Recherche: 4. September 2026.