Eine Abschrift, in der niemand erkennen kann, wer welchen Satz gesagt hat, taugt als Besprechungsprotokoll wenig.

Erst kostenlos reinschnuppern, dann entscheiden

Bevor du dich für eine Weiterbildung entscheidest, sieh dir kostenlos an, wie sie läuft, fünf Lektionen plus Live-Demo, ohne Verpflichtung. Passt es, ist der Digitalisierungsmanager bei bewilligtem Bildungsgutschein für dich kostenlos.

Kostenlos reinschnuppern

Der Schnupperkurs ist gratis. Ob die Weiterbildung über den Bildungsgutschein gefördert wird, entscheidet die Agentur für Arbeit im Einzelfall.

Was das Modell tut

Die Fachbezeichnung lautet Speaker Diarization. Gemeint ist die Frage, wer in einer echten Aufnahme wann gesprochen hat. Nemotron 3 Diarization beantwortet sie laut Modellkarte für bis zu acht Sprecher, entweder während die Aufnahme noch läuft (Streaming) oder im Nachgang an einer fertigen Datei (offline). Veröffentlicht wurde das Modell laut Modellkarte am 23. September 2026, und NVIDIA hat am selben Tag einen Blogbeitrag dazu auf Hugging Face gestellt.

Übertragen auf eine Teambesprechung heißt das: Jede erkannte Stimme bekommt eine eigene Kennung, und zu jeder Kennung gehören die Zeitabschnitte, in denen diese Stimme zu hören war. Eine Runde mit fünf Beteiligten liegt damit im Rahmen, den die Modellkarte nennt. Bei einer Betriebsversammlung mit zwanzig Wortmeldungen aus dem Saal endet dieser Rahmen dagegen deutlich früher als die Besprechung.

Fallen sich zwei Personen ins Wort, muss das Modell sich nicht für eine Stimme entscheiden. Laut NVIDIA-Blog können im selben Zeitabschnitt zwei Kanäle gleichzeitig aktiv sein.

Heraus kommen Zeitabschnitte mit anonymen Kennungen wie „speaker_2“. Wer sich dahinter verbirgt, stellt das Modell nicht fest. Laut Blog bleibt diese Zuordnung nachgelagerten Anwendungen überlassen, die sie etwa über Metadaten des Meetings herstellen könnten. Eine Abschrift schreibt das Modell ebenfalls nicht. Für ein Protokoll braucht es deshalb zusätzlich eine Spracherkennung, deren Text das Modell laut Modellkarte mit wortgenauen Sprecherkennzeichen versehen kann; die Modellkarte zeigt dafür einen Beispielbefehl mit der Option --diarize.

Technische Eckdaten laut Modellkarte

Erwartet wird einkanaliges Audio mit 16 kHz. Wie schnell die Sprecherzuordnung erscheint, hängt vom Eingangspuffer ab. Möglich sind laut Modellkarte schon 80 Millisekunden, empfohlen werden mindestens 0,32 Sekunden. Die Offline-Einstellung arbeitet mit 30,4 Sekunden Puffer. Ausgelegt oder optimiert ist das Modell für Systeme mit NVIDIA-GPU-Beschleunigung, ein gewöhnlicher Büro-PC ohne passende Grafikkarte ist also nicht die Zielplattform. Trainiert wurde es nach Angaben der Modellkarte mit rund 10.000 Stunden echter Gespräche, ergänzt um simulierte Mischungen. Als Sprachen nennt die Karte Englisch, Mandarin, Hindi, Kannada, Telugu, Bengali und weitere aus mehrsprachigen Quellen; die lizenzierten Mischungen umfassen 21 Sprachen. Bemerkenswert offen vermerkt die Modellkarte außerdem, dass Sprachaufnahmen personenbezogene Daten sein können.

Bei der Lizenz verweist Nvidia auf die OpenMDW-Lizenz Version 1.1. Die Modellkarte bezeichnet das Modell sinngemäß als bereit für kommerzielle und nicht kommerzielle Nutzung. Was die Lizenz im konkreten Einsatz erlaubt oder verlangt, legen wir nicht aus, das bleibt eine Prüfung am Lizenztext im Einzelfall.

Laut Unite.AI hat der Plattformanbieter Baseten am 23. September 2026 angekündigt, den Betrieb des Modells zu unterstützen.

Wie belastbar ist der Benchmark?

NVIDIA nennt ein Ergebnis aus dem ersten Durchlauf der Diarization-Bench von VoiceArena. Dort lag das Modell nach Angaben von NVIDIA auf Platz 1 unter 12 Systemen. Gemessen wurde an 139 englischsprachigen Gesprächen mit zusammen rund 22 Stunden Audio. Die Diarization Error Rate betrug 14,72 Prozent, beim nächstplatzierten System waren es 19,3 Prozent.

Zwei Einschränkungen gehören zu diesen Zahlen. Sie stammen aus NVIDIAs eigenem Beitrag, und NVIDIA schreibt selbst, diese ersten Ergebnisse könnten sich noch ändern. Außerdem ist der Test rein englisch. Wer die Zahl intern weitergibt, etwa in einer Entscheidungsvorlage, sollte beide Punkte dazuschreiben.

Wie gut das Modell eine deutsche Teambesprechung auseinanderhält, sagen die Quellen nicht.

Unsere Einschätzung

Für einen Betrieb ist Nemotron 3 Diarization ein Baustein und noch kein fertiges Werkzeug. Wer Besprechungen auf eigener Hardware protokollieren und Aufnahmen nicht an einen Cloud-Dienst geben möchte, braucht neben der Spracherkennung genau diese Antwort darauf, wer was gesagt hat. Das Modell liefert sie als offen verfügbare Komponente. Ohne Spracherkennung, ohne passende GPU und ohne jemanden, der beides zusammensetzt und pflegt, entsteht daraus aber kein Protokoll.

Aus unserer Sicht bleibt die Reihenfolge dieselbe wie bei jedem Aufzeichnungswerkzeug. Zuerst wird geklärt, ob überhaupt aufgezeichnet werden darf und ob alle Teilnehmer Bescheid wissen, dann kommt die Technik. Welche Fragen dabei auf den Tisch gehören, beschreibt unser Beitrag KI-Protokolle im Meeting: erlaubt oder heikel?, und an dieser Vorfrage ändert auch ein lokal betriebenes Modell nichts.

Die anonymen Kennungen halten wir eher für einen Vorteil. Ein Modell, das „speaker_2“ ausgibt, legt sich auf keine Person fest. Den Namen setzt am Ende ein Mensch, der das Protokoll liest und freigibt, und damit liegt die Verantwortung für die Zuordnung bei jemandem, der die Besprechung kennt.

Vor einem Einsatz würden wir das Modell mit einer deutschen Testaufnahme prüfen, deren Teilnehmer ausdrücklich eingewilligt haben, und dabei schlicht zählen, wie oft ein Sprecherwechsel falsch erkannt wird. Eine Fehlerquote aus englischen Gesprächen ersetzt diese Probe nicht.

Wer bereits einen Dienstleister für Besprechungsprotokolle nutzt, kann dort gezielt nachfragen, mit welchem Modell die Sprecher getrennt werden und auf welchem Rechner die Aufnahmen dabei landen.

Quellen

Die genannten Angaben stützen sich auf folgende öffentlich zugängliche Quellen (Stand der Recherche: 25. September 2026):

Häufige Fragen

Was ist Nemotron 3 Diarization?

Nemotron 3 Diarization ist ein Modell von Nvidia mit 100 Millionen Parametern, das laut Modellkarte am 23. September 2026 veröffentlicht wurde. Es beantwortet in Audioaufnahmen die Frage, wer wann gesprochen hat, und unterscheidet bis zu acht Sprecher. Es arbeitet live während der Aufnahme oder nachträglich an fertigen Dateien.

Schreibt das Modell ein fertiges Meetingprotokoll?

Nein. Das Modell liefert Zeitabschnitte je Sprecher mit anonymen Kennungen wie „speaker_2“, aber keine Abschrift und keine Namen. Für ein Protokoll braucht es zusätzlich eine Spracherkennung, deren Text das Modell laut Modellkarte mit wortgenauen Sprecherkennzeichen versehen kann.

Funktioniert Nemotron 3 Diarization auch mit deutschen Besprechungen?

Das sagen die Quellen nicht. Deutsch ist unter den ausdrücklich genannten Trainingssprachen nicht aufgeführt, und der von NVIDIA genannte Benchmark mit 139 Gesprächen ist rein englisch. NVIDIA bezeichnet diese ersten Ergebnisse außerdem selbst als vorläufig.

Was sollte ein Betrieb vor dem Einsatz klären?

Zuerst, ob Besprechungen überhaupt aufgezeichnet werden dürfen und ob alle Teilnehmer Bescheid wissen; die Modellkarte weist selbst darauf hin, dass Sprachaufnahmen personenbezogene Daten sein können. Danach die Technik: Das Modell ist laut Modellkarte für Systeme mit NVIDIA-GPU ausgelegt und erwartet einkanaliges Audio mit 16 kHz. Aus unserer Sicht lohnt sich vorab ein Test mit einer deutschen Aufnahme, deren Teilnehmer eingewilligt haben.

Wer setzt im Betrieb die Namen ins Protokoll, bevor es verteilt wird?

Im kostenlosen KI-Schnupperkurs zeigen wir in fünf Lektionen, wie kleine und mittlere Firmen KI im Alltag einsetzen. Tiefer und praxisnah geht es im Vollkurs Digitalisierungsmanager, DEKRA-zertifiziert und förderfähig über den Bildungsgutschein.


Zuletzt aktualisiert: 25. September 2026. Stand der Recherche: 25. September 2026.