Auf die Schnelle

Alibaba hat Qwen3.8-Max am 3. August 2026 veröffentlicht. Das Modell hat 2,4 Billionen Parameter in einer Mixture-of-Experts-Architektur, verarbeitet Text, Bilder und Video und fasst bis zu einer Million Token Kontext. Laut offizieller Modellseite kostet die Nutzung 2 US-Dollar je Million Token Eingabe und 6 US-Dollar je Million Token Ausgabe. Angekündigt ist die Freigabe der Gewichte in der Folgewoche sowie eine deutlich kleinere Variante namens Qwen3.8-27B. Stand 4. August läuft das Modell nur über QwenCloud.

Ein Modell mit 2,4 Billionen Parametern kann kein mittelständischer Betrieb selbst betreiben. Interessant an der Ankündigung vom 3. August 2026 ist deshalb nicht die Größe, sondern der Satz daneben: Alibaba will die Gewichte freigeben und zusätzlich eine kleine Variante nachschieben.

Was in dem Modell steckt

Qwen3.8-Max nutzt eine Mixture-of-Experts-Architektur. Von den 2,4 Billionen Parametern insgesamt sind laut Berichterstattung je Anfrage rund 95 Milliarden aktiv, was Rechenaufwand und Antwortzeit begrenzt.

Eingaben verarbeitet das Modell als Text, Bild und Video, ausgegeben wird Text. Das Kontextfenster reicht bis eine Million Token, die maximale Eingabe liegt laut offizieller Modellseite bei 991.000 Token, die maximale Ausgabe bei 131.000.

Alibaba wirbt vor allem mit langen, eigenständig durchgezogenen Arbeitsaufträgen. Als Beleg nennt der Anbieter ein Softwareprojekt, an dem das Modell über 16 Tage ohne menschliches Eingreifen gearbeitet habe, mit 265 Commits, 127 Pull Requests und 151 Issues. Herausgekommen ist ein Kommandozeilenwerkzeug namens oh-my-cli.

An Benchmarks nennt der Anbieter unter anderem 86,6 auf Terminal-Bench 2.1 und 93,0 auf PaperBench. Das sind Herstellerangaben, unabhängig nachgemessen ist davon zum Zeitpunkt dieser Recherche nichts.

Der Preis, den man vergleichen kann

Laut offizieller Modellseite kostet eine Million Token Eingabe 2 US-Dollar, eine Million Token Ausgabe 6 US-Dollar. Für zwischengespeicherte Eingaben liegt der Wert bei 0,25 US-Dollar, für explizit angelegten Zwischenspeicher bei 2,50 US-Dollar und für das Lesen daraus bei 0,17 US-Dollar.

Zum Vergleich hilft ein Blick auf die eigene Rechnung. Wer heute Angebote entwerfen, Protokolle zusammenfassen oder Kundenanfragen vorsortieren lässt, bewegt sich pro Vorgang meist im Bereich weniger tausend Token. Der Unterschied zwischen zwei und fünf Dollar je Million Token entscheidet bei diesem Volumen nichts. Er entscheidet erst dort, wo Agenten stundenlang durchlaufen und dabei ihren eigenen Verlauf immer wieder neu einlesen.

Was die offenen Gewichte praktisch bedeuten

Alibaba hat angekündigt, die Gewichte in der Woche nach dem Start über Hugging Face und ModelScope bereitzustellen. Laut Berichterstattung wäre Qwen3.8-Max das erste Modell der Max-Klasse, dessen Gewichte veröffentlicht werden.

Für einen Betrieb mit eigener Serverhardware ändert das an der 2,4-Billionen-Variante wenig. Ein Modell dieser Größe braucht eine Rechenzentrumsausstattung, die im sechsstelligen Bereich beginnt, plus jemanden, der sie betreibt.

Die angekündigte Variante Qwen3.8-27B ist die eigentlich relevante Nachricht für den Mittelstand. Modelle dieser Größenordnung laufen auf einem einzelnen leistungsfähigen Server und lassen sich im eigenen Haus betreiben, ohne dass Daten das Gebäude verlassen. Für Betriebe mit sensiblen Unterlagen, etwa in der Steuerberatung, im Gesundheitsbereich oder in der Auftragsfertigung, ist genau das der Punkt, an dem KI überhaupt erst diskutabel wird. Was dabei technisch und organisatorisch zu bedenken ist, haben wir am Beispiel eines anderen offenen Modells im Beitrag zum Selbsthosten offener Modelle beschrieben. Wie schnell die Qwen-Reihe sich weiterentwickelt, zeigt der Abstand zur Vorgängergeneration, die wir im Beitrag zu Qwen 3.7 Max besprochen haben.

Bis die Gewichte tatsächlich da sind, bleibt es eine Ankündigung. Termine dieser Art verschieben sich regelmäßig.

Zu offenen Gewichten gehört eine Einschränkung, die in Meldungen oft untergeht. Offene Gewichte heißen nicht automatisch freie Nutzung. Entscheidend ist die Lizenz, die dabei liegt, und die legt fest, ob gewerbliche Nutzung erlaubt ist, ob Ergebnisse zum Training eigener Modelle verwendet werden dürfen und ob es Auflagen zur Namensnennung gibt. Wer ein offenes Modell in ein Produkt einbaut, sollte diese Lizenz gelesen haben, bevor der erste Kunde damit arbeitet.

Die Datenschutzfrage vor dem Test

Wer das Modell über QwenCloud nutzt, gibt Daten an einen Anbieter außerhalb der EU. Damit gelten die Regeln für Drittlandübermittlungen nach Artikel 44 und folgende der Datenschutz-Grundverordnung, dazu die Frage nach einem Auftragsverarbeitungsvertrag nach Artikel 28.

Das ist kein Ausschlusskriterium und auch kein Sonderfall für chinesische Anbieter, dieselbe Prüfung fällt bei US-Anbietern an. Sie fällt nur an, bevor jemand die ersten Kundendaten in ein Testfenster kopiert, und nicht danach.

Was für den konkreten Fall gilt, beantwortet eine Fachanwaltskanzlei oder der eigene Datenschutzbeauftragte. Dieser Artikel ersetzt das nicht.

Wie wir das einordnen

Die Parameterzahl ist die Zahl, die es in die Überschriften schafft, und sie ist für einen Betrieb mit 40 Leuten ohne jede Bedeutung.

Bedeutung hat etwas anderes. Seit gut einem Jahr erscheinen leistungsfähige Modelle mit offenen Gewichten in immer kürzeren Abständen, und die kleinen Varianten holen auf. Das verschiebt die Frage, die im Mittelstand tatsächlich gestellt wird. Sie lautet nicht mehr, ob KI im eigenen Haus laufen kann, sondern ob sich der Aufwand gegenüber einem eingekauften Dienst lohnt. Für die meisten Betriebe lautet die Antwort heute noch: eher nicht, weil Betrieb, Aktualisierung und Absicherung eines eigenen Modells laufende Arbeit sind, die jemand machen muss.

Wer sich das trotzdem anschaut, sollte den Vergleich ehrlich rechnen. Serverhardware, Strom, Wartung und die Arbeitszeit für Betrieb und Aktualisierungen stehen gegen eine Rechnung, die bei den meisten kleinen Betrieben im zweistelligen Eurobereich pro Monat liegt. Der Grund für ein eigenes Modell ist dann selten der Preis, sondern die Frage, welche Daten das Haus verlassen dürfen.

Quellen

Die genannten Angaben stützen sich auf folgende öffentlich zugängliche Quellen (Stand der Recherche: 4. August 2026):

Häufige Fragen

Was kann Qwen3.8-Max?

Das Modell hat 2,4 Billionen Parameter in einer Mixture-of-Experts-Architektur, verarbeitet Text, Bilder und Video und gibt Text aus. Das Kontextfenster reicht bis eine Million Token, die maximale Eingabe liegt bei 991.000 Token. Alibaba wirbt vor allem mit lange durchgehaltenen, eigenständigen Arbeitsaufträgen und nennt ein Softwareprojekt über 16 Tage als Beleg.

Was kostet die Nutzung von Qwen3.8-Max?

Laut offizieller Modellseite kostet eine Million Token Eingabe 2 US-Dollar und eine Million Token Ausgabe 6 US-Dollar. Für zwischengespeicherte Eingaben werden 0,25 US-Dollar berechnet, für explizit angelegten Zwischenspeicher 2,50 US-Dollar und für das Lesen daraus 0,17 US-Dollar.

Sind die Gewichte schon frei verfügbar?

Nein. Alibaba hat angekündigt, die Gewichte in der Woche nach dem Start über Hugging Face und ModelScope bereitzustellen und zusätzlich eine kleinere Variante namens Qwen3.8-27B zu veröffentlichen. Stand 4. August 2026 läuft das Modell ausschließlich über QwenCloud. Termine dieser Art verschieben sich erfahrungsgemäß.

Kann ein mittelständischer Betrieb so ein Modell selbst betreiben?

Die 2,4-Billionen-Variante braucht eine Rechenzentrumsausstattung, die für einen typischen Betrieb außer Reichweite liegt. Interessanter ist die angekündigte Variante mit 27 Milliarden Parametern, die auf einem einzelnen leistungsfähigen Server laufen kann. Der Grund für eigenen Betrieb ist dabei selten der Preis, sondern die Frage, welche Daten das Haus verlassen dürfen.

Einschätzen können, welches KI-Modell zum eigenen Betrieb passt?

Im kostenlosen KI-Schnupperkurs zeigen wir in fünf Lektionen, wie kleine und mittlere Firmen KI im Alltag nutzen. Tiefer und praxisnah geht es im Vollkurs Digitalisierungsmanager, DEKRA-zertifiziert und förderfähig über den Bildungsgutschein.


Zuletzt aktualisiert: 4. August 2026. Stand der Recherche: 4. August 2026.