GLM-5.3 lokal nutzen: die ehrliche Hardware-Rechnung
Die kurze Antwort: auf dem Rechner, den Sie besitzen, mit hoher Wahrscheinlichkeit nicht. Die kleinste brauchbare Fassung des großen Modells ist 216,7 GB, die kleinste Fassung des leichteren GLM-5.3-Flash liegt bei 93,1 GB. Das sind Downloadgrößen, noch ohne Kontext und Zwischenspeicher. Wer eine Grafikkarte mit 24 GB hat, ist bei diesem Modell nicht gemeint, und daran ändert auch keine Quantisierung etwas.
Das ist die ehrliche Fassung. Der Rest dieser Seite ist die Begründung dazu, geprüft an den echten Dateien statt an der Ankündigung.
Was erschienen ist, und wann
Z.ai hat GLM-5.3 zuerst über die eigene Schnittstelle ausgeliefert und die Gewichte zurückgehalten. Ein belastbares Datum für diesen Schnittstellenstart haben wir in keiner Primärquelle gefunden, deshalb steht hier keines. Die Gewichte dagegen sind dokumentiert: GLM-5.3-Flash ist seit dem 27. August 2026 um 10:33 UTC öffentlich, das Flaggschiff GLM-5.3 seit dem 28. August 2026 um 15:22 UTC. Eine Unschärfe bleibt: das GGUF-Paket von Unsloth für Flash trägt den 26. August 2026, und niemand baut ein GGUF aus Gewichten, die es noch nicht gibt. Für Flash gilt der 26. August also als Untergrenze.
Als Grund für das Zurückhalten nennt das Unternehmen Sicherheitsprüfung und Härtung, und es benennt auch, worum es dabei geht: das Modell ist deutlich besser darin geworden, Sicherheitslücken in Software zu finden und auszunutzen. Das hilft Verteidigern und Angreifern gleichermaßen, sobald die Gewichte frei verfügbar sind.
Erschienen sind zwei Modelle, und sie haben weniger gemeinsam, als der geteilte Name vermuten lässt.
| GLM-5.3 | GLM-5.3-Flash | |
|---|---|---|
| Parameter | 753,9 Milliarden | 320,8 Milliarden |
| aktiv je Token | nicht veröffentlicht | 18 Milliarden |
| Kontextfenster | 1.048.576 Token | 1.048.576 Token |
| Rohgewichte | 756 GB | 328 GB |
| Lizenz | eigene, nicht MIT | MIT |
| versteht Bilder | nein | ja, von Haus aus |
Der Lizenzunterschied wiegt schwerer, als am ersten Tag auffällt. Flash steht unter MIT, also gewerbliche Nutzung, Veränderung und Weitergabe ohne Rückfrage. Das große Modell nicht. Es kommt unter Z.ais eigenen Bedingungen, und wer ein Produkt darauf bauen will, sollte diesen Text wirklich lesen statt überfliegen.
Was es auf der Festplatte kostet
Zuhause läuft niemand die Rohgewichte. Man nimmt eine quantisierte Fassung, und die lagen innerhalb weniger Stunden bereit. Das Unsloth-Paket für Flash trägt den 26. August 2026, das für das Flaggschiff den 28. August, und seit dem 2. September 2026 gibt es MLX-Fassungen des Flaggschiffs als mlx-community/GLM-5.3-4bit. Die folgenden Zahlen sind die tatsächlichen Größen der Unsloth-Pakete, gelesen am Abend des 28. August 2026.
GLM-5.3, das große Modell
| Quant | Downloadgröße | realistisch für |
|---|---|---|
| UD-IQ1_S | 216,7 GB | 256 GB, und es wird eng |
| UD-IQ1_M | 228,5 GB | 256 GB, mit weniger Luft |
| UD-Q2_K_XL | 253,9 GB | ab 384 GB |
| UD-Q3_K_XL | 343,0 GB | 512 GB |
| UD-Q4_K_XL | 467,3 GB | ein Server, kein Rechner |
GLM-5.3-Flash
| Quant | Downloadgröße | realistisch für |
|---|---|---|
| UD-IQ1_S | 93,1 GB | 128 GB gemeinsamer Speicher |
| UD-IQ1_M | 97,6 GB | 128 GB |
| UD-Q2_K_XL | 108,7 GB | 128 GB, wird eng |
| UD-IQ3_XXS | 120,4 GB | 128 GB nur mit kurzem Kontext |
| UD-Q3_K_XL | 147,5 GB | ab 192 GB |
| UD-IQ4_XS | 156,8 GB | 192 GB |
| UD-Q4_K_XL | 199,7 GB | 256 GB |
Für Flash gibt es eine zweite Datei, wenn das Modell Bilder ansehen soll: mmproj-F16.gguf mit 1,13 GB. Laden Sie sie zusammen mit dem Modell. Ohne sie ist Flash ein starkes Textmodell, das stillschweigend nichts sieht, und es gibt keine Fehlermeldung, die darauf hinweist.
Das sind Dateigrößen, kein Speicherbedarf. Die Gewichte sind die Untergrenze. Kontextfenster und Zwischenspeicher wollen zusätzlichen Platz, und bei einem Modell, das mit einer Million Token wirbt, ist dieser Zwischenspeicher kein Rundungsfehler. Eine Fassung, die mit etwas Luft auf die Platte passt, passt deshalb noch lange nicht in den Arbeitsspeicher.
Die Falle, die alles umdreht
Das große Modell mit 754 Milliarden Parametern läuft in einem normalen, aktuellen llama.cpp. Das kleinere Flash nicht. Wer das vorher nicht weiß, verliert daran einen Nachmittag.
Das klingt verkehrt herum, bis man den Grund kennt. GLM-5.3 ist baugleich mit GLM-5.2: dieselben 78 Schichten, dieselben 256 Experten, dasselbe Millionenfenster und exakt dieselbe Parameterzahl bis auf die letzte Stelle. Es ist derselbe Körper mit einem anderen Nachtraining. Seine Architektur glm-dsa wird deshalb seit GLM-5.2 unterstützt und braucht nichts Neues.
Flash ist das wirklich Neue. Es meldet sich als glm5next, und diese Architektur steht nicht im Hauptzweig von llama.cpp. Die Modellkarte von Unsloth verweist stattdessen auf Pull Request 27754 oder die eigene Desktop-Anwendung.
Wir haben den Hauptzweig am 2. September 2026 erneut geprüft: er kennt chatglm, glm4, glm4moe und glm-dsa, aber kein glm5next. Pull Request 27754 war an diesem Tag noch offen. Das kann sich ändern, möglicherweise noch bevor Sie das hier lesen. Prüfen Sie es, bevor Sie neu bauen. Wenn Ihr llama.cpp einen Flash-Download mit einem Fehler über eine unbekannte Architektur ablehnt, liegt es daran, und Sie haben nichts falsch eingestellt.
Die eine Einstellung, die über das Tempo entscheidet
GLM-5.3 nimmt einen Parameter reasoning_effort mit drei Stufen: low, high und max.
Wer ihn weglässt, bekommt max. Wer sich vertippt, bekommt ebenfalls max. Es gibt keine mittlere Voreinstellung und keine Warnung. Bei einem Modell dieser Größe bedeutet das langes, teures Nachdenken bei jeder einzelnen Nachricht, und es ist der häufigste Grund, warum ein starkes Modell sich unbenutzbar anfühlt. Fangen Sie mit low an und erhöhen Sie, wenn eine Aufgabe es verdient.
Beide Modelle laufen jetzt in der LU Labs Cloud
Wenn die Zahlen oben Ihren Rechner ausschließen, ist das der Normalfall und kein Versagen Ihrerseits. Es gibt einen Weg daran vorbei: beide Modelle stehen im Katalog der LU Labs Cloud. GLM-5.3-Flash liegt im Hosted-Plan und damit in jedem Plan, das Flaggschiff GLM-5.3 im Pro- und im Max-Plan. Sie tauchen in der Modellauswahl der Web-App und der Desktop-App unter Windows, Linux und Mac auf.
Weil beide Modelle vor jeder Antwort nachdenken, sitzt neben dem Brain-Knopf jetzt ein Effort-Knopf, und der steuert, wie viel das Modell vor der Antwort nachdenkt. In der Web-App von LU Labs Cloud ist er heute schon da, in die Desktop-App kommt er mit dem nächsten Update 2.6.8 für Windows, Linux und Mac. Die meisten Reasoning-Modelle haben drei Stufen: Low, Medium und High. GLM-5.3 und GLM-5.3-Flash haben darüber noch eine vierte, Max, deshalb zeigt der Knopf bei diesen beiden vier Stufen und sonst überall drei. Er startet auf High. Eine höhere Stufe erzeugt mehr Ausgabetoken, und Ausgabetoken sind das, was am Guthaben zieht. Low ist also die Ersparnis, und Max lohnt sich für eine Aufgabe, die es verdient. Der Knopf gilt nicht nur für GLM, sondern für jedes Reasoning-Modell im Katalog.
Werkzeuge laufen bei beiden Modellen nativ, der Agent-Modus und der Coding-Agent arbeiten also ganz normal, und Flash nimmt Bilder an.
Gibt es eine unzensierte Fassung
Für Flash ja, und rechtlich sauber. Die MIT-Lizenz erlaubt Feinabstimmungen und Abliterationen ohne Rückfrage, und die ersten Gemeinschaftsfassungen tauchten noch am Tag der Veröffentlichung auf, darunter unzensierte GGUF-Pakete.
Beim großen Modell gilt Z.ais eigene Lizenz statt MIT, was Sie veröffentlichen dürfen, richtet sich also nach diesem Text und nicht nach Gewohnheit. Und bei 216,7 GB für die kleinste Fassung kommt die praktische Grenze für fast alle ohnehin vor der rechtlichen.
Wenn es Ihnen um unzensierte KI auf dem eigenen Rechner geht, lautet die ehrliche Empfehlung: nehmen Sie ein Modell, das für normale Hardware gebaut ist. Unser Guide zu unzensierter KI auf dem eigenen PC zeigt die Modelle, die wirklich passen, und Qwen 3.8 27B ist derzeit der beste Kompromiss für eine einzelne Grafikkarte.
Was wir nicht nachgeprüft haben
Z.ai veröffentlicht Verbesserungen von GLM-5.3 gegenüber GLM-5.2, darunter einen Anstieg bei CyberGym von 77,2 auf 84,5 Prozent und bei ExploitBench von 24,4 auf 54,4 Prozent. Beide Zahlen stammen vom Hersteller, aus dessen eigener Testumgebung, mit dessen Einstellungen, veröffentlicht am Tag der Vorstellung über dessen eigenes Produkt.
Wir haben sie nicht nachgefahren, und zum Zeitpunkt dieses Textes hat das außerhalb von Z.ai niemand getan. Behandeln Sie sie als Richtungsangabe, nicht als Beleg. Alle Angaben auf dieser Seite zu Dateigrößen, Parametern, Architekturen und Lizenzen stammen dagegen aus den Modellablagen und dem Quelltext von llama.cpp, nicht aus der Ankündigung.
Locally Uncensored steht unter AGPL-3.0 und ist kostenlos nutzbar. Gebaut von PurpleDoubleD.