Можно ли запустить GLM-5.3 локально: честный расчёт по железу
Короткий ответ: на вашем компьютере почти наверняка нет. Наименьшая рабочая сборка старшей модели весит 216,7 ГБ, наименьшая сборка более лёгкой GLM-5.3-Flash 93,1 ГБ. Это размеры загрузки, ещё без контекста и кеша. Если у вас видеокарта на 24 ГБ, этот релиз не про вашу машину, и никакая квантизация этого не изменит.
Это честная версия. Всё остальное на этой странице служит обоснованием, проверенным по самим файлам, а не по анонсу.
Что вышло и когда
Z.ai сначала открыла доступ к GLM-5.3 через собственный API, а веса придержала. Дату этого запуска API мы не нашли ни в одном первоисточнике, поэтому здесь её нет. Сами веса задокументированы: GLM-5.3-Flash открыта 27 августа 2026 года в 10:33 UTC, старшая GLM-5.3 28 августа 2026 года в 15:22 UTC. Одна неточность остаётся: пакет GGUF от Unsloth для Flash датирован 26 августа 2026 года, а собрать GGUF из ещё не опубликованных весов невозможно. Значит, для Flash нижняя граница это 26 августа.
Причиной задержки компания называет проверку безопасности и упрочнение, и прямо объясняет суть: модель стала заметно лучше находить и эксплуатировать уязвимости в программном обеспечении. Это одинаково помогает и защитникам, и атакующим, как только веса становятся общедоступными.
Вышли две модели, и общего у них меньше, чем можно подумать по названию.
| GLM-5.3 | GLM-5.3-Flash | |
|---|---|---|
| Параметров | 753,9 млрд | 320,8 млрд |
| активных на токен | не опубликовано | 18 млрд |
| Контекстное окно | 1 048 576 токенов | 1 048 576 токенов |
| Исходные веса | 756 ГБ | 328 ГБ |
| Лицензия | собственная, не MIT | MIT |
| Понимает изображения | нет | да, изначально |
Разница в лицензиях весит больше, чем кажется в день релиза. Flash выходит под MIT: коммерческое использование, изменение и распространение без чьего-либо разрешения. Старшая модель нет. Она поставляется на собственных условиях Z.ai, и если вы строите на ней продукт, этот текст стоит прочитать, а не пролистать.
Сколько это занимает на диске
Дома никто не запускает исходные веса. Запускают квантованную сборку, и такие появились в течение нескольких часов. Пакет Unsloth для Flash датирован 26 августа 2026 года, для старшей модели 28 августа, а со 2 сентября 2026 года есть сборки MLX старшей модели под именем mlx-community/GLM-5.3-4bit. Ниже реальные размеры пакетов Unsloth, считанные вечером 28 августа 2026 года.
GLM-5.3, старшая модель
| Квант | Размер загрузки | реально для |
|---|---|---|
| UD-IQ1_S | 216,7 ГБ | 256 ГБ, и будет тесно |
| UD-IQ1_M | 228,5 ГБ | 256 ГБ, запаса меньше |
| UD-Q2_K_XL | 253,9 ГБ | от 384 ГБ |
| UD-Q3_K_XL | 343,0 ГБ | 512 ГБ |
| UD-Q4_K_XL | 467,3 ГБ | сервер, а не компьютер |
GLM-5.3-Flash
| Квант | Размер загрузки | реально для |
|---|---|---|
| UD-IQ1_S | 93,1 ГБ | 128 ГБ общей памяти |
| UD-IQ1_M | 97,6 ГБ | 128 ГБ |
| UD-Q2_K_XL | 108,7 ГБ | 128 ГБ, становится тесно |
| UD-IQ3_XXS | 120,4 ГБ | 128 ГБ только с коротким контекстом |
| UD-Q3_K_XL | 147,5 ГБ | от 192 ГБ |
| UD-IQ4_XS | 156,8 ГБ | 192 ГБ |
| UD-Q4_K_XL | 199,7 ГБ | 256 ГБ |
Для Flash есть второй файл, если нужно, чтобы модель видела изображения: mmproj-F16.gguf, 1,13 ГБ. Скачивайте его вместе с моделью. Без него Flash остаётся сильной текстовой моделью, которая молча ничего не видит, и никакого сообщения об ошибке при этом не будет.
Это размеры файлов, а не требования к памяти. Веса задают только нижнюю границу. Контекстное окно и его кеш требуют места сверх этого, а у модели, заявляющей миллион токенов, этот кеш далеко не погрешность. Сборка, которая с запасом легла на диск, ещё не помещается в оперативную память.
Ловушка, которая переворачивает всё
Старшая модель на 754 миллиарда параметров работает в обычном актуальном llama.cpp. Меньшая Flash нет. Кто не знает этого заранее, теряет на этом целый вечер.
Это звучит наоборот, пока не знаешь причину. GLM-5.3 архитектурно совпадает с GLM-5.2: те же 78 слоёв, те же 256 экспертов, то же окно на миллион токенов и ровно то же число параметров вплоть до последней цифры. Это то же тело с другим дообучением. Поэтому её архитектура glm-dsa поддерживается со времён GLM-5.2 и не требует ничего нового.
По-настоящему новой здесь оказалась именно Flash. Она объявляет себя как glm5next, и этой архитектуры нет в основной ветке llama.cpp. Карточка модели Unsloth отсылает к pull request 27754 либо к их собственному настольному приложению.
Мы снова проверили основную ветку 2 сентября 2026 года: в ней есть chatglm, glm4, glm4moe и glm-dsa, но нет glm5next. Pull request 27754 в этот день был всё ещё открыт. Это может измениться, возможно, ещё до того, как вы это прочтёте. Проверьте перед пересборкой. Если ваш llama.cpp встречает загрузку Flash ошибкой о неизвестной архитектуре, дело именно в этом, и вы ничего не настроили неправильно.
Одна настройка, которая решает вопрос скорости
GLM-5.3 принимает параметр reasoning_effort с тремя значениями: low, high и max.
Если его не передать, вы получите max. Если ошибиться в написании, вы тоже получите max. Промежуточного значения по умолчанию нет, предупреждения тоже. На модели такого размера это означает долгое и дорогое размышление над каждым сообщением, и это самая частая причина, по которой сильная модель кажется непригодной. Начинайте с low и повышайте, когда задача этого заслуживает.
Обе модели теперь работают в LU Labs Cloud
Если цифры выше исключают вашу машину, это обычный исход, а не ваша ошибка. Обходной путь есть: обе модели входят в каталог LU Labs Cloud. GLM-5.3-Flash доступна в плане Hosted, то есть в любом плане, а старшая GLM-5.3 в планах Pro и Max. Они появляются в выборе модели в веб-приложении и в настольном приложении под Windows, Linux и Mac.
Поскольку обе модели думают перед каждым ответом, рядом с кнопкой Brain теперь стоит кнопка Effort, и она задаёт, сколько модель размышляет перед ответом. В веб-приложении LU Labs Cloud она уже есть, в настольное приложение придёт со следующим обновлением 2.6.8 для Windows, Linux и Mac. У большинства рассуждающих моделей три ступени: Low, Medium и High. У GLM-5.3 и GLM-5.3-Flash сверху есть четвёртая, Max, поэтому на этих двух кнопка показывает четыре ступени, а на остальных три. Стартует она на High. Более высокая ступень даёт больше выходных токенов, а выходные токены и тратят кредиты, так что Low это экономия, а Max стоит брать для задачи, которая того заслуживает. Кнопка работает не только с GLM, а с любой рассуждающей моделью в каталоге.
Инструменты работают нативно у обеих моделей, так что режим агента и агент для кода действуют как обычно, а Flash принимает изображения.
Есть ли версия без цензуры
Для Flash да, и юридически чисто. Лицензия MIT разрешает дообучение и аблитерацию без разрешения, и первые сборки сообщества появились в тот же день, что и веса, включая пакеты GGUF без цензуры.
У старшей модели вместо MIT действует собственная лицензия Z.ai, поэтому то, что вы вправе опубликовать, определяется этим текстом, а не привычкой. А при 216,7 ГБ для наименьшей сборки практический предел почти для всех наступает раньше юридического.
Если вам нужен именно локальный ИИ без цензуры, честная рекомендация такая: берите модель, рассчитанную на обычное железо. Наше руководство по локальному ИИ без цензуры перечисляет те, что действительно помещаются, а Qwen 3.8 27B сейчас лучший компромисс для одной видеокарты.
Что мы не проверяли
Z.ai публикует прирост GLM-5.3 относительно GLM-5.2, в том числе рост CyberGym с 77,2 до 84,5 процента и ExploitBench с 24,4 до 54,4 процента. Обе цифры принадлежат производителю, получены в его собственной среде тестирования, с его настройками и опубликованы в день релиза о его же продукте.
Мы их не воспроизводили, и на момент написания этого не сделал никто за пределами Z.ai. Считайте их указанием направления, а не доказательством. Все данные на этой странице о размерах файлов, параметрах, архитектурах и лицензиях, напротив, взяты из репозиториев моделей и исходного кода llama.cpp, а не из анонса.
Locally Uncensored распространяется под AGPL-3.0 и бесплатен. Разработка PurpleDoubleD.