ИИтак

← Назад

Модель · Z.ai

GLM-5.3-FlashX

Ускоренная версия недорогой GLM-5.3-Flash для программирования и агентов: выдаёт до 200 токенов в секунду

вышла 18 сентября

Характеристики

Вышла
18 сентября
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,37 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,075 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$1,25 за миллион токенов
Понимает
текст, изображения, видео, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
glm-5.3-flashx

Что это за модель

GLM-5.3-FlashX — ускоренный вариант GLM-5.3-Flash. Z.ai описывает обе в одной документации как одну модель: FlashX отличается скоростью работы в API, до 200 токенов в секунду. В основе смесь экспертов (mixture of experts): всего 320 млрд параметров, но на каждый токен работают только 18 млрд. Внимание гибридное: разреженное сочетается с линейным. Так модель дешевле обрабатывает длинные тексты.

Flash — облегчённая версия GLM-5.3. Слоёв у неё вдвое меньше: 45 против 92. Активных параметров тоже меньше, 18 млрд против 32 млрд. По данным Z.ai, на длинном контексте вычислений внимания нужно в 3 раза меньше, а памяти под кэш — в 4,4 раза. Это первая в линейке GLM-5 модель, которая с самого начала обучена понимать не только текст, но и картинки с видео. По замерам лаборатории, она обходит GLM-5.2, причём часто с большим отрывом: 63,4 против 46,2 в DeepSWE v1.1 и 48,8 против 26,2 в AutomationBench. На Hugging Face компания заявляет, что в программировании и агентных задачах модель приближается к Claude Opus 4.8.

Модель берут для программирования, долгих агентных задач и работы с визуальными данными. Среди сценариев Z.ai называет вёрстку интерфейса по скриншоту, подготовку презентаций, таблиц и документов, финансовый анализ, разметку видео с субтитрами, 3D-модели в Blender и управление компьютером. Версию FlashX выбирают, когда важна скорость ответа. Она примерно в два с половиной раза дороже обычной Flash.

Отключить рассуждения перед ответом нельзя: API принимает только включённый режим, но его глубину можно задать уровнем. На старте FlashX не вошла в подписку GLM Coding Plan, куда входит обычная Flash. Веса GLM-5.3-Flash выложены на Hugging Face под лицензией MIT, модель можно запускать у себя через vLLM, SGLang и другие движки.

Источники: Документация Z.ai: GLM-5.3-Flash и FlashX, Карточка GLM-5.3-Flash на Hugging Face

Другие модели семейства

Новости о модели

  1. 01

    Натан Ламберт рассказал Конгрессу, насколько Китай обогнал США в открытых моделях

    Interconnects

  2. 02

    «Интеллект растёт экспоненциально»: Маск о малых открытых моделях, обошедших лидеров 2025 года

    Илон Маск

  3. 03

    Z.ai собрала инфраструктуру для GLM-5.3-Flash с помощью GLM-5.3

    Z.ai · X

  4. 04

    DeepSeek V4.1-Flash в независимых тестах: очень многословна, но всё равно дешевле всех

    Latent Space

  5. 05

    Z.ai закрутила лицензию GLM-5.3: гигантам с выручкой от 10 млрд долларов нужна её проверка

    Interconnects

  6. 06

    NVIDIA покупает Hugging Face за 13 млрд долларов — почти вдвое дороже первого предложения

    Latent Space

все 7 новостей о GLM-5.3 →

Данные: models.dev (MIT).