Модель · Z.ai
GLM-5.3-FlashX
Ускоренная версия недорогой GLM-5.3-Flash для программирования и агентов: выдаёт до 200 токенов в секунду
вышла 18 сентября
Характеристики
- Вышла
- 18 сентября
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 1 млн токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 131 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,37 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $0,075 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $1,25 за миллион токенов
- Понимает
- текст, изображения, видео, PDF
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- glm-5.3-flashx
Что это за модель
GLM-5.3-FlashX — ускоренный вариант GLM-5.3-Flash. Z.ai описывает обе в одной документации как одну модель: FlashX отличается скоростью работы в API, до 200 токенов в секунду. В основе смесь экспертов (mixture of experts): всего 320 млрд параметров, но на каждый токен работают только 18 млрд. Внимание гибридное: разреженное сочетается с линейным. Так модель дешевле обрабатывает длинные тексты.
Flash — облегчённая версия GLM-5.3. Слоёв у неё вдвое меньше: 45 против 92. Активных параметров тоже меньше, 18 млрд против 32 млрд. По данным Z.ai, на длинном контексте вычислений внимания нужно в 3 раза меньше, а памяти под кэш — в 4,4 раза. Это первая в линейке GLM-5 модель, которая с самого начала обучена понимать не только текст, но и картинки с видео. По замерам лаборатории, она обходит GLM-5.2, причём часто с большим отрывом: 63,4 против 46,2 в DeepSWE v1.1 и 48,8 против 26,2 в AutomationBench. На Hugging Face компания заявляет, что в программировании и агентных задачах модель приближается к Claude Opus 4.8.
Модель берут для программирования, долгих агентных задач и работы с визуальными данными. Среди сценариев Z.ai называет вёрстку интерфейса по скриншоту, подготовку презентаций, таблиц и документов, финансовый анализ, разметку видео с субтитрами, 3D-модели в Blender и управление компьютером. Версию FlashX выбирают, когда важна скорость ответа. Она примерно в два с половиной раза дороже обычной Flash.
Отключить рассуждения перед ответом нельзя: API принимает только включённый режим, но его глубину можно задать уровнем. На старте FlashX не вошла в подписку GLM Coding Plan, куда входит обычная Flash. Веса GLM-5.3-Flash выложены на Hugging Face под лицензией MIT, модель можно запускать у себя через vLLM, SGLang и другие движки.
Источники: Документация Z.ai: GLM-5.3-Flash и FlashX, Карточка GLM-5.3-Flash на Hugging Face
Другие модели семейства
-
GLM-5.3-Flash
Z.ai41-е место в Epochконтекст 1 млн$0,15 / $0,50открытые весарассуждения
-
GLM-4.7-Flash
Z.aiконтекст 200 тыс.бесплатнооткрытые весарассуждения
-
GLM-4.7-FlashX
Z.aiконтекст 200 тыс.$0,07 / $0,40открытые весарассуждения
-
GLM-4.6V-Flash
Z.aiконтекст 128 тыс.бесплатнооткрытые весарассуждения
-
GLM-4.5-Flash
Z.aiконтекст 131 тыс.бесплатнооткрытые весарассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).