hubris

Z.ai: GLM 5.3 Prime

z-ai/glm-5.3-prime
z-ai
Выпущена 23 сентября 2026 г.|1.0М контекст|353,46 ₽/М вход|1 110,88 ₽/М выход

GLM-5.3-Prime — это высокоскоростной вариант GLM-5.3 от Z.ai, который наследует все его возможности, обеспечивая при этом в 1,5–2 раза большую пропускную способность вывода за счет ускорения инференса. Он поддерживает текстовый ввод и вывод с контекстным окном в 1M токенов и до 128K выходных токенов, а также предназначен для рабочих нагрузок, связанных с кодированием и агентными задачами, включая многоэтапную оркестрацию агентов с длительным горизонтом, разговор в реальном времени и потоковую генерацию кода. Рассуждения всегда включены и не могут быть отключены. Поддерживаются низкие, высокие и максимальные усилия рассуждений; по умолчанию установлено максимальное значение.

Провайдер для Z.ai: GLM 5.3 Prime

Hubris маршрутизирует запросы к лучшему доступному провайдеру с автоматическим fallback при сбоях.

z-ai
Контекст
1.0М
токенов
Макс. ответ
131К
токенов
Вход
353,46 ₽
за 1М токенов
Выход
1 110,88 ₽
за 1М токенов
Кеш чтение
70,69 ₽
за 1М токенов

Модальности

Вход:ТекстВыход:Текст

Провайдеры

Запросы обслуживает один из провайдеров ниже — маршрутизация автоматически выбирает оптимального по доступности и скорости в момент запроса. Итоговая стоимость зависит от того, какой провайдер обслужил запрос, и от попадания в кэш: при повторяющемся контексте вход тарифицируется по цене чтения кэша — до 60–80 % дешевле. Цены — в рублях за 1 млн токенов.

Alibaba
353,46 ₽1 110,88 ₽70,69 ₽—99,2 %

Поддерживаемые параметры

frequency_penaltyinclude_reasoninglogprobsmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstoptemperaturetool_choicetoolstop_ktop_logprobstop_p

Другие модели от z-ai

Z.ai: GLM 5.3 Flash

Ограниченная по времени скидка 50% через ZAI до 9 сентября 2026 года в 16:00 UTC.

1.3М контекст·от 18,94 ₽/М

Z.ai: GLM 5.3

GLM-5.3 — это крупномасштабная модель рассуждений от Z.ai, созданная для решения сложных задач программной инженерии и долгосрочных агентских задач. Она поддерживает текстовый ввод и вывод с контекстным окном в 1M токенов и превосходит GLM-5.2 в кодировании и в балансе между производительностью и эффективностью токенов. Рассуждения всегда включены и не могут быть отключены. Поддерживаются низкие, высокие и максимальные усилия рассуждений; по умолчанию установлено максимальное.

1.3М контекст·от 176,73 ₽/М

Z.ai: GLM 5.3 FlashX

GLM-5.3-FlashX — это высокоскоростной вариант GLM-5.3-Flash от Z.ai, нативной мультимодальной модели, обеспечивающей скорость инференса до 200 токенов/с. Построенная на той же гибридной архитектуре разреженного и линейного attention (320B общих параметров, 18B активных), она подходит для эффективного кодирования, визуального понимания и задач агентов с длинным горизонтом с контекстным окном в 1M токенов.

1.0М контекст·от 46,71 ₽/М

Z.ai: GLM Flash Latest

Эта модель всегда перенаправляется на последнюю модель в семействе GLM Flash.

1.3М контекст·от 5,68 ₽/М

Z.ai: GLM 5.3 Flash (batch)

GLM-5.3-Flash — это нативная мультимодальная модель от Z.ai. Она подходит для эффективного кодирования и выполнения агентских задач с длительным горизонтом. Её гибридная архитектура с разреженным и линейным вниманием поддерживает точное поведение в длинном контексте, снижая при этом вычислительные затраты.

1.0М контекст·от 7,57 ₽/М

Z.ai: GLM Latest

Эта модель всегда перенаправляется на последнюю модель GLM от Z.ai.

1.3М контекст·от 57,08 ₽/М