hubris

Z.ai: GLM 5.3 Flash

z-ai/glm-5.3-flash
z-ai
Выпущена 26 августа 2026 г.|1.3М контекст|9,48 ₽/М вход|31,59 ₽/М выход

Ограниченная по времени скидка 50% через ZAI до 9 сентября 2026 года в 16:00 UTC.

Провайдер для Z.ai: GLM 5.3 Flash

Hubris маршрутизирует запросы к лучшему доступному провайдеру с автоматическим fallback при сбоях.

z-ai
Контекст
1.3М
токенов
Макс. ответ
131К
токенов
Вход
9,48 ₽
за 1М токенов
Выход
31,59 ₽
за 1М токенов
Кеш чтение
1,90 ₽
за 1М токенов

Модальности

Вход:ТекстИзображенияВидеоВыход:Текст

Провайдеры

Запросы обслуживает один из провайдеров ниже — маршрутизация автоматически выбирает оптимального по доступности и скорости в момент запроса. Итоговая стоимость зависит от того, какой провайдер обслужил запрос, и от попадания в кэш: при повторяющемся контексте вход тарифицируется по цене чтения кэша — до 60–80 % дешевле. Цены — в рублях за 1 млн токенов.

Средняя фактическая цена
3,35 ₽
по запросам за 30 дней · за 1 млн токенов
GMICloud50 %
18,96 ₽9,48 ₽63,18 ₽31,59 ₽3,80 ₽1,90 ₽34 т/с91,3 %5,0 %
Novita50 %
18,96 ₽9,48 ₽63,18 ₽31,59 ₽3,80 ₽1,90 ₽41 т/с98,9 %1,2 %
DeepInfra50 %
18,96 ₽9,48 ₽63,18 ₽31,59 ₽3,80 ₽1,90 ₽99,6 %< 0,1 %
Z.AI50 %
18,96 ₽9,48 ₽63,18 ₽31,59 ₽3,80 ₽1,90 ₽34 т/с98,6 %65,1 %
Wafer
12,64 ₽44,23 ₽2,53 ₽95,1 %< 0,1 %
Morph
16,43 ₽56,86 ₽2,53 ₽98,8 %< 0,1 %
Makora
17,69 ₽59,39 ₽3,03 ₽97,7 %< 0,1 %
Modal67 %
57,42 ₽18,95 ₽191,42 ₽63,17 ₽11,48 ₽3,79 ₽99,9 %< 0,1 %
Sail Research
18,95 ₽63,18 ₽3,79 ₽99,5 %< 0,1 %
StreamLake
18,95 ₽63,18 ₽3,79 ₽98,5 %< 0,1 %
NextBit
18,95 ₽63,18 ₽3,79 ₽36 т/с97,9 %0,5 %
Fireworks
18,95 ₽63,18 ₽3,79 ₽98,9 %< 0,1 %
Phala
18,95 ₽63,18 ₽3,79 ₽98,8 %< 0,1 %
Friendli
18,95 ₽63,18 ₽3,79 ₽99,4 %< 0,1 %
SiliconFlow
18,95 ₽63,18 ₽3,79 ₽99,4 %< 0,1 %
DigitalOcean
18,95 ₽63,18 ₽3,79 ₽98,8 %< 0,1 %
Together
18,95 ₽63,18 ₽3,79 ₽29 т/с92,4 %4,6 %
Reka
18,95 ₽63,18 ₽3,79 ₽23 т/с99,8 %0,6 %
Parasail
18,95 ₽63,18 ₽3,79 ₽33 т/с96,4 %21,2 %
BaseTen
18,95 ₽63,18 ₽3,79 ₽99,8 %< 0,1 %
Venice
18,95 ₽63,18 ₽3,79 ₽98,7 %< 0,1 %
Io Net
18,95 ₽63,18 ₽3,79 ₽91,7 %< 0,1 %
Cloudflare
18,95 ₽63,18 ₽3,79 ₽41 т/с99,7 %0,6 %

Доля запросов, скорость и латентность считаются по нашему трафику за 30 дней, в разрезе по провайдеру. У одного провайдера может быть несколько строк — разные регионы или тарифы с отдельными ценами; эти значения общие для провайдера, поэтому в таких строках они совпадают.

Поддерживаемые параметры

frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p

Другие модели от z-ai

Z.ai: GLM Flash Latest

Эта модель всегда перенаправляется на последнюю модель в семействе GLM Flash.

1.3М контекст·от 9,48 ₽/М

Z.ai: GLM 5.3 Flash (batch)

GLM-5.3-Flash — это нативная мультимодальная модель от Z.ai. Она подходит для эффективного кодирования и выполнения агентских задач с длительным горизонтом. Её гибридная архитектура с разреженным и линейным вниманием поддерживает точное поведение в длинном контексте, снижая при этом вычислительные затраты.

1.0М контекст·от 18,95 ₽/М

Z.ai: GLM Latest

Эта модель всегда перенаправляется на последнюю модель GLM от Z.ai.

1.3М контекст·от 145,31 ₽/М

Z.ai: GLM 5.3

GLM-5.3 — это крупномасштабная модель рассуждений от Z.ai, созданная для решения сложных задач программной инженерии и долгосрочных агентских задач. Она поддерживает текстовый ввод и вывод с контекстным окном в 1M токенов и превосходит GLM-5.2 в кодировании и в балансе между производительностью и эффективностью токенов. Рассуждения всегда включены и не могут быть отключены. Поддерживаются низкие, высокие и максимальные усилия рассуждений; по умолчанию установлено максимальное.

1.3М контекст·от 176,91 ₽/М

Z.ai: GLM 5.2

GLM 5.2 — это крупномасштабная модель рассуждений от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и подходит для долгосрочных рабочих процессов агентов, программной инженерии на уровне проектов и сложной многошаговой автоматизации. Поддерживаются уровни рассуждений high и xhigh; xhigh соответствует максимальному уровню рассуждений. Модель особенно сильна в кодировании и использовании инструментов в рамках длительных задач, способна поддерживать инженерный контекст и последовательно следовать стандартам на протяжении всего цикла разработки, от требований до многоплатформенного развертывания, в рамках одной задачи.

1.0М контекст·от 122,06 ₽/М

Z.ai: GLM 5.2 (free)

GLM 5.2 — это крупномасштабная модель рассуждений от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и подходит для долгосрочных рабочих процессов агентов, программной инженерии на уровне проектов и сложной многошаговой автоматизации. Поддерживаются уровни рассуждений high и xhigh; xhigh соответствует максимальному уровню рассуждений. Модель особенно сильна в кодировании и использовании инструментов в рамках длительных задач, способна поддерживать инженерный контекст и последовательно следовать стандартам на протяжении всего цикла разработки, от требований до многоплатформенного развертывания, в рамках одной задачи.

256К контекст·бесплатно