GLM 5.2 — это крупномасштабная модель рассуждений от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и подходит для долгосрочных рабочих процессов агентов, программной инженерии на уровне проектов и сложной многошаговой автоматизации. Поддерживаются уровни рассуждений high и xhigh; xhigh соответствует максимальному уровню рассуждений. Модель особенно сильна в кодировании и использовании инструментов в рамках длительных задач, способна поддерживать инженерный контекст и последовательно следовать стандартам на протяжении всего цикла разработки, от требований до многоплатформенного развертывания, в рамках одной задачи.
Провайдер для Z.ai: GLM 5.2
Hubris маршрутизирует запросы к лучшему доступному провайдеру с автоматическим fallback при сбоях.
Модальности
Провайдеры
Запросы обслуживает один из провайдеров ниже — маршрутизация автоматически выбирает оптимального по доступности и скорости в момент запроса. Итоговая стоимость зависит от того, какой провайдер обслужил запрос, и от попадания в кэш: при повторяющемся контексте вход тарифицируется по цене чтения кэша — до 60–80 % дешевле. Цены — в рублях за 1 млн токенов.
Sail Research | 63,18 ₽ | 398,04 ₽ | 14,53 ₽ | — | 99,6 % | < 0,1 % |
Ambient | 75,82 ₽ | 252,72 ₽ | 18,95 ₽ | — | 87,4 % | < 0,1 % |
Decart−43 % | — | 99,5 % | < 0,1 % | |||
DigitalOcean | 88,45 ₽ | 277,99 ₽ | 13,27 ₽ | — | 98,4 % | < 0,1 % |
StreamLake−48 % | 24 т/с | 99,8 % | 21,5 % | |||
Novita−47 % | 22 т/с | 98,9 % | 26,5 % | |||
GMICloud−47 % | — | 99,1 % | < 0,1 % | |||
DeepInfra | 94,77 ₽ | 303,27 ₽ | 17,69 ₽ | — | 99,2 % | < 0,1 % |
Inceptron | 94,77 ₽ | 366,45 ₽ | 21,48 ₽ | — | 96,1 % | < 0,1 % |
CoreWeave | 96,03 ₽ | 305,79 ₽ | 17,69 ₽ | 66 т/с | 98,8 % | 16,1 % |
Alibaba | 122,06 ₽ | 383,63 ₽ | 24,41 ₽ | — | 99,5 % | < 0,1 % |
Morph | 139,00 ₽ | 518,08 ₽ | 27,80 ₽ | — | 98,4 % | < 0,1 % |
Baidu−16 % | 35 т/с | 99,9 % | 18,3 % | |||
SiliconFlow−15 % | 35 т/с | 100,0 % | 2,5 % | |||
Phala | 159,21 ₽ | 379,08 ₽ | 27,80 ₽ | — | 99,8 % | < 0,1 % |
Wafer | 159,21 ₽ | 500,39 ₽ | 29,57 ₽ | — | 97,1 % | < 0,1 % |
AtlasCloud−10 % | — | 99,1 % | < 0,1 % | |||
Z.AI | 176,91 ₽ | 555,99 ₽ | 32,85 ₽ | — | 99,2 % | < 0,1 % |
Fireworks | 176,91 ₽ | 555,99 ₽ | 17,69 ₽ | 40 т/с | 97,8 % | 2,2 % |
Cloudflare | 176,91 ₽ | 555,99 ₽ | 32,85 ₽ | — | 99,4 % | < 0,1 % |
Friendli | 176,91 ₽ | 555,99 ₽ | 32,85 ₽ | 50 т/с | 99,3 % | 3,0 % |
Parasail | 176,91 ₽ | 555,99 ₽ | 32,85 ₽ | — | 99,8 % | < 0,1 % |
Venice | 176,91 ₽ | 555,99 ₽ | 32,85 ₽ | — | 98,6 % | < 0,1 % |
Together | 176,91 ₽ | 555,99 ₽ | 32,85 ₽ | 26 т/с | 93,6 % | 4,3 % |
Crusoe | 176,91 ₽ | 555,99 ₽ | 32,85 ₽ | — | 99,8 % | < 0,1 % |
BaseTen | 176,91 ₽ | 555,99 ₽ | 17,69 ₽ | — | 99,8 % | < 0,1 % |
Fireworks | 265,36 ₽ | 833,98 ₽ | 26,54 ₽ | 40 т/с | 95,0 % | 2,2 % |
Cloudflare | 265,36 ₽ | 833,98 ₽ | 26,54 ₽ | — | 99,9 % | < 0,1 % |
BaseTen | 265,36 ₽ | 833,98 ₽ | 26,54 ₽ | — | 99,7 % | < 0,1 % |
Alibaba | 291,89 ₽ | 917,38 ₽ | 58,38 ₽ | — | 99,9 % | < 0,1 % |
Доля запросов, скорость и латентность считаются по нашему трафику за 30 дней, в разрезе по провайдеру. У одного провайдера может быть несколько строк — разные регионы или тарифы с отдельными ценами; эти значения общие для провайдера, поэтому в таких строках они совпадают.
Поддерживаемые параметры
Другие модели от z-ai
Z.ai: GLM 5.3
GLM-5.3 — это крупномасштабная модель рассуждений от Z.ai, созданная для решения сложных задач программной инженерии и долгосрочных агентских задач. Она поддерживает текстовый ввод и вывод с контекстным окном в 1M токенов и превосходит GLM-5.2 в кодировании и в балансе между производительностью и эффективностью токенов. Рассуждения всегда включены и не могут быть отключены. Поддерживаются низкие, высокие и максимальные усилия рассуждений; по умолчанию установлено максимальное.
Z.ai: GLM 5.2 (batch)
GLM 5.2 — это крупномасштабная модель рассуждений от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и подходит для долгосрочных рабочих процессов агентов, программной инженерии на уровне проектов и сложной многошаговой автоматизации. Поддерживаются уровни рассуждений high и xhigh; xhigh соответствует максимальному уровню рассуждений. Модель особенно сильна в кодировании и использовании инструментов в рамках длительных задач, способна поддерживать инженерный контекст и последовательно следовать стандартам на протяжении всего цикла разработки, от требований до многоплатформенного развертывания, в рамках одной задачи.
Z.ai: GLM 5.2 (free)
GLM 5.2 — это крупномасштабная модель рассуждений от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и подходит для долгосрочных рабочих процессов агентов, программной инженерии на уровне проектов и сложной многошаговой автоматизации. Поддерживаются уровни рассуждений high и xhigh; xhigh соответствует максимальному уровню рассуждений. Модель особенно сильна в кодировании и использовании инструментов в рамках длительных задач, способна поддерживать инженерный контекст и последовательно следовать стандартам на протяжении всего цикла разработки, от требований до многоплатформенного развертывания, в рамках одной задачи.
Z.ai: GLM 5.1
GLM-5.1 обеспечивает значительный скачок в возможностях кодирования, с особенно заметными улучшениями в решении долгосрочных задач. В отличие от предыдущих моделей, построенных на взаимодействиях минутного уровня, GLM-5.1 может работать независимо и непрерывно над одной задачей более 8 часов, автономно планируя, выполняя и совершенствуя себя на протяжении всего процесса, в конечном итоге предоставляя полные результаты инженерного уровня.
Z.ai: GLM 5V Turbo
GLM-5V-Turbo — это первая нативная мультимодальная базовая модель агента от Z.ai, созданная для визуального кодирования и задач, управляемых агентами. Она нативно обрабатывает изображения, видео и текстовые входные данные, превосходно справляется с долгосрочным планированием, сложным кодированием и выполнением задач, а также беспрепятственно работает с агентами для завершения полного цикла «воспринимать → планировать → выполнять».
Z.ai: GLM 5 Turbo
GLM-5 Turbo — это новая модель от Z.ai, разработанная для быстрого вывода и высокой производительности в агент-ориентированных средах, таких как сценарии OpenClaw. Она глубоко оптимизирована для реальных рабочих процессов агентов, включающих длинные цепочки выполнения, с улучшенным разложением сложных инструкций, использованием инструментов, запланированным и постоянным выполнением, а также общей стабильностью при выполнении длительных задач.