Hy3 — это модель Mixture-of-Experts от Tencent с 295 миллиардами параметров (21 миллиард активных, 192 эксперта с маршрутизацией top-8), созданная для рассуждений, агентских рабочих процессов и реального производственного использования. Она поддерживает настраиваемое усилие рассуждений: прямой режим без размышлений по умолчанию, а также режимы цепочки рассуждений низкой и высокой сложности для сложных математических задач, кодирования и многошаговых проблем. С окном контекста в 256K Hy3 нацелена на долгосрочные задачи, включая улучшенное разрешение кореференции, отслеживание многошаговых ограничений и стабильный вызов инструментов, который обобщается по различным агентским структурам. Tencent позиционирует её как надёжный, экономически эффективный вариант для кодирования, обработки документов, финансового анализа, разработки игр и фронтенд-дизайна, с сильным акцентом на обоснованное, антигаллюцинационное поведение, которое даёт ответы, когда они обоснованы, и сигнализирует об отсутствии доказательств, вместо того чтобы их фабриковать.
Провайдер для Tencent: Hy3
Hubris маршрутизирует запросы к лучшему доступному провайдеру с автоматическим fallback при сбоях.
Модальности
Провайдеры
Запросы обслуживает один из провайдеров ниже — маршрутизация автоматически выбирает оптимального по доступности и скорости в момент запроса. Итоговая стоимость зависит от того, какой провайдер обслужил запрос, и от попадания в кэш: при повторяющемся контексте вход тарифицируется по цене чтения кэша — до 60–80 % дешевле. Цены — в рублях за 1 млн токенов.
GMICloud−10 % | 43 т/с | 99,9 % | 8,8 % | |||
Baidu | 16,68 ₽ | 66,72 ₽ | 4,17 ₽ | — | 99,7 % | < 0,1 % |
Tencent | 16,68 ₽ | 66,72 ₽ | 4,17 ₽ | 26 т/с | 99,9 % | 17,4 % |
DeepInfra | 17,69 ₽ | 73,29 ₽ | 4,42 ₽ | 55 т/с | 98,2 % | 25,7 % |
Novita | 17,69 ₽ | 73,29 ₽ | 4,42 ₽ | 40 т/с | 99,9 % | 28,7 % |
Phala | 18,95 ₽ | 80,87 ₽ | 5,05 ₽ | — | 99,9 % | < 0,1 % |
AtlasCloud | 25,27 ₽ | 101,09 ₽ | 6,32 ₽ | 33 т/с | 100,0 % | 19,3 % |
Доля запросов, скорость и латентность считаются по нашему трафику за 30 дней, в разрезе по провайдеру. У одного провайдера может быть несколько строк — разные регионы или тарифы с отдельными ценами; эти значения общие для провайдера, поэтому в таких строках они совпадают.
Поддерживаемые параметры
Другие модели от tencent
Tencent: Hy-MT2-1.8B
Hy-MT2-1.8B — это компактная модель перевода от Tencent с 1,8 миллиардами параметров. Она поддерживает 33 языковые пары и пять пар китайских диалектов и языков меньшинств, с рабочими процессами для структурированного, основанного на разделителях, контекстного, основанного на глоссарии и управляемого стилем перевода.
Tencent: Hy-MT2-30B-A3B
Hy-MT2-30B-A3B — это флагманская модель перевода от Tencent в семействе Hy-MT2. Она поддерживает 33 языковые пары и пять пар китайских диалектов и языков меньшинств, с рабочими процессами для структурированного, основанного на разделителях, контекстного, основанного на глоссарии и управляемого стилем перевода. Модель использует 3 миллиарда активных параметров из 30 миллиардов общих.
Tencent: Hy-MT2-7B
Hy-MT2-7B — это модель перевода от Tencent с 7 миллиардами параметров. Она поддерживает 33 языковые пары и пять пар китайских диалектов и языков меньшинств, с рабочими процессами для структурированного, основанного на разделителях, контекстного, глоссарийного и стилевого перевода.
Tencent: Hy3 preview
Hy3 preview — это высокоэффективная модель Mixture-of-Experts от Tencent, разработанная для агентских рабочих процессов и использования в производстве. Она поддерживает настраиваемые уровни рассуждений в режимах «отключено», «низкий» и «высокий», что позволяет ей балансировать между скоростью и глубиной в зависимости от задачи, обеспечивая при этом мощную генерацию кода и надежную производительность в многоэтапных, реальных рабочих процессах.
Tencent: Hunyuan A13B Instruct
Hunyuan-A13B — это языковая модель Mixture-of-Experts (MoE) с 13 миллиардами активных параметров, разработанная Tencent, с общим количеством параметров 80 миллиардов и поддержкой рассуждений через Chain-of-Thought. Она демонстрирует конкурентоспособные результаты в бенчмарках по математике, естественным наукам, программированию и многошаговым рассуждениям, сохраняя при этом высокую эффективность инференса благодаря Grouped Query Attention (GQA) и поддержке квантования (FP8, GPTQ и т. д.).