hubris
Логотип DeepSeek — провайдер модели DeepSeek: DeepSeek V3.2

DeepSeek: DeepSeek V3.2

deepseek/deepseek-v3.2
deepseek
Выпущена 1 декабря 2025 г.|164К контекст|33,99 ₽/М вход|50,54 ₽/М выход

DeepSeek-V3.2 — это большая языковая модель, разработанная для гармоничного сочетания высокой вычислительной эффективности с мощными возможностями рассуждений и использования инструментов в качестве агента. Она представляет DeepSeek Sparse Attention (DSA), мелкозернистый механизм разреженного внимания, который снижает затраты на обучение и инференс, сохраняя при этом качество в сценариях с длинным контекстом. Масштабируемая структура пост-обучения с подкреплением дополнительно улучшает рассуждения, демонстрируя производительность класса GPT-5, и модель показала золотые результаты на IMO и IOI 2025 года. V3.2 также использует крупномасштабный конвейер синтеза агентских задач для лучшей интеграции рассуждений в настройки использования инструментов, повышая соответствие и обобщение в интерактивных средах.

Пользователи могут управлять поведением рассуждений с помощью булевого параметра reasoning enabled.

Провайдер для DeepSeek: DeepSeek V3.2

Hubris маршрутизирует запросы к лучшему доступному провайдеру с автоматическим fallback при сбоях.

deepseek
Контекст
164К
токенов
Макс. ответ
66К
токенов
Вход
33,99 ₽
за 1М токенов
Выход
50,54 ₽
за 1М токенов
Кеш чтение
17,00 ₽
за 1М токенов

Модальности

Вход:ТекстВыход:Текст

Провайдеры

Запросы обслуживает один из провайдеров ниже — маршрутизация автоматически выбирает оптимального по доступности и скорости в момент запроса. Итоговая стоимость зависит от того, какой провайдер обслужил запрос, и от попадания в кэш: при повторяющемся контексте вход тарифицируется по цене чтения кэша — до 60–80 % дешевле. Цены — в рублях за 1 млн токенов.

Средняя фактическая цена
29,32 ₽
по запросам за 30 дней · за 1 млн токенов
GMICloud28 %
36,64 ₽26,38 ₽54,33 ₽39,12 ₽3,79 ₽2,73 ₽97,4 %< 0,1 %
StreamLake25 %
36,13 ₽27,10 ₽54,21 ₽40,66 ₽3,61 ₽2,71 ₽22 т/с99,9 %9,8 %
DigitalOcean
31,59 ₽101,09 ₽9,48 ₽33 т/с95,7 %3,7 %
SiliconFlow
32,73 ₽53,07 ₽17,06 ₽30 т/с99,6 %4,5 %
DeepInfra
32,85 ₽48,02 ₽16,43 ₽99,0 %< 0,1 %
AtlasCloud
32,85 ₽48,02 ₽16,43 ₽28 т/с99,9 %37,0 %
Novita
33,99 ₽50,54 ₽17,00 ₽44 т/с100,0 %1,2 %
Baidu
35,38 ₽53,07 ₽3,54 ₽16 т/с99,9 %38,0 %
Venice
41,70 ₽60,65 ₽20,22 ₽92,7 %< 0,1 %
Alibaba
46,82 ₽140,45 ₽9,36 ₽21 т/с98,0 %1,2 %
Friendli
63,18 ₽189,54 ₽31,59 ₽13 т/с99,9 %3,3 %
Google
70,76 ₽212,29 ₽99,4 %< 0,1 %
Phala
126,36 ₽126,36 ₽63,18 ₽99,0 %< 0,1 %
SambaNova
379,08 ₽568,62 ₽97,7 %< 0,1 %

Доля запросов, скорость и латентность считаются по нашему трафику за 30 дней, в разрезе по провайдеру. У одного провайдера может быть несколько строк — разные регионы или тарифы с отдельными ценами; эти значения общие для провайдера, поэтому в таких строках они совпадают.

Поддерживаемые параметры

frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p

Другие модели от deepseek

DeepSeek: DeepSeek V4 Flash 0423

DeepSeek V4 Flash — это оптимизированная по эффективности модель Mixture-of-Experts от DeepSeek с общим количеством параметров 284B и 13B активированных параметров, поддерживающая контекстное окно в 1M токенов. Она разработана для быстрого инференса и высокопроизводительных рабочих нагрузок, сохраняя при этом высокую производительность в рассуждениях и кодировании. Модель включает гибридный механизм attention для эффективной обработки длинного контекста. Поддерживаются уровни рассуждений `high` и `xhigh`; `xhigh` соответствует максимальному уровню рассуждений. Она хорошо подходит для таких приложений, как помощники по кодированию, чат-системы и рабочие процессы агентов, где важны скорость отклика и экономическая эффективность.

1.0М контекст·от 10,08 ₽/М

DeepSeek: DeepSeek V4 Pro 0813

DeepSeek V4 Pro 0813 — это крупномасштабная модель Mixture-of-Experts от DeepSeek. Это общедоступная версия DeepSeek V4 Pro.

1.0М контекст·от 83,40 ₽/М

DeepSeek V4 Flash Latest

Эта модель всегда перенаправляется на последнюю модель семейства DeepSeek V4 Flash.

1.3М контекст·от 9,93 ₽/М

DeepSeek: DeepSeek V4 Flash 0731

DeepSeek V4 Flash 0731 — это разреженная модель mixture-of-experts от DeepSeek с 13 миллиардами активных параметров из 284 миллиардов общих. Эта переобученная версия подходит для кодирования, рассуждений и рабочих процессов агентов.

1.3М контекст·от 17,69 ₽/М

DeepSeek: DeepSeek V4 Pro 0423

DeepSeek V4 Pro — это крупномасштабная модель Mixture-of-Experts от DeepSeek с общим количеством параметров 1,6T и 49B активированных параметров, поддерживающая контекстное окно в 1M токенов. Она разработана для продвинутого рассуждения, кодирования и рабочих процессов агентов с длительным горизонтом, демонстрируя высокую производительность в тестах по знаниям, математике и разработке программного обеспечения. Построенная на той же архитектуре, что и DeepSeek V4 Flash, она представляет гибридную систему attention для эффективной обработки длинного контекста. Поддерживаются уровни рассуждения `high` и `xhigh`; `xhigh` соответствует максимальному уровню рассуждения. Модель хорошо подходит для сложных рабочих нагрузок, таких как анализ всей кодовой базы, многошаговая автоматизация и крупномасштабный синтез информации, где критически важны как возможности, так и эффективность.

1.0М контекст·от 83,40 ₽/М

DeepSeek: DeepSeek V3.2 Exp

DeepSeek-V3.2-Exp — это экспериментальная большая языковая модель, выпущенная DeepSeek в качестве промежуточного шага между V3.1 и будущими архитектурами. Она представляет DeepSeek Sparse Attention (DSA), механизм разреженного внимания с мелкой гранулярностью, разработанный для повышения эффективности обучения и инференса в сценариях с длинным контекстом при сохранении качества вывода. Пользователи могут управлять поведением рассуждений с помощью булевого параметра `reasoning` `enabled`. Модель обучалась в условиях, соответствующих V3.1-Terminus, чтобы обеспечить прямое сравнение. Бенчмаркинг показывает производительность примерно на уровне V3.1 в задачах рассуждения, кодирования и использования агентских инструментов, с незначительными компромиссами и улучшениями в зависимости от области. Этот выпуск сосредоточен на проверке архитектурных оптимизаций для расширенной длины контекста, а не на повышении точности выполнения задач, что делает его в первую очередь исследовательской моделью для изучения эффективных конструкций transformer.

164К контекст·от 34,12 ₽/М