DeepSeek V4 Flash 0731 — это разреженная модель mixture-of-experts от DeepSeek с 13 миллиардами активных параметров из 284 миллиардов общих. Эта переобученная версия подходит для кодирования, рассуждений и рабочих процессов агентов.
Провайдер для DeepSeek: DeepSeek V4 Flash 0731
Hubris маршрутизирует запросы к лучшему доступному провайдеру с автоматическим fallback при сбоях.
Модальности
Провайдеры
Запросы обслуживает один из провайдеров ниже — маршрутизация автоматически выбирает оптимального по доступности и скорости в момент запроса. Итоговая стоимость зависит от того, какой провайдер обслужил запрос, и от попадания в кэш: при повторяющемся контексте вход тарифицируется по цене чтения кэша — до 60–80 % дешевле. Цены — в рублях за 1 млн токенов.
Decart−15 % | 28 т/с | 71,4 % | 3,4 % | |||
StreamLake−44 % | 44 т/с | 95,1 % | 11,1 % | |||
DigitalOcean | 10,11 ₽ | 31,84 ₽ | 3,18 ₽ | 16 т/с | 95,9 % | 5,4 % |
DeepInfra | 10,11 ₽ | 22,74 ₽ | 2,02 ₽ | 31 т/с | 98,1 % | 39,0 % |
OpenInference | 10,11 ₽ | 22,74 ₽ | 3,54 ₽ | — | 95,2 % | < 0,1 % |
Sail Research | 11,37 ₽ | 22,74 ₽ | 2,53 ₽ | 17 т/с | 98,8 % | 1,5 % |
Relace | 13,27 ₽ | 26,54 ₽ | 2,65 ₽ | — | 98,8 % | < 0,1 % |
GMICloud−20 % | 53 т/с | 98,4 % | 10,7 % | |||
BaseTen | 16,43 ₽ | 32,85 ₽ | 3,54 ₽ | — | 98,7 % | < 0,1 % |
CoreWeave | 16,43 ₽ | 35,38 ₽ | 8,85 ₽ | 50 т/с | 99,9 % | 5,2 % |
Inceptron | 16,43 ₽ | 35,38 ₽ | 3,79 ₽ | — | 98,5 % | < 0,1 % |
Morph | 17,56 ₽ | 35,13 ₽ | 8,85 ₽ | — | 96,0 % | < 0,1 % |
Fireworks | 17,69 ₽ | 35,38 ₽ | 3,54 ₽ | — | 93,3 % | < 0,1 % |
AkashML | 17,69 ₽ | 35,38 ₽ | 2,53 ₽ | — | 97,5 % | < 0,1 % |
Novita | 17,69 ₽ | 35,38 ₽ | 3,54 ₽ | — | 98,9 % | < 0,1 % |
Together | 17,69 ₽ | 35,38 ₽ | 3,79 ₽ | — | 95,9 % | < 0,1 % |
Parasail | 17,69 ₽ | 35,38 ₽ | 8,85 ₽ | — | 98,2 % | < 0,1 % |
AtlasCloud | 17,69 ₽ | 35,38 ₽ | 3,54 ₽ | — | 99,3 % | < 0,1 % |
SiliconFlow | 17,69 ₽ | 35,38 ₽ | 3,54 ₽ | — | 98,0 % | < 0,1 % |
Ambient | 17,69 ₽ | 35,38 ₽ | 3,54 ₽ | — | 93,4 % | < 0,1 % |
Baidu | 17,69 ₽ | 35,38 ₽ | 3,54 ₽ | 65 т/с | 98,7 % | 19,5 % |
Mancer 2 | 18,32 ₽ | 56,86 ₽ | — | — | 95,4 % | < 0,1 % |
Io Net | 18,83 ₽ | 40,44 ₽ | 9,73 ₽ | — | 98,4 % | < 0,1 % |
Venice | 22,11 ₽ | 44,23 ₽ | 4,42 ₽ | — | 95,4 % | < 0,1 % |
Phala | 25,27 ₽ | 50,54 ₽ | 8,85 ₽ | — | 97,0 % | < 0,1 % |
DeepSeek | 27,80 ₽ | 83,40 ₽ | 0,880 ₽ | — | 74,7 % | < 0,1 % |
Wafer | 35,38 ₽ | 70,76 ₽ | 8,85 ₽ | — | 97,2 % | < 0,1 % |
Cloudflare | 55,60 ₽ | 166,80 ₽ | 1,77 ₽ | — | 99,9 % | < 0,1 % |
Доля запросов, скорость и латентность считаются по нашему трафику за 30 дней, в разрезе по провайдеру. У одного провайдера может быть несколько строк — разные регионы или тарифы с отдельными ценами; эти значения общие для провайдера, поэтому в таких строках они совпадают.
Поддерживаемые параметры
Другие модели от deepseek
DeepSeek: DeepSeek V4 Flash 0423
DeepSeek V4 Flash — это оптимизированная по эффективности модель Mixture-of-Experts от DeepSeek с общим количеством параметров 284B и 13B активированных параметров, поддерживающая контекстное окно в 1M токенов. Она разработана для быстрого инференса и высокопроизводительных рабочих нагрузок, сохраняя при этом высокую производительность в рассуждениях и кодировании. Модель включает гибридный механизм attention для эффективной обработки длинного контекста. Поддерживаются уровни рассуждений `high` и `xhigh`; `xhigh` соответствует максимальному уровню рассуждений. Она хорошо подходит для таких приложений, как помощники по кодированию, чат-системы и рабочие процессы агентов, где важны скорость отклика и экономическая эффективность.
DeepSeek: DeepSeek V4 Pro 0813
DeepSeek V4 Pro 0813 — это крупномасштабная модель Mixture-of-Experts от DeepSeek. Это общедоступная версия DeepSeek V4 Pro.
DeepSeek V4 Flash Latest
Эта модель всегда перенаправляется на последнюю модель семейства DeepSeek V4 Flash.
DeepSeek: DeepSeek V4 Pro 0423
DeepSeek V4 Pro — это крупномасштабная модель Mixture-of-Experts от DeepSeek с общим количеством параметров 1,6T и 49B активированных параметров, поддерживающая контекстное окно в 1M токенов. Она разработана для продвинутого рассуждения, кодирования и рабочих процессов агентов с длительным горизонтом, демонстрируя высокую производительность в тестах по знаниям, математике и разработке программного обеспечения. Построенная на той же архитектуре, что и DeepSeek V4 Flash, она представляет гибридную систему attention для эффективной обработки длинного контекста. Поддерживаются уровни рассуждения `high` и `xhigh`; `xhigh` соответствует максимальному уровню рассуждения. Модель хорошо подходит для сложных рабочих нагрузок, таких как анализ всей кодовой базы, многошаговая автоматизация и крупномасштабный синтез информации, где критически важны как возможности, так и эффективность.
DeepSeek: DeepSeek V3.2
DeepSeek-V3.2 — это большая языковая модель, разработанная для гармоничного сочетания высокой вычислительной эффективности с мощными возможностями рассуждений и использования инструментов в качестве агента. Она представляет DeepSeek Sparse Attention (DSA), мелкозернистый механизм разреженного внимания, который снижает затраты на обучение и инференс, сохраняя при этом качество в сценариях с длинным контекстом. Масштабируемая структура пост-обучения с подкреплением дополнительно улучшает рассуждения, демонстрируя производительность класса GPT-5, и модель показала золотые результаты на IMO и IOI 2025 года. V3.2 также использует крупномасштабный конвейер синтеза агентских задач для лучшей интеграции рассуждений в настройки использования инструментов, повышая соответствие и обобщение в интерактивных средах. Пользователи могут управлять поведением рассуждений с помощью булевого параметра `reasoning` `enabled`.
DeepSeek: DeepSeek V3.2 Exp
DeepSeek-V3.2-Exp — это экспериментальная большая языковая модель, выпущенная DeepSeek в качестве промежуточного шага между V3.1 и будущими архитектурами. Она представляет DeepSeek Sparse Attention (DSA), механизм разреженного внимания с мелкой гранулярностью, разработанный для повышения эффективности обучения и инференса в сценариях с длинным контекстом при сохранении качества вывода. Пользователи могут управлять поведением рассуждений с помощью булевого параметра `reasoning` `enabled`. Модель обучалась в условиях, соответствующих V3.1-Terminus, чтобы обеспечить прямое сравнение. Бенчмаркинг показывает производительность примерно на уровне V3.1 в задачах рассуждения, кодирования и использования агентских инструментов, с незначительными компромиссами и улучшениями в зависимости от области. Этот выпуск сосредоточен на проверке архитектурных оптимизаций для расширенной длины контекста, а не на повышении точности выполнения задач, что делает его в первую очередь исследовательской моделью для изучения эффективных конструкций transformer.