DeepSeek R1 Distill Llama 70B — это дистиллированная большая языковая модель, основанная на Llama-3.3-70B-Instruct, использующая выходные данные DeepSeek R1. Модель сочетает в себе передовые методы дистилляции для достижения высокой производительности в нескольких бенчмарках, включая:
- AIME 2024 pass@1: 70.0
- MATH-500 pass@1: 94.5
- CodeForces Rating: 1633
Модель использует fine-tuning на основе выходных данных DeepSeek R1, что обеспечивает конкурентоспособную производительность, сравнимую с более крупными передовыми моделями.
Провайдер для DeepSeek: R1 Distill Llama 70B
Hubris маршрутизирует запросы к лучшему доступному провайдеру с автоматическим fallback при сбоях.
Модальности
Провайдеры
Запросы обслуживает один из провайдеров ниже — маршрутизация автоматически выбирает оптимального по доступности и скорости в момент запроса. Итоговая стоимость зависит от того, какой провайдер обслужил запрос, и от попадания в кэш: при повторяющемся контексте вход тарифицируется по цене чтения кэша — до 60–80 % дешевле. Цены — в рублях за 1 млн токенов.
Novita | 101,09 ₽ | 101,09 ₽ | — | — | 100,0 % |
Поддерживаемые параметры
Сравнить с…
выбрать любую модель →Другие модели от deepseek
DeepSeek: DeepSeek V4 Flash 0731
DeepSeek V4 Flash 0731 — это разреженная модель mixture-of-experts от DeepSeek с 13 миллиардами активных параметров из 284 миллиардов общих. Эта переобученная версия подходит для кодирования, рассуждений и рабочих процессов агентов.
DeepSeek: DeepSeek V4 Flash Vision Exp
DeepSeek V4 Flash Vision Exp — это экспериментальная версия DeepSeek V4 Flash 0731 от DeepSeek с поддержкой зрения, добавляющая понимание изображений при сохранении текстовых возможностей базовой модели, включая агентов, рассуждения и мировые знания. Это разреженная модель mixture-of-experts с 13 миллиардами активных параметров из 284 миллиардов общих. Она подходит для понимания документов и диаграмм, визуальных ответов на вопросы и рабочих процессов мультимодальных агентов, которые чередуют текст и изображения.
DeepSeek: DeepSeek V4 Pro 0813
DeepSeek V4 Pro 0813 — это крупномасштабная модель Mixture-of-Experts от DeepSeek. Это общедоступная версия DeepSeek V4 Pro.
DeepSeek: DeepSeek V4 Pro 0813 (batch)
DeepSeek V4 Pro 0813 — это крупномасштабная модель Mixture-of-Experts от DeepSeek. Это общедоступная версия DeepSeek V4 Pro.
DeepSeek V4 Flash Latest
Эта модель всегда перенаправляется на последнюю модель семейства DeepSeek V4 Flash.
DeepSeek: DeepSeek V4 Flash 0731 (batch)
DeepSeek V4 Flash 0731 — это разреженная модель mixture-of-experts от DeepSeek, с 13 миллиардами активных параметров из 284 миллиардов общих. Эта переобученная версия подходит для кодирования, рассуждений и рабочих процессов агентов. Это GA-релиз DeepSeek V4 Flash.