NVIDIA Nemotron Nano 2 VL — это открытая мультимодальная модель рассуждений с 12 миллиардами параметров, разработанная для понимания видео и анализа документов. Она представляет гибридную архитектуру Transformer-Mamba, сочетающую точность на уровне Transformer с эффективным использованием памяти Mamba для моделирования последовательностей, что обеспечивает значительно более высокую пропускную способность и меньшую задержку. Модель поддерживает ввод текста и многоизобразительных документов, выдавая результаты на естественном языке. Она обучена на высококачественных синтетических наборах данных, разработанных NVIDIA и оптимизированных для оптического распознавания символов, анализа диаграмм и мультимодального понимания. Nemotron Nano 2 VL достигает лидирующих результатов на OCRBench v2 и набирает в среднем ≈ 74 балла по MMMU, MathVista, AI2D, OCRBench, OCR-Reasoning, ChartQA, DocVQA и Video-MME, превосходя предыдущие открытые базовые модели VL. Благодаря эффективной выборке видео (EVS) она обрабатывает длинные видеоролики, снижая при этом затраты на вывод. Открытые веса, данные для обучения и рецепты fine-tuning выпущены под разрешительной открытой лицензией NVIDIA, а развертывание поддерживается в NeMo, NIM и основных средах выполнения вывода.
⚠ Бесплатная витрина модели
Лимиты RPM/RPD выставляет провайдер модели, не Hubris — конкретные значения провайдер не публикует. При 429 повторите запрос с экспоненциальной задержкой либо переключитесь на платную версию модели. Подробнее.
Провайдер для NVIDIA: Nemotron Nano 12B 2 VL (free)
Hubris маршрутизирует запросы к лучшему доступному провайдеру с автоматическим fallback при сбоях.
Модальности
Провайдеры
Запросы обслуживает один из провайдеров ниже — маршрутизация автоматически выбирает оптимального по доступности и скорости в момент запроса. Итоговая стоимость зависит от того, какой провайдер обслужил запрос, и от попадания в кэш: при повторяющемся контексте вход тарифицируется по цене чтения кэша — до 60–80 % дешевле. Цены — в рублях за 1 млн токенов.
Nvidia | 0 ₽ | 0 ₽ | — | 14 т/с | 76,0 % | 100,0 % |
Доля запросов, скорость и латентность считаются по нашему трафику за 30 дней, в разрезе по провайдеру. У одного провайдера может быть несколько строк — разные регионы или тарифы с отдельными ценами; эти значения общие для провайдера, поэтому в таких строках они совпадают.
Поддерживаемые параметры
Другие модели от nvidia
NVIDIA: Nemotron 3 Embed 1B (free)
NVIDIA Nemotron 3 Embed 1B — это открытая модель встраивания текста от NVIDIA, оптимизированная для высокопроизводительного поиска с низкой задержкой. Она подходит для корпоративного поиска, RAG, поиска кода и рабочих процессов агентского поиска, сохраняя более 95% точности модели 8B при меньших требованиях к развертыванию.
NVIDIA: Nemotron 3.5 Content Safety (free)
NVIDIA Nemotron 3.5 Content Safety — это компактная 4B-параметрическая мультимодальная модель-ограничитель от NVIDIA, доработанная на основе Google Gemma-3-4B. Она модерирует как входные данные, так и ответы от LLM и VLM, принимая текстовые и графические входные данные и возвращая текстовый вывод: классификацию пользовательского запроса и ответа как безопасного/небезопасного, метки категорий безопасности и необязательный трассировочный вывод. Она поддерживает 12 языков с контекстным окном до 128K токенов. Модель подходит для модерации запросов и ответов, классификации контента, конвейеров безопасности и корпоративных AI-ограничителей с принудительным применением политик, а также включает переключаемый режим рассуждений. Она является частью семейства открытых моделей NVIDIA Nemotron для агентного ИИ.
NVIDIA: Nemotron 3 Ultra (free)
NVIDIA Nemotron 3 Ultra — это открытая модель от NVIDIA для рассуждений и оркестрации, с 55 миллиардами активных параметров из 550 миллиардов общих (MoE). Построенная на гибридной архитектуре Transformer-Mamba mixture-of-experts, она поддерживает текстовый ввод и вывод с контекстным окном до 1 миллиона токенов. Она подходит для длительных агентских рабочих процессов, включая оркестрацию агентов, агентов для кодирования, глубокие исследования и сложные корпоративные задачи. Модель особенно сильна в многошаговых рассуждениях и планировании, с высокой пропускной способностью вывода, разработанной для высокообъемных агентских конвейеров. Она является частью семейства открытых моделей NVIDIA Nemotron для агентского ИИ.
NVIDIA: Nemotron 3 Ultra
NVIDIA Nemotron 3 Ultra — это открытая модель от NVIDIA для рассуждений и оркестрации, с 55 млрд активных параметров из 550 млрд общих (MoE). Построенная на гибридной архитектуре Transformer-Mamba mixture-of-experts, она поддерживает текстовый ввод и вывод с контекстным окном до 1M токенов. Модель подходит для длительных агентных рабочих процессов, включая оркестрацию агентов, кодирующих агентов, глубокие исследования и сложные корпоративные задачи. Она особенно сильна в многошаговых рассуждениях и планировании, с высокопроизводительным выводом, разработанным для высокообъемных агентных конвейеров. Модель является частью семейства открытых моделей NVIDIA Nemotron для агентного ИИ.
NVIDIA: Parakeet TDT 0.6B v3
Parakeet TDT 0.6B v3 — это мультиязычная модель преобразования речи в текст от NVIDIA с 600 миллионами параметров, построенная на архитектуре FastConformer-TDT. Обученная на наборе данных Granary (более 670 000 часов аудио), она поддерживает автоматическое определение языка среди...
NVIDIA: Nemotron 3 Nano Omni (free)
NVIDIA Nemotron™ 3 Nano Omni — это открытая мультимодальная модель 30B-A3B, разработанная для функционирования в качестве субагента восприятия и контекста в корпоративных агентских системах. Она принимает текстовые, графические, видео- и аудиовходы и выдает текстовый вывод, позволяя агентам воспринимать и рассуждать в различных модальностях за один цикл вывода. Построенная на гибридной архитектуре MoE Transformer-Mamba с видеослоями Conv3D и Efficient Video Sampling (EVS), она обеспечивает примерно в 2 раза более высокую пропускную способность и в 2,5 раза меньшие вычислительные затраты для обработки видео по сравнению с отдельными конвейерами зрения + речи. Она поддерживает длину контекста до 300K и бюджет рассуждений 16 384, с расширенным мышлением, включенным через параметр `reasoning.enabled`.