Nemotron 3 Ultra — 550 млрд параметров через API из России
13 августа 2026 г. · Константин Романков · 5 мин чтения
Коротко о главном
NVIDIA Nemotron 3 Ultra (nvidia/nemotron-3-ultra-550b-a55b) — это большая языковая модель на 550 млрд параметров с контекстным окном в 1 млн токенов. Подключить её из России можно через наш API: оплата в рублях через СБП или карту, минимальное пополнение — 300 ₽. Есть и бесплатный вариант с ограничениями по скорости.
Что такое Nemotron 3 Ultra
Nemotron 3 Ultra — семейство моделей от NVIDIA, ориентированное на сложные рассуждения, работу с кодом и обработку больших объёмов текста. Ключевые характеристики версии 550b-a55b:
- 550 млрд параметров — модель относится к верхнему сегменту по масштабу, что даёт качественную работу с многоступенчатыми задачами.
- Архитектура с активными экспертами (a55b) — во время генерации активируется лишь часть параметров, поэтому модель сочетает высокое качество с приемлемой скоростью ответа.
- Контекстное окно 1 000 000 токенов — можно передавать целые кодовые базы, длинные документы, логи или несколько статей за один запрос без потери контекста.
Модель хорошо подходит для задач, где важна связная работа с большим объёмом информации: анализ документации, ревью крупных диффов, суммаризация длинных транскриптов, RAG-пайплайны с обширными источниками.
Если вы пока выбираете модель под конкретную задачу, посмотрите наш разбор «Как выбрать LLM для задачи» — там разложены критерии по типам применения.
Как получить доступ из России
Основная проблема при работе с зарубежными моделями из России — оплата и доступность. Наш гейтвей решает обе: вы работаете через единый API, а платите в рублях.
Шаг 1. Регистрация и пополнение
Создайте аккаунт и пополните баланс. Доступные способы оплаты:
- СБП — по QR-коду или ссылке;
- банковская карта;
- счёт для юридических лиц — с закрывающими документами.
Минимальная сумма пополнения — 300 ₽, максимальная — 100 000 ₽ за одну операцию. Баланс списывается по факту использования токенов, без абонентской платы.
Шаг 2. Получение ключа
После пополнения создайте API-ключ в личном кабинете. Он используется в заголовке Authorization при запросах. Формат запросов совместим с популярными OpenAI-подобными библиотеками, поэтому переключиться на нашу модель можно, поменяв только base_url, ключ и название модели.
Шаг 3. Первый запрос
Модель nvidia/nemotron-3-ultra-550b-a55b доступна сразу после пополнения. Пример на Python:
from openai import OpenAI
client = OpenAI(
base_url="https://hubris.pw/api/v1",
api_key="ВАШ_КЛЮЧ",
)
response = client.chat.completions.create(
model="nvidia/nemotron-3-ultra-550b-a55b",
messages=[
{"role": "system", "content": "Вы — помощник по код-ревью."},
{"role": "user", "content": "Проверьте этот diff на утечки памяти..."},
],
)
print(response.choices[0].message.content)
Весь каталог из 512 моделей доступен по одному и тому же ключу — переключаться между ними можно на лету, меняя параметр model. Полный список смотрите в каталоге моделей.
Цены в рублях
Оплата — только за фактически использованные токены. Для nvidia/nemotron-3-ultra-550b-a55b:
- входящие токены (ваш запрос, промпт, контекст): 68,83 ₽ за 1 млн токенов;
- исходящие токены (ответ модели): 412,96 ₽ за 1 млн токенов.
Поскольку модель поддерживает контекст до 1 млн токенов, обращайте внимание именно на объём входящих данных: при передаче больших документов основная часть стоимости может приходиться на промпт. Практический совет — не отправляйте в контекст лишнее, а для RAG заранее фильтруйте фрагменты по релевантности.
Пополнив баланс на минимальные 300 ₽, вы получаете достаточно кредитов для полноценного тестирования на реальных задачах.
Бесплатный вариант: nemotron-3-ultra-550b-a55b:free
Да, у модели есть бесплатный вариант — nvidia/nemotron-3-ultra-550b-a55b:free. Он использует ту же модель, но работает с ограничениями по скорости: количество запросов в единицу времени ограничено, поэтому вариант подходит для знакомства с моделью, прототипов и нерегулярных задач, но не для продакшена с высокой нагрузкой.
Чтобы использовать бесплатный вариант, просто укажите его в поле model:
response = client.chat.completions.create(
model="nvidia/nemotron-3-ultra-550b-a55b:free",
messages=[
{"role": "user", "content": "Объясните разницу между процессом и потоком."},
],
)
Если вам важна именно экономия, посмотрите подборку «Топ-5 бесплатных нейросетей через API» — там собраны варианты с бесплатными тарифами и описаны их ограничения.
Когда лимитов бесплатного варианта перестанет хватать, переход на платный не требует изменений в коде — достаточно убрать суффикс :free из названия модели.
Когда стоит выбрать Nemotron 3 Ultra
Модель оправдана, если вам нужны:
- очень большой контекст — работа с целыми репозиториями, длинными PDF, объёмными логами;
- качественные рассуждения — многоступенчатые задачи, анализ, планирование;
- стабильный API из России без сложностей с оплатой.
Если же задача проще и объёмы контекста небольшие, возможно, вам подойдёт более лёгкая модель — например, Llama 3.3 70B или DeepSeek. Обе доступны в том же каталоге и по тому же ключу.
Частые вопросы
Действительно ли Nemotron 3 Ultra бесплатна?
Есть бесплатный вариант nvidia/nemotron-3-ultra-550b-a55b:free, но он работает с ограничениями по скорости и не рассчитан на высокую нагрузку. Для регулярной работы используйте платный вариант — оплата идёт только за фактически использованные токены.
Сколько стоит использование платной версии?
68,83 ₽ за 1 млн входящих токенов и 412,96 ₽ за 1 млн исходящих. Минимальное пополнение баланса — 300 ₽, оплата в рублях через СБП, карту или по счёту для юрлиц.
Нужно ли менять код при переходе с бесплатного варианта на платный?
Нет. Достаточно убрать суффикс :free из значения параметра model. Всё остальное — base_url, ключ, структура запроса — остаётся прежним.
Все модели из статьи доступны в Hubris — единый API, оплата в рублях.