hubris
Nemotron 3 Ultra — 550 млрд параметров через API из России

Nemotron 3 Ultra — 550 млрд параметров через API из России

13 августа 2026 г. · Константин Романков · 5 мин чтения

Коротко о главном

NVIDIA Nemotron 3 Ultra (nvidia/nemotron-3-ultra-550b-a55b) — это большая языковая модель на 550 млрд параметров с контекстным окном в 1 млн токенов. Подключить её из России можно через наш API: оплата в рублях через СБП или карту, минимальное пополнение — 300 ₽. Есть и бесплатный вариант с ограничениями по скорости.

Логотип нейросети Nemotron 3 Ultra на экране

Что такое Nemotron 3 Ultra

Nemotron 3 Ultra — семейство моделей от NVIDIA, ориентированное на сложные рассуждения, работу с кодом и обработку больших объёмов текста. Ключевые характеристики версии 550b-a55b:

  • 550 млрд параметров — модель относится к верхнему сегменту по масштабу, что даёт качественную работу с многоступенчатыми задачами.
  • Архитектура с активными экспертами (a55b) — во время генерации активируется лишь часть параметров, поэтому модель сочетает высокое качество с приемлемой скоростью ответа.
  • Контекстное окно 1 000 000 токенов — можно передавать целые кодовые базы, длинные документы, логи или несколько статей за один запрос без потери контекста.

Модель хорошо подходит для задач, где важна связная работа с большим объёмом информации: анализ документации, ревью крупных диффов, суммаризация длинных транскриптов, RAG-пайплайны с обширными источниками.

Если вы пока выбираете модель под конкретную задачу, посмотрите наш разбор «Как выбрать LLM для задачи» — там разложены критерии по типам применения.

Как получить доступ из России

Основная проблема при работе с зарубежными моделями из России — оплата и доступность. Наш гейтвей решает обе: вы работаете через единый API, а платите в рублях.

Шаг 1. Регистрация и пополнение

Создайте аккаунт и пополните баланс. Доступные способы оплаты:

  • СБП — по QR-коду или ссылке;
  • банковская карта;
  • счёт для юридических лиц — с закрывающими документами.

Минимальная сумма пополнения — 300 ₽, максимальная — 100 000 ₽ за одну операцию. Баланс списывается по факту использования токенов, без абонентской платы.

Шаг 2. Получение ключа

После пополнения создайте API-ключ в личном кабинете. Он используется в заголовке Authorization при запросах. Формат запросов совместим с популярными OpenAI-подобными библиотеками, поэтому переключиться на нашу модель можно, поменяв только base_url, ключ и название модели.

Шаг 3. Первый запрос

Модель nvidia/nemotron-3-ultra-550b-a55b доступна сразу после пополнения. Пример на Python:

from openai import OpenAI

client = OpenAI(
    base_url="https://hubris.pw/api/v1",
    api_key="ВАШ_КЛЮЧ",
)

response = client.chat.completions.create(
    model="nvidia/nemotron-3-ultra-550b-a55b",
    messages=[
        {"role": "system", "content": "Вы — помощник по код-ревью."},
        {"role": "user", "content": "Проверьте этот diff на утечки памяти..."},
    ],
)

print(response.choices[0].message.content)

Весь каталог из 512 моделей доступен по одному и тому же ключу — переключаться между ними можно на лету, меняя параметр model. Полный список смотрите в каталоге моделей.

Пример кода на Python для запроса к API

Цены в рублях

Оплата — только за фактически использованные токены. Для nvidia/nemotron-3-ultra-550b-a55b:

  • входящие токены (ваш запрос, промпт, контекст): 68,83 ₽ за 1 млн токенов;
  • исходящие токены (ответ модели): 412,96 ₽ за 1 млн токенов.

Поскольку модель поддерживает контекст до 1 млн токенов, обращайте внимание именно на объём входящих данных: при передаче больших документов основная часть стоимости может приходиться на промпт. Практический совет — не отправляйте в контекст лишнее, а для RAG заранее фильтруйте фрагменты по релевантности.

Пополнив баланс на минимальные 300 ₽, вы получаете достаточно кредитов для полноценного тестирования на реальных задачах.

Бесплатный вариант: nemotron-3-ultra-550b-a55b:free

Да, у модели есть бесплатный вариант — nvidia/nemotron-3-ultra-550b-a55b:free. Он использует ту же модель, но работает с ограничениями по скорости: количество запросов в единицу времени ограничено, поэтому вариант подходит для знакомства с моделью, прототипов и нерегулярных задач, но не для продакшена с высокой нагрузкой.

Чтобы использовать бесплатный вариант, просто укажите его в поле model:

response = client.chat.completions.create(
    model="nvidia/nemotron-3-ultra-550b-a55b:free",
    messages=[
        {"role": "user", "content": "Объясните разницу между процессом и потоком."},
    ],
)

Если вам важна именно экономия, посмотрите подборку «Топ-5 бесплатных нейросетей через API» — там собраны варианты с бесплатными тарифами и описаны их ограничения.

Когда лимитов бесплатного варианта перестанет хватать, переход на платный не требует изменений в коде — достаточно убрать суффикс :free из названия модели.

Когда стоит выбрать Nemotron 3 Ultra

Модель оправдана, если вам нужны:

  • очень большой контекст — работа с целыми репозиториями, длинными PDF, объёмными логами;
  • качественные рассуждения — многоступенчатые задачи, анализ, планирование;
  • стабильный API из России без сложностей с оплатой.

Если же задача проще и объёмы контекста небольшие, возможно, вам подойдёт более лёгкая модель — например, Llama 3.3 70B или DeepSeek. Обе доступны в том же каталоге и по тому же ключу.

Частые вопросы

Действительно ли Nemotron 3 Ultra бесплатна?

Есть бесплатный вариант nvidia/nemotron-3-ultra-550b-a55b:free, но он работает с ограничениями по скорости и не рассчитан на высокую нагрузку. Для регулярной работы используйте платный вариант — оплата идёт только за фактически использованные токены.

Сколько стоит использование платной версии?

68,83 ₽ за 1 млн входящих токенов и 412,96 ₽ за 1 млн исходящих. Минимальное пополнение баланса — 300 ₽, оплата в рублях через СБП, карту или по счёту для юрлиц.

Нужно ли менять код при переходе с бесплатного варианта на платный?

Нет. Достаточно убрать суффикс :free из значения параметра model. Всё остальное — base_url, ключ, структура запроса — остаётся прежним.

Все модели из статьи доступны в Hubris — единый API, оплата в рублях.