hubris
Топ-5 бесплатных нейросетей с доступом по API (2026)

Топ-5 бесплатных нейросетей с доступом по API (2026)

11 июня 2026 г. · Константин Романков · 9 мин чтения · Обновлено 7 сентября 2026 г.

Бесплатные нейросети с доступом по API — это не урезанные демо, а полноценные модели: контекст до 1 млн токенов, вызов инструментов, генерация кода, разбор изображений. Всего в каталоге Hubris 527 моделей, и у части из них стоимость токенов — 0 ₽; актуальный список открывается фильтром «бесплатные». Мы отобрали пять, которые закрывают разные задачи: код, агенты, длинный контекст, изображения на входе и обычный чат.

Сначала о механике, честно. «Бесплатная» здесь означает ровно одно: у модели в каталоге нулевая цена за входящие и исходящие токены, поэтому запросы к ней не списывают деньги с баланса. Набор бесплатных моделей непостоянен: модели появляются и уходят вслед за решениями их разработчиков, поэтому любую подборку стоит сверять с каталогом по фильтру «бесплатные», там список всегда живой. И второе: у бесплатного доступа есть суточный лимит — 100 запросов на пользователя, общий на все бесплатные модели. Отсчёт идёт от первого бесплатного запроса и обнуляется целиком через сутки после него. При исчерпании приходит ошибка 429 с кодом daily_limit_exceeded: дождитесь обнуления счётчика или переключитесь на платную версию модели, предварительно открыв её страницу — заявленный контекст у платного варианта может отличаться. Отдельно действуют ограничения разработчика модели: их значения не публикуются, при таком 429 выручает повтор с нарастающей задержкой.

И третье, о чём стоит знать заранее: у части бесплатных доступов разработчик модели оставляет за собой право использовать запросы и ответы для обучения. Из нашей подборки так делает Laguna S 2.1, а из упомянутых ниже — Nemotron 3 Nano Omni. В карточке модели это указано явно, а в каталоге такие модели помечены отдельно. Если данные чувствительные, берите модель без такой пометки: в подборке это Nemotron 3 Ultra, Nemotron 3 Super, Gemma 4 31B и GLM 5.2.

1. NVIDIA Nemotron 3 Ultra — миллион токенов контекста

Открытая модель NVIDIA для рассуждений и оркестрации: 550 млрд параметров всего, активны 55 млрд — гибридная архитектура Transformer-Mamba с разреженной смесью экспертов (MoE). Контекст — 1 млн токенов: в один запрос помещается небольшая кодовая база или несколько сотен страниц документации. Поддерживает вызов инструментов, включаемый режим рассуждений и регулировку его глубины (reasoning_effort) — модель работает и в «быстром», и в «думающем» режиме. Страница модели — nvidia/nemotron-3-ultra-550b-a55b:free.

Плюсы: самый большой контекст среди бесплатных моделей каталога; инструменты и рассуждения доступны сразу; открытые веса.

Минусы: принимает только текст — изображения не загрузить; на запросах в сотни тысяч токенов ответ идёт заметно дольше; миллион токенов заявлен только у бесплатного варианта — у платного меньше.

Светящаяся лента данных сворачивается в спираль — миллион токенов контекста

2. Poolside Laguna S 2.1 — код и многошаговые правки

Свежая модель Poolside для работы с кодом в агентном режиме: 118 млрд параметров всего при 8 млрд активных. Разработчик приводит 70,2% на Terminal-Bench 2.1 и 40,4% на DeepSWE — это оценки агентной работы с кодом. Контекст — 262 144 токена, поддерживаются вызов инструментов и рассуждения, поэтому модель годится не только для «допиши функцию», но и для цепочек правок по нескольким файлам. Страница модели — poolside/laguna-s-2.1:free.

Плюсы: специализация на разработке; уверенная работа с инструментами — готовая основа для агента, который ведёт правки по коду; мало активных параметров, отсюда скорость.

Минусы: вне программирования — не её поле; вход только текстовый, макет или скриншот загрузить нельзя; разработчик вправе использовать запросы для обучения своих моделей — для закрытого кода это может оказаться неприемлемо.

Строки кода превращаются в светящиеся архитектурные конструкции

3. NVIDIA Nemotron 3 Super 120B A12B — рабочая лошадка для агентов

Гибридная MoE-модель NVIDIA под многоагентные сценарии: 120 млрд параметров всего, активны 12 млрд — отсюда скорость генерации при солидном размере. Архитектура Mamba-Transformer с предсказанием нескольких токенов, веса открыты. Контекст через наш API — 262 144 токена, есть вызов инструментов вместе с принудительным выбором функции (tool_choice) и включаемый режим рассуждений. Страница модели — nvidia/nemotron-3-super-120b-a12b:free.

Плюсы: дисциплинированная работа с инструментами; быстрая генерация за счёт малой доли активных параметров; предсказуемое поведение в многошаговых сценариях.

Минусы: вход только текстовый; NVIDIA заявляет для этой модели контекст в 1 млн токенов, но у бесплатного доступа он урезан до 262 144 — проверяйте карточку в каталоге, прежде чем рассчитывать на длинный запрос.

4. Google Gemma 4 31B — изображения на входе

Плотная мультимодальная модель Google DeepMind на 30,7 млрд параметров: на входе текст, изображения и видео, на выходе — текст. Контекст — 262 144 токена, режим рассуждений настраивается, поддерживаются вызов инструментов и ответ по заданной схеме (response_format). Берите её, когда нужно распознать документ или разобрать скриншот и получить структурированный результат. Страница модели — google/gemma-4-31b-it:free.

Плюсы: единственная в подборке принимает изображения; аккуратный структурированный вывод; компактная, а значит быстрая.

Минусы: 30,7 млрд параметров — не флагманский уровень, на сложной логике ошибается чаще; выход только текстовый — картинки она не генерирует.

5. Z.ai GLM 5.2 — универсальный чат и быстрые ответы

Крупная модель рассуждений от Z.ai: ровно работает и в обычном чате, и в длинных агентных цепочках, сильна в коде и вызове инструментов. Контекст через наш API — 256 000 токенов, вход текстовый, уровень рассуждений переключается (high, xhigh). Ровный универсал для чат-ботов, текстов и классификации, когда не нужен миллионный контекст. Страница модели — z-ai/glm-5.2:free.

Плюсы: одинаково уместна и в чате, и в агентных задачах; регулируемая глубина рассуждений; уверенная работа с инструментами.

Минусы: контекст скромнее, чем у лидера подборки — 256 000 токенов против миллиона у Nemotron 3 Ultra; изображения на входе не поддерживает.

Сводная таблица

МодельИдентификатор для APIКонтекстВходДля чего
NVIDIA Nemotron 3 Ultranvidia/nemotron-3-ultra-550b-a55b:free1 000 000текстдлинные документы, оркестрация
Poolside Laguna S 2.1poolside/laguna-s-2.1:free262 144тексткод, агенты для работы с кодом
NVIDIA Nemotron 3 Super 120B A12Bnvidia/nemotron-3-super-120b-a12b:free262 144текстагенты, вызов инструментов
Google Gemma 4 31Bgoogle/gemma-4-31b-it:free262 144текст, изображения, видеораспознавание, разбор картинок
Z.ai GLM 5.2z-ai/glm-5.2:free256 000текстчат, тексты, классификация

Цена токенов у всех пяти — 0 ₽ и на входе, и на выходе.

Что выбрать под задачу

  • Длинные документы, своды правил, разбор большой кодовой базы — Nemotron 3 Ultra.
  • Агент для работы с кодом в редакторе или в сборочном конвейере — Laguna S 2.1.
  • Многошаговые сценарии с внешними функциями — Nemotron 3 Super 120B A12B; как устроен такой обмен, разобрано в статье про вызов функций.
  • Картинки, сканы и скриншоты на входе — Gemma 4 31B; практические примеры — в статье про распознавание изображений.
  • Чат-бот, тексты, классификация — GLM 5.2.
  • Не хочется выбирать вручную — бесплатный маршрутизатор hubris/free с контекстом 200 000 токенов: он сам подберёт подходящую бесплатную модель под параметры запроса и принимает изображения.

Бесплатных моделей в каталоге больше пяти: Cohere North Mini Code для кода, Gemma 4 26B с видео на входе, Nemotron 3 Nano Omni со звуком на входе, Nemotron 3 Embed 1B для встраивания текста. Подключение не отличается от платных: ключ — на странице ключей API, порядок действий — в руководстве по быстрому старту, выбрать помогает разбор моделей под задачу.

Частые вопросы

Это действительно бесплатно? Да. У перечисленных моделей нулевая цена за входящие и исходящие токены, запросы к ним не уменьшают баланс. Пополнение нужно только для платных моделей — минимальная сумма 300 ₽.

Почему список бесплатных моделей меняется? Бесплатный доступ открывают и закрывают сами разработчики моделей, а каталог отражает текущее положение дел. Актуальный список — по фильтру «бесплатные», сверьтесь с ним перед тем, как закладывать модель в проект.

Какие ограничения у бесплатного доступа? Суточный лимит — 100 запросов на пользователя, один на все бесплатные модели вместе. Отсчёт начинается с первого бесплатного запроса и обнуляется целиком через сутки после него, а не понемногу: при исчерпании возвращается 429 с кодом daily_limit_exceeded. Отдельно действуют ограничения разработчика модели — их значения не публикуются, поэтому предусмотрите повтор с задержкой и запасную модель, тогда 429 не уронит сервис.

Чем бесплатная версия отличается от платной? Условиями доступа. У бесплатного варианта есть суточный лимит в 100 запросов, у платных версий суточного лимита нет — поэтому они предсказуемее под постоянной нагрузкой. Заявленный контекст у платного варианта тоже может отличаться от бесплатного, причём в обе стороны, так что перед переключением откройте страницу модели в каталоге.

Подходят ли бесплатные модели для рабочих проектов? Для прототипов, внутренних инструментов и фоновых задач, которым хватает 100 запросов в сутки, — вполне. Для клиентских сервисов с постоянной нагрузкой разумнее платные версии, а бесплатную оставить запасной.

Все модели из статьи доступны в Hubris — единый API, оплата в рублях.