Топ-5 бесплатных нейросетей с доступом по API (2026)
11 июня 2026 г. · Константин Романков · 9 мин чтения · Обновлено 7 сентября 2026 г.
Бесплатные нейросети с доступом по API — это не урезанные демо, а полноценные модели: контекст до 1 млн токенов, вызов инструментов, генерация кода, разбор изображений. Всего в каталоге Hubris 527 моделей, и у части из них стоимость токенов — 0 ₽; актуальный список открывается фильтром «бесплатные». Мы отобрали пять, которые закрывают разные задачи: код, агенты, длинный контекст, изображения на входе и обычный чат.
Сначала о механике, честно. «Бесплатная» здесь означает ровно одно: у модели в каталоге нулевая цена за входящие и исходящие токены, поэтому запросы к ней не списывают деньги с баланса. Набор бесплатных моделей непостоянен: модели появляются и уходят вслед за решениями их разработчиков, поэтому любую подборку стоит сверять с каталогом по фильтру «бесплатные», там список всегда живой. И второе: у бесплатного доступа есть суточный лимит — 100 запросов на пользователя, общий на все бесплатные модели. Отсчёт идёт от первого бесплатного запроса и обнуляется целиком через сутки после него. При исчерпании приходит ошибка 429 с кодом daily_limit_exceeded: дождитесь обнуления счётчика или переключитесь на платную версию модели, предварительно открыв её страницу — заявленный контекст у платного варианта может отличаться. Отдельно действуют ограничения разработчика модели: их значения не публикуются, при таком 429 выручает повтор с нарастающей задержкой.
И третье, о чём стоит знать заранее: у части бесплатных доступов разработчик модели оставляет за собой право использовать запросы и ответы для обучения. Из нашей подборки так делает Laguna S 2.1, а из упомянутых ниже — Nemotron 3 Nano Omni. В карточке модели это указано явно, а в каталоге такие модели помечены отдельно. Если данные чувствительные, берите модель без такой пометки: в подборке это Nemotron 3 Ultra, Nemotron 3 Super, Gemma 4 31B и GLM 5.2.
1. NVIDIA Nemotron 3 Ultra — миллион токенов контекста
Открытая модель NVIDIA для рассуждений и оркестрации: 550 млрд параметров всего, активны 55 млрд — гибридная архитектура Transformer-Mamba с разреженной смесью экспертов (MoE). Контекст — 1 млн токенов: в один запрос помещается небольшая кодовая база или несколько сотен страниц документации. Поддерживает вызов инструментов, включаемый режим рассуждений и регулировку его глубины (reasoning_effort) — модель работает и в «быстром», и в «думающем» режиме. Страница модели — nvidia/nemotron-3-ultra-550b-a55b:free.
Плюсы: самый большой контекст среди бесплатных моделей каталога; инструменты и рассуждения доступны сразу; открытые веса.
Минусы: принимает только текст — изображения не загрузить; на запросах в сотни тысяч токенов ответ идёт заметно дольше; миллион токенов заявлен только у бесплатного варианта — у платного меньше.
2. Poolside Laguna S 2.1 — код и многошаговые правки
Свежая модель Poolside для работы с кодом в агентном режиме: 118 млрд параметров всего при 8 млрд активных. Разработчик приводит 70,2% на Terminal-Bench 2.1 и 40,4% на DeepSWE — это оценки агентной работы с кодом. Контекст — 262 144 токена, поддерживаются вызов инструментов и рассуждения, поэтому модель годится не только для «допиши функцию», но и для цепочек правок по нескольким файлам. Страница модели — poolside/laguna-s-2.1:free.
Плюсы: специализация на разработке; уверенная работа с инструментами — готовая основа для агента, который ведёт правки по коду; мало активных параметров, отсюда скорость.
Минусы: вне программирования — не её поле; вход только текстовый, макет или скриншот загрузить нельзя; разработчик вправе использовать запросы для обучения своих моделей — для закрытого кода это может оказаться неприемлемо.
3. NVIDIA Nemotron 3 Super 120B A12B — рабочая лошадка для агентов
Гибридная MoE-модель NVIDIA под многоагентные сценарии: 120 млрд параметров всего, активны 12 млрд — отсюда скорость генерации при солидном размере. Архитектура Mamba-Transformer с предсказанием нескольких токенов, веса открыты. Контекст через наш API — 262 144 токена, есть вызов инструментов вместе с принудительным выбором функции (tool_choice) и включаемый режим рассуждений. Страница модели — nvidia/nemotron-3-super-120b-a12b:free.
Плюсы: дисциплинированная работа с инструментами; быстрая генерация за счёт малой доли активных параметров; предсказуемое поведение в многошаговых сценариях.
Минусы: вход только текстовый; NVIDIA заявляет для этой модели контекст в 1 млн токенов, но у бесплатного доступа он урезан до 262 144 — проверяйте карточку в каталоге, прежде чем рассчитывать на длинный запрос.
4. Google Gemma 4 31B — изображения на входе
Плотная мультимодальная модель Google DeepMind на 30,7 млрд параметров: на входе текст, изображения и видео, на выходе — текст. Контекст — 262 144 токена, режим рассуждений настраивается, поддерживаются вызов инструментов и ответ по заданной схеме (response_format). Берите её, когда нужно распознать документ или разобрать скриншот и получить структурированный результат. Страница модели — google/gemma-4-31b-it:free.
Плюсы: единственная в подборке принимает изображения; аккуратный структурированный вывод; компактная, а значит быстрая.
Минусы: 30,7 млрд параметров — не флагманский уровень, на сложной логике ошибается чаще; выход только текстовый — картинки она не генерирует.
5. Z.ai GLM 5.2 — универсальный чат и быстрые ответы
Крупная модель рассуждений от Z.ai: ровно работает и в обычном чате, и в длинных агентных цепочках, сильна в коде и вызове инструментов. Контекст через наш API — 256 000 токенов, вход текстовый, уровень рассуждений переключается (high, xhigh). Ровный универсал для чат-ботов, текстов и классификации, когда не нужен миллионный контекст. Страница модели — z-ai/glm-5.2:free.
Плюсы: одинаково уместна и в чате, и в агентных задачах; регулируемая глубина рассуждений; уверенная работа с инструментами.
Минусы: контекст скромнее, чем у лидера подборки — 256 000 токенов против миллиона у Nemotron 3 Ultra; изображения на входе не поддерживает.
Сводная таблица
| Модель | Идентификатор для API | Контекст | Вход | Для чего |
|---|---|---|---|---|
| NVIDIA Nemotron 3 Ultra | nvidia/nemotron-3-ultra-550b-a55b:free | 1 000 000 | текст | длинные документы, оркестрация |
| Poolside Laguna S 2.1 | poolside/laguna-s-2.1:free | 262 144 | текст | код, агенты для работы с кодом |
| NVIDIA Nemotron 3 Super 120B A12B | nvidia/nemotron-3-super-120b-a12b:free | 262 144 | текст | агенты, вызов инструментов |
| Google Gemma 4 31B | google/gemma-4-31b-it:free | 262 144 | текст, изображения, видео | распознавание, разбор картинок |
| Z.ai GLM 5.2 | z-ai/glm-5.2:free | 256 000 | текст | чат, тексты, классификация |
Цена токенов у всех пяти — 0 ₽ и на входе, и на выходе.
Что выбрать под задачу
- Длинные документы, своды правил, разбор большой кодовой базы — Nemotron 3 Ultra.
- Агент для работы с кодом в редакторе или в сборочном конвейере — Laguna S 2.1.
- Многошаговые сценарии с внешними функциями — Nemotron 3 Super 120B A12B; как устроен такой обмен, разобрано в статье про вызов функций.
- Картинки, сканы и скриншоты на входе — Gemma 4 31B; практические примеры — в статье про распознавание изображений.
- Чат-бот, тексты, классификация — GLM 5.2.
- Не хочется выбирать вручную — бесплатный маршрутизатор hubris/free с контекстом 200 000 токенов: он сам подберёт подходящую бесплатную модель под параметры запроса и принимает изображения.
Бесплатных моделей в каталоге больше пяти: Cohere North Mini Code для кода, Gemma 4 26B с видео на входе, Nemotron 3 Nano Omni со звуком на входе, Nemotron 3 Embed 1B для встраивания текста. Подключение не отличается от платных: ключ — на странице ключей API, порядок действий — в руководстве по быстрому старту, выбрать помогает разбор моделей под задачу.
Частые вопросы
Это действительно бесплатно? Да. У перечисленных моделей нулевая цена за входящие и исходящие токены, запросы к ним не уменьшают баланс. Пополнение нужно только для платных моделей — минимальная сумма 300 ₽.
Почему список бесплатных моделей меняется? Бесплатный доступ открывают и закрывают сами разработчики моделей, а каталог отражает текущее положение дел. Актуальный список — по фильтру «бесплатные», сверьтесь с ним перед тем, как закладывать модель в проект.
Какие ограничения у бесплатного доступа?
Суточный лимит — 100 запросов на пользователя, один на все бесплатные модели вместе. Отсчёт начинается с первого бесплатного запроса и обнуляется целиком через сутки после него, а не понемногу: при исчерпании возвращается 429 с кодом daily_limit_exceeded. Отдельно действуют ограничения разработчика модели — их значения не публикуются, поэтому предусмотрите повтор с задержкой и запасную модель, тогда 429 не уронит сервис.
Чем бесплатная версия отличается от платной? Условиями доступа. У бесплатного варианта есть суточный лимит в 100 запросов, у платных версий суточного лимита нет — поэтому они предсказуемее под постоянной нагрузкой. Заявленный контекст у платного варианта тоже может отличаться от бесплатного, причём в обе стороны, так что перед переключением откройте страницу модели в каталоге.
Подходят ли бесплатные модели для рабочих проектов? Для прототипов, внутренних инструментов и фоновых задач, которым хватает 100 запросов в сутки, — вполне. Для клиентских сервисов с постоянной нагрузкой разумнее платные версии, а бесплатную оставить запасной.
Все модели из статьи доступны в Hubris — единый API, оплата в рублях.