Gemini 2.5 Flash через API из России — подключение и цены в 2026
25 июля 2026 г. · Константин Романков · 6 мин чтения
Gemini 2.5 Flash доступна через Hubris — OpenAI-совместимый API-шлюз с оплатой в рублях через СБП. Подключение занимает 5 минут: получаете ключ, меняете base URL и начинаете работать.
Что такое Gemini 2.5 Flash
Gemini 2.5 Flash — флагманская рабочая модель Google в линейке Flash, предназначенная для задач, которые требуют глубокого рассуждения, но не хотят платить за Pro-класс. Контекстное окно — 1 048 576 токенов (1 млн), что покрывает весь средний кодовый репозиторий или часовой транскрипт встречи за один вызов.
Модель поддерживает мультимодальный ввод: текст, изображения, файлы, аудио, видео. На выходе — только текст (или JSON через structured outputs). Поддерживает tool calling, function calling, response_format и параметр reasoning (встроенный режим мышления).
Gemini 2.5 Flash vs Flash Lite
| Gemini 2.5 Flash | Gemini 2.5 Flash Lite | |
|---|---|---|
| Входящие токены | 33,61 ₽/млн | 11,20 ₽/млн |
| Исходящие токены | 280,12 ₽/млн | 44,82 ₽/млн |
| Контекст | 1 млн токенов | 1 млн токенов |
| Режим мышления | Есть | Есть |
| Мультимодальность | Текст, фото, файл, видео, аудио | Текст, фото, файл, видео, аудио |
Если задача допускает более лёгкую модель (краткие FAQ, классификация, простой код) — Gemini 2.5 Flash Lite сэкономит в 6 раз на выходящих токенах.
Как подключиться из России
Прямой доступ к Google AI Studio ограничен для российских пользователей. Hubris выступает шлюзом: принимает запросы в формате OpenAI, проксирует в Google и возвращает ответ — вы не меняете библиотеку, только URL и ключ.
Шаг 1. Зарегистрируйтесь на hubris.pw и пополните баланс через СБП от 300 ₽ — никаких иностранных карт.
Шаг 2. Создайте API-ключ в разделе «Ключи». Ключ имеет формат sk-gw-… — он показывается один раз, сохраните его.
Шаг 3. Замените api.openai.com на api.hubris.pw в вашем коде. Всё.
Примеры подключения
curl
curl https://api.hubris.pw/v1/chat/completions \
-H "Authorization: Bearer sk-gw-ВАШ_КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemini-2.5-flash",
"messages": [{"role": "user", "content": "Объясни квантовую запутанность в двух предложениях"}]
}'
Python (openai SDK)
from openai import OpenAI
client = OpenAI(
base_url="https://api.hubris.pw/v1",
api_key="sk-gw-ВАШ_КЛЮЧ"
)
response = client.chat.completions.create(
model="google/gemini-2.5-flash",
messages=[{"role": "user", "content": "Напиши unit-тест для функции сортировки на Python"}]
)
print(response.choices[0].message.content)
Режим мышления (Thinking)
Gemini 2.5 Flash поддерживает встроенный reasoning — модель показывает цепочку рассуждений перед финальным ответом. Включается через параметр reasoning:
response = client.chat.completions.create(
model="google/gemini-2.5-flash",
messages=[{"role": "user", "content": "Сколько простых чисел в диапазоне от 1 до 100?"}],
extra_body={"reasoning": {"effort": "medium"}}
)
# Рассуждения — в response.choices[0].message.reasoning_content
print(response.choices[0].message.reasoning_content)
print(response.choices[0].message.content)
Модальности: отправка изображений
Gemini 2.5 Flash принимает изображения в base64 или по URL — стандартный OpenAI vision format:
import base64
with open("screenshot.png", "rb") as f:
img_b64 = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="google/gemini-2.5-flash",
messages=[{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{img_b64}"}},
{"type": "text", "text": "Опиши что на скриншоте и найди баги в UI"}
]
}]
)
Поддерживается также передача аудио и видео — через те же image_url-поля с соответствующими MIME-типами.
Цены в рублях
Стоимость рассчитывается в рублях по актуальному курсу ЦБ на момент запроса:
- Входящие токены: 33,61 ₽ за 1 млн токенов
- Исходящие токены: 280,12 ₽ за 1 млн токенов
- Режим мышления (internal_reasoning): 280,12 ₽ за 1 млн токенов (те же, что и выходящие)
Пример стоимости типичного запроса: 1 000 входящих (0,034 ₽) + 500 выходящих (0,14 ₽) ≈ 0,17 ₽. Запрос с мышлением и 2 000 reasoning-токенами добавляет ещё ~0,56 ₽.
Баланс пополняется через СБП — мгновенно, от любого российского банка, от 100 ₽.
Практические применения
Анализ документов. Миллион токенов — это ~750 страниц текста. Скармливайте целые PDF-отчёты, договоры или кодовые базы без чанкинга.
RAG-агенты. Модель поддерживает tool calling и structured outputs — удобно для многошагового retrieval с вызовом инструментов.
Мультимодальный анализ. Скриншоты, схемы, аудиозаписи встреч — Flash принимает всё в одном запросе вместе с текстом.
Генерация кода. По бенчмаркам кода Flash 2.5 сопоставима с моделями уровня GPT-4o при значительно меньшей цене выходящих токенов.
Частые вопросы
Чем Flash отличается от Flash Lite? Flash — полная версия с высоким качеством рассуждений. Flash Lite — облегчённая, примерно в 6 раз дешевле на выходящих токенах, но с несколько меньшим качеством на сложных задачах. Для простых задач начните с Lite, переходите на Flash там, где нужна точность.
Можно ли использовать Gemini 2.5 Flash в n8n или Dify?
Да. В n8n выберите узел «OpenAI» и укажите Custom Base URL: https://api.hubris.pw/v1. В Dify — аналогично в разделе Model Provider. Подробнее: подключение Hubris в Dify как OpenAI-провайдер.
Работает ли стриминг?
Да, параметр stream: true поддерживается — ответ приходит токен за токеном, как в ChatGPT.
Поддерживаются ли функции (function calling / tools)?
Да, в полном объёме — тот же формат, что и у OpenAI. Параметр tool_choice тоже доступен.
Другие статьи по теме: Gemini API из России — обзор всех моделей Google, как выбрать LLM под задачу, генерация изображений через API.
Все модели из статьи доступны в Hubris — единый API, оплата в рублях.