Mercury 2.5 — это самая быстрая LLM для рассуждений и новейшая диффузионная LLM (dLLM) от Inception. Вместо последовательной генерации токенов Mercury 2.5 производит и уточняет несколько токенов параллельно, достигая скорости 1107 токенов/сек на стандартных GPU. Она обеспечивает прирост интеллекта более чем на 10 пунктов по сравнению с Mercury 2, демонстрируя качество, сопоставимое с оптимизированными по стоимости передовыми моделями, такими как GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5. Mercury 2.5 поддерживает настраиваемые уровни рассуждений, параллельные вызовы инструментов и вывод JSON, соответствующий схеме. Она создана для производственных рабочих нагрузок, где задержка имеет критическое значение: поисковые агенты, голосовые конвейеры и вспомогательные агенты для кодирования.
Провайдер для Inception: Mercury 2.5 Preview
Hubris маршрутизирует запросы к лучшему доступному провайдеру с автоматическим fallback при сбоях.
Модальности
Провайдеры
Запросы обслуживает один из провайдеров ниже — маршрутизация автоматически выбирает оптимального по доступности и скорости в момент запроса. Итоговая стоимость зависит от того, какой провайдер обслужил запрос, и от попадания в кэш: при повторяющемся контексте вход тарифицируется по цене чтения кэша — до 60–80 % дешевле. Цены — в рублях за 1 млн токенов.
Inception−80 % | — | 100,0 % |