hubris

Нейросети для распознавания речи через API

В каталоге Hubris 19 моделей для распознавания речи: доступ через единый OpenAI-совместимый API, оплата картой РФ или СБП, без VPN. Цены — в рублях за токены.

Ddeepgram

nova-3

Deepgram Nova-3 — универсальная модель преобразования речи в текст с поддержкой моноязычной и многоязычной транскрипции.

0,550за минуту
0,660за минуту
audio-in
Открыть →
Ffish-audio

transcribe-1

Transcribe 1 — это модель преобразования речи в текст от Fish Audio. Она подходит для транскрибирования аудио с автоматическим определением языка и может возвращать сегменты на уровне слов с отметками времени, если запрашиваются детали…

0,020за секунду
audio-in
Открыть →
Логотип Google Geminigoogle

chirp-3

Chirp 3 — это новейшая многоязычная модель преобразования речи в текст от Google. Она обеспечивает повышенную точность транскрипции для 24 общедоступных языков и более 77 языков предварительного просмотра, с поддержкой автоматического…

2,03за минуту
audio-in · json
Открыть →
Логотип Microsoftmicrosoft

mai-transcribe-1.5

MAI-Transcribe 1.5 — это многоязычная модель преобразования речи в текст от Microsoft AI. Она подходит для создания субтитров, транскрибирования звонков, обеспечения доступности и других голосовых приложений, предлагая надёжную…

45,49за час
audio-in
Открыть →
Логотип Mistral AImistralai

voxtral-mini-3b-2507

Voxtral Mini 3B 2507 — это модель понимания речи и аудио от Mistral AI. Она подходит для транскрипции, перевода и компактных рабочих нагрузок по обработке аудио.

0,010за секунду
audio-in · json
Открыть →
Логотип Mistral AImistralai

voxtral-mini-transcribe

Voxtral Mini Transcribe — это модель преобразования речи в текст от Mistral, разработанная на основе семейства Voxtral Mini. Она принимает аудиовход и возвращает расшифрованный текст через стандартный API транскрипции. Подходит для…

0,380за минуту
audio-in · json
Открыть →
Логотип Mistral AImistralai

voxtral-small-24b-2507-stt

Voxtral Small 24B 2507 STT — это модель транскрипции речи от Mistral AI. Она подходит для задач транскрипции, перевода и понимания аудио, которым полезна её большая ёмкость модели.

0,010за секунду
audio-in · json
Открыть →
Логотип NVIDIAnvidia

nemotron-3.5-asr-streaming-multilingual-0.6b

Nemotron 3.5 ASR Streaming Multilingual 0.6B — это модель распознавания речи от NVIDIA. Её дизайн FastConformer-RNNT, обусловленный подсказками и учитывающий кэш, предназначен для транскрипции с низкой задержкой на более чем 40 языках для…

0,010за секунду
audio-in · json
Открыть →
Логотип NVIDIAnvidia

parakeet-tdt-0.6b-v3

Parakeet TDT 0.6B v3 — это мультиязычная модель преобразования речи в текст от NVIDIA с 600 миллионами параметров, построенная на архитектуре FastConformer-TDT. Обученная на наборе данных Granary (более 670 000 часов аудио), она…

0,190за минуту
audio-in
Открыть →
openai

gpt-4o-mini-transcribe

GPT-4o Mini Transcribe — это уменьшенная, экономичная модель преобразования речи в текст от OpenAI, основанная на аудиовозможностях GPT-4o Mini. Она тарифицируется за токен (входной и выходной), что делает её подходящей для рабочих…

prompt / 1M
158
completion / 1M
632
контекст 128kaudio-in · json
Открыть →
openai

gpt-4o-transcribe

GPT-4o Transcribe — это высококачественная модель преобразования речи в текст от OpenAI, основанная на аудиовозможностях GPT-4o. Оплата производится за токен (входной и выходной), что делает её подходящей для рабочих процессов, которым…

prompt / 1M
316
completion / 1M
1 264
контекст 128kaudio-in · json
Открыть →
openai

gpt-transcribe

GPT Transcribe — это высокоточная модель преобразования речи в текст от OpenAI. Она подходит для записанного аудио, потоковой транскрипции файлов и зафиксированных сеансов в реальном времени, с контекстом в свободной форме, подсказками по…

0,570за минуту
audio-in · json
Открыть →
openai

whisper-1

Whisper — это модель автоматического распознавания речи с открытым исходным кодом от OpenAI, доступная через API как `whisper-1`. Она поддерживает транскрипцию и перевод более чем на 50 языков из аудиофайлов размером до 25 МБ. Принимает…

0,760за минуту
audio-in · json
Открыть →
openai

whisper-large-v3

Whisper Large V3 — это модель автоматического распознавания речи с открытым исходным кодом от OpenAI, предлагающая как транскрипцию, так и перевод аудио. Она поддерживает более 99 языков и принимает распространённые аудиоформаты, включая…

0,010за секунду
audio-in · json
Открыть →
openai

whisper-large-v3-turbo

Whisper Large V3 Turbo — это оптимизированная версия модели распознавания речи Whisper Large V3 от OpenAI, разработанная для обеспечения скорости и экономичности. Она поддерживает транскрипцию на более чем 99 языках с...

0,010за секунду
audio-in · json
Открыть →
Логотип Qwenqwen

qwen3-asr-0.6b

Qwen3 ASR 0.6B — это компактная модель автоматического распознавания речи от Qwen. Она поддерживает многоязычную идентификацию и транскрипцию речи на 30 языках и 22 китайских диалектах, с потоковой и офлайн-обработкой...

0,010за секунду
audio-in · json
Открыть →
Логотип Qwenqwen

qwen3-asr-1.7b

Qwen3 ASR 1.7B — это модель автоматического распознавания речи от Qwen. Она поддерживает многоязычную идентификацию и транскрипцию на 30 языках и 22 китайских диалектах, с потоковым и офлайн-выводом...

0,010за секунду
audio-in · json
Открыть →
Логотип Qwenqwen

qwen3-asr-flash-2026-02-10

Qwen3-ASR-Flash — это сервис автоматического распознавания речи от Alibaba, построенный на основе Qwen3-Omni и обученный на десятках миллионов часов мультимодальных речевых данных. Модель поддерживает 11 языков —...

0,010за секунду
audio-in · json
Открыть →
x-ai

grok-stt-1.0

Grok STT — это модель преобразования речи в текст от xAI, доступная через конечную точку REST /v1/stt. Она поддерживает транскрипцию с временными метками на уровне слов, опциональную диаризацию диктора и многоканальное аудио.

12,64за час
audio-in · json
Открыть →