Нейросети для распознавания речи через API
В каталоге Hubris 19 моделей для распознавания речи: доступ через единый OpenAI-совместимый API, оплата картой РФ или СБП, без VPN. Цены — в рублях за токены.
nova-3
Deepgram Nova-3 — универсальная модель преобразования речи в текст с поддержкой моноязычной и многоязычной транскрипции.
transcribe-1
Transcribe 1 — это модель преобразования речи в текст от Fish Audio. Она подходит для транскрибирования аудио с автоматическим определением языка и может возвращать сегменты на уровне слов с отметками времени, если запрашиваются детали…
chirp-3
Chirp 3 — это новейшая многоязычная модель преобразования речи в текст от Google. Она обеспечивает повышенную точность транскрипции для 24 общедоступных языков и более 77 языков предварительного просмотра, с поддержкой автоматического…
mai-transcribe-1.5
MAI-Transcribe 1.5 — это многоязычная модель преобразования речи в текст от Microsoft AI. Она подходит для создания субтитров, транскрибирования звонков, обеспечения доступности и других голосовых приложений, предлагая надёжную…
voxtral-mini-3b-2507
Voxtral Mini 3B 2507 — это модель понимания речи и аудио от Mistral AI. Она подходит для транскрипции, перевода и компактных рабочих нагрузок по обработке аудио.
voxtral-mini-transcribe
Voxtral Mini Transcribe — это модель преобразования речи в текст от Mistral, разработанная на основе семейства Voxtral Mini. Она принимает аудиовход и возвращает расшифрованный текст через стандартный API транскрипции. Подходит для…
voxtral-small-24b-2507-stt
Voxtral Small 24B 2507 STT — это модель транскрипции речи от Mistral AI. Она подходит для задач транскрипции, перевода и понимания аудио, которым полезна её большая ёмкость модели.
nemotron-3.5-asr-streaming-multilingual-0.6b
Nemotron 3.5 ASR Streaming Multilingual 0.6B — это модель распознавания речи от NVIDIA. Её дизайн FastConformer-RNNT, обусловленный подсказками и учитывающий кэш, предназначен для транскрипции с низкой задержкой на более чем 40 языках для…
parakeet-tdt-0.6b-v3
Parakeet TDT 0.6B v3 — это мультиязычная модель преобразования речи в текст от NVIDIA с 600 миллионами параметров, построенная на архитектуре FastConformer-TDT. Обученная на наборе данных Granary (более 670 000 часов аудио), она…
gpt-4o-mini-transcribe
GPT-4o Mini Transcribe — это уменьшенная, экономичная модель преобразования речи в текст от OpenAI, основанная на аудиовозможностях GPT-4o Mini. Она тарифицируется за токен (входной и выходной), что делает её подходящей для рабочих…
gpt-4o-transcribe
GPT-4o Transcribe — это высококачественная модель преобразования речи в текст от OpenAI, основанная на аудиовозможностях GPT-4o. Оплата производится за токен (входной и выходной), что делает её подходящей для рабочих процессов, которым…
gpt-transcribe
GPT Transcribe — это высокоточная модель преобразования речи в текст от OpenAI. Она подходит для записанного аудио, потоковой транскрипции файлов и зафиксированных сеансов в реальном времени, с контекстом в свободной форме, подсказками по…
whisper-1
Whisper — это модель автоматического распознавания речи с открытым исходным кодом от OpenAI, доступная через API как `whisper-1`. Она поддерживает транскрипцию и перевод более чем на 50 языков из аудиофайлов размером до 25 МБ. Принимает…
whisper-large-v3
Whisper Large V3 — это модель автоматического распознавания речи с открытым исходным кодом от OpenAI, предлагающая как транскрипцию, так и перевод аудио. Она поддерживает более 99 языков и принимает распространённые аудиоформаты, включая…
whisper-large-v3-turbo
Whisper Large V3 Turbo — это оптимизированная версия модели распознавания речи Whisper Large V3 от OpenAI, разработанная для обеспечения скорости и экономичности. Она поддерживает транскрипцию на более чем 99 языках с...
qwen3-asr-0.6b
Qwen3 ASR 0.6B — это компактная модель автоматического распознавания речи от Qwen. Она поддерживает многоязычную идентификацию и транскрипцию речи на 30 языках и 22 китайских диалектах, с потоковой и офлайн-обработкой...
qwen3-asr-1.7b
Qwen3 ASR 1.7B — это модель автоматического распознавания речи от Qwen. Она поддерживает многоязычную идентификацию и транскрипцию на 30 языках и 22 китайских диалектах, с потоковым и офлайн-выводом...
qwen3-asr-flash-2026-02-10
Qwen3-ASR-Flash — это сервис автоматического распознавания речи от Alibaba, построенный на основе Qwen3-Omni и обученный на десятках миллионов часов мультимодальных речевых данных. Модель поддерживает 11 языков —...
grok-stt-1.0
Grok STT — это модель преобразования речи в текст от xAI, доступная через конечную точку REST /v1/stt. Она поддерживает транскрипцию с временными метками на уровне слов, опциональную диаризацию диктора и многоканальное аудио.