Нейросети для распознавания речи через API
В каталоге Hubris 12 моделей для распознавания речи: доступ через единый OpenAI-совместимый API, оплата картой РФ или СБП, без VPN. Цены — в рублях за токены.
nova-3
Deepgram Nova-3 — универсальная модель преобразования речи в текст с поддержкой моноязычной и многоязычной транскрипции.
chirp-3
Chirp 3 — это новейшая многоязычная модель преобразования речи в текст от Google. Она обеспечивает повышенную точность транскрипции для 24 общедоступных языков и более 77 языков предварительного просмотра, с поддержкой автоматического…
mai-transcribe-1.5
MAI-Transcribe 1.5 — это многоязычная модель преобразования речи в текст от Microsoft AI. Она подходит для создания субтитров, транскрибирования звонков, обеспечения доступности и других голосовых приложений, предлагая надёжную…
voxtral-mini-transcribe
Voxtral Mini Transcribe — это модель преобразования речи в текст от Mistral, разработанная на основе семейства Voxtral Mini. Она принимает аудиовход и возвращает расшифрованный текст через стандартный API транскрипции. Подходит для…
parakeet-tdt-0.6b-v3
Parakeet TDT 0.6B v3 — это мультиязычная модель преобразования речи в текст от NVIDIA с 600 миллионами параметров, построенная на архитектуре FastConformer-TDT. Обученная на наборе данных Granary (более 670 000 часов аудио), она…
gpt-4o-mini-transcribe
GPT-4o Mini Transcribe — это уменьшенная, экономичная модель преобразования речи в текст от OpenAI, основанная на аудиовозможностях GPT-4o Mini. Она тарифицируется за токен (входной и выходной), что делает её подходящей для рабочих…
gpt-4o-transcribe
GPT-4o Transcribe — это высококачественная модель преобразования речи в текст от OpenAI, основанная на аудиовозможностях GPT-4o. Оплата производится за токен (входной и выходной), что делает её подходящей для рабочих процессов, которым…
whisper-1
Whisper — это модель автоматического распознавания речи с открытым исходным кодом от OpenAI, доступная через API как `whisper-1`. Она поддерживает транскрипцию и перевод более чем на 50 языков из аудиофайлов размером до 25 МБ. Принимает…
whisper-large-v3
Whisper Large V3 — это модель автоматического распознавания речи с открытым исходным кодом от OpenAI, предлагающая как транскрипцию, так и перевод аудио. Она поддерживает более 99 языков и принимает распространённые аудиоформаты, включая…
whisper-large-v3-turbo
Whisper Large V3 Turbo — это оптимизированная версия модели распознавания речи Whisper Large V3 от OpenAI, разработанная для обеспечения скорости и экономичности. Она поддерживает транскрипцию на более чем 99 языках с...
qwen3-asr-flash-2026-02-10
Qwen3-ASR-Flash — это сервис автоматического распознавания речи от Alibaba, построенный на основе Qwen3-Omni и обученный на десятках миллионов часов мультимодальных речевых данных. Модель поддерживает 11 языков —...
grok-stt-1.0
Grok STT — это модель преобразования речи в текст от xAI, доступная через конечную точку REST /v1/stt. Она поддерживает транскрипцию с временными метками на уровне слов, опциональную диаризацию диктора и многоканальное аудио.