Grok STT — это модель преобразования речи в текст от xAI, доступная через конечную точку REST /v1/stt. Она поддерживает транскрипцию с временными метками на уровне слов, опциональную диаризацию диктора и многоканальное аудио.
Провайдер для xAI: Grok STT 1.0
Hubris маршрутизирует запросы к лучшему доступному провайдеру с автоматическим fallback при сбоях.
Модальности
Поддерживаемые параметры
Другие модели от x-ai
xAI: Grok Imagine Video 1.5
Grok Imagine Video 1.5 — это модель генерации изображений в видео от xAI. Она анимирует исходное изображение с помощью опционального текстового запроса, который может управлять движением объекта и камеры, темпом, атмосферой и т. д.
xAI: Grok 4.5
Grok 4.5 — самая умная модель xAI: передовые результаты в программировании, агентных задачах и STEM.
xAI: Grok Latest
Эта модель всегда перенаправляется на последнюю модель Grok от xAI.
xAI: Grok Build 0.1
Grok Build 0.1 — это быстрая модель кодирования от xAI, разработанная специально для агентских рабочих процессов разработки программного обеспечения. Она поддерживает текстовые и графические входные данные с текстовым выводом и оптимизирована для интерактивных агентов кодирования, использования инструментов и многоэтапных задач разработки. Модель лежит в основе Grok Build CLI от xAI и имеет контекстное окно размером 256K без ограничения на объем текстового вывода, что делает ее хорошо подходящей для долгосрочного кодирования и автоматизации рабочих процессов. В настоящее время находится на стадии раннего доступа.
xAI: Grok Imagine Video
Grok Imagine Video — это быстрая модель генерации видео от xAI, обусловленная текстом, изображениями и референсами. Она создает короткие видео (1–15 секунд, 24 кадра в секунду) в разрешении 480p или 720p с семью соотношениями сторон.
xAI: Grok Imagine Image Quality
Grok Imagine Image Quality — это быстрая, высококачественная модель для генерации и редактирования изображений от xAI. Она принимает текстовые запросы и опциональные референсные изображения, создавая фотореалистичные результаты в разрешениях 1K или 2K с различными соотношениями сторон, включая гибкую настройку референсных изображений. Модель делает акцент на реалистичных деталях — естественном освещении и физике, точных текстурах и последовательном рендеринге именованных сущностей, таких как бренды, публичные личности и конкретные локации. Она поддерживает чистое многоязычное отображение текста внутри изображений, что делает её лучшим выбором для плакатов, упаковки, рекламы, меню и графики для социальных сетей. При наличии референсных изображений она сохраняет идентичность и структуру для размещения продуктов, вариаций, соответствующих бренду, и непрерывности персонажей в различных сценах.