Qwen3-VL-235B-A22B Instruct — это открытая мультимодальная модель, которая объединяет мощную генерацию текста с визуальным пониманием изображений и видео. Модель Instruct предназначена для общего использования в задачах «зрение-язык» (VQA, анализ документов, извлечение диаграмм/таблиц, многоязычное оптическое распознавание символов). Серия моделей делает акцент на надёжном восприятии (распознавание разнообразных реальных и синтетических категорий), пространственном понимании (2D/3D привязка) и долгосрочном визуальном понимании, демонстрируя конкурентоспособные результаты в публичных мультимодальных бенчмарках как для восприятия, так и для рассуждений.
Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: она может следовать сложным инструкциям в многоизобразительных, многоходовых диалогах; сопоставлять текст с временными шкалами видео для точных временных запросов; и управлять элементами графического интерфейса для задач автоматизации. Модели также позволяют использовать рабочие процессы визуального кодирования — превращать эскизы или макеты в код и помогать с отладкой пользовательского интерфейса — при этом сохраняя высокую производительность только для текста, сравнимую с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL подходящей для производственных сценариев, охватывающих документооборот с ИИ, многоязычное оптическое распознавание символов, помощь в разработке программного обеспечения/пользовательского интерфейса, пространственные/воплощённые задачи и исследования в области агентов «зрение-язык».
Провайдер для Qwen: Qwen3 VL 235B A22B Instruct
Hubris маршрутизирует запросы к лучшему доступному провайдеру с автоматическим fallback при сбоях.
Модальности
Провайдеры
Запросы обслуживает один из провайдеров ниже — маршрутизация автоматически выбирает оптимального по доступности и скорости в момент запроса. Итоговая стоимость зависит от того, какой провайдер обслужил запрос, и от попадания в кэш: при повторяющемся контексте вход тарифицируется по цене чтения кэша — до 60–80 % дешевле. Цены — в рублях за 1 млн токенов.
DeepInfra | 25,25 ₽ | 111,09 ₽ | 13,89 ₽ | 14 т/с | 97,5 % | 24,9 % |
Venice | 26,51 ₽ | 239,85 ₽ | 12,62 ₽ | 55 т/с | 97,7 % | 24,3 % |
Parasail | 26,51 ₽ | 239,85 ₽ | 12,62 ₽ | 21 т/с | 98,5 % | 11,5 % |
Alibaba | 32,82 ₽ | 131,29 ₽ | — | 31 т/с | 99,7 % | 30,3 % |
Novita | 37,87 ₽ | 189,35 ₽ | — | 22 т/с | 94,5 % | 9,0 % |
Доля запросов, скорость и латентность считаются по нашему трафику за 30 дней, в разрезе по провайдеру. У одного провайдера может быть несколько строк — разные регионы или тарифы с отдельными ценами; эти значения общие для провайдера, поэтому в таких строках они совпадают.
Поддерживаемые параметры
Сравнить с…
выбрать любую модель →Другие модели от qwen
Qwen: Qwen3.8 Max (0902)
Qwen3.8 Max 0902 — это обновленный снимок Qwen3.8 Max от команды Qwen из Alibaba. Это модель Mixture-of-Experts с 2,4 триллионами параметров, которая принимает текстовые, графические и видеовходы и возвращает текст, с окном контекста в 1 миллион токенов и включенным по умолчанию механизмом рассуждений. Этот снимок прошел пост-обучение для кодирования и агентской работы, включая многоэтапные программные проекты, оркестрацию нескольких инструментов и выполнение долгосрочных задач. Он также предназначен для анализа диаграмм, парсинга документов и мультимодального понимания больших документов и расширенного видео. Поддерживаются вызовы инструментов, структурированные выводы и настраиваемое усилие рассуждений.
Qwen: Qwen3.8 Flash
Qwen3.8 Flash — это мультимодальная модель рассуждений от Alibaba. Она подходит для помощи в кодировании, агентских рабочих процессов, визуального понимания, анализа документов и кодовых баз, взаимодействия с рабочим столом, анализа диаграмм и анализа длинных видео.
Qwen: Qwen3.8 27B (free)
Qwen3.8 27B — это открытая плотная визуально-языковая модель от Qwen. Она подходит для кодирования, профессиональных рабочих процессов, исследований, мультимодального взаимодействия и длительных агентских задач, с гибким мышлением, которое можно включать или отключать.
Qwen: Qwen3.8 27B
Qwen3.8 27B — это открытая плотная визуально-языковая модель от Qwen. Она подходит для кодирования, профессиональных рабочих процессов, исследований, мультимодального взаимодействия и длительных агентских задач, с гибким мышлением, которое можно включать или отключать.
Qwen: Qwen3 ASR 1.7B
Qwen3 ASR 1.7B — это модель автоматического распознавания речи от Qwen. Она поддерживает многоязычную идентификацию и транскрипцию на 30 языках и 22 китайских диалектах, с потоковым и офлайн-выводом...
Qwen: Qwen3 ASR 0.6B
Qwen3 ASR 0.6B — это компактная модель автоматического распознавания речи от Qwen. Она поддерживает многоязычную идентификацию и транскрипцию речи на 30 языках и 22 китайских диалектах, с потоковой и офлайн-обработкой...