Qwen: Qwen3 VL 235B A22B Instruct
qwen/qwen3-vl-235b-a22b-instructQwen3-VL-235B-A22B Instruct — это мультимодальная модель с открытыми весами, объединяющая сильную генерацию текста с визуальным пониманием изображений и видео. Модель Instruct ориентирована на универсальные сценарии применения в области зрения и языка (VQA, разбор документов, извлечение данных из диаграмм и таблиц, многоязычный OCR). Серия подчеркивает надежное восприятие (распознавание разнообразных реальных и синтетических категорий), пространственное понимание (2D/3D-grounding) и длительное визуальное понимание, демонстрируя конкурентоспособные результаты на публичных мультимодальных бенчмарках как по восприятию, так и по рассуждению. Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: модель может следовать сложным инструкциям в многоизображных и многоходовых диалогах; согласовывать текст с видеошкалой времени для точных временных запросов; а также управлять элементами GUI для задач автоматизации. Модели также обеспечивают рабочие процессы визуального кодирования — превращая эскизы или макеты в код и помогая с отладкой UI — сохраняя при этом высокую производительность при работе только с текстом, сопоставимую с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL пригодными для производственных сценариев, охватывающих AI документов, многоязычный OCR, помощь в разработке ПО/UI, пространственные/воплощенные задачи и исследования агентов на основе зрения и языка.
Qwen3-VL-235B-A22B Instruct — это мультимодальная модель с открытыми весами, объединяющая сильную генерацию текста с визуальным пониманием изображений и видео. Модель Instruct ориентирована на универсальные сценарии применения в области зрения и языка (VQA, разбор документов, извлечение данных из диаграмм и таблиц, многоязычный OCR). Серия подчеркивает надежное восприятие (распознавание разнообразных реальных и синтетических категорий), пространственное понимание (2D/3D-grounding) и длительное визуальное понимание, демонстрируя конкурентоспособные результаты на публичных мультимодальных бенчмарках как по восприятию, так и по рассуждению.
Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: модель может следовать сложным инструкциям в многоизображных и многоходовых диалогах; согласовывать текст с видеошкалой времени для точных временных запросов; а также управлять элементами GUI для задач автоматизации. Модели также обеспечивают рабочие процессы визуального кодирования — превращая эскизы или макеты в код и помогая с отладкой UI — сохраняя при этом высокую производительность при работе только с текстом, сопоставимую с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL пригодными для производственных сценариев, охватывающих AI документов, многоязычный OCR, помощь в разработке ПО/UI, пространственные/воплощенные задачи и исследования агентов на основе зрения и языка.
Поставщики, endpoint’ы и маршрутизация
Один поставщик может предлагать несколько endpoint-вариантов: стандартный, flex, priority или региональный. Без дополнительных настроек выбирается самый дешёвый доступный endpoint.
5 поставщика · 5 endpoint-вариантов
Красный и жёлтый щиты отмечают предупреждения о данных. Наведите на значок для подробностей. Условия конкретного endpoint могут отличаться от общей политики провайдера.
Цены
Стоимость показана в рублях по текущему курсу пополнения. Итоговая сумма зависит от фактического usage ответа.
Бенчмарки
Результаты стандартизированных оценок. Для индексов, ELO и точности большее значение означает лучший результат.
Публичные eval-задачи
Точность опубликованных прогонов.
Данные API на 02.09.2026, 12:01:44.
Параметры и модальности
Поддержка параметров синхронизирована с текущей версией модели.