Qwen3-VL-235B-A22B Instruct — open-weight мультимодальная модель, объединяющая сильную генерацию текста с визуальным пониманием изображений и видео. Instruct-модель предназначена для общего визуально-языкового использования (VQA, парсинг документов, извлечение из диаграмм/таблиц, многоязычное OCR). Серия делает акцент на надёжном восприятии (распознавание разнообразных реальных и синтетических категорий), пространственном понимании (2D/3D привязка) и длинном визуальном понимании с конкурентоспособными результатами на публичных мультимодальных бенчмарках для восприятия и рассуждений.
Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: следование сложным инструкциям в многоизображенческих многооборотных диалогах, привязка текста к временным линиям видео для точных временных запросов и управление элементами GUI для задач автоматизации. Модели также обеспечивают визуальные рабочие процессы кодинга — превращение набросков или макетов в код и помощь в отладке UI — при сохранении высоких текстовых показателей, сравнимых с флагманскими языковыми моделями Qwen3.
Ключевые характеристики:
- Open-weight: Доступна под открытой лицензией
- MoE архитектура: 235B параметров, 22B активных
- Мультимодальность: Текст, изображения, видео на входе
- Многоязычное OCR: Распознавание текста
- Пространственное понимание: 2D/3D grounding
- GUI автоматизация: Управление интерфейсами
- Визуальный кодинг: Скетчи/макеты → код
Идеально подходит для:
- VQA и парсинга документов
- Автоматизации GUI
- Визуального кодинга и отладки UI
- Пространственных и воплощённых задач
- Исследований визуально-языковых агентов
Тарификация:
- Вход: 48 Искр за 1M токенов
- Выход: 212 Искр за 1M токенов
Дата релиза: 24 сентября 2025 г.