Qwen3-VL-32B-Instruct — крупномасштабная мультимодальная визуально-языковая модель, разработанная для высокоточного понимания и рассуждений над текстом, изображениями и видео. С 32B параметров, модель сочетает глубокое визуальное восприятие с продвинутым пониманием текста, обеспечивая мелкозернистые пространственные рассуждения, анализ документов и сцен, а также понимание длинных видео.
Модель предлагает надёжное OCR на 32 языках и улучшенное мультимодальное слияние через архитектуры Interleaved-MRoPE и DeepStack. Оптимизированная для агентного взаимодействия и визуального использования инструментов, Qwen3-VL-32B обеспечивает передовую производительность для сложных реальных мультимодальных задач.
Ключевые характеристики:
- 32B параметров: Крупномасштабная VL модель
- Мультимодальность: Текст, изображения, видео на входе
- OCR на 32 языках: Надёжное распознавание текста
- Interleaved-MRoPE: Улучшенное мультимодальное слияние
- DeepStack архитектура: Продвинутая обработка
- Агентное взаимодействие: Для визуального tool use
- Пространственные рассуждения: Мелкозернистый анализ
Идеально подходит для:
- Анализа документов и сцен
- Понимания длинных видео
- Пространственных рассуждений
- Агентных систем с визуальным восприятием
- Многоязычного OCR
Тарификация:
- Вход: 39 Искр за 1M токенов
- Выход: 154 Искры за 1M токенов
Дата релиза: 23 октября 2025 г.