Qwen3 VL 32B Instruct

ТекстПлатнаяДоступна

Релиз: 23 октября 2025 г.

Крупномасштабная визуально-языковая модель 32B: понимание текста, изображений, видео, OCR на 32 языках.

Вход: 39 искр/1M токенов модели · Выход: 154 искр/1M токенов модели

Qwen3-VL-32B-Instruct — крупномасштабная мультимодальная визуально-языковая модель, разработанная для высокоточного понимания и рассуждений над текстом, изображениями и видео. С 32B параметров, модель сочетает глубокое визуальное восприятие с продвинутым пониманием текста, обеспечивая мелкозернистые пространственные рассуждения, анализ документов и сцен, а также понимание длинных видео.

Модель предлагает надёжное OCR на 32 языках и улучшенное мультимодальное слияние через архитектуры Interleaved-MRoPE и DeepStack. Оптимизированная для агентного взаимодействия и визуального использования инструментов, Qwen3-VL-32B обеспечивает передовую производительность для сложных реальных мультимодальных задач.

Ключевые характеристики:

  • 32B параметров: Крупномасштабная VL модель
  • Мультимодальность: Текст, изображения, видео на входе
  • OCR на 32 языках: Надёжное распознавание текста
  • Interleaved-MRoPE: Улучшенное мультимодальное слияние
  • DeepStack архитектура: Продвинутая обработка
  • Агентное взаимодействие: Для визуального tool use
  • Пространственные рассуждения: Мелкозернистый анализ

Идеально подходит для:

  • Анализа документов и сцен
  • Понимания длинных видео
  • Пространственных рассуждений
  • Агентных систем с визуальным восприятием
  • Многоязычного OCR

Тарификация:

  • Вход: 39 Искр за 1M токенов
  • Выход: 154 Искры за 1M токенов

Дата релиза: 23 октября 2025 г.