DeepSeek V3.2 Exp

ТекстПлатнаяДоступна

Релиз: 29 сентября 2025 г.

Экспериментальная модель DeepSeek с DSA для эффективных длинных контекстов. Промежуточный шаг к будущим архитектурам.

Вход: 65 искр/1M токенов модели · Выход: 99 искр/1M токенов модели

DeepSeek V3.2 Exp — экспериментальная языковая модель, выпущенная DeepSeek в качестве промежуточного шага между V3.1 и будущими архитектурами. Модель внедряет DeepSeek Sparse Attention (DSA), механизм мелкозернистого разреженного внимания, предназначенный для повышения эффективности обучения и вывода в сценариях с длинными контекстами при сохранении качества выходных данных.

Модель была обучена в условиях, согласованных с V3.1-Terminus, для обеспечения прямого сравнения. Бенчмарки показывают производительность примерно на уровне V3.1 в задачах рассуждений, программирования и агентного использования инструментов, с незначительными компромиссами и улучшениями в зависимости от области. Этот релиз фокусируется на валидации архитектурных оптимизаций для расширенных длин контекстов, а не на повышении сырой точности задач, что делает его в первую очередь исследовательской моделью для изучения эффективных transformer-дизайнов.

Ключевые характеристики:

  • Экспериментальная: Исследовательская модель, не финальный продукт
  • DSA архитектура: DeepSeek Sparse Attention для длинных контекстов
  • Эффективность: Улучшенное обучение и вывод
  • Промежуточный шаг: Между V3.1 и будущими версиями
  • Производительность: На уровне V3.1
  • Research-oriented: Для изучения эффективных transformer-дизайнов
  • Контроль рассуждений: Параметр reasoning enabled

Идеально подходит для:

  • Исследовательских задач
  • Изучения эффективных transformer-архитектур
  • Тестирования длинноконтекстных оптимизаций
  • Экспериментальных проектов
  • Бенчмаркинга архитектурных улучшений

Тарификация:

  • Вход: 65 Искр за 1M токенов
  • Выход: 99 Искр за 1M токенов

Дата релиза: 29 сентября 2025 г.