DeepSeek V3.2 Exp — экспериментальная языковая модель, выпущенная DeepSeek в качестве промежуточного шага между V3.1 и будущими архитектурами. Модель внедряет DeepSeek Sparse Attention (DSA), механизм мелкозернистого разреженного внимания, предназначенный для повышения эффективности обучения и вывода в сценариях с длинными контекстами при сохранении качества выходных данных.
Модель была обучена в условиях, согласованных с V3.1-Terminus, для обеспечения прямого сравнения. Бенчмарки показывают производительность примерно на уровне V3.1 в задачах рассуждений, программирования и агентного использования инструментов, с незначительными компромиссами и улучшениями в зависимости от области. Этот релиз фокусируется на валидации архитектурных оптимизаций для расширенных длин контекстов, а не на повышении сырой точности задач, что делает его в первую очередь исследовательской моделью для изучения эффективных transformer-дизайнов.
Ключевые характеристики:
- Экспериментальная: Исследовательская модель, не финальный продукт
- DSA архитектура: DeepSeek Sparse Attention для длинных контекстов
- Эффективность: Улучшенное обучение и вывод
- Промежуточный шаг: Между V3.1 и будущими версиями
- Производительность: На уровне V3.1
- Research-oriented: Для изучения эффективных transformer-дизайнов
- Контроль рассуждений: Параметр reasoning enabled
Идеально подходит для:
- Исследовательских задач
- Изучения эффективных transformer-архитектур
- Тестирования длинноконтекстных оптимизаций
- Экспериментальных проектов
- Бенчмаркинга архитектурных улучшений
Тарификация:
- Вход: 65 Искр за 1M токенов
- Выход: 99 Искр за 1M токенов
Дата релиза: 29 сентября 2025 г.