DeepSeek V3.1
Релиз: 21 августа 2025 г.
Большая гибридная модель рассуждений DeepSeek: 671B параметров, 37B активных, с режимами thinking/non-thinking.
Вход: 51 искр/1M токенов модели · Выход: 190 искр/1M токенов модели
DeepSeek V3.1 — большая гибридная модель рассуждений (671B параметров, 37B активных), поддерживающая как режимы мышления (thinking), так и режимы без мышления (non-thinking) через шаблоны промптов. Модель расширяет базу DeepSeek-V3 с помощью двухфазного процесса обучения на длинных контекстах, достигая до 128K токенов, и использует FP8 микроскейлинг для эффективного вывода. Пользователи могут контролировать поведение рассуждений с помощью булева параметра reasoning enabled.
Модель улучшает использование инструментов, генерацию кода и эффективность рассуждений, достигая производительности, сравнимой с DeepSeek-R1 на сложных бенчмарках, при этом отвечая быстрее. Поддерживает структурированный вызов инструментов, кодинг-агентов и поисковых агентов, что делает её пригодной для исследований, программирования и агентных рабочих процессов. Модель является преемником DeepSeek V3-0324 и показывает высокие результаты на широком спектре задач.
Ключевые характеристики:
- MoE архитектура: 671B параметров, 37B активных
- Thinking/Non-thinking: Два режима работы через шаблоны промптов
- Двухфазное обучение: До 128K контекста
- FP8 микроскейлинг: Эффективный вывод
- Производительность как R1: Сравнимая с R1, но быстрее
- Структурированный tool calling: Для кодинг и поисковых агентов
- Преемник V3-0324: Улучшенная версия
Идеально подходит для:
- Исследовательских задач
- Программирования и кодинг-агентов
- Агентных рабочих процессов
- Структурированного вызова инструментов
- Сценариев, требующих быстрых рассуждений
Тарификация:
- Вход: 51 Искра за 1M токенов
- Выход: 190 Искр за 1M токенов
Дата релиза: 21 августа 2025 г.
