DeepSeek V3.1

ТекстПлатнаяДоступна

Релиз: 21 августа 2025 г.

Большая гибридная модель рассуждений DeepSeek: 671B параметров, 37B активных, с режимами thinking/non-thinking.

Вход: 51 искр/1M токенов модели · Выход: 190 искр/1M токенов модели

DeepSeek V3.1 — большая гибридная модель рассуждений (671B параметров, 37B активных), поддерживающая как режимы мышления (thinking), так и режимы без мышления (non-thinking) через шаблоны промптов. Модель расширяет базу DeepSeek-V3 с помощью двухфазного процесса обучения на длинных контекстах, достигая до 128K токенов, и использует FP8 микроскейлинг для эффективного вывода. Пользователи могут контролировать поведение рассуждений с помощью булева параметра reasoning enabled.

Модель улучшает использование инструментов, генерацию кода и эффективность рассуждений, достигая производительности, сравнимой с DeepSeek-R1 на сложных бенчмарках, при этом отвечая быстрее. Поддерживает структурированный вызов инструментов, кодинг-агентов и поисковых агентов, что делает её пригодной для исследований, программирования и агентных рабочих процессов. Модель является преемником DeepSeek V3-0324 и показывает высокие результаты на широком спектре задач.

Ключевые характеристики:

  • MoE архитектура: 671B параметров, 37B активных
  • Thinking/Non-thinking: Два режима работы через шаблоны промптов
  • Двухфазное обучение: До 128K контекста
  • FP8 микроскейлинг: Эффективный вывод
  • Производительность как R1: Сравнимая с R1, но быстрее
  • Структурированный tool calling: Для кодинг и поисковых агентов
  • Преемник V3-0324: Улучшенная версия

Идеально подходит для:

  • Исследовательских задач
  • Программирования и кодинг-агентов
  • Агентных рабочих процессов
  • Структурированного вызова инструментов
  • Сценариев, требующих быстрых рассуждений

Тарификация:

  • Вход: 51 Искра за 1M токенов
  • Выход: 190 Искр за 1M токенов

Дата релиза: 21 августа 2025 г.