Whisper Large V3

Речь в текстПлатнаяДоступна

Релиз: 1 мая 2026 г.

Open-source ASR модель 1.55B параметров. 99+ языков, WER 10.3%, шумоустойчивая, поддержка таймстемпов.

Whisper Large V3 — open-source модель автоматического распознавания речи от OpenAI, предлагающая транскрипцию и перевод аудио. Поддерживает 99+ языков и принимает распространённые аудиоформаты: mp3, mp4, wav, webm, flac, ogg.

С 1 550M параметров модель достигает 10,3% WER (word error rate) и хорошо подходит для шумоустойчивой многоязычной транскрипции в сложных условиях. Поддерживает детализацию таймстемпов на уровне слов и сегментов.

Ключевые характеристики:

  • Open-source: Свободно доступная модель
  • 1.55B параметров: Мощная архитектура
  • 99+ языков: Максимальное покрытие
  • WER 10,3%: Низкая ошибка распознавания
  • Шумоустойчивость: Для сложных условий
  • Таймстемпы: На уровне слов и сегментов
  • Экономичная: $0.09 за час

Идеально подходит для:

  • Многоязычной транскрипции (99+ языков)
  • Распознавания в шумных условиях
  • Проектов с низким бюджетом
  • Анализа аудио с таймстемпами
  • Масштабных STT-развёртываний

Тарификация:

  • 22 Искры за час аудио

💡 Пример: 1 час аудио = 22 Искры

Дата релиза: 1 мая 2026 г.