Whisper Large V3 — open-source модель автоматического распознавания речи от OpenAI, предлагающая транскрипцию и перевод аудио. Поддерживает 99+ языков и принимает распространённые аудиоформаты: mp3, mp4, wav, webm, flac, ogg.
С 1 550M параметров модель достигает 10,3% WER (word error rate) и хорошо подходит для шумоустойчивой многоязычной транскрипции в сложных условиях. Поддерживает детализацию таймстемпов на уровне слов и сегментов.
Ключевые характеристики:
- Open-source: Свободно доступная модель
- 1.55B параметров: Мощная архитектура
- 99+ языков: Максимальное покрытие
- WER 10,3%: Низкая ошибка распознавания
- Шумоустойчивость: Для сложных условий
- Таймстемпы: На уровне слов и сегментов
- Экономичная: $0.09 за час
Идеально подходит для:
- Многоязычной транскрипции (99+ языков)
- Распознавания в шумных условиях
- Проектов с низким бюджетом
- Анализа аудио с таймстемпами
- Масштабных STT-развёртываний
Тарификация:
💡 Пример: 1 час аудио = 22 Искры
Дата релиза: 1 мая 2026 г.