MAI-Voice-2

Синтез речиБез русскогоПлатнаяДоступна

Русский язык не поддерживается — модель рассчитана на английский и указанные в описании языки.

Релиз: 2 июня 2026 г.

Expressive TTS от Microsoft (Azure AI Speech): 10+ языков, SSML-стили и скорость 0.5×–2×, голоса формата Azure locale.

MAI-Voice-2 — высококачественная expressive TTS-модель от Microsoft на базе Azure AI Speech. Синтезирует естественную речь на 10+ языках, включая русский, с поддержкой выразительных SSML-стилей (cheerful, sad, excited и др.) и управлением скоростью от 0.5× до 2×.

Имена голосов следуют формату Azure locale (например, en-US-Harper:MAI-Voice-2, ru-RU-Masha:MAI-Voice-2 или ru-RU-Lev:MAI-Voice-2). Выход доступен в MP3 и PCM на частоте 24 кГц.

Ключевые характеристики:

  • 10+ языков: Включая русский (ru-RU-Masha, ru-RU-Lev)
  • SSML-стили: Cheerful, sad, excited и другие
  • Скорость 0.5×–2×: Гибкий темп озвучки
  • Azure locale голоса: Полный каталог региональных голосов
  • MP3 и PCM 24 кГц: Production-ready форматы

Идеально подходит для:

  • Русскоязычного озвучивания с выразительными стилями
  • Аудиоконтента с контролем эмоций через SSML
  • Локализации под разные регионы Azure
  • Профессионального TTS на базе Azure Speech

Тарификация:

  • 1 Искра за ~189 символов (минимальная комиссия 1 Искра за запрос)

💡 Цена основана на количестве символов: $22.00 за 1M символов

Дата релиза: 2 июня 2026 г.

🎙️ Expressive Azure TTS с SSML-стилями и русским языком