Gemini 3.1 Flash TTS Preview

Синтез речиПлатнаяДоступна

Релиз: 24 апреля 2026 г.

TTS-модель Google с 200+ аудио-тегами для контроля эмоций, темпа и голоса. 70+ языков, до 2 спикеров.

Gemini 3.1 Flash TTS Preview — модель преобразования текста в речь от Google, значительно превосходящая Gemini 2.5 Flash TTS. Принимает текстовый ввод и производит аудиовыход на 70+ языках — почти в 3 раза больше языков, чем у предшественницы.

Главное нововведение — система 200+ инлайн аудио-тегов (например, [шепотом], [смеётся], [возбуждённо]), которые позволяют разработчикам управлять подачей, эмоциями и темпом прямо в середине предложения, а также возможность определять до двух спикеров с независимой конфигурацией голоса и стиля.

Выходной аудиоформат: PCM 24 кГц / 16-bit моно. Все выходные данные автоматически маркируются водяными знаками SynthID.

Ключевые характеристики:

  • 70+ языков: Почти в 3x больше предшественника
  • 200+ аудио-тегов: Контроль эмоций, темпа, пауз
  • До 2 спикеров: Независимая настройка голоса и стиля
  • Director's chair workflow: Audio Profiles и контекст сцены
  • SynthID: Автоматическая маркировка водяными знаками
  • PCM 24 кГц / 16-bit моно: Высокое качество

Идеально подходит для:

  • Озвучивания с контролем эмоций и темпа
  • Диалогов между двумя персонажами
  • Многоязычных TTS-проектов (70+ языков)
  • Аудиокниг с выразительной речью
  • Голосовых агентов с реалистичными эмоциями

Тарификация:

  • Вход: 240 Искр за 1M токенов
  • Выход: 4 800 Искр за 1M токенов

💡 Цена основана на количестве токенов (не символов)

Дата релиза: 24 апреля 2026 г.

🎙️ 200+ аудио-тегов для управления эмоциями и голосом