Gemini 3.1 Flash TTS Preview
Релиз: 24 апреля 2026 г.
TTS-модель Google с 200+ аудио-тегами для контроля эмоций, темпа и голоса. 70+ языков, до 2 спикеров.
Gemini 3.1 Flash TTS Preview — модель преобразования текста в речь от Google, значительно превосходящая Gemini 2.5 Flash TTS. Принимает текстовый ввод и производит аудиовыход на 70+ языках — почти в 3 раза больше языков, чем у предшественницы.
Главное нововведение — система 200+ инлайн аудио-тегов (например, [шепотом], [смеётся], [возбуждённо]), которые позволяют разработчикам управлять подачей, эмоциями и темпом прямо в середине предложения, а также возможность определять до двух спикеров с независимой конфигурацией голоса и стиля.
Выходной аудиоформат: PCM 24 кГц / 16-bit моно. Все выходные данные автоматически маркируются водяными знаками SynthID.
Ключевые характеристики:
- 70+ языков: Почти в 3x больше предшественника
- 200+ аудио-тегов: Контроль эмоций, темпа, пауз
- До 2 спикеров: Независимая настройка голоса и стиля
- Director's chair workflow: Audio Profiles и контекст сцены
- SynthID: Автоматическая маркировка водяными знаками
- PCM 24 кГц / 16-bit моно: Высокое качество
Идеально подходит для:
- Озвучивания с контролем эмоций и темпа
- Диалогов между двумя персонажами
- Многоязычных TTS-проектов (70+ языков)
- Аудиокниг с выразительной речью
- Голосовых агентов с реалистичными эмоциями
Тарификация:
- Вход: 240 Искр за 1M токенов
- Выход: 4 800 Искр за 1M токенов
💡 Цена основана на количестве токенов (не символов)
Дата релиза: 24 апреля 2026 г.
🎙️ 200+ аудио-тегов для управления эмоциями и голосом
