Google: Gemini 3.1 Flash TTS Preview

google/gemini-3.1-flash-tts-preview
Документация

Gemini 3.1 Flash TTS Preview — это модель преобразования текста в речь от Google, и значительный шаг вперед по сравнению с Gemini 2.5 Flash TTS. Она принимает текстовый ввод и создает аудиовыход на 70+ языках — почти в 3× больше языков, чем у ее предшественницы. Главное дополнение — это система из 200+ встроенных аудиотегов (например, [whispers], [laughs], [excited]), которые позволяют разработчикам управлять подачей, эмоциями и темпом прямо в середине предложения, а также рабочий процесс «режиссерского кресла» в студии Google AI для определения аудиопрофилей для каждого персонажа и контекста сцены. Она поддерживает до двух говорящих с независимой настройкой голоса и стиля для каждого, выводит аудио PCM в формате 24 kHz / 16-бит моно и автоматически добавляет водяной знак SynthID ко всем выходам. Окно контекста — 32k токенов.

Модальности
Выходные токены
2 475,51 ₽ за 1 млн аудиотокенов
Контекст
32 768
Добавлена
24 апр. 2026 г.

Поставщики, endpoint’ы и маршрутизация

Один поставщик может предлагать несколько endpoint-вариантов: стандартный, flex, priority или региональный. Без дополнительных настроек выбирается самый дешёвый доступный endpoint.

Сначала самый дешёвый доступный endpoint
"provider": { "sort": "price" }

1 поставщика · 1 endpoint-вариантов

Поставщик / endpointДанныеЦенаЗадержкаСкоростьДоступность
GoogleДешевле
google-vertex·Стандарт
2 475,51 ₽за 1 млн аудиотокенов100,00%

Красный и жёлтый щиты отмечают предупреждения о данных. Наведите на значок для подробностей. Условия конкретного endpoint могут отличаться от общей политики провайдера.

Цены

Стоимость показана в рублях по текущему курсу пополнения. Итоговая сумма зависит от фактического usage ответа.

ОперацияСтоимость
Входные токены123,78 ₽за 1 млн текстовых токенов
Выходные токены2 475,51 ₽за 1 млн аудиотокенов

Бенчмарки

Результаты стандартизированных оценок. Для индексов, ELO и точности большее значение означает лучший результат.

Для этой версии модели публичных результатов пока нет.

Параметры и модальности

Поддержка параметров синхронизирована с текущей версией модели.

Входные модальности

text

Выходные модальности

speech
max_tokensresponse_formatseedtemperaturetop_p

Пример запроса

curl https://gorouter.ru/api/v1/audio/speech \
  -H "Authorization: Bearer $GOROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "google/gemini-3.1-flash-tts-preview",
  "input": "Привет! Это GoRouter.",
  "voice": "alloy",
  "format": "mp3"
}'