Google: Gemini 3.5 Transcribe

google/gemini-3.5-transcribe
Документация

Gemini 3.5 Transcribe — это модель преобразования речи в текст от Google. Она подходит для синхронной транскрипции, требующей временных меток на уровне слов или диаризации говорящих, с поддержкой до восьми говорящих. Аудио может быть длительностью до одного часа или 30 минут при включённых временных метках или диаризации.

Модальности
Входные токены
242,47 ₽ за 1 млн токенов
Контекст
98 304
Добавлена
25 сент. 2026 г.

Провайдеры

Для этой модели используется маршрут, указанный в таблице провайдеров.

Для этой модели используется фиксированный маршрут. Выбор и сортировка провайдеров недоступны.

Провайдеры: 1Варианты: 1

ПровайдерЦенаЗадержкаСкоростьДоступность
google-ai-studio
242,47 ₽за 1 млн токенов——100,00%

Красный и жёлтый щиты отмечают предупреждения о данных. Наведите на значок для подробностей. Условия конкретного endpoint могут отличаться от общей политики провайдера.

Цены

Стоимость показана в рублях по текущему курсу пополнения. Итоговая сумма зависит от фактического usage ответа.

ОперацияСтоимость
Входные токены242,47 ₽за 1 млн токенов
Выходные токены1 454,82 ₽за 1 млн токенов

Параметры и модальности

Поддержка параметров синхронизирована с текущей версией модели.

Входные модальности

audio

Выходные модальности

transcription

Пример запроса

AUDIO_BASE64=$(base64 < audio.wav | tr -d '\n')

curl https://gorouter.ru/api/v1/audio/transcriptions \
  -H "Authorization: Bearer $GOROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{"model":"google/gemini-3.5-transcribe","input_audio":{"data":"$AUDIO_BASE64","format":"wav"}}"