Z.ai: GLM 5.3 Flash

z-ai/glm-5.3-flash
Документация

GLM-5.3-Flash — это нативная мультимодальная модель от Z.ai. Она подходит для эффективного программирования и долгосрочных агентных задач. Её гибридная архитектура разрежённого и линейного внимания сохраняет точное поведение при работе с длинным контекстом, одновременно снижая вычислительные накладные расходы.

Модальности
Вход / выход за 1 млн
9,28 ₽ / 30,94 ₽
Контекст
1 310 720
Добавлена
26 авг. 2026 г.

Поставщики, endpoint’ы и маршрутизация

Один поставщик может предлагать несколько endpoint-вариантов: стандартный, flex, priority или региональный. Без дополнительных настроек выбирается самый дешёвый доступный endpoint.

Сначала самый дешёвый доступный endpoint
"provider": { "sort": "price" }

22 поставщика · 22 endpoint-вариантов

Поставщик / endpointДанныеВход / 1 млнВыход / 1 млнКэш / 1 млнЗадержкаСкоростьДоступность
Z.AIДешевле50%
z-ai/fp8·FP8
18,57 ₽9,28 ₽61,89 ₽30,94 ₽1,86 ₽3,52 с22 ток/с98,12%
Novita50%
novita/fp8·FP8
18,57 ₽9,28 ₽61,89 ₽30,94 ₽1,86 ₽2,14 с24 ток/с99,40%
deepinfra/fp8·FP8
18,57 ₽61,89 ₽3,71 ₽1,26 с25 ток/с99,46%
gmicloud/fp8·FP8
9,28 ₽30,94 ₽1,86 ₽3,24 с18 ток/с97,92%
makora·Стандарт
17,33 ₽58,17 ₽2,97 ₽1,32 с80 ток/с95,33%
modal/fp8·FP8
55,70 ₽185,66 ₽11,14 ₽435 мс69 ток/с99,93%
reka/fp8·FP8
18,57 ₽61,89 ₽3,71 ₽1,8 с22 ток/с98,79%
together·Стандарт
18,57 ₽61,89 ₽3,71 ₽619 мс58 ток/с98,51%
wafer·Стандарт
18,57 ₽61,89 ₽3,71 ₽4,24 с41 ток/с98,25%
siliconflow/fp8·FP8
18,57 ₽61,89 ₽3,71 ₽3,15 с20 ток/с99,23%
friendli·Стандарт
18,57 ₽61,89 ₽3,71 ₽5,63 с45 ток/с98,96%
fireworks·Стандарт
18,57 ₽61,89 ₽3,71 ₽1,81 с59 ток/с95,32%
nextbit/fp8·FP8
18,57 ₽61,89 ₽3,71 ₽2,16 с22 ток/с97,80%
streamlake·Стандарт
18,57 ₽61,89 ₽3,71 ₽1,64 с23 ток/с98,48%
cloudflare·Стандарт
18,57 ₽61,89 ₽3,71 ₽2,52 с37 ток/с99,86%
baseten/fp8·FP8
18,57 ₽61,89 ₽3,71 ₽1,13 с97 ток/с100,00%
morph/fp8·FP8
16,09 ₽55,70 ₽2,48 ₽5,28 с3 ток/с45,96%
parasail/fp8·FP8
18,57 ₽61,89 ₽3,71 ₽1,97 с20 ток/с91,07%
digitalocean·Стандарт
18,57 ₽61,89 ₽3,71 ₽2,62 с37 ток/с94,06%
phala/fp8·FP8
18,57 ₽61,89 ₽3,71 ₽3,33 с10 ток/с92,05%
io-net/fp8·FP8
18,57 ₽61,89 ₽3,71 ₽1,06 с17 ток/с89,81%
venice·Стандарт
18,57 ₽61,89 ₽3,71 ₽1,49 с27 ток/с92,84%

Красный и жёлтый щиты отмечают предупреждения о данных. Наведите на значок для подробностей. Условия конкретного endpoint могут отличаться от общей политики провайдера.

Цены

Стоимость показана в рублях по текущему курсу пополнения. Итоговая сумма зависит от фактического usage ответа.

ОперацияСтоимость
Входные токены9,28 ₽за 1 млн токенов
Выходные токены30,94 ₽за 1 млн токенов
Чтение кэша1,86 ₽за 1 млн токенов

Бенчмарки

Результаты стандартизированных оценок. Для индексов, ELO и точности большее значение означает лучший результат.

Artificial Analysis

Сводные индексы способностей модели.

Источник
Интеллекттоп 9%
57,5индекс

место 10 из 117

Кодтоп 12%
71,5индекс

место 17 из 143

Агентные задачитоп 6%
58,2индекс

место 6 из 118

Публичные eval-задачи

Точность опубликованных прогонов.

Источник
GPQA Diamond
85,2%точность

198 задач

τ-bench Verified — Airline
73,3%точность

50 задач

Данные API на 02.09.2026, 12:01:44.

Параметры и модальности

Поддержка параметров синхронизирована с текущей версией модели.

Входные модальности

textimagevideo

Выходные модальности

text
frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p

Пример запроса

curl https://gorouter.ru/api/v1/chat/completions \
  -H "Authorization: Bearer $GOROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.3-flash",
    "messages": [{"role": "user", "content": "Привет!"}]
  }'