Z.ai: GLM 4.6

z-ai/glm-4.6
Документация

По сравнению с GLM-4.5, это поколение включает несколько ключевых улучшений: Более длинное контекстное окно: размер контекстного окна был расширен с 128K до 200K токенов, что позволяет модели справляться с более сложными агентными задачами. Превосходная производительность в кодировании: модель достигает более высоких результатов в бенчмарках для кода и демонстрирует лучшую реальную производительность в таких приложениях, как Claude Code, Cline, Roo Code и Kilo Code, включая улучшения в генерации визуально отполированных фронтенд-страниц. Продвинутые рассуждения: GLM-4.6 демонстрирует явное улучшение в способности к рассуждениям и поддерживает использование инструментов во время вывода, что приводит к более сильной общей функциональности. Более способные агенты: GLM-4.6 показывает более высокую производительность в агентах, использующих инструменты и поиск, и более эффективно интегрируется в агентные фреймворки. Улучшенный стиль письма: лучше соответствует человеческим предпочтениям в стиле и читабельности, а также ведёт себя более естественно в сценариях ролевых игр.

Модальности
Вход / выход за 1 млн
53,22 ₽ / 216,61 ₽
Контекст
204 800
Добавлена
30 сент. 2025 г.

Поставщики, endpoint’ы и маршрутизация

Один поставщик может предлагать несколько endpoint-вариантов: стандартный, flex, priority или региональный. Без дополнительных настроек выбирается самый дешёвый доступный endpoint.

Сначала самый дешёвый доступный endpoint
"provider": { "sort": "price" }

5 поставщика · 5 endpoint-вариантов

Поставщик / endpointДанныеВход / 1 млнВыход / 1 млнКэш / 1 млнЗадержкаСкоростьДоступность
VeniceДешевле
venice/fp4·FP4
53,22 ₽216,61 ₽9,90 ₽1,06 с70 ток/с100,00%
deepinfra/fp4·FP4
61,89 ₽247,55 ₽12,38 ₽863 мс19 ток/с99,87%
novita/bf16·BF16
68,08 ₽272,31 ₽13,62 ₽1,19 с55 ток/с97,71%
z-ai/fp4·FP4
74,27 ₽272,31 ₽13,62 ₽1,53 с49 ток/с99,25%
atlas-cloud/fp8·FP8
74,27 ₽272,31 ₽13,62 ₽799 мс46 ток/с91,89%

Красный и жёлтый щиты отмечают предупреждения о данных. Наведите на значок для подробностей. Условия конкретного endpoint могут отличаться от общей политики провайдера.

Цены

Стоимость показана в рублях по текущему курсу пополнения. Итоговая сумма зависит от фактического usage ответа.

ОперацияСтоимость
Входные токены53,22 ₽за 1 млн токенов
Выходные токены216,61 ₽за 1 млн токенов
Чтение кэша9,90 ₽за 1 млн токенов

Бенчмарки

Результаты стандартизированных оценок. Для индексов, ELO и точности большее значение означает лучший результат.

Artificial Analysis

Сводные индексы способностей модели.

Источник
Интеллекттоп 62%
29,3индекс

место 72 из 117

Кодтоп 44%
45,8индекс

место 62 из 143

Агентные задачитоп 59%
18,6индекс

место 69 из 118

Design Arena

ELO и доля побед по категориям визуальных задач.

Источник
Веб-сайтытоп 51%
1 191ELO
54,3%побед115,1 ссреднее76/151место
Категории кодатоп 49%
1 187ELO
54,3%побед109,3 ссреднее69/141место
Разработка игртоп 49%
1 187ELO
54,8%побед108,7 ссреднее68/139место
Визуализация данныхтоп 53%
1 183ELO
52,6%побед86,1 ссреднее72/137место
UI-компонентытоп 57%
1 171ELO
52,5%побед86,8 ссреднее77/136место
3Dтоп 50%
1 169ELO
54,2%побед80,2 ссреднее65/130место
SVGтоп 59%
1 147ELO
52,1%побед33,2 ссреднее58/99место

Публичные eval-задачи

Точность опубликованных прогонов.

Источник
GPQA Diamond
79,2%точность

4 131 задач

τ-bench Verified — Airline
66,6%точность

1 300 задач

Данные API на 02.09.2026, 12:01:44.

Параметры и модальности

Поддержка параметров синхронизирована с текущей версией модели.

Входные модальности

text

Выходные модальности

text
frequency_penaltyinclude_reasoninglogit_biasmax_tokensmin_ppresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_p

Пример запроса

curl https://gorouter.ru/api/v1/chat/completions \
  -H "Authorization: Bearer $GOROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-4.6",
    "messages": [{"role": "user", "content": "Привет!"}]
  }'