Хостинг-провайдер

Cloudflare

Cloudflare обслуживает эти модели как инфраструктурный провайдер. Авторы моделей указаны отдельно в списке.

18

моделей в каталоге

Модели на хостинге Cloudflare

В списке показаны только включённые модели из публичного каталога GoRouter.

Z.ai: GLM 5.3 Flash

z-ai/glm-5.3-flash

GLM-5.3-Flash — это нативная мультимодальная модель от Z.ai. Она подходит для эффективного программирования и долгосрочных агентных задач. Её гибридная архитектура разрежённого и линейного внимания сохраняет точное поведение при работе с длинным контекстом, одновременно снижая вычислительные накладные расходы.

автор z-ai26 авг. 2026 г.9,28 ₽ / 1 млн входных30,94 ₽ / 1 млн выходных
Z.ai: GLM 5.3

z-ai/glm-5.3

GLM-5.3 — это крупномасштабная модель рассуждения от Z.ai, созданная для сложной разработки программного обеспечения и долгосрочных агентных задач. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и превосходит GLM-5.2 в кодировании, а также в балансе между производительностью и эффективностью использования токенов. Рассуждение всегда включено и не может быть отключено. Поддерживаются уровни усилий рассуждения low, high и max; по умолчанию используется max.

автор z-ai18 авг. 2026 г.173,29 ₽ / 1 млн входных544,61 ₽ / 1 млн выходных
Qwen: Qwen3.8 27B

qwen/qwen3.8-27b

Qwen3.8 27B — это открытая модель с публичными весами, относящаяся к классу плотных мультимодальных моделей «зрение-язык» от компании Qwen. Она подходит для задач программирования, профессиональных рабочих процессов, исследований, мультимодального взаимодействия и длительных агентских задач, поддерживая гибкий режим рассуждений, который можно включать или отключать.

автор qwen14 авг. 2026 г.52,60 ₽ / 1 млн входных315,63 ₽ / 1 млн выходных
DeepSeek: DeepSeek V4 Pro 0813

deepseek/deepseek-v4-pro-0813

DeepSeek V4 Pro 0813 — это крупномасштабная модель смеси экспертов от DeepSeek. Это GA-й выпуск DeepSeek V4 Pro.

автор deepseek12 авг. 2026 г.163,38 ₽ / 1 млн входных490,15 ₽ / 1 млн выходных
DeepSeek: DeepSeek V4 Flash 0731

deepseek/deepseek-v4-flash-0731

DeepSeek V4 Flash 0731 — это разреженная модель смеси экспертов от DeepSeek, с 13B активными параметрами из 284B общих. Эта переобученная версия подходит для задач кодирования, рассуждений и агентных рабочих процессов. Это GA-релиз DeepSeek V4 Flash.

автор deepseek31 июл. 2026 г.13,41 ₽ / 1 млн входных37,13 ₽ / 1 млн выходных
Z.ai: GLM 5.2

z-ai/glm-5.2

GLM 5.2 — это крупномасштабная модель рассуждения от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и подходит для долгосрочных агентных рабочих процессов, разработки программного обеспечения на уровне проектов и сложной многоэтапной автоматизации. Поддерживаются уровни усилий рассуждения high и xhigh; xhigh соответствует максимальному уровню рассуждения. Модель особенно сильна в написании кода и использовании инструментов в длительных задачах, способна сохранять инженерный контекст и последовательно следовать стандартам на протяжении всего цикла разработки — от требований до развертывания на нескольких платформах — в рамках одной задачи.

автор z-ai16 июн. 2026 г.164,92 ₽ / 1 млн входных518,32 ₽ / 1 млн выходных
MoonshotAI: Kimi K2.7 Code

moonshotai/kimi-k2.7-code

MoonshotAI: Kimi K2.7 Code — это модель, ориентированная на программирование, из семейства Kimi K2 от Moonshot AI, созданная для надёжного выполнения комплексных задач программирования в условиях длинных контекстов. Она использует нативную мультимодальную архитектуру смеси экспертов, которая принимает текст и изображения на входе, и всегда работает в режиме мышления, сохраняя полное содержимое рассуждений при многоходовых диалогах. С контекстным окном в 256K токенов модель нацелена на долгосрочное программирование, декомпозицию агентских задач и многоходовые диалоги. Модель активирует 32B параметров из примерно 1T общих.

автор moonshotai12 июн. 2026 г.81,69 ₽ / 1 млн входных420,84 ₽ / 1 млн выходных
DeepSeek: DeepSeek V4 Flash 0423

deepseek/deepseek-v4-flash

DeepSeek V4 Flash — это оптимизированная по эффективности модель Mixture-of-Experts от DeepSeek с 284B общим количеством параметров и 13B активируемых параметров, поддерживающая контекстное окно в 1M токенов. Она предназначена для быстрого вывода и высокопроизводительных рабочих нагрузок, сохраняя при этом высокую производительность в рассуждениях и написании кода. Модель включает гибридное внимание для эффективной обработки длинного контекста. Поддерживаются режимы рассуждений high и xhigh; xhigh соответствует максимальному режиму рассуждений. Она хорошо подходит для таких приложений, как ассистенты программирования, чат-системы и агентные рабочие процессы, где важны отзывчивость и экономическая эффективность.

автор deepseek24 апр. 2026 г.10,59 ₽ / 1 млн входных21,18 ₽ / 1 млн выходных
MoonshotAI: Kimi K2.6

moonshotai/kimi-k2.6

Kimi K2.6 — это мультимодальная модель следующего поколения от Moonshot AI, предназначенная для долгосрочного программирования, генерации UI/UX на основе кода и мультиагентной оркестрации. Она справляется со сложными сквозными задачами программирования на Python, Rust и Go, а также может преобразовывать промпты и визуальные входные данные в готовые к эксплуатации интерфейсы. Её архитектура роя агентов масштабируется до сотен параллельных субагентов для автономной декомпозиции задач — создавая документы, веб-сайты и электронные таблицы за один запуск без участия человека.

автор moonshotai20 апр. 2026 г.117,59 ₽ / 1 млн входных495,10 ₽ / 1 млн выходных
Google: Gemma 4 26B A4B

google/gemma-4-26b-a4b-it

Gemma 4 26B A4B IT — это модель Mixture-of-Experts (MoE) с инструкционной настройкой от Google DeepMind. Несмотря на 25.2B общих параметров, во время инференса активируется только 3.8B на токен, что обеспечивает качество, близкое к -31B, при доле вычислительных затрат. Поддерживает мультимодальный ввод, включая текст, изображения и видео (до 60 секунд при 1fps). Имеет контекстное окно в 256K токенов, встроенный вызов функций, настраиваемый режим мышления/рассуждения и поддержку структурированного вывода. Выпущена под лицензией Apache 2.0.

автор google3 апр. 2026 г.8,66 ₽ / 1 млн входных42,08 ₽ / 1 млн выходных
Z.ai: GLM 4.7 Flash

z-ai/glm-4.7-flash

Являясь моделью класса 30B-SOTA, GLM-4.7-Flash предлагает новый вариант, который балансирует производительность и эффективность. Она дополнительно оптимизирована для агентских сценариев использования в кодинге, усиливая возможности программирования, планирования долгосрочных задач и взаимодействия с инструментами, и достигла ведущих показателей среди open-source моделей того же размера в нескольких актуальных публичных рейтингах бенчмарков.

автор z-ai19 янв. 2026 г.7,43 ₽ / 1 млн входных49,51 ₽ / 1 млн выходных
IBM: Granite 4.0 Micro

ibm-granite/granite-4.0-h-micro

Granite-4.0-H-Micro — это модель с 3B параметрами из семейства моделей Granite 4. Эти модели являются новейшими в серии моделей, выпущенных IBM. Они дообучены для вызова инструментов в длинном контексте.

автор ibm-granite20 окт. 2025 г.2,10 ₽ / 1 млн входных13,86 ₽ / 1 млн выходных
Mistral: Mistral Small 3.1 24B

mistralai/mistral-small-3.1-24b-instruct

Mistral Small 3.1 24B — это улучшенная версия Mistral Small 3 (2501), обладающая 24 миллиардами параметров и расширенными мультимодальными возможностями. Она обеспечивает передовую производительность в текстовых задачах и визуальном анализе, включая обработку изображений, программирование, многоязычные рассуждения и поддержку десятков языков. Оснащённая обширным контекстным окном 128k и оптимизированная для эффективного локального вывода, модель поддерживает такие сценарии, как диалоговые агенты, вызов функций, понимание длинных документов и развёртывание в условиях ограниченной конфиденциальности. Обновлённая версия доступна как Mistral Small 3.2.

автор mistralai17 мар. 2025 г.43,45 ₽ / 1 млн входных68,70 ₽ / 1 млн выходных
Meta: Llama 3.3 70B Instruct

meta-llama/llama-3.3-70b-instruct

Многоязычная большая языковая модель Meta Llama 3.3 (LLM) — это предобученная и инструкционно настроенная генеративная модель в 70B (текст на входе/текст на выходе). Модель Llama 3.3, инструкционно настроенная и работающая только с текстом, оптимизирована для многоязычных диалоговых сценариев и превосходит многие доступные открытые и закрытые чат-модели на распространённых отраслевых бенчмарках. Поддерживаемые языки: английский, немецкий, французский, итальянский, португальский, хинди, испанский и тайский. Model Card

автор meta-llama6 дек. 2024 г.117,17 ₽ / 1 млн входных117,17 ₽ / 1 млн выходных
Qwen2.5 Coder 32B Instruct

qwen/qwen-2.5-coder-32b-instruct

Qwen2.5-Coder — это последняя серия больших языковых моделей Qwen, специализированных на коде (ранее известных как CodeQwen). Qwen2.5-Coder представляет следующие улучшения по сравнению с CodeQwen1.5: Значительные улучшения в генерации кода, рассуждении о коде и исправлении кода. Более комплексная основа для реальных приложений, таких как кодовые агенты. Не только улучшение возможностей кодирования, но и сохранение сильных сторон в математике и общих компетенциях. Чтобы узнать больше о результатах оценки, посмотрите блог Qwen 2.5 Coder.

автор qwen11 нояб. 2024 г.81,69 ₽ / 1 млн входных123,78 ₽ / 1 млн выходных
Meta: Llama 3.2 1B Instruct

meta-llama/llama-3.2-1b-instruct

Llama 3.2 1B — это языковая модель с 1 миллиардами параметров, ориентированная на эффективное выполнение задач обработки естественного языка, таких как суммаризация, диалоги и многоязычный анализ текста. Меньший размер позволяет ей эффективно работать в средах с ограниченными ресурсами, сохраняя при этом высокую производительность. Поддерживая восемь основных языков и допуская дообучение для дополнительных языков, Llama 1.3B идеально подходит для бизнеса или разработчиков, которые ищут лёгкие, но мощные решения типа AI, способные работать в различных многоязычных средах без высоких вычислительных затрат, характерных для более крупных моделей. Нажмите здесь: оригинальная карточка модели. Использование данной модели регулируется Политикой допустимого использования Meta.

автор meta-llama25 сент. 2024 г.3,34 ₽ / 1 млн входных24,88 ₽ / 1 млн выходных
Meta: Llama 3.2 3B Instruct

meta-llama/llama-3.2-3b-instruct

Llama 3.2 3B — это многоязычная большая языковая модель с 3 миллиардами параметров, оптимизированная для продвинутых задач обработки естественного языка, таких как генерация диалогов, рассуждение и суммаризация. Разработанная с использованием новейшей архитектуры трансформера, она поддерживает восемь языков, включая английский, испанский и хинди, и может быть адаптирована для дополнительных языков. Обученная на 9 триллионах токенов, модель Llama 3.2 3B превосходно справляется с выполнением инструкций, сложными рассуждениями и использованием инструментов. Её сбалансированная производительность делает её идеальной для приложений, требующих точности и эффективности в генерации текста в многоязычных средах. Нажмите здесь для оригинальной карточки модели. Использование этой модели регулируется Политикой допустимого использования Meta.

автор meta-llama25 сент. 2024 г.6,19 ₽ / 1 млн входных40,85 ₽ / 1 млн выходных
Meta: Llama 3.1 8B Instruct

meta-llama/llama-3.1-8b-instruct

Последний класс моделей Meta (Llama 3.1) был выпущен в различных размерах и вариантах. Эта версия 8B, настроенная по инструкциям, быстрая и эффективная. Она продемонстрировала высокую производительность по сравнению с ведущими закрытыми моделями в оценках людьми. Чтобы узнать больше о выпуске модели, нажмите здесь. Использование этой модели регулируется Политикой допустимого использования Meta.

автор meta-llama23 июл. 2024 г.6,19 ₽ / 1 млн входных9,90 ₽ / 1 млн выходных