Cloudflare
Cloudflare обслуживает эти модели как инфраструктурный провайдер. Авторы моделей указаны отдельно в списке.
18
моделей в каталоге
Модели на хостинге Cloudflare
В списке показаны только включённые модели из публичного каталога GoRouter.
z-ai/glm-5.3-flash
GLM-5.3-Flash — это нативная мультимодальная модель от Z.ai. Она подходит для эффективного программирования и долгосрочных агентных задач. Её гибридная архитектура разрежённого и линейного внимания сохраняет точное поведение при работе с длинным контекстом, одновременно снижая вычислительные накладные расходы.
z-ai/glm-5.3
GLM-5.3 — это крупномасштабная модель рассуждения от Z.ai, созданная для сложной разработки программного обеспечения и долгосрочных агентных задач. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и превосходит GLM-5.2 в кодировании, а также в балансе между производительностью и эффективностью использования токенов. Рассуждение всегда включено и не может быть отключено. Поддерживаются уровни усилий рассуждения low, high и max; по умолчанию используется max.
qwen/qwen3.8-27b
Qwen3.8 27B — это открытая модель с публичными весами, относящаяся к классу плотных мультимодальных моделей «зрение-язык» от компании Qwen. Она подходит для задач программирования, профессиональных рабочих процессов, исследований, мультимодального взаимодействия и длительных агентских задач, поддерживая гибкий режим рассуждений, который можно включать или отключать.
deepseek/deepseek-v4-pro-0813
DeepSeek V4 Pro 0813 — это крупномасштабная модель смеси экспертов от DeepSeek. Это GA-й выпуск DeepSeek V4 Pro.
deepseek/deepseek-v4-flash-0731
DeepSeek V4 Flash 0731 — это разреженная модель смеси экспертов от DeepSeek, с 13B активными параметрами из 284B общих. Эта переобученная версия подходит для задач кодирования, рассуждений и агентных рабочих процессов. Это GA-релиз DeepSeek V4 Flash.
z-ai/glm-5.2
GLM 5.2 — это крупномасштабная модель рассуждения от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и подходит для долгосрочных агентных рабочих процессов, разработки программного обеспечения на уровне проектов и сложной многоэтапной автоматизации. Поддерживаются уровни усилий рассуждения high и xhigh; xhigh соответствует максимальному уровню рассуждения. Модель особенно сильна в написании кода и использовании инструментов в длительных задачах, способна сохранять инженерный контекст и последовательно следовать стандартам на протяжении всего цикла разработки — от требований до развертывания на нескольких платформах — в рамках одной задачи.
moonshotai/kimi-k2.7-code
MoonshotAI: Kimi K2.7 Code — это модель, ориентированная на программирование, из семейства Kimi K2 от Moonshot AI, созданная для надёжного выполнения комплексных задач программирования в условиях длинных контекстов. Она использует нативную мультимодальную архитектуру смеси экспертов, которая принимает текст и изображения на входе, и всегда работает в режиме мышления, сохраняя полное содержимое рассуждений при многоходовых диалогах. С контекстным окном в 256K токенов модель нацелена на долгосрочное программирование, декомпозицию агентских задач и многоходовые диалоги. Модель активирует 32B параметров из примерно 1T общих.
deepseek/deepseek-v4-flash
DeepSeek V4 Flash — это оптимизированная по эффективности модель Mixture-of-Experts от DeepSeek с 284B общим количеством параметров и 13B активируемых параметров, поддерживающая контекстное окно в 1M токенов. Она предназначена для быстрого вывода и высокопроизводительных рабочих нагрузок, сохраняя при этом высокую производительность в рассуждениях и написании кода. Модель включает гибридное внимание для эффективной обработки длинного контекста. Поддерживаются режимы рассуждений high и xhigh; xhigh соответствует максимальному режиму рассуждений. Она хорошо подходит для таких приложений, как ассистенты программирования, чат-системы и агентные рабочие процессы, где важны отзывчивость и экономическая эффективность.
moonshotai/kimi-k2.6
Kimi K2.6 — это мультимодальная модель следующего поколения от Moonshot AI, предназначенная для долгосрочного программирования, генерации UI/UX на основе кода и мультиагентной оркестрации. Она справляется со сложными сквозными задачами программирования на Python, Rust и Go, а также может преобразовывать промпты и визуальные входные данные в готовые к эксплуатации интерфейсы. Её архитектура роя агентов масштабируется до сотен параллельных субагентов для автономной декомпозиции задач — создавая документы, веб-сайты и электронные таблицы за один запуск без участия человека.
google/gemma-4-26b-a4b-it
Gemma 4 26B A4B IT — это модель Mixture-of-Experts (MoE) с инструкционной настройкой от Google DeepMind. Несмотря на 25.2B общих параметров, во время инференса активируется только 3.8B на токен, что обеспечивает качество, близкое к -31B, при доле вычислительных затрат. Поддерживает мультимодальный ввод, включая текст, изображения и видео (до 60 секунд при 1fps). Имеет контекстное окно в 256K токенов, встроенный вызов функций, настраиваемый режим мышления/рассуждения и поддержку структурированного вывода. Выпущена под лицензией Apache 2.0.
z-ai/glm-4.7-flash
Являясь моделью класса 30B-SOTA, GLM-4.7-Flash предлагает новый вариант, который балансирует производительность и эффективность. Она дополнительно оптимизирована для агентских сценариев использования в кодинге, усиливая возможности программирования, планирования долгосрочных задач и взаимодействия с инструментами, и достигла ведущих показателей среди open-source моделей того же размера в нескольких актуальных публичных рейтингах бенчмарков.
ibm-granite/granite-4.0-h-micro
Granite-4.0-H-Micro — это модель с 3B параметрами из семейства моделей Granite 4. Эти модели являются новейшими в серии моделей, выпущенных IBM. Они дообучены для вызова инструментов в длинном контексте.
mistralai/mistral-small-3.1-24b-instruct
Mistral Small 3.1 24B — это улучшенная версия Mistral Small 3 (2501), обладающая 24 миллиардами параметров и расширенными мультимодальными возможностями. Она обеспечивает передовую производительность в текстовых задачах и визуальном анализе, включая обработку изображений, программирование, многоязычные рассуждения и поддержку десятков языков. Оснащённая обширным контекстным окном 128k и оптимизированная для эффективного локального вывода, модель поддерживает такие сценарии, как диалоговые агенты, вызов функций, понимание длинных документов и развёртывание в условиях ограниченной конфиденциальности. Обновлённая версия доступна как Mistral Small 3.2.
meta-llama/llama-3.3-70b-instruct
Многоязычная большая языковая модель Meta Llama 3.3 (LLM) — это предобученная и инструкционно настроенная генеративная модель в 70B (текст на входе/текст на выходе). Модель Llama 3.3, инструкционно настроенная и работающая только с текстом, оптимизирована для многоязычных диалоговых сценариев и превосходит многие доступные открытые и закрытые чат-модели на распространённых отраслевых бенчмарках. Поддерживаемые языки: английский, немецкий, французский, итальянский, португальский, хинди, испанский и тайский. Model Card
qwen/qwen-2.5-coder-32b-instruct
Qwen2.5-Coder — это последняя серия больших языковых моделей Qwen, специализированных на коде (ранее известных как CodeQwen). Qwen2.5-Coder представляет следующие улучшения по сравнению с CodeQwen1.5: Значительные улучшения в генерации кода, рассуждении о коде и исправлении кода. Более комплексная основа для реальных приложений, таких как кодовые агенты. Не только улучшение возможностей кодирования, но и сохранение сильных сторон в математике и общих компетенциях. Чтобы узнать больше о результатах оценки, посмотрите блог Qwen 2.5 Coder.
meta-llama/llama-3.2-1b-instruct
Llama 3.2 1B — это языковая модель с 1 миллиардами параметров, ориентированная на эффективное выполнение задач обработки естественного языка, таких как суммаризация, диалоги и многоязычный анализ текста. Меньший размер позволяет ей эффективно работать в средах с ограниченными ресурсами, сохраняя при этом высокую производительность. Поддерживая восемь основных языков и допуская дообучение для дополнительных языков, Llama 1.3B идеально подходит для бизнеса или разработчиков, которые ищут лёгкие, но мощные решения типа AI, способные работать в различных многоязычных средах без высоких вычислительных затрат, характерных для более крупных моделей. Нажмите здесь: оригинальная карточка модели. Использование данной модели регулируется Политикой допустимого использования Meta.
meta-llama/llama-3.2-3b-instruct
Llama 3.2 3B — это многоязычная большая языковая модель с 3 миллиардами параметров, оптимизированная для продвинутых задач обработки естественного языка, таких как генерация диалогов, рассуждение и суммаризация. Разработанная с использованием новейшей архитектуры трансформера, она поддерживает восемь языков, включая английский, испанский и хинди, и может быть адаптирована для дополнительных языков. Обученная на 9 триллионах токенов, модель Llama 3.2 3B превосходно справляется с выполнением инструкций, сложными рассуждениями и использованием инструментов. Её сбалансированная производительность делает её идеальной для приложений, требующих точности и эффективности в генерации текста в многоязычных средах. Нажмите здесь для оригинальной карточки модели. Использование этой модели регулируется Политикой допустимого использования Meta.
meta-llama/llama-3.1-8b-instruct
Последний класс моделей Meta (Llama 3.1) был выпущен в различных размерах и вариантах. Эта версия 8B, настроенная по инструкциям, быстрая и эффективная. Она продемонстрировала высокую производительность по сравнению с ведущими закрытыми моделями в оценках людьми. Чтобы узнать больше о выпуске модели, нажмите здесь. Использование этой модели регулируется Политикой допустимого использования Meta.