SiliconFlow
SiliconFlow обслуживает эти модели как инфраструктурный провайдер. Авторы моделей указаны отдельно в списке.
40
моделей в каталоге
Модели на хостинге SiliconFlow
В списке показаны только включённые модели из публичного каталога GoRouter.
z-ai/glm-5.3-flash
GLM-5.3-Flash — это нативная мультимодальная модель от Z.ai. Она подходит для эффективного программирования и долгосрочных агентных задач. Её гибридная архитектура разрежённого и линейного внимания сохраняет точное поведение при работе с длинным контекстом, одновременно снижая вычислительные накладные расходы.
z-ai/glm-5.3
GLM-5.3 — это крупномасштабная модель рассуждения от Z.ai, созданная для сложной разработки программного обеспечения и долгосрочных агентных задач. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и превосходит GLM-5.2 в кодировании, а также в балансе между производительностью и эффективностью использования токенов. Рассуждение всегда включено и не может быть отключено. Поддерживаются уровни усилий рассуждения low, high и max; по умолчанию используется max.
qwen/qwen3.8-2.4t-a95b
Qwen3.8 2.4T A95B — это открытая по весам разреженная модель смеси экспертов от Qwen и открытая по весам версия Qwen3.8 Max, с 95 миллиардами активных параметров из 2.4 триллионов всего. Она подходит для программирования, исследований, сложных рассуждений и агентных рабочих процессов.
deepseek/deepseek-v4-pro-0813
DeepSeek V4 Pro 0813 — это крупномасштабная модель смеси экспертов от DeepSeek. Это GA-й выпуск DeepSeek V4 Pro.
deepseek/deepseek-v4-flash-0731
DeepSeek V4 Flash 0731 — это разреженная модель смеси экспертов от DeepSeek, с 13B активными параметрами из 284B общих. Эта переобученная версия подходит для задач кодирования, рассуждений и агентных рабочих процессов. Это GA-релиз DeepSeek V4 Flash.
z-ai/glm-5.2
GLM 5.2 — это крупномасштабная модель рассуждения от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и подходит для долгосрочных агентных рабочих процессов, разработки программного обеспечения на уровне проектов и сложной многоэтапной автоматизации. Поддерживаются уровни усилий рассуждения high и xhigh; xhigh соответствует максимальному уровню рассуждения. Модель особенно сильна в написании кода и использовании инструментов в длительных задачах, способна сохранять инженерный контекст и последовательно следовать стандартам на протяжении всего цикла разработки — от требований до развертывания на нескольких платформах — в рамках одной задачи.
moonshotai/kimi-k2.7-code
MoonshotAI: Kimi K2.7 Code — это модель, ориентированная на программирование, из семейства Kimi K2 от Moonshot AI, созданная для надёжного выполнения комплексных задач программирования в условиях длинных контекстов. Она использует нативную мультимодальную архитектуру смеси экспертов, которая принимает текст и изображения на входе, и всегда работает в режиме мышления, сохраняя полное содержимое рассуждений при многоходовых диалогах. С контекстным окном в 256K токенов модель нацелена на долгосрочное программирование, декомпозицию агентских задач и многоходовые диалоги. Модель активирует 32B параметров из примерно 1T общих.
nex-agi/nex-n2-pro
Nex-N2-Pro — это агентная модель смеси экспертов от Nex AGI с 17B активными параметрами из общего числа 397B. Основанная на архитектуре Qwen3.5, она принимает на вход текст и изображения и выдает текстовые выводы, а также поддерживает рассуждения, вызов функций и структурированные выводы. Она предназначена для программирования, использования инструментов, глубоких исследований и долгосрочных агентных рабочих процессов, объединяя планирование, реализацию кода, отладку и итерации в единый цикл выполнения.
qwen/qwen3.6-35b-a3b
Qwen3.6-35B-A3B — это мультимодальная модель с открытыми весами от Alibaba Cloud с 35 миллиардами параметров суммарно и 3 миллиардами активных параметров на токен. Она использует гибридную разреженную архитектуру смеси экспертов, сочетающую гейтированное линейное внимание DeltaNet со стандартными гейтированными слоями внимания, что обеспечивает эффективный инференс за небольшую долю вычислительных затрат. Модель поддерживает нативное окно контекста на 262K токенов (расширяемое до 1M с помощью YaRN) и принимает текстовые, графические и видеовходные данные. В неё встроен режим размышления с сохранением следов рассуждений в многоходовых беседах, вызов функций и структурированный вывод. Модель выпущена под лицензией Apache 2.0.
qwen/qwen3.6-27b
Qwen3.6 27B — это плотная языковая модель с 27 миллиардами параметров от команды Qwen в Alibaba, выпущенная в апреле 2026. Она обладает гибридными мультимодальными возможностями — принимает текстовые, графические и видео входные данные — и поддерживает контекстное окно на 262,144 токенов. Модель предназначена для агентных задач кодирования и рассуждений, с особой силой в понимании кода на уровне репозитория, рабочих процессах фронтенд-разработки и многошаговом решении проблем. Она включает встроенный режим мышления для расширенного рассуждения и сохраняет контекст мышления в истории разговора. Qwen3.6 27B поддерживает 201 языков и диалектов и выпущена под лицензией Apache 2.0.
deepseek/deepseek-v4-pro
DeepSeek V4 Pro — это крупномасштабная модель смеси экспертов от DeepSeek с общим количеством параметров 1.6T и активными параметрами 49B, поддерживающая контекстное окно в 1M токенов. Модель предназначена для сложных задач рассуждения, программирования и длительных агентных сценариев, демонстрируя высокую производительность в области знаний, математики и программной инженерии. Основанная на той же архитектуре, что и DeepSeek V4 Flash, она использует гибридную систему внимания для эффективной обработки длинных контекстов. Поддерживаются уровни рассуждения high и xhigh; xhigh соответствует максимальному режиму рассуждения. Модель хорошо подходит для ресурсоёмких задач, таких как анализ всего кодового репозитория, многошаговая автоматизация и крупномасштабный синтез информации, где критически важны как производительность, так и эффективность.
deepseek/deepseek-v4-flash
DeepSeek V4 Flash — это оптимизированная по эффективности модель Mixture-of-Experts от DeepSeek с 284B общим количеством параметров и 13B активируемых параметров, поддерживающая контекстное окно в 1M токенов. Она предназначена для быстрого вывода и высокопроизводительных рабочих нагрузок, сохраняя при этом высокую производительность в рассуждениях и написании кода. Модель включает гибридное внимание для эффективной обработки длинного контекста. Поддерживаются режимы рассуждений high и xhigh; xhigh соответствует максимальному режиму рассуждений. Она хорошо подходит для таких приложений, как ассистенты программирования, чат-системы и агентные рабочие процессы, где важны отзывчивость и экономическая эффективность.
moonshotai/kimi-k2.6
Kimi K2.6 — это мультимодальная модель следующего поколения от Moonshot AI, предназначенная для долгосрочного программирования, генерации UI/UX на основе кода и мультиагентной оркестрации. Она справляется со сложными сквозными задачами программирования на Python, Rust и Go, а также может преобразовывать промпты и визуальные входные данные в готовые к эксплуатации интерфейсы. Её архитектура роя агентов масштабируется до сотен параллельных субагентов для автономной декомпозиции задач — создавая документы, веб-сайты и электронные таблицы за один запуск без участия человека.
z-ai/glm-5.1
GLM-5.1 обеспечивает значительный скачок в возможностях программирования, особенно заметный при работе с долгосрочными задачами. В отличие от предыдущих моделей, ориентированных на взаимодействие в масштабе минут, GLM-5.1 может работать независимо и непрерывно над одной задачей в течение более чем 8 часов, автономно планируя, выполняя и улучшая себя в процессе, в конечном итоге предоставляя полные результаты инженерного уровня.
google/gemma-4-26b-a4b-it
Gemma 4 26B A4B IT — это модель Mixture-of-Experts (MoE) с инструкционной настройкой от Google DeepMind. Несмотря на 25.2B общих параметров, во время инференса активируется только 3.8B на токен, что обеспечивает качество, близкое к -31B, при доле вычислительных затрат. Поддерживает мультимодальный ввод, включая текст, изображения и видео (до 60 секунд при 1fps). Имеет контекстное окно в 256K токенов, встроенный вызов функций, настраиваемый режим мышления/рассуждения и поддержку структурированного вывода. Выпущена под лицензией Apache 2.0.
google/gemma-4-31b-it
Gemma 4 31B Instruct — это 30.7B плотная мультимодальная модель Google DeepMind, поддерживающая ввод текста и изображений с выводом текста. Она имеет контекстное окно размером 256K токенов, настраиваемый режим мышления/рассуждений, встроенный вызов функций и многоязычную поддержку для 140+ языков. Сильна в задачах программирования, рассуждений и понимания документов. Лицензия Apache 2.0.
qwen/qwen3.5-9b
Qwen3.5-9B — это мультимодальная фундаментальная модель из семейства Qwen3.5, разработанная для обеспечения сильных рассуждений, программирования и визуального понимания в эффективной архитектуре с 9B параметрами. Она использует унифицированный дизайн «зрение-язык» с ранним слиянием мультимодальных токенов, что позволяет модели обрабатывать и рассуждать над текстом и изображениями в одном контексте.
qwen/qwen3.5-35b-a3b
Серия Qwen3.5 35B-A3B представляет собой нативную визуально-языковую модель, разработанную с гибридной архитектурой, которая объединяет механизмы линейного внимания и разреженную модель смеси экспертов, обеспечивая более высокую эффективность вывода. Её общая производительность сопоставима с производительностью Qwen3.5-27B.
qwen/qwen3.5-27b
Модель Qwen3.5 27B, основанная на плотном vision-language подходе, использует механизм линейного внимания, обеспечивая быструю реакцию при сохранении баланса между скоростью вывода и производительностью. Её общие возможности сопоставимы с характеристиками Qwen3.5-122B-A10B.
qwen/qwen3.5-122b-a10b
Нативная визуально-языковая модель Qwen3.5 122B-A10B построена на гибридной архитектуре, которая объединяет механизм линейного внимания с разреженной моделью смеси экспертов, обеспечивая более высокую эффективность инференса. По общей производительности эта модель уступает только Qwen3.5-397B-A17B. Её текстовые возможности значительно превосходят возможности Qwen3-235B-2507, а визуальные возможности превосходят Qwen3-VL-235B.
minimax/minimax-m2.5
MiniMax-M2.5 — это большая языковая модель SOTA, предназначенная для реальной продуктивности. Обученная на разнообразных сложных реальных цифровых рабочих средах, M2.5 опирается на экспертизу в программировании M2.1, чтобы расшириться на общую офисную работу, достигая свободного владения генерацией и работой с файлами Word, Excel и Powerpoint, переключением контекста между разнообразными программными средами и работой в разных командах агентов и людей. Набрав 80.2% на SWE-Bench Verified, 51.3% на Multi-SWE-Bench и 76.3% на BrowseComp, M2.5 также более эффективен по токенам, чем предыдущие поколения, будучи обученным оптимизировать свои действия и вывод через планирование.
z-ai/glm-5
GLM-5 — это флагманская open-source базовая модель Z.ai, разработанная для проектирования сложных систем и долгосрочных агентных рабочих процессов. Созданная для опытных разработчиков, она обеспечивает производительность производственного уровня при решении крупномасштабных задач программирования, конкурируя с ведущими закрытыми моделями. Благодаря продвинутому агентному планированию, глубоким внутренним рассуждениям и итеративной самокоррекции GLM-5 выходит за рамки генерации кода, обеспечивая построение целых систем и автономное выполнение.
stepfun/step-3.5-flash
Step 3.5 Flash — это наиболее производительная открытая фундаментальная модель StepFun. Построенная на архитектуре разреженной смеси экспертов (MoE), она выборочно активирует только 11B из своих 196B параметров на каждый токен. Это модель рассуждений, которая невероятно эффективна по скорости даже при длинных контекстах.
moonshotai/kimi-k2.5
Kimi K2.5 — это нативная мультимодальная модель Moonshot AI, обеспечивающая передовые возможности визуального кодирования и самодостаточную парадигму роя агентов. Построенная на базе Kimi K2 с продолженным предобучением на примерно 15T смешанных визуальных и текстовых токенах, она демонстрирует высокую производительность в общем рассуждении, визуальном кодировании и агентном вызове инструментов.
deepseek/deepseek-v3.2
DeepSeek-V3.2 — это большая языковая модель, предназначенная для гармоничного сочетания высокой вычислительной эффективности с сильными возможностями рассуждения и использования инструментов. Она внедряет DeepSeek Разреженное Внимание (DSA), механизм мелкозернистого разреженного внимания, который снижает затраты на обучение и вывод, сохраняя при этом качество в сценариях с длинным контекстом. Масштабируемая структура обучения с подкреплением дополнительно улучшает её, обеспечивая производительность в классе GPT-5 и демонстрируя результаты уровня золотой медали на 2025 IMO и IOI. V3.2 также использует крупномасштабный конвейер синтеза задач агентного типа, чтобы лучше интегрировать рассуждения в сценарии использования инструментов, повышая соответствие и обобщение в интерактивных средах. Пользователи могут управлять поведением рассуждения с помощью reasoning enabled логического параметра. Подробнее в нашей документации
qwen/qwen3-embedding-8b
Серия моделей Qwen3 Embedding — это новейшая проприетарная модель семейства Qwen, специально предназначенная для задач текстовых эмбеддингов и ранжирования. Эта серия наследует исключительные многоязычные способности, понимание длинных текстов и навыки рассуждения своей базовой модели. Серия Qwen3 Embedding представляет собой значительный прогресс в нескольких задачах текстовых эмбеддингов и ранжирования, включая поиск текста, поиск кода, классификацию текста, кластеризацию текста и извлечение двуязычных параллелей.
qwen/qwen3-vl-30b-a3b-thinking
Qwen3-VL-30B-A3B-Thinking — это мультимодальная модель, объединяющая мощную генерацию текста с визуальным пониманием изображений и видео. Вариант Thinking улучшает рассуждения в STEM, математике и сложных задачах. Она превосходно справляется с восприятием реальных/синтетических категорий, пространственной привязкой 2D/3D и длинным визуальным пониманием, достигая конкурентоспособных результатов в мультимодальных бенчмарках. Для агентного использования она обрабатывает многообразные многоходовые инструкции, согласование временных линий видео, автоматизацию GUI и визуальное программирование от набросков до отлаженного UI. Текстовая производительность соответствует флагманским моделям Qwen3, подходя для обработки документов AI, OCR, помощи UI, пространственных задач и агентных исследований.
qwen/qwen3-vl-30b-a3b-instruct
Qwen3-VL-30B-A3B-Instruct — это мультимодальная модель, которая объединяет сильную генерацию текста с визуальным пониманием изображений и видео. Её вариант Instruct оптимизирует следование инструкциям для общих мультимодальных задач. Она превосходно справляется с восприятием реальных/синтетических категорий, пространственной привязкой в 2D/3D и длинным визуальным пониманием, достигая конкурентоспособных результатов в мультимодальных бенчмарках. Для агентного использования она обрабатывает многораундовые инструкции с несколькими изображениями, выравнивание временной шкалы видео, автоматизацию GUI и визуальное кодирование от эскизов до отлаженного UI. Текстовая производительность соответствует флагманским моделям Qwen3, что подходит для AI документов, OCR, UI-помощи, пространственных задач и агентных исследований.
deepseek/deepseek-v3.2-exp
DeepSeek-V3.2-Exp — это экспериментальная большая языковая модель, выпущенная компанией DeepSeek в качестве промежуточного шага между V3.1 и будущими архитектурами. Она представляет DeepSeek Sparse Attention (DSA) — механизм мелкозернистого разреженного внимания, предназначенный для повышения эффективности обучения и инференса в сценариях с длинным контекстом при сохранении качества выходных данных. Пользователи могут управлять поведением рассуждения с помощью логического значения reasoning enabled. Узнайте больше в нашей документации Модель обучалась в условиях, согласованных с V3.1-Terminus, чтобы обеспечить прямое сравнение. Тестирование показывает, что производительность примерно находится на уровне V3.1 в задачах рассуждения, написания кода и агентного использования инструментов, с небольшими компромиссами и выигрышами в зависимости от области применения. Этот выпуск сосредоточен на проверке оптимизаций архитектуры для расшirенных длин контекста, а не на повышении точности задач как таковой, что делает модель в первую очередь исследовательской, предназначенной для изучения эффективных конструкций трансформеров.
deepseek/deepseek-v3.1-terminus
DeepSeek-V3.1 Terminus — это обновление модели DeepSeek V3.1, которое сохраняет исходные возможности модели, одновременно устраняя проблемы, о которых сообщают пользователи, включая согласованность языка и возможности агентов, а также дополнительно оптимизируя производительность модели в задачах написания кода и поисковых агентов. Это большая гибридная модель рассуждений (671B параметров, 37B активны), которая поддерживает как режим мышления, так и режим без мышления. Она расширяет базу DeepSeek-V3 двухэтапным процессом обучения на длинном контексте, достигая до 128K токенов, и использует FP8 микроскейлинг для эффективного вывода. Пользователи могут управлять поведением рассуждений с помощью логического значения reasoning enabled. Подробнее в нашей документации Модель улучшает использование инструментов, генерацию кода и эффективность рассуждений, достигая производительности, сравнимой с DeepSeek-R1 на сложных бенчмарках, при этом отвечая быстрее. Она поддерживает структурированные вызовы инструментов, агентов для работы с кодом и поисковых агентов, что делает её подходящей для исследовательских, кодовых и агентных рабочих процессов.
deepseek/deepseek-chat-v3.1
DeepSeek-V3.1 — это крупная гибридная модель рассуждений (671B параметров, 37B активных), поддерживающая как режим размышлений, так и режим без размышлений с помощью шаблонов подсказок. Она расширяет базовую модель DeepSeek-V3 двухэтапным процессом обучения на длинных контекстах, достигая до 128K токенов, и использует масштабирование FP8 для эффективного вывода. Пользователи могут управлять поведением рассуждений с помощью логического значения reasoning enabled. Подробнее в нашей документации Модель улучшает использование инструментов, генерацию кода и эффективность рассуждений, достигая производительности, сравнимой с DeepSeek-R1 на сложных бенчмарках, при этом отвечая быстрее. Она поддерживает структурированные вызовы инструментов, кодовых агентов и поисковых агентов, что делает её подходящей для исследовательских, кодовых и агентных сценариев. Она является преемником модели DeepSeek V3-0324 и хорошо справляется с разнообразными задачами.
openai/gpt-oss-120b
gpt-oss-120b — это модель языка с открытым весом, на 117B параметров, архитектуры Mixture-of-Experts (MoE) от OpenAI, предназначенная для производственных сценариев с высокими требованиями к рассуждению, агентных и универсальных задач. Она активирует 5.1B параметров за прямой проход и оптимизирована для работы на одном H100 GPU с нативной квантизацией MXFP4. Модель поддерживает настраиваемую глубину рассуждений, полный доступ к цепочке рассуждений и нативное использование инструментов, включая вызов функций, просмотр веб-страниц и генерацию структурированных выходных данных.
openai/gpt-oss-20b
gpt-oss-20b — это модель с открытыми весами, выпущенная OpenAI с 21B параметрами под лицензией Apache 2.0. В ней используется архитектура смеси экспертов (MoE) с 3.6B активными параметрами на прямой проход, что обеспечивает более низкую задержку вывода и возможность развертывания на потребительском или однопроцессорном оборудовании GPU. Модель обучается в формате ответов Harmony от OpenAI и поддерживает настройку уровня рассуждений, дообучение, а также агентные возможности, включая вызов функций, использование инструментов и структурированные выходные данные.
qwen/qwen3-coder-30b-a3b-instruct
Qwen3-Coder-30B-A3B-Instruct — это модель смеси экспертов (MoE) с параметрами 30.5B, содержащая 128 экспертов (8 активны на каждом прямом проходе), предназначенная для продвинутой генерации кода, понимания на уровне репозитория и агентного использования инструментов. Построенная на архитектуре Qwen3, она поддерживает нативную длину контекста в 256K токенов (расширяемую до 1M с помощью Yarn) и показывает высокие результаты в задачах, включающих вызовы функций, использование браузера и структурированное завершение кода. Эта модель оптимизирована для следования инструкциям без «режима размышлений» и хорошо интегрируется с форматами использования инструментов, совместимыми с OpenAI.
qwen/qwen3-30b-a3b-instruct-2507
Qwen3-30B-A3B-Instruct-2507 — это языковая модель смеси экспертов с 30.5B параметрами от Qwen, с 3.3B активными параметрами на каждый вывод. Она работает в режиме без мышления и предназначена для качественного следования инструкциям, многоязычного понимания и использования агентных инструментов. Дообученная на инструкциях, она демонстрирует конкурентоспособные результаты в бенчмарках рассуждений (AIME, ZebraLogic), кодирования (MultiPL-E, LiveCodeBench) и согласованности (IFEval, WritingBench). Она превосходит свою версию без инструкций в субъективных и открытых задачах, сохраняя при этом высокую фактическую точность и производительность в кодировании.
z-ai/glm-4.5-air
GLM-4.5-Air — это облегченная версия нашей последней серии флагманских моделей, специально созданная для агентных приложений. Как и GLM-4.5, она использует архитектуру «смесь экспертов» (MoE), но с более компактным размером параметров. GLM-4.5-Air также поддерживает гибридные режимы вывода, предлагая «режим мышления» для сложных рассуждений и использования инструментов, а также «режим без мышления» для взаимодействия в реальном времени. Пользователи могут управлять поведением рассуждений с помощью логического параметра reasoning enabled. Подробнее в нашей документации
tencent/hunyuan-a13b-instruct
Hunyuan-A13B — это языковая модель Mixture-of-Experts (MoE) с 13B активными параметрами, разработанная Tencent, с общим количеством параметров 80B и поддержкой рассуждений через цепочку мыслей. Она демонстрирует конкурентоспособные результаты в бенчмарках по математике, естественным наукам, программированию и многошаговым задачам рассуждений, сохраняя высокую эффективность инференса благодаря Grouped Query Attention (GQA) и поддержке квантования (FP8, GPTQ и т. д.).
deepseek/deepseek-r1-0528
28-е обновление к оригиналу DeepSeek R1 — производительность на уровне OpenAI o1, но с открытым исходным кодом и полностью открытыми токенами рассуждения. Размер модели — 671B параметров, при этом в ходе инференса активно задействовано 37B. Полностью открытая модель.
qwen/qwen3-32b
Qwen3-32B — это плотная 32.8B-параметрическая каузальная языковая модель из серии Qwen3, оптимизированная как для сложных рассуждений, так и для эффективного диалога. Она поддерживает плавное переключение между режимом «размышления» для задач математики, программирования и логического вывода, а также режимом «без размышлений» для более быстрых общих бесед. Модель демонстрирует высокую производительность в следовании инструкциям, использовании агентских инструментов, творческом написании и многоязычных задачах на более чем 100 языках и диалектах. Она изначально работает с контекстами до 32K токенов и может быть расширена до 131K токенов с помощью масштабирования на основе YaRN.
deepseek/deepseek-chat-v3-0324
DeepSeek V3, модель со смешанными экспертами с 685B параметрами, является новейшей итерацией флагманского семейства чат-моделей команды DeepSeek. Она приходит на смену модели DeepSeek V3 и отлично справляется с самыми разными задачами.