Novita
Novita обслуживает эти модели как инфраструктурный провайдер. Авторы моделей указаны отдельно в списке.
70
моделей в каталоге
Модели на хостинге Novita
В списке показаны только включённые модели из публичного каталога GoRouter.
z-ai/glm-5.3-flash
GLM-5.3-Flash — это нативная мультимодальная модель от Z.ai. Она подходит для эффективного программирования и долгосрочных агентных задач. Её гибридная архитектура разрежённого и линейного внимания сохраняет точное поведение при работе с длинным контекстом, одновременно снижая вычислительные накладные расходы.
deepseek/deepseek-v4-flash-vision-exp
DeepSeek V4 Flash Vision Exp — это экспериментальная версия с поддержкой зрения DeepSeek V4 Flash 0731 от DeepSeek, добавляющая понимание изображений, сохраняя при этом уровень базовой модели в работе с текстом, включая агентные сценарии и рассуждения. Это разреженная модель на основе смеси экспертов с 13B активными параметрами из общего числа 284B. Она подходит для понимания документов и диаграмм, ответов на вопросы по изображениям и мультимодальных агентных рабочих процессов, объединяющих текст и изображения.
z-ai/glm-5.3
GLM-5.3 — это крупномасштабная модель рассуждения от Z.ai, созданная для сложной разработки программного обеспечения и долгосрочных агентных задач. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и превосходит GLM-5.2 в кодировании, а также в балансе между производительностью и эффективностью использования токенов. Рассуждение всегда включено и не может быть отключено. Поддерживаются уровни усилий рассуждения low, high и max; по умолчанию используется max.
qwen/qwen3.8-27b
Qwen3.8 27B — это открытая модель с публичными весами, относящаяся к классу плотных мультимодальных моделей «зрение-язык» от компании Qwen. Она подходит для задач программирования, профессиональных рабочих процессов, исследований, мультимодального взаимодействия и длительных агентских задач, поддерживая гибкий режим рассуждений, который можно включать или отключать.
qwen/qwen3.8-2.4t-a95b
Qwen3.8 2.4T A95B — это открытая по весам разреженная модель смеси экспертов от Qwen и открытая по весам версия Qwen3.8 Max, с 95 миллиардами активных параметров из 2.4 триллионов всего. Она подходит для программирования, исследований, сложных рассуждений и агентных рабочих процессов.
deepseek/deepseek-v4-pro-0813
DeepSeek V4 Pro 0813 — это крупномасштабная модель смеси экспертов от DeepSeek. Это GA-й выпуск DeepSeek V4 Pro.
deepseek/deepseek-v4-flash-0731
DeepSeek V4 Flash 0731 — это разреженная модель смеси экспертов от DeepSeek, с 13B активными параметрами из 284B общих. Эта переобученная версия подходит для задач кодирования, рассуждений и агентных рабочих процессов. Это GA-релиз DeepSeek V4 Flash.
inclusionai/ling-3.0-flash
Ling-3.0-flash — это модель со смесью экспертов (MoE) с 124B параметрами, при этом на каждый токен активируется примерно 5.1B параметров. Модель разработана с приоритетом эффективности использования токенов и продакшн-масштабного агентного инференса, что позволяет разработчикам выполнять больше полезной работы в рамках ограниченных бюджетов на токены, задержку и стоимость обслуживания.
tencent/hy3
Hy3 — это модель смеси экспертов (Mixture-of-Experts) с 295B параметрами от Tencent (активно 21B, 192 экспертов с маршрутизацией top-8), предназначенная для рассуждений, агентных рабочих процессов и реального производственного использования. Она поддерживает настраиваемое усилие рассуждения: по умолчанию — прямой режим без размышлений, а также режимы цепочки рассуждений с низким и высоким уровнем для сложных задач по математике, программированию и многошаговых проблем. С контекстным окном 256K, Hy3 нацелена на задачи с длинным горизонтом, включая улучшенное разрешение кореферентности, отслеживание ограничений в многоходовых диалогах и стабильный вызов инструментов, который обобщается на различные агентные каркасы. Tencent позиционирует её как надёжный и экономически эффективный вариант для программирования, обработки документов, финансового анализа, разработки игр и дизайна фронтенда, с сильным акцентом на обоснованное поведение, препятствующее галлюцинациям: модель отвечает, когда есть основание, и сигнализирует об отсутствии доказательств, а не выдумывает.
z-ai/glm-5.2
GLM 5.2 — это крупномасштабная модель рассуждения от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и подходит для долгосрочных агентных рабочих процессов, разработки программного обеспечения на уровне проектов и сложной многоэтапной автоматизации. Поддерживаются уровни усилий рассуждения high и xhigh; xhigh соответствует максимальному уровню рассуждения. Модель особенно сильна в написании кода и использовании инструментов в длительных задачах, способна сохранять инженерный контекст и последовательно следовать стандартам на протяжении всего цикла разработки — от требований до развертывания на нескольких платформах — в рамках одной задачи.
moonshotai/kimi-k2.7-code
MoonshotAI: Kimi K2.7 Code — это модель, ориентированная на программирование, из семейства Kimi K2 от Moonshot AI, созданная для надёжного выполнения комплексных задач программирования в условиях длинных контекстов. Она использует нативную мультимодальную архитектуру смеси экспертов, которая принимает текст и изображения на входе, и всегда работает в режиме мышления, сохраняя полное содержимое рассуждений при многоходовых диалогах. С контекстным окном в 256K токенов модель нацелена на долгосрочное программирование, декомпозицию агентских задач и многоходовые диалоги. Модель активирует 32B параметров из примерно 1T общих.
minimax/minimax-m3
MiniMax-M3 — это мультимодальная фундаментальная модель от MiniMax. Она поддерживает ввод текста, изображений и видео с выводом текста, имеет контекстное окно в 1M токенов и предназначена для длительных агентных задач, программирования и использования инструментов. Модель построена на основе MiniMax Sparse Attention (MSA), которая заменяет полное внимание на KV-block-выборку, сокращая вычислительные затраты на токен при длинном контексте — примерно на 1/20 по сравнению с предыдущим поколением при 1M токенах, обеспечивая значительно более быструю предварительную обработку и декодирование без потери качества на большинстве задач. Обученная как нативная мультимодальная модель на перемежённых данных и оптимизированная для многоходового, производственно-ориентированного взаимодействия через интерактивный симулятор пользователя, модель ориентирована на длительные, многошаговые задачи, а не на одноразовое выполнение.
stepfun/step-3.7-flash
Step 3.7 Flash — последняя высокоэффективная мультимодальная модель архитектуры Mixture-of-Experts от StepFun. Она объединяет языковую основу с 196B параметрами и визуальный энкодер для нативного понимания изображений и видео, активируя примерно 11B параметров на токен. Модель поддерживает контекстное окно в 256K и предоставляет выбираемые уровни рассуждения (высокий/средний/низкий), позволяя вызывающим сторонам балансировать скорость, стоимость и глубину рассуждений. Разработана для написания кода, агентных сценариев, структурированных выходных данных и задач продуктивности с длинным контекстом.
deepseek/deepseek-v4-pro
DeepSeek V4 Pro — это крупномасштабная модель смеси экспертов от DeepSeek с общим количеством параметров 1.6T и активными параметрами 49B, поддерживающая контекстное окно в 1M токенов. Модель предназначена для сложных задач рассуждения, программирования и длительных агентных сценариев, демонстрируя высокую производительность в области знаний, математики и программной инженерии. Основанная на той же архитектуре, что и DeepSeek V4 Flash, она использует гибридную систему внимания для эффективной обработки длинных контекстов. Поддерживаются уровни рассуждения high и xhigh; xhigh соответствует максимальному режиму рассуждения. Модель хорошо подходит для ресурсоёмких задач, таких как анализ всего кодового репозитория, многошаговая автоматизация и крупномасштабный синтез информации, где критически важны как производительность, так и эффективность.
deepseek/deepseek-v4-flash
DeepSeek V4 Flash — это оптимизированная по эффективности модель Mixture-of-Experts от DeepSeek с 284B общим количеством параметров и 13B активируемых параметров, поддерживающая контекстное окно в 1M токенов. Она предназначена для быстрого вывода и высокопроизводительных рабочих нагрузок, сохраняя при этом высокую производительность в рассуждениях и написании кода. Модель включает гибридное внимание для эффективной обработки длинного контекста. Поддерживаются режимы рассуждений high и xhigh; xhigh соответствует максимальному режиму рассуждений. Она хорошо подходит для таких приложений, как ассистенты программирования, чат-системы и агентные рабочие процессы, где важны отзывчивость и экономическая эффективность.
xiaomi/mimo-v2.5-pro
MiMo-V2.5-Pro — флагманская модель Xiaomi, обеспечивающая высокую производительность в общих агентных возможностях, сложной программной инженерии и задачах с длинным горизонтом планирования, занимая верхние строчки в бенчмарках, таких как ClawEval, GDPVal и SWE-bench Pro. Модель способна независимо и автономно выполнять профессиональные задачи, на которые у экспертов-людей ушли бы дни или недели, задействуя более тысячи вызовов инструментов. Длина контекста до 1M делает её хорошо подходящей для интеграции с широким спектром агентных фреймворков.
xiaomi/mimo-v2.5
MiMo-V2.5 — это нативная омнимодальная модель от Xiaomi. Она обеспечивает производительность агентного уровня Pro примерно при вдвое меньших затратах на инференс, превосходя MiMo-V2-Omni в мультимодальном восприятии при решении задач понимания изображений и видео. Её контекстное окно 1M поддерживает полные документы, протяжённые диалоги и сложные контексты задач за один проход, что делает её идеальной для интеграции с агентными фреймворками, где важны сильные рассуждения, богатое восприятие и экономическая эффективность.
moonshotai/kimi-k2.6
Kimi K2.6 — это мультимодальная модель следующего поколения от Moonshot AI, предназначенная для долгосрочного программирования, генерации UI/UX на основе кода и мультиагентной оркестрации. Она справляется со сложными сквозными задачами программирования на Python, Rust и Go, а также может преобразовывать промпты и визуальные входные данные в готовые к эксплуатации интерфейсы. Её архитектура роя агентов масштабируется до сотен параллельных субагентов для автономной декомпозиции задач — создавая документы, веб-сайты и электронные таблицы за один запуск без участия человека.
z-ai/glm-5.1
GLM-5.1 обеспечивает значительный скачок в возможностях программирования, особенно заметный при работе с долгосрочными задачами. В отличие от предыдущих моделей, ориентированных на взаимодействие в масштабе минут, GLM-5.1 может работать независимо и непрерывно над одной задачей в течение более чем 8 часов, автономно планируя, выполняя и улучшая себя в процессе, в конечном итоге предоставляя полные результаты инженерного уровня.
google/gemma-4-26b-a4b-it
Gemma 4 26B A4B IT — это модель Mixture-of-Experts (MoE) с инструкционной настройкой от Google DeepMind. Несмотря на 25.2B общих параметров, во время инференса активируется только 3.8B на токен, что обеспечивает качество, близкое к -31B, при доле вычислительных затрат. Поддерживает мультимодальный ввод, включая текст, изображения и видео (до 60 секунд при 1fps). Имеет контекстное окно в 256K токенов, встроенный вызов функций, настраиваемый режим мышления/рассуждения и поддержку структурированного вывода. Выпущена под лицензией Apache 2.0.
google/gemma-4-31b-it
Gemma 4 31B Instruct — это 30.7B плотная мультимодальная модель Google DeepMind, поддерживающая ввод текста и изображений с выводом текста. Она имеет контекстное окно размером 256K токенов, настраиваемый режим мышления/рассуждений, встроенный вызов функций и многоязычную поддержку для 140+ языков. Сильна в задачах программирования, рассуждений и понимания документов. Лицензия Apache 2.0.
minimax/minimax-m2.7
MiniMax-M2.7 — это большая языковая модель нового поколения, предназначенная для автономной продуктивности в реальных условиях и постоянного совершенствования. Созданная для активного участия в собственной эволюции, M2.7 интегрирует передовые агентные возможности благодаря мультиагентному взаимодействию, что позволяет ей планировать, выполнять и уточнять сложные задачи в динамических средах. Обученная для работы на производственном уровне, M2.7 справляется с такими задачами, как живая отладка, анализ первопричин, финансовое моделирование и полная генерация документов в Word, Excel и PowerPoint. Она показывает высокие результаты на тестах, включая 56.2% на SWE-Pro и 57.0% на Terminal Bench 2, а также достигает 1495 ELO на GDPval-AA, устанавливая новый стандарт для мультиагентных систем, работающих в реальных цифровых процессах.
qwen/qwen3.5-27b
Модель Qwen3.5 27B, основанная на плотном vision-language подходе, использует механизм линейного внимания, обеспечивая быструю реакцию при сохранении баланса между скоростью вывода и производительностью. Её общие возможности сопоставимы с характеристиками Qwen3.5-122B-A10B.
qwen/qwen3.5-122b-a10b
Нативная визуально-языковая модель Qwen3.5 122B-A10B построена на гибридной архитектуре, которая объединяет механизм линейного внимания с разреженной моделью смеси экспертов, обеспечивая более высокую эффективность инференса. По общей производительности эта модель уступает только Qwen3.5-397B-A17B. Её текстовые возможности значительно превосходят возможности Qwen3-235B-2507, а визуальные возможности превосходят Qwen3-VL-235B.
qwen/qwen3.5-397b-a17b
Серия Qwen3.5 (397B–A17B) — это нативная модель «Vision-Language», построенная на гибридной архитектуре, которая объединяет механизм линейного внимания с разреженной моделью «смесь экспертов», что обеспечивает более высокую эффективность вывода. Она демонстрирует производительность, сопоставимую с ведущими современными моделями, в широком спектре задач: понимание языка, логические рассуждения, генерация кода, агентные сценарии, понимание изображений и видео, а также взаимодействие с графическими интерфейсами (GUI). Благодаря развитым возможностям генерации кода и агентному подходу модель показывает высокую обобщающую способность в разнообразных прикладных областях.
minimax/minimax-m2.5
MiniMax-M2.5 — это большая языковая модель SOTA, предназначенная для реальной продуктивности. Обученная на разнообразных сложных реальных цифровых рабочих средах, M2.5 опирается на экспертизу в программировании M2.1, чтобы расшириться на общую офисную работу, достигая свободного владения генерацией и работой с файлами Word, Excel и Powerpoint, переключением контекста между разнообразными программными средами и работой в разных командах агентов и людей. Набрав 80.2% на SWE-Bench Verified, 51.3% на Multi-SWE-Bench и 76.3% на BrowseComp, M2.5 также более эффективен по токенам, чем предыдущие поколения, будучи обученным оптимизировать свои действия и вывод через планирование.
z-ai/glm-5
GLM-5 — это флагманская open-source базовая модель Z.ai, разработанная для проектирования сложных систем и долгосрочных агентных рабочих процессов. Созданная для опытных разработчиков, она обеспечивает производительность производственного уровня при решении крупномасштабных задач программирования, конкурируя с ведущими закрытыми моделями. Благодаря продвинутому агентному планированию, глубоким внутренним рассуждениям и итеративной самокоррекции GLM-5 выходит за рамки генерации кода, обеспечивая построение целых систем и автономное выполнение.
qwen/qwen3-coder-next
Qwen3-Coder-Next — это языковая модель с открытым весом и архитектурой причинно-следственного типа, оптимизированная для агентов кодинга и локальных рабочих процессов разработки. Она использует разреженную конструкцию MoE с 80B общими параметрами, из которых при обработке каждого токена активируется только 3B, что обеспечивает производительность, сопоставимую с моделями, имеющими в 10–20x более высокую активную вычислительную нагрузку. Это делает её хорошо подходящей для затратно-чувствительного и постоянно работающего развертывания агентов. Модель обучена с сильным акцентом на агентский сценарий и надёжно работает при выполнении длительных задач по кодингу, сложном использовании инструментов и восстановлении после сбоев выполнения. Благодаря собственному контекстному окну 256k она легко интегрируется в реальные среды CLI и IDE и хорошо адаптируется к распространённым агентским каркасам, используемым современными инструментами разработки. Модель работает исключительно в режиме без рассуждений и не генерирует блоки thinking, что упрощает интеграцию для производственных агентов кодинга.
moonshotai/kimi-k2.5
Kimi K2.5 — это нативная мультимодальная модель Moonshot AI, обеспечивающая передовые возможности визуального кодирования и самодостаточную парадигму роя агентов. Построенная на базе Kimi K2 с продолженным предобучением на примерно 15T смешанных визуальных и текстовых токенах, она демонстрирует высокую производительность в общем рассуждении, визуальном кодировании и агентном вызове инструментов.
z-ai/glm-4.7-flash
Являясь моделью класса 30B-SOTA, GLM-4.7-Flash предлагает новый вариант, который балансирует производительность и эффективность. Она дополнительно оптимизирована для агентских сценариев использования в кодинге, усиливая возможности программирования, планирования долгосрочных задач и взаимодействия с инструментами, и достигла ведущих показателей среди open-source моделей того же размера в нескольких актуальных публичных рейтингах бенчмарков.
minimax/minimax-m2.1
MiniMax-M2.1 — это легковесная большая языковая модель современного уровня, оптимизированная для программирования, агентных рабочих процессов и разработки современных приложений. Имея всего 10 миллиарда активных параметров, она обеспечивает значительный скачок в реальной производительности, сохраняя при этом исключительную задержку, масштабируемость и экономическую эффективность. По сравнению с предшественником, M2.1 выдаёт более чистые и лаконичные результаты и более быстрое воспринимаемое время ответа. Она демонстрирует ведущую многоязычную производительность в области кодирования в основных системах и языках приложений, достигая 49.4% в Multi-SWE-Bench и 72.5% в SWE-Bench Multilingual, и служит универсальным «мозгом» агента для IDEs, инструментов кодирования и общей помощи. Чтобы не допустить ухудшения производительности этой модели, MiniMax настоятельно рекомендует сохранять рассуждения между ходами. Узнайте больше об использовании reasoning_details для передачи рассуждений в нашей документации.
z-ai/glm-4.7
GLM-4.7 — это последняя флагманская модель Z.ai, с улучшениями в двух ключевых областях: расширенные возможности программирования и более стабильное многошаговое рассуждение/исполнение. Она демонстрирует значительные улучшения в выполнении сложных агентных задач, обеспечивая при этом более естественное общение и превосходную эстетику интерфейса.
nvidia/nemotron-3-nano-30b-a3b
NVIDIA Nemotron 3 Nano 30B A3B — это небольшая языковая MoE модель с наивысшей вычислительной эффективностью и точностью для разработчиков, создающих специализированные агентные AI системы. Модель полностью открыта: открытые веса, наборы данных и рецепты позволяют разработчикам легко настраивать, оптимизировать и разворачивать модель на своей инфраструктуре для максимальной конфиденциальности и безопасности.
z-ai/glm-4.6v
GLM-4.6V — это большая мультимодальная модель, предназначенная для высокоточного визуального понимания и рассуждений в длинном контексте по изображениям, документам и смешанным медиа. Модель поддерживает до 128K токенов, обрабатывает сложные макеты страниц и диаграммы непосредственно как визуальные входные данные, а также интегрирует нативную мультимодальную функцию вызова для связи восприятия с последующим выполнением инструментов. Модель также обеспечивает чередующуюся генерацию изображений и текста и рабочие процессы реконструкции UI, включая синтез из скриншота в HTML и итеративное визуальное редактирование.
deepseek/deepseek-v3.2
DeepSeek-V3.2 — это большая языковая модель, предназначенная для гармоничного сочетания высокой вычислительной эффективности с сильными возможностями рассуждения и использования инструментов. Она внедряет DeepSeek Разреженное Внимание (DSA), механизм мелкозернистого разреженного внимания, который снижает затраты на обучение и вывод, сохраняя при этом качество в сценариях с длинным контекстом. Масштабируемая структура обучения с подкреплением дополнительно улучшает её, обеспечивая производительность в классе GPT-5 и демонстрируя результаты уровня золотой медали на 2025 IMO и IOI. V3.2 также использует крупномасштабный конвейер синтеза задач агентного типа, чтобы лучше интегрировать рассуждения в сценарии использования инструментов, повышая соответствие и обобщение в интерактивных средах. Пользователи могут управлять поведением рассуждения с помощью reasoning enabled логического параметра. Подробнее в нашей документации
moonshotai/kimi-k2-thinking
Kimi K2 Thinking — это самая продвинутая открытая модель для рассуждений от Moonshot AI, расширяющая серию K2 до агентных и долгосрочных рассуждений. Построенная на триллионной архитектуре смеси экспертов (MoE), представленной в Kimi K2, она активирует 32 миллиардов параметров за проход и поддерживает контекстные окна в 256 тысяч токенов. Модель оптимизирована для устойчивого пошагового мышления, динамического вызова инструментов и сложных рабочих процессов рассуждений, охватывающих сотни витков. Она чередует пошаговые рассуждения с использованием инструментов, что позволяет автономно выполнять исследования, написание кода и текстов, сохраняя устойчивость на протяжении сотен последовательных действий без сбоев. Она устанавливает новые открытые эталоны в HLE, BrowseComp, SWE-Multilingual и LiveCodeBench, сохраняя стабильное мультиагентное поведение благодаря 200–300 вызовам инструментов. Построенная на крупномасштабной архитектуре MoE с оптимизацией MuonClip, модель сочетает глубокую способность к рассуждениям с высокой эффективностью вывода для сложных агентных и аналитических задач.
minimax/minimax-m2
MiniMax-M2 — это компактная языковая модель с высокой производительностью, оптимизированная для кодирования и агентных задач. Благодаря архитектуре с 10 млрд активированных параметров (всего 230 млрд) модель обеспечивает производительность, близкую к передовым системам, в общем мышлении, работе с инструментами и многошаговых задачах, сохраняя при этом низкую задержку и эффективность развертывания. Модель отлично справляется с генерацией кода, редактированием нескольких файлов, циклами компиляции и исправления, а также проверкой тестами, показывая высокие результаты на SWE-Bench Verified, Multi-SWE-Bench и Terminal-Bench. Она также конкурентоспособна в агентных оценках, таких как BrowseComp и GAIA, эффективно обрабатывая долгосрочное планирование, поиск информации и восстановление после ошибок выполнения. По результатам тестов Artificial Analysis, MiniMax-M2 входит в число лучших открытых моделей по составному интеллекту, охватывающему математику, естественные науки и следование инструкциям. Небольшой объем активируемых параметров обеспечивает быстрый вывод, высокую конкурентность и улучшенную экономическую эффективность, что делает модель подходящей для крупномасштабных агентов, помощников разработчиков и приложений, требующих высокой скорости и эффективности затрат. Чтобы не снижать производительность модели, MiniMax настоятельно рекомендует сохранять рассуждения между шагами. Узнайте больше об использовании reasoning_details для передачи рассуждений в нашей документации.
qwen/qwen3-vl-30b-a3b-instruct
Qwen3-VL-30B-A3B-Instruct — это мультимодальная модель, которая объединяет сильную генерацию текста с визуальным пониманием изображений и видео. Её вариант Instruct оптимизирует следование инструкциям для общих мультимодальных задач. Она превосходно справляется с восприятием реальных/синтетических категорий, пространственной привязкой в 2D/3D и длинным визуальным пониманием, достигая конкурентоспособных результатов в мультимодальных бенчмарках. Для агентного использования она обрабатывает многораундовые инструкции с несколькими изображениями, выравнивание временной шкалы видео, автоматизацию GUI и визуальное кодирование от эскизов до отлаженного UI. Текстовая производительность соответствует флагманским моделям Qwen3, что подходит для AI документов, OCR, UI-помощи, пространственных задач и агентных исследований.
z-ai/glm-4.6
По сравнению с GLM-4.5, это поколение включает несколько ключевых улучшений: Более длинное контекстное окно: размер контекстного окна был расширен с 128K до 200K токенов, что позволяет модели справляться с более сложными агентными задачами. Превосходная производительность в кодировании: модель достигает более высоких результатов в бенчмарках для кода и демонстрирует лучшую реальную производительность в таких приложениях, как Claude Code, Cline, Roo Code и Kilo Code, включая улучшения в генерации визуально отполированных фронтенд-страниц. Продвинутые рассуждения: GLM-4.6 демонстрирует явное улучшение в способности к рассуждениям и поддерживает использование инструментов во время вывода, что приводит к более сильной общей функциональности. Более способные агенты: GLM-4.6 показывает более высокую производительность в агентах, использующих инструменты и поиск, и более эффективно интегрируется в агентные фреймворки. Улучшенный стиль письма: лучше соответствует человеческим предпочтениям в стиле и читабельности, а также ведёт себя более естественно в сценариях ролевых игр.
deepseek/deepseek-v3.2-exp
DeepSeek-V3.2-Exp — это экспериментальная большая языковая модель, выпущенная компанией DeepSeek в качестве промежуточного шага между V3.1 и будущими архитектурами. Она представляет DeepSeek Sparse Attention (DSA) — механизм мелкозернистого разреженного внимания, предназначенный для повышения эффективности обучения и инференса в сценариях с длинным контекстом при сохранении качества выходных данных. Пользователи могут управлять поведением рассуждения с помощью логического значения reasoning enabled. Узнайте больше в нашей документации Модель обучалась в условиях, согласованных с V3.1-Terminus, чтобы обеспечить прямое сравнение. Тестирование показывает, что производительность примерно находится на уровне V3.1 в задачах рассуждения, написания кода и агентного использования инструментов, с небольшими компромиссами и выигрышами в зависимости от области применения. Этот выпуск сосредоточен на проверке оптимизаций архитектуры для расшirенных длин контекста, а не на повышении точности задач как таковой, что делает модель в первую очередь исследовательской, предназначенной для изучения эффективных конструкций трансформеров.
qwen/qwen3-vl-235b-a22b-thinking
Qwen3-VL-235B-A22B Thinking — это мультимодальная модель, объединяющая сильную генерацию текста с визуальным пониманием изображений и видео. Модель Thinking оптимизирована для мультимодальных рассуждений в STEM и математике. Серия подчеркивает надежное восприятие (распознавание разнообразных реальных и синтетических категорий), пространственное понимание (2D/3D привязка) и длительное визуальное восприятие, с конкурентоспособными результатами на публичных мультимодальных бенчмарках как для восприятия, так и для рассуждений. Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: он может следовать сложным инструкциям в многоизображных и многооборотных диалогах; согласовывать текст с видео-таймлайнами для точных временных запросов; и управлять элементами GUI для задач автоматизации. Модели также обеспечивают визуальные рабочие процессы кодирования, превращая наброски или макеты в код и помогая с отладкой UI, сохраняя при этом высокую производительность только для текста, сравнимую с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL подходящими для производственных сценариев, охватывающих AI документов, многоязычный OCR, помощь в разработке ПО/UI, пространственные/воплощенные задачи и исследования агентов зрения и языка.
qwen/qwen3-vl-235b-a22b-instruct
Qwen3-VL-235B-A22B Instruct — это мультимодальная модель с открытыми весами, объединяющая сильную генерацию текста с визуальным пониманием изображений и видео. Модель Instruct ориентирована на универсальные сценарии применения в области зрения и языка (VQA, разбор документов, извлечение данных из диаграмм и таблиц, многоязычный OCR). Серия подчеркивает надежное восприятие (распознавание разнообразных реальных и синтетических категорий), пространственное понимание (2D/3D-grounding) и длительное визуальное понимание, демонстрируя конкурентоспособные результаты на публичных мультимодальных бенчмарках как по восприятию, так и по рассуждению. Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: модель может следовать сложным инструкциям в многоизображных и многоходовых диалогах; согласовывать текст с видеошкалой времени для точных временных запросов; а также управлять элементами GUI для задач автоматизации. Модели также обеспечивают рабочие процессы визуального кодирования — превращая эскизы или макеты в код и помогая с отладкой UI — сохраняя при этом высокую производительность при работе только с текстом, сопоставимую с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL пригодными для производственных сценариев, охватывающих AI документов, многоязычный OCR, помощь в разработке ПО/UI, пространственные/воплощенные задачи и исследования агентов на основе зрения и языка.
deepseek/deepseek-v3.1-terminus
DeepSeek-V3.1 Terminus — это обновление модели DeepSeek V3.1, которое сохраняет исходные возможности модели, одновременно устраняя проблемы, о которых сообщают пользователи, включая согласованность языка и возможности агентов, а также дополнительно оптимизируя производительность модели в задачах написания кода и поисковых агентов. Это большая гибридная модель рассуждений (671B параметров, 37B активны), которая поддерживает как режим мышления, так и режим без мышления. Она расширяет базу DeepSeek-V3 двухэтапным процессом обучения на длинном контексте, достигая до 128K токенов, и использует FP8 микроскейлинг для эффективного вывода. Пользователи могут управлять поведением рассуждений с помощью логического значения reasoning enabled. Подробнее в нашей документации Модель улучшает использование инструментов, генерацию кода и эффективность рассуждений, достигая производительности, сравнимой с DeepSeek-R1 на сложных бенчмарках, при этом отвечая быстрее. Она поддерживает структурированные вызовы инструментов, агентов для работы с кодом и поисковых агентов, что делает её подходящей для исследовательских, кодовых и агентных рабочих процессов.
qwen/qwen3-next-80b-a3b-instruct
Qwen3-Next-80B-A3B-Instruct — это инструктивно-настроенная чат-модель из серии Qwen3-Next, оптимизированная для быстрых и стабильных ответов без следов «размышлений». Она нацелена на сложные задачи, включая рассуждение, генерацию кода, знания QA и многоязычное использование, оставаясь при этом устойчивой к согласованию и форматированию. По сравнению с предыдущими инструктивными вариантами Qwen3, она фокусируется на более высокой пропускной способности и стабильности на сверхдлинных входах и многоходовых диалогах, что делает её хорошо подходящей для RAG, использования инструментов и агентных рабочих процессов, требующих последовательных финальных ответов, а не видимой цепочки рассуждений. Модель использует эффективное с точки зрения масштабирования обучение и декодирование для улучшения эффективности параметров и скорости инференса, и была проверена на широком наборе публичных бенчмарков, где она достигает или приближается к более крупным системам Qwen3 в нескольких категориях, превосходя при этом более ранние модели среднего размера. Её лучше всего использовать как универсального ассистента, помощника по коду и решателя задач с длинным контекстом в производственных средах, где предпочтительны детерминированные выводы, следующие инструкциям.
moonshotai/kimi-k2-0905
Kimi K2 0905 — это сентябрьское обновление модели Kimi K2 0711. Это крупномасштабная языковая модель на основе смеси экспертов (MoE), разработанная компанией Moonshot AI, с 1 триллионами параметров суммарно и 32 миллиардами активных параметров на каждом прямом проходе. Она поддерживает вывод с длинным контекстом до 256k токенов, что расширено с предыдущих 128k. Это обновление улучшает агентное программирование с более высокой точностью и лучшей обобщаемостью на различных каркасах, а также улучшает фронтенд-разработку, обеспечивая более эстетичные и функциональные результаты для веб-задач, задач 3D и смежных областей. Kimi K2 оптимизирована для агентных возможностей, включая продвинутое использование инструментов, рассуждение и синтез кода. Модель превосходно показывает себя в тестах на программирование (LiveCodeBench, SWE-bench), рассуждение (ZebraLogic, GPQA) и использование инструментов (Tau2, AceBench). Модель обучена с использованием нового стека, включающего оптимизатор MuonClip для стабильного крупномасштабного обучения MoE.
deepseek/deepseek-chat-v3.1
DeepSeek-V3.1 — это крупная гибридная модель рассуждений (671B параметров, 37B активных), поддерживающая как режим размышлений, так и режим без размышлений с помощью шаблонов подсказок. Она расширяет базовую модель DeepSeek-V3 двухэтапным процессом обучения на длинных контекстах, достигая до 128K токенов, и использует масштабирование FP8 для эффективного вывода. Пользователи могут управлять поведением рассуждений с помощью логического значения reasoning enabled. Подробнее в нашей документации Модель улучшает использование инструментов, генерацию кода и эффективность рассуждений, достигая производительности, сравнимой с DeepSeek-R1 на сложных бенчмарках, при этом отвечая быстрее. Она поддерживает структурированные вызовы инструментов, кодовых агентов и поисковых агентов, что делает её подходящей для исследовательских, кодовых и агентных сценариев. Она является преемником модели DeepSeek V3-0324 и хорошо справляется с разнообразными задачами.
z-ai/glm-4.5v
GLM-4.5V — это фундаментальная модель зрения и языка для мультимодальных агентных приложений. Построенная на архитектуре Mixture-of-Experts (MoE) с 106B параметрами и 12B активируемыми параметрами, она достигает передовых результатов в понимании видео, ответах на вопросы по изображениям, OCR и разборе документов, со значительными улучшениями во фронтенд-веб-кодинге, grounding и пространственном мышлении. Она предлагает гибридный режим инференса: «режим мышления» для глубокого рассуждения и «режим без мышления» для быстрых ответов. Поведение рассуждения можно переключать через логическое значение reasoning enabled. Узнайте больше в нашей документации
openai/gpt-oss-120b
gpt-oss-120b — это модель языка с открытым весом, на 117B параметров, архитектуры Mixture-of-Experts (MoE) от OpenAI, предназначенная для производственных сценариев с высокими требованиями к рассуждению, агентных и универсальных задач. Она активирует 5.1B параметров за прямой проход и оптимизирована для работы на одном H100 GPU с нативной квантизацией MXFP4. Модель поддерживает настраиваемую глубину рассуждений, полный доступ к цепочке рассуждений и нативное использование инструментов, включая вызов функций, просмотр веб-страниц и генерацию структурированных выходных данных.
openai/gpt-oss-20b
gpt-oss-20b — это модель с открытыми весами, выпущенная OpenAI с 21B параметрами под лицензией Apache 2.0. В ней используется архитектура смеси экспертов (MoE) с 3.6B активными параметрами на прямой проход, что обеспечивает более низкую задержку вывода и возможность развертывания на потребительском или однопроцессорном оборудовании GPU. Модель обучается в формате ответов Harmony от OpenAI и поддерживает настройку уровня рассуждений, дообучение, а также агентные возможности, включая вызов функций, использование инструментов и структурированные выходные данные.
qwen/qwen3-coder-30b-a3b-instruct
Qwen3-Coder-30B-A3B-Instruct — это модель смеси экспертов (MoE) с параметрами 30.5B, содержащая 128 экспертов (8 активны на каждом прямом проходе), предназначенная для продвинутой генерации кода, понимания на уровне репозитория и агентного использования инструментов. Построенная на архитектуре Qwen3, она поддерживает нативную длину контекста в 256K токенов (расширяемую до 1M с помощью Yarn) и показывает высокие результаты в задачах, включающих вызовы функций, использование браузера и структурированное завершение кода. Эта модель оптимизирована для следования инструкциям без «режима размышлений» и хорошо интегрируется с форматами использования инструментов, совместимыми с OpenAI.
z-ai/glm-4.5-air
GLM-4.5-Air — это облегченная версия нашей последней серии флагманских моделей, специально созданная для агентных приложений. Как и GLM-4.5, она использует архитектуру «смесь экспертов» (MoE), но с более компактным размером параметров. GLM-4.5-Air также поддерживает гибридные режимы вывода, предлагая «режим мышления» для сложных рассуждений и использования инструментов, а также «режим без мышления» для взаимодействия в реальном времени. Пользователи могут управлять поведением рассуждений с помощью логического параметра reasoning enabled. Подробнее в нашей документации
qwen/qwen3-235b-a22b-thinking-2507
Qwen3-235B-A22B-Thinking-2507 — это высокопроизводительная открытая языковая модель архитектуры Mixture-of-Experts (MoE), оптимизированная для сложных задач рассуждения. Она активирует 22B из своих 235B параметров за один прямой проход и изначально поддерживает до 262,144 токенов контекста. Этот вариант «только для размышлений» улучшает структурированные логические рассуждения, математику, естественные науки и длительную генерацию текста, демонстрируя сильные результаты в бенчмарках AIME, SuperGPQA, LiveCodeBench и MMLU-Redux. Модель принудительно использует специальный режим рассуждения (response) и предназначена для генерации большого количества токенов (до 81,920 токенов) в сложных областях. Модель дообучена на инструкциях и превосходно справляется с пошаговыми рассуждениями, использованием инструментов, агентными сценариями работы и многоязычными задачами. Этот релиз представляет собой самую производительную открытую версию в серии Qwen3-235B, превосходящую многие закрытые модели в сценариях структурированных рассуждений.
qwen/qwen3-coder
Qwen3-Coder-480B-A35B-Instruct — это модель генерации кода, основанная на архитектуре смеси экспертов (MoE), разработанная командой Qwen. Она оптимизирована для агентных задач кодирования, таких как вызов функций, использование инструментов и длинноконтекстное рассуждение по репозиториям. Модель имеет 480 миллиардов параметров, из которых 35 миллиардов активны во время каждого прямого прохода (8 из 160 экспертов). Цены на конечные точки Alibaba варьируются в зависимости от длины контекста. Если длина запроса превышает 128k входных токенов, применяется более высокая цена.
qwen/qwen3-235b-a22b-2507
Qwen3-235B-A22B-Instruct-2507 — это многоязычная языковая модель, настроенная на инструкции и основанная на архитектуре смеси экспертов Qwen3-235B, с 22B активными параметрами за один прямой проход. Она оптимизирована для генерации текста общего назначения, включая следование инструкциям, логические рассуждения, математику, код и использование инструментов. Модель поддерживает нативную длину контекста 262K и не реализует «режим мышления» (блоки thinking). По сравнению с базовой версией, эта версия обеспечивает значительные улучшения в охвате знаний, рассуждениях на длинном контексте, бенчмарках программирования и согласованности с открытыми задачами. Она особенно сильна в многоязычном понимании, математических рассуждениях (например, AIME, HMMT) и оценках согласованности, таких как Arena-Hard и WritingBench.
moonshotai/kimi-k2
Kimi K2 Instruct — это большая масштабируемая языковая модель на основе смеси экспертов (MoE), разработанная компанией Moonshot AI, с общим количеством параметров в 1 триллиона, из которых 32 миллиардов активны при каждом прямом проходе. Она оптимизирована для агентных возможностей, включая продвинутое использование инструментов, рассуждение и генерацию кода. Kimi K2 превосходит широкий круг бенчмарков, особенно в задачах программирования (LiveCodeBench, SWE-bench), рассуждения (ZebraLogic, GPQA) и использования инструментов (Tau2, AceBench). Она поддерживает инференс с длинным контекстом до 128K токенов и спроектирована с новым тренировочным стеком, включающим оптимизатор MuonClip для стабильного крупномасштабного обучения MoE.
baidu/ernie-4.5-vl-424b-a47b
ERNIE-4.5-VL-424B-A47B — это мультимодальная модель с архитектурой «смесь экспертов» (MoE) из серии ERNIE 4.5 от Baidu, имеющая 424B всего параметров и 47B активных на каждый токен. Модель обучается совместно на текстовых и графических данных с использованием гетерогенной архитектуры MoE и изолированной маршрутизации по модальностям, что обеспечивает высокоточные межмодальные рассуждения, понимание изображений и генерацию длинного контекста (до 131k токенов). Благодаря тонкой настройке с такими методами, как SFT, DPO, UPO и RLVR, модель поддерживает как режимы «размышления», так и режимы без размышлений. Предназначенная для задач зрения и языка на английском и китайском, модель оптимизирована для эффективного масштабирования и может работать с квантованием в 4-бит и 8-бит.
minimax/minimax-m1
MiniMax-M1 — это крупномасштабная модель с открытым весом, предназначенная для рассуждений, оптимизированная для длинного контекста и эффективного вывода. Она использует гибридную архитектуру смеси экспертов (MoE) в сочетании с пользовательским механизмом «молниеносного внимания», позволяющим обрабатывать длинные последовательности — до 1 миллионов токенов — при сохранении конкурентоспособной эффективности FLOP. При общем количестве 456 миллиардов параметров и 45.9B активных параметров на токен этот вариант оптимизирован для сложных многошаговых задач рассуждения. Обученная с помощью пользовательского конвейера обучения с подкреплением (CISPO), модель M1 превосходно справляется с пониманием длинного контекста, разработкой программного обеспечения, автономным использованием инструментов и математическими рассуждениями. Бенчмарки демонстрируют высокую производительность в задачах FullStackBench, SWE-bench, MATH, GPQA и TAU-Bench, часто превосходя другие открытые модели, такие как DeepSeek R1 и Qwen3-235B.
deepseek/deepseek-r1-0528
28-е обновление к оригиналу DeepSeek R1 — производительность на уровне OpenAI o1, но с открытым исходным кодом и полностью открытыми токенами рассуждения. Размер модели — 671B параметров, при этом в ходе инференса активно задействовано 37B. Полностью открытая модель.
meta-llama/llama-4-maverick
Llama 4 Maverick 17B Instruct (128E) — это высокопроизводительная мультимодальная языковая модель от Meta, построенная на архитектуре смеси экспертов (MoE) с 128 экспертами и 17 миллиардами активных параметров на один прямой проход (всего 400B). Она поддерживает многоязычный текстовый и графический ввод и создаёт многоязычный текст и код на 12 поддерживаемых языках. Оптимизированная для задач зрения и языка, Maverick доработана с помощью инструкций для поведения, подобного ассистенту, логических рассуждений над изображениями и универсального мультимодального взаимодействия. Maverick отличается ранним слиянием для нативной мультимодальности и контекстным окном на 1 миллионов токенов. Модель обучалась на тщательно подобранной смеси публичных, лицензированных и данных платформы Meta, охватывающей примерно 22 триллионов токенов, с датой отсечения знаний — август 2024. Выпущенная в апреле 5, 2025 под лицензией сообщества Llama 4, Maverick подходит для исследовательских и коммерческих приложений, требующих продвинутого мультимодального понимания и высокой пропускной способности модели.
meta-llama/llama-4-scout
Llama 4 Scout 17B Instruct (16E) — это языковая модель со смешанной экспертной архитектурой (MoE), разработанная компанией Meta, которая активирует 17 миллиарда параметров из общего числа 109B. Модель поддерживает нативный мультимодальный ввод (текст и изображения) и многоязычный вывод (текст и код) на 12 поддерживаемых языках. Созданная для ассистентского взаимодействия и визуального рассуждения, Scout использует 16 экспертов за один прямой проход и имеет длину контекста в 10 миллиона токенов, с обучающим корпусом объёмом около 40 триллионов токенов. Разработанная для высокой эффективности и локального или коммерческого развёртывания, Llama 4 Scout включает раннее слияние для бесшовной интеграции модальностей. Модель дообучена на инструкциях для использования в многоязычных чатах, генерации подписей и задачах понимания изображений. Выпущена под лицензией Llama 4 Community License, модель последний раз обучалась на данных, актуальных по август 2024, и была публично запущена в апреле 5, 2025.
google/gemma-3-27b-it
Gemma 3 вводит мультимодальность, поддерживая визуально-языковой ввод и текстовые выводы. Он обрабатывает контекстные окна до 128k токенов, понимает более 140 языков и предлагает улучшенные возможности в области математики, рассуждений и чата, включая структурированные выводы и вызовы функций. Gemma 3 27B — это последняя модель с открытым исходным кодом от Google, преемница Gemma 2
deepseek/deepseek-r1-distill-llama-70b
DeepSeek R1 Distill Llama 70B — это дистиллированная большая языковая модель, основанная на Llama-3.3-70B-Instruct и использующая выходные данные DeepSeek R1. Модель объединяет передовые методы дистилляции для достижения высокой производительности по множеству бенчмарков, включая: AIME 2024 pass@1: 70.0 MATH-500 pass@1: 94.5 CodeForces Rating: 1633 Модель использует точную настройку на выходных данных DeepSeek R1, что обеспечивает конкурентоспособную производительность, сравнимую с более крупными передовыми моделями.
deepseek/deepseek-r1
DeepSeek R1 на месте: производительность на уровне OpenAI o1, но с открытым исходным кодом и полностью открытыми токенами рассуждений. Размер — 671B параметров, из которых 37B активны во время прохода вывода. Полностью открытая модель и технический отчет. Лицензия MIT: свободно дистиллируйте и коммерциализируйте!
meta-llama/llama-3.3-70b-instruct
Многоязычная большая языковая модель Meta Llama 3.3 (LLM) — это предобученная и инструкционно настроенная генеративная модель в 70B (текст на входе/текст на выходе). Модель Llama 3.3, инструкционно настроенная и работающая только с текстом, оптимизирована для многоязычных диалоговых сценариев и превосходит многие доступные открытые и закрытые чат-модели на распространённых отраслевых бенчмарках. Поддерживаемые языки: английский, немецкий, французский, итальянский, португальский, хинди, испанский и тайский. Model Card
qwen/qwen-2.5-72b-instruct
Qwen2.5 72B — последняя серия больших языковых моделей Qwen. Qwen2.5 обеспечивает следующие улучшения по сравнению с Qwen2: Значительно больше знаний и улучшенные возможности в программировании и математике благодаря нашим специализированным моделям в этих областях. Значительные улучшения в следовании инструкциям, генерации длинных текстов (более 8K токенов), понимании структурированных данных (например, таблиц) и создании структурированных результатов, особенно JSON. Повышенная устойчивость к разнообразию системных промптов, улучшение реализации ролевых сценариев и условий для чат-ботов. Поддержка длинного контекста до 128K токенов и возможность генерации до 8K токенов. Многоязычная поддержка более 29 языков, включая китайский, английский, французский, испанский, португальский, немецкий, итальянский, русский, японский, корейский, вьетнамский, тайский, арабский и другие. Использование этой модели регулируется условиями Tongyi Qianwen LICENSE AGREEMENT.
sao10k/l3.1-euryale-70b
Euryale L3.1 70B v2.2 — это модель, ориентированная на творческую ролевую игру от Sao10k. Она является преемником Euryale L3 70B v2.1.
sao10k/l3-lunaris-8b
Lunaris 8B — это универсальная модель для ролевых игр, основанная на Llama 3. Она представляет собой стратегическое объединение нескольких моделей, созданное для баланса между креативностью и улучшенной логикой. Созданная Sao10k, эта модель нацелена на улучшение опыта по сравнению со Stheno v3.2, с повышенной креативностью и логическим мышлением. Для наилучших результатов используйте шаблон контекста инструкций Llama 3, температуру 1.4 и min_p 0.1.
meta-llama/llama-3.1-8b-instruct
Последний класс моделей Meta (Llama 3.1) был выпущен в различных размерах и вариантах. Эта версия 8B, настроенная по инструкциям, быстрая и эффективная. Она продемонстрировала высокую производительность по сравнению с ведущими закрытыми моделями в оценках людьми. Чтобы узнать больше о выпуске модели, нажмите здесь. Использование этой модели регулируется Политикой допустимого использования Meta.
mistralai/mistral-nemo
Модель с параметрами 12B и длиной контекста 128k токенов, созданная Mistral в сотрудничестве с NVIDIA. Модель является многоязычной и поддерживает английский, французский, немецкий, испанский, итальянский, португальский, китайский, японский, корейский, арабский и хинди. Она поддерживает вызов функций и выпущена под лицензией Apache 2.0.
microsoft/wizardlm-2-8x22b
WizardLM-2 8x22B — самая продвинутая модель Microsoft AI. Она демонстрирует высокую конкурентоспособность по сравнению с ведущими проприетарными моделями и стабильно превосходит все существующие открытые модели. Это инструктивная тонкая настройка Mixtral 8x22B. Подробнее о выпуске модели читайте здесь. moe