DeepInfra
DeepInfra обслуживает эти модели как инфраструктурный провайдер. Авторы моделей указаны отдельно в списке.
99
моделей в каталоге
Модели на хостинге DeepInfra
В списке показаны только включённые модели из публичного каталога GoRouter.
z-ai/glm-5.3-flash
GLM-5.3-Flash — это нативная мультимодальная модель от Z.ai. Она подходит для эффективного программирования и долгосрочных агентных задач. Её гибридная архитектура разрежённого и линейного внимания сохраняет точное поведение при работе с длинным контекстом, одновременно снижая вычислительные накладные расходы.
z-ai/glm-5.3
GLM-5.3 — это крупномасштабная модель рассуждения от Z.ai, созданная для сложной разработки программного обеспечения и долгосрочных агентных задач. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и превосходит GLM-5.2 в кодировании, а также в балансе между производительностью и эффективностью использования токенов. Рассуждение всегда включено и не может быть отключено. Поддерживаются уровни усилий рассуждения low, high и max; по умолчанию используется max.
nvidia/nemotron-3.5-asr-streaming-multilingual-0.6b
Nemotron 3.5 ASR Streaming Multilingual 0.6B — это модель распознавания речи от NVIDIA. Её архитектура FastConformer-RNNT, учитывающая промпты и кэш, нацелена на транскрипцию с низкой задержкой более чем на 40 языках для субтитров в реальном времени, голосовых агентов и конвейеров многоязычной транскрипции.
mistralai/voxtral-small-24b-2507-stt
Voxtral Small 24B 2507 STT — это модель транскрипции речи от Mistral AI. Она подходит для задач транскрипции, перевода и понимания аудио, которым выгодна её большая ёмкость модели.
mistralai/voxtral-mini-3b-2507
Voxtral Mini 3B 2507 — это модель для распознавания речи и аудио от Mistral AI. Она подходит для задач транскрипции, перевода и компактной обработки аудио.
qwen/qwen3-asr-1.7b
Qwen3 ASR 1.7B — это модель автоматического распознавания речи от Qwen. Она поддерживает многоязычную идентификацию языка и транскрипцию для 30 языков и 22 китайских диалектов, с потоковым и автономным выводом, а также временными метками на уровне сегментов и слов.
qwen/qwen3-asr-0.6b
Qwen3 ASR 0.6B — это компактная модель автоматического распознавания речи от Qwen. Она поддерживает многоязычную идентификацию языка и транскрипцию на 30 языках и 22 китайских диалектах, с потоковым и офлайн-инференсом, а также таймстампами на уровне сегментов и слов.
qwen/qwen3.8-2.4t-a95b
Qwen3.8 2.4T A95B — это открытая по весам разреженная модель смеси экспертов от Qwen и открытая по весам версия Qwen3.8 Max, с 95 миллиардами активных параметров из 2.4 триллионов всего. Она подходит для программирования, исследований, сложных рассуждений и агентных рабочих процессов.
deepseek/deepseek-v4-pro-0813
DeepSeek V4 Pro 0813 — это крупномасштабная модель смеси экспертов от DeepSeek. Это GA-й выпуск DeepSeek V4 Pro.
nvidia/nemotron-3.5-lightning
NVIDIA Nemotron 3.5 Lightning — открытая модель смеси экспертов от NVIDIA, с 3B активными параметрами из 30B общих. Она подходит для высоконагруженных агентных рабочих нагрузок и специализированных задач, которым выгодна настройка под конкретную предметную область.
meta/muse-glimmer-30b
Muse Glimmer 30B — это плотная мультимодальная модель с открытыми весами от Meta Superintelligence Labs, дистиллированная из Muse Spark и оптимизированная для автономных агентов на потребительском оборудовании. Она подходит для долгосрочных агентных и программных рабочих процессов, обеспечивая многошаговые рассуждения, надёжное использование инструментов, восстановление после сбоев, понимание изображений и многоязычную поддержку более чем 100 языков.
deepseek/deepseek-v4-flash-0731
DeepSeek V4 Flash 0731 — это разреженная модель смеси экспертов от DeepSeek, с 13B активными параметрами из 284B общих. Эта переобученная версия подходит для задач кодирования, рассуждений и агентных рабочих процессов. Это GA-релиз DeepSeek V4 Flash.
thinkingmachines/inkling-small
Inkling Small — это открытая мультимодальная модель смеси экспертов с открытыми весами от лаборатории Thinking Machines, с 12B активными параметрами из 276B общих. Она позиционируется как меньший и более эффективный представитель семейства Inkling и подходит для рассуждений, программирования, агентных рабочих процессов, генерации с дополнением на основе поиска, следования инструкциям и многоязычного общения.
inclusionai/ling-3.0-flash
Ling-3.0-flash — это модель со смесью экспертов (MoE) с 124B параметрами, при этом на каждый токен активируется примерно 5.1B параметров. Модель разработана с приоритетом эффективности использования токенов и продакшн-масштабного агентного инференса, что позволяет разработчикам выполнять больше полезной работы в рамках ограниченных бюджетов на токены, задержку и стоимость обслуживания.
thinkingmachines/inkling
Inkling — это мультимодальная модель со смесью экспертов и открытыми весами от лаборатории Thinking Machines, с 41B активными параметрами из 975B общих. Она предназначена для универсальных рассуждений, написания кода, использования в агентных системах и инструментальных средах, дополнения с检索-усиленной генерацией, следования инструкциям, а также для многоязычных диалоговых сценариев. Встроенное понимание изображений и звука позволяет модели обрабатывать мультимодальные данные наряду с текстом.
moonshotai/kimi-k3
Kimi K3 — это мультимодальная модель рассуждений с открытыми весами на 2.8T параметров от Moonshot AI. Она подходит для сложного программирования, работы со знаниями и длительных агентных сценариев, а особенно сильна в навигации по крупным репозиториям, использовании инструментов, отладке и итеративной работе с изображениями, логами, тестами и обратной связью от выполнения. В её архитектуре используются KDA и Attention Residuals для вычислительной эффективности.
tencent/hy3
Hy3 — это модель смеси экспертов (Mixture-of-Experts) с 295B параметрами от Tencent (активно 21B, 192 экспертов с маршрутизацией top-8), предназначенная для рассуждений, агентных рабочих процессов и реального производственного использования. Она поддерживает настраиваемое усилие рассуждения: по умолчанию — прямой режим без размышлений, а также режимы цепочки рассуждений с низким и высоким уровнем для сложных задач по математике, программированию и многошаговых проблем. С контекстным окном 256K, Hy3 нацелена на задачи с длинным горизонтом, включая улучшенное разрешение кореферентности, отслеживание ограничений в многоходовых диалогах и стабильный вызов инструментов, который обобщается на различные агентные каркасы. Tencent позиционирует её как надёжный и экономически эффективный вариант для программирования, обработки документов, финансового анализа, разработки игр и дизайна фронтенда, с сильным акцентом на обоснованное поведение, препятствующее галлюцинациям: модель отвечает, когда есть основание, и сигнализирует об отсутствии доказательств, а не выдумывает.
z-ai/glm-5.2
GLM 5.2 — это крупномасштабная модель рассуждения от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и подходит для долгосрочных агентных рабочих процессов, разработки программного обеспечения на уровне проектов и сложной многоэтапной автоматизации. Поддерживаются уровни усилий рассуждения high и xhigh; xhigh соответствует максимальному уровню рассуждения. Модель особенно сильна в написании кода и использовании инструментов в длительных задачах, способна сохранять инженерный контекст и последовательно следовать стандартам на протяжении всего цикла разработки — от требований до развертывания на нескольких платформах — в рамках одной задачи.
moonshotai/kimi-k2.7-code
MoonshotAI: Kimi K2.7 Code — это модель, ориентированная на программирование, из семейства Kimi K2 от Moonshot AI, созданная для надёжного выполнения комплексных задач программирования в условиях длинных контекстов. Она использует нативную мультимодальную архитектуру смеси экспертов, которая принимает текст и изображения на входе, и всегда работает в режиме мышления, сохраняя полное содержимое рассуждений при многоходовых диалогах. С контекстным окном в 256K токенов модель нацелена на долгосрочное программирование, декомпозицию агентских задач и многоходовые диалоги. Модель активирует 32B параметров из примерно 1T общих.
nvidia/nemotron-3-ultra-550b-a55b
NVIDIA Nemotron 3 Ultra — открытая модель фронтьерного рассуждения и оркестрации от NVIDIA, с 55B активными параметрами из 550B общих (MoE). Построенная на гибридной архитектуре Transformer-Mamba смеси экспертов, она поддерживает ввод и вывод текста с окном контекста до 1M токенов. Она подходит для длительных агентных рабочих процессов, включая оркестрацию агентов, агентов программирования, глубокие исследования и сложные корпоративные задачи. Модель особенно сильна в многошаговом рассуждении и планировании, с высокопроизводительным инференсом, разработанным для высокообъёмных агентных конвейеров. Она является частью семейства открытых моделей NVIDIA Nemotron для агентных AI.
minimax/minimax-m3
MiniMax-M3 — это мультимодальная фундаментальная модель от MiniMax. Она поддерживает ввод текста, изображений и видео с выводом текста, имеет контекстное окно в 1M токенов и предназначена для длительных агентных задач, программирования и использования инструментов. Модель построена на основе MiniMax Sparse Attention (MSA), которая заменяет полное внимание на KV-block-выборку, сокращая вычислительные затраты на токен при длинном контексте — примерно на 1/20 по сравнению с предыдущим поколением при 1M токенах, обеспечивая значительно более быструю предварительную обработку и декодирование без потери качества на большинстве задач. Обученная как нативная мультимодальная модель на перемежённых данных и оптимизированная для многоходового, производственно-ориентированного взаимодействия через интерактивный симулятор пользователя, модель ориентирована на длительные, многошаговые задачи, а не на одноразовое выполнение.
stepfun/step-3.7-flash
Step 3.7 Flash — последняя высокоэффективная мультимодальная модель архитектуры Mixture-of-Experts от StepFun. Она объединяет языковую основу с 196B параметрами и визуальный энкодер для нативного понимания изображений и видео, активируя примерно 11B параметров на токен. Модель поддерживает контекстное окно в 256K и предоставляет выбираемые уровни рассуждения (высокий/средний/низкий), позволяя вызывающим сторонам балансировать скорость, стоимость и глубину рассуждений. Разработана для написания кода, агентных сценариев, структурированных выходных данных и задач продуктивности с длинным контекстом.
openai/whisper-large-v3
Whisper Large V3 — это открытая модель автоматического распознавания речи от OpenAI, которая обеспечивает как транскрибацию аудио, так и перевод. Она поддерживает 99+ языков и принимает распространённые аудиоформаты, включая mp3, mp4, wav, webm, flac и ogg. С 1,550M параметрами модель достигает показателя ошибок в 10.3% слов и хорошо подходит для помехоустойчивой многоязычной транскрибации в сложных условиях. Поддерживается детализация временных меток на уровне слов и сегментов.
openai/whisper-large-v3-turbo
Whisper Large V3 Turbo — это оптимизированная версия модели распознавания речи OpenAI's Whisper Large V3, разработанная для скорости и экономической эффективности. Она поддерживает транскрипцию на 99+ языках с коэффициентом ошибок в словах 12% и принимает распространённые аудиоформаты, включая mp3, mp4, wav, webm, flac и ogg. Достигает коэффициентов реального времени до 216x, что делает её хорошо подходящей для задач транскрипции, чувствительных к задержке и с высокой пропускной способностью.
qwen/qwen3.6-35b-a3b
Qwen3.6-35B-A3B — это мультимодальная модель с открытыми весами от Alibaba Cloud с 35 миллиардами параметров суммарно и 3 миллиардами активных параметров на токен. Она использует гибридную разреженную архитектуру смеси экспертов, сочетающую гейтированное линейное внимание DeltaNet со стандартными гейтированными слоями внимания, что обеспечивает эффективный инференс за небольшую долю вычислительных затрат. Модель поддерживает нативное окно контекста на 262K токенов (расширяемое до 1M с помощью YaRN) и принимает текстовые, графические и видеовходные данные. В неё встроен режим размышления с сохранением следов рассуждений в многоходовых беседах, вызов функций и структурированный вывод. Модель выпущена под лицензией Apache 2.0.
qwen/qwen3.6-27b
Qwen3.6 27B — это плотная языковая модель с 27 миллиардами параметров от команды Qwen в Alibaba, выпущенная в апреле 2026. Она обладает гибридными мультимодальными возможностями — принимает текстовые, графические и видео входные данные — и поддерживает контекстное окно на 262,144 токенов. Модель предназначена для агентных задач кодирования и рассуждений, с особой силой в понимании кода на уровне репозитория, рабочих процессах фронтенд-разработки и многошаговом решении проблем. Она включает встроенный режим мышления для расширенного рассуждения и сохраняет контекст мышления в истории разговора. Qwen3.6 27B поддерживает 201 языков и диалектов и выпущена под лицензией Apache 2.0.
deepseek/deepseek-v4-pro
DeepSeek V4 Pro — это крупномасштабная модель смеси экспертов от DeepSeek с общим количеством параметров 1.6T и активными параметрами 49B, поддерживающая контекстное окно в 1M токенов. Модель предназначена для сложных задач рассуждения, программирования и длительных агентных сценариев, демонстрируя высокую производительность в области знаний, математики и программной инженерии. Основанная на той же архитектуре, что и DeepSeek V4 Flash, она использует гибридную систему внимания для эффективной обработки длинных контекстов. Поддерживаются уровни рассуждения high и xhigh; xhigh соответствует максимальному режиму рассуждения. Модель хорошо подходит для ресурсоёмких задач, таких как анализ всего кодового репозитория, многошаговая автоматизация и крупномасштабный синтез информации, где критически важны как производительность, так и эффективность.
deepseek/deepseek-v4-flash
DeepSeek V4 Flash — это оптимизированная по эффективности модель Mixture-of-Experts от DeepSeek с 284B общим количеством параметров и 13B активируемых параметров, поддерживающая контекстное окно в 1M токенов. Она предназначена для быстрого вывода и высокопроизводительных рабочих нагрузок, сохраняя при этом высокую производительность в рассуждениях и написании кода. Модель включает гибридное внимание для эффективной обработки длинного контекста. Поддерживаются режимы рассуждений high и xhigh; xhigh соответствует максимальному режиму рассуждений. Она хорошо подходит для таких приложений, как ассистенты программирования, чат-системы и агентные рабочие процессы, где важны отзывчивость и экономическая эффективность.
canopylabs/orpheus-3b-0.1-ft
Orpheus 3B — это англоязычная модель синтеза речи от Canopy Labs, тонко настроенная для естественной просодии и выразительного озвучивания. Она предлагает 7 предустановленных голосов и подходит для озвучивания повествований, голосовых ассистентов и интерактивных приложений, где приоритетом является естественность речи.
sesame/csm-1b
CSM 1B — это разговорная речевая модель от Sesame. Она принимает текстовый ввод и генерирует англоязычную речь, с вариантами голоса, охватывающими разговорный и чтение-речевой стили. При 1B параметрах она подходит для приложений, ориентированных на диалог, таких как голосовые ассистенты и интерактивные агенты.
hexgrad/kokoro-82m
Kokoro 82M — это легковесная модель синтеза речи с открытыми весами от hexgrad. Она преобразует текст в речь на 8 языках (американский и британский английский, испанский, французский, хинди, итальянский, японский, португальский и китайский) с использованием 54 предустановленных голосов, сгруппированных по языку и полу. При 82M параметрах она хорошо подходит для многоязычных TTS развертываний, где важны компактность и эффективность затрат.
xiaomi/mimo-v2.5-pro
MiMo-V2.5-Pro — флагманская модель Xiaomi, обеспечивающая высокую производительность в общих агентных возможностях, сложной программной инженерии и задачах с длинным горизонтом планирования, занимая верхние строчки в бенчмарках, таких как ClawEval, GDPVal и SWE-bench Pro. Модель способна независимо и автономно выполнять профессиональные задачи, на которые у экспертов-людей ушли бы дни или недели, задействуя более тысячи вызовов инструментов. Длина контекста до 1M делает её хорошо подходящей для интеграции с широким спектром агентных фреймворков.
xiaomi/mimo-v2.5
MiMo-V2.5 — это нативная омнимодальная модель от Xiaomi. Она обеспечивает производительность агентного уровня Pro примерно при вдвое меньших затратах на инференс, превосходя MiMo-V2-Omni в мультимодальном восприятии при решении задач понимания изображений и видео. Её контекстное окно 1M поддерживает полные документы, протяжённые диалоги и сложные контексты задач за один проход, что делает её идеальной для интеграции с агентными фреймворками, где важны сильные рассуждения, богатое восприятие и экономическая эффективность.
moonshotai/kimi-k2.6
Kimi K2.6 — это мультимодальная модель следующего поколения от Moonshot AI, предназначенная для долгосрочного программирования, генерации UI/UX на основе кода и мультиагентной оркестрации. Она справляется со сложными сквозными задачами программирования на Python, Rust и Go, а также может преобразовывать промпты и визуальные входные данные в готовые к эксплуатации интерфейсы. Её архитектура роя агентов масштабируется до сотен параллельных субагентов для автономной декомпозиции задач — создавая документы, веб-сайты и электронные таблицы за один запуск без участия человека.
z-ai/glm-5.1
GLM-5.1 обеспечивает значительный скачок в возможностях программирования, особенно заметный при работе с долгосрочными задачами. В отличие от предыдущих моделей, ориентированных на взаимодействие в масштабе минут, GLM-5.1 может работать независимо и непрерывно над одной задачей в течение более чем 8 часов, автономно планируя, выполняя и улучшая себя в процессе, в конечном итоге предоставляя полные результаты инженерного уровня.
google/gemma-4-26b-a4b-it
Gemma 4 26B A4B IT — это модель Mixture-of-Experts (MoE) с инструкционной настройкой от Google DeepMind. Несмотря на 25.2B общих параметров, во время инференса активируется только 3.8B на токен, что обеспечивает качество, близкое к -31B, при доле вычислительных затрат. Поддерживает мультимодальный ввод, включая текст, изображения и видео (до 60 секунд при 1fps). Имеет контекстное окно в 256K токенов, встроенный вызов функций, настраиваемый режим мышления/рассуждения и поддержку структурированного вывода. Выпущена под лицензией Apache 2.0.
google/gemma-4-31b-it
Gemma 4 31B Instruct — это 30.7B плотная мультимодальная модель Google DeepMind, поддерживающая ввод текста и изображений с выводом текста. Она имеет контекстное окно размером 256K токенов, настраиваемый режим мышления/рассуждений, встроенный вызов функций и многоязычную поддержку для 140+ языков. Сильна в задачах программирования, рассуждений и понимания документов. Лицензия Apache 2.0.
minimax/minimax-m2.7
MiniMax-M2.7 — это большая языковая модель нового поколения, предназначенная для автономной продуктивности в реальных условиях и постоянного совершенствования. Созданная для активного участия в собственной эволюции, M2.7 интегрирует передовые агентные возможности благодаря мультиагентному взаимодействию, что позволяет ей планировать, выполнять и уточнять сложные задачи в динамических средах. Обученная для работы на производственном уровне, M2.7 справляется с такими задачами, как живая отладка, анализ первопричин, финансовое моделирование и полная генерация документов в Word, Excel и PowerPoint. Она показывает высокие результаты на тестах, включая 56.2% на SWE-Pro и 57.0% на Terminal Bench 2, а также достигает 1495 ELO на GDPval-AA, устанавливая новый стандарт для мультиагентных систем, работающих в реальных цифровых процессах.
nvidia/nemotron-3-super-120b-a12b
NVIDIA Nemotron 3 Super — это открытая гибридная модель MoE с параметрами 120B, активирующая всего 12B параметров для максимальной вычислительной эффективности и точности в сложных мультиагентных приложениях. Построенная на гибридной архитектуре Mamba-Transformer Mixture-of-Experts с многотокенным предсказанием (MTP), она обеспечивает более чем 50% более высокую генерацию токенов по сравнению с ведущими открытыми моделями. Модель имеет контекстное окно в 1M токенов для долгосрочной когерентности агента, междокументного рассуждения и многошагового планирования задач. Латентный MoE позволяет вызывать 4 экспертов по стоимости вывода только одного, улучшая интеллект и обобщение. Многосредовое обучение RL на 10+ средах обеспечивает ведущую точность на бенчмарках, включая AIME 2025, TerminalBench и SWE-Bench Verified. Полностью открытая с весами, наборами данных и рецептами под открытой лицензией NVIDIA, Nemotron 3 Super позволяет легко настраивать и безопасно развертывать где угодно — от рабочей станции до облака.
qwen/qwen3.5-9b
Qwen3.5-9B — это мультимодальная фундаментальная модель из семейства Qwen3.5, разработанная для обеспечения сильных рассуждений, программирования и визуального понимания в эффективной архитектуре с 9B параметрами. Она использует унифицированный дизайн «зрение-язык» с ранним слиянием мультимодальных токенов, что позволяет модели обрабатывать и рассуждать над текстом и изображениями в одном контексте.
qwen/qwen3.5-35b-a3b
Серия Qwen3.5 35B-A3B представляет собой нативную визуально-языковую модель, разработанную с гибридной архитектурой, которая объединяет механизмы линейного внимания и разреженную модель смеси экспертов, обеспечивая более высокую эффективность вывода. Её общая производительность сопоставима с производительностью Qwen3.5-27B.
qwen/qwen3.5-27b
Модель Qwen3.5 27B, основанная на плотном vision-language подходе, использует механизм линейного внимания, обеспечивая быструю реакцию при сохранении баланса между скоростью вывода и производительностью. Её общие возможности сопоставимы с характеристиками Qwen3.5-122B-A10B.
qwen/qwen3.5-122b-a10b
Нативная визуально-языковая модель Qwen3.5 122B-A10B построена на гибридной архитектуре, которая объединяет механизм линейного внимания с разреженной моделью смеси экспертов, обеспечивая более высокую эффективность инференса. По общей производительности эта модель уступает только Qwen3.5-397B-A17B. Её текстовые возможности значительно превосходят возможности Qwen3-235B-2507, а визуальные возможности превосходят Qwen3-VL-235B.
qwen/qwen3.5-397b-a17b
Серия Qwen3.5 (397B–A17B) — это нативная модель «Vision-Language», построенная на гибридной архитектуре, которая объединяет механизм линейного внимания с разреженной моделью «смесь экспертов», что обеспечивает более высокую эффективность вывода. Она демонстрирует производительность, сопоставимую с ведущими современными моделями, в широком спектре задач: понимание языка, логические рассуждения, генерация кода, агентные сценарии, понимание изображений и видео, а также взаимодействие с графическими интерфейсами (GUI). Благодаря развитым возможностям генерации кода и агентному подходу модель показывает высокую обобщающую способность в разнообразных прикладных областях.
z-ai/glm-5
GLM-5 — это флагманская open-source базовая модель Z.ai, разработанная для проектирования сложных систем и долгосрочных агентных рабочих процессов. Созданная для опытных разработчиков, она обеспечивает производительность производственного уровня при решении крупномасштабных задач программирования, конкурируя с ведущими закрытыми моделями. Благодаря продвинутому агентному планированию, глубоким внутренним рассуждениям и итеративной самокоррекции GLM-5 выходит за рамки генерации кода, обеспечивая построение целых систем и автономное выполнение.
moonshotai/kimi-k2.5
Kimi K2.5 — это нативная мультимодальная модель Moonshot AI, обеспечивающая передовые возможности визуального кодирования и самодостаточную парадигму роя агентов. Построенная на базе Kimi K2 с продолженным предобучением на примерно 15T смешанных визуальных и текстовых токенах, она демонстрирует высокую производительность в общем рассуждении, визуальном кодировании и агентном вызове инструментов.
z-ai/glm-4.7-flash
Являясь моделью класса 30B-SOTA, GLM-4.7-Flash предлагает новый вариант, который балансирует производительность и эффективность. Она дополнительно оптимизирована для агентских сценариев использования в кодинге, усиливая возможности программирования, планирования долгосрочных задач и взаимодействия с инструментами, и достигла ведущих показателей среди open-source моделей того же размера в нескольких актуальных публичных рейтингах бенчмарков.
z-ai/glm-4.7
GLM-4.7 — это последняя флагманская модель Z.ai, с улучшениями в двух ключевых областях: расширенные возможности программирования и более стабильное многошаговое рассуждение/исполнение. Она демонстрирует значительные улучшения в выполнении сложных агентных задач, обеспечивая при этом более естественное общение и превосходную эстетику интерфейса.
nvidia/nemotron-3-nano-30b-a3b
NVIDIA Nemotron 3 Nano 30B A3B — это небольшая языковая MoE модель с наивысшей вычислительной эффективностью и точностью для разработчиков, создающих специализированные агентные AI системы. Модель полностью открыта: открытые веса, наборы данных и рецепты позволяют разработчикам легко настраивать, оптимизировать и разворачивать модель на своей инфраструктуре для максимальной конфиденциальности и безопасности.
deepseek/deepseek-v3.2
DeepSeek-V3.2 — это большая языковая модель, предназначенная для гармоничного сочетания высокой вычислительной эффективности с сильными возможностями рассуждения и использования инструментов. Она внедряет DeepSeek Разреженное Внимание (DSA), механизм мелкозернистого разреженного внимания, который снижает затраты на обучение и вывод, сохраняя при этом качество в сценариях с длинным контекстом. Масштабируемая структура обучения с подкреплением дополнительно улучшает её, обеспечивая производительность в классе GPT-5 и демонстрируя результаты уровня золотой медали на 2025 IMO и IOI. V3.2 также использует крупномасштабный конвейер синтеза задач агентного типа, чтобы лучше интегрировать рассуждения в сценарии использования инструментов, повышая соответствие и обобщение в интерактивных средах. Пользователи могут управлять поведением рассуждения с помощью reasoning enabled логического параметра. Подробнее в нашей документации
thenlper/gte-base
Модель эмбеддингов gte-base кодирует английские предложения и абзацы в плотное векторное пространство размерности 768, обеспечивая эффективные и действенные семантические вложения, оптимизированные для задач семантического сходства, семантического поиска и кластеризации.
thenlper/gte-large
Модель встраивания gte-large преобразует английские предложения, абзацы и документы средней длины в плотное векторное пространство размерности 1024, обеспечивая высококачественные семантические встраивания, оптимизированные для задач поиска информации, семантического текстового сходства, реранжирования и кластеризации. Обученная с помощью многоэтапного контрастивного обучения на крупном корпусе релевантности, разнообразном по доменам, она обеспечивает отличную производительность в различных случаях использования встраиваний общего назначения.
intfloat/e5-large-v2
Модель эмбеддингов e5-large-v2 отображает английские предложения, абзацы и документы в плотное векторное пространство размерности 1024, обеспечивая высокоточные семантические векторы, оптимизированные для поиска, семантического поиска, реранжирования и задач оценки сходства.
intfloat/e5-base-v2
Модель эмбеддингов e5-base-v2 кодирует английские предложения и абзацы в плотное векторное пространство размерности 768, создавая эффективные и высококачественные семантические эмбеддинги, оптимизированные для таких задач, как семантический поиск, оценка схожести, поиск информации и кластеризация.
intfloat/multilingual-e5-large
Модель вложений multilingual-e5-large кодирует предложения, абзацы и документы на более чем 90 языках в плотное векторное пространство размерности 1024, обеспечивая надежные семантические вложения, оптимизированные для многоязычного поиска, кросс-языкового сходства и поиска по крупномасштабным данным.
sentence-transformers/paraphrase-minilm-l6-v2
Модель эмбеддингов paraphrase-MiniLM-L6-v2 преобразует предложения и короткие абзацы в плотное векторное пространство размерности 384, создавая высококачественные семантические эмбеддинги, оптимизированные для определения парафраз, оценки семантической схожести, кластеризации и облегченных задач поиска.
sentence-transformers/all-minilm-l12-v2
Модель эмбеддингов all-MiniLM-L12-v2 отображает предложения и короткие абзацы в плотное векторное пространство размерности 384, создавая эффективные и высококачественные семантические эмбеддинги, оптимизированные для таких задач, как семантический поиск, кластеризация и оценка сходства.
baai/bge-base-en-v1.5
Модель эмбеддингов bge-base-en-v1.5 преобразует английские предложения и абзацы в плотные векторы размерности 768, обеспечивая эффективные и качественные семантические эмбеддинги, оптимизированные для задач поиска, семантического поиска и сопоставления документов. Эта версия (v1.5) отличается улучшенным распределением оценки сходства и более высокой производительностью поиска из коробки.
sentence-transformers/multi-qa-mpnet-base-dot-v1
Модель эмбеддингов multi-qa-mpnet-base-dot-v1 преобразует предложения и короткие абзацы в плотное векторное пространство размерности 768, создавая высококачественные семантические эмбеддинги, оптимизированные для поиска по вопросам и ответам, семантического поиска и оценки сходства разнообразного контента.
baai/bge-large-en-v1.5
Модель вложений bge-large-en-v1.5 сопоставляет английские предложения, абзацы и документы с плотным векторным пространством размерности 1024, выдавая высокоточные семантические вложения, оптимизированные для семантического поиска, поиска документов и последующих задач NLP на английском языке.
baai/bge-m3
Модель эмбеддингов bge-m3 кодирует предложения, абзацы и длинные документы в плотное векторное пространство размерностью 1024, обеспечивая высококачественные семантические эмбеддинги, оптимизированные для многоязычного поиска, семантического поиска и приложений с большим контекстом.
sentence-transformers/all-mpnet-base-v2
Модель эмбеддингов all-mpnet-base-v2 кодирует предложения и короткие абзацы в плотное векторное пространство размерности 768, обеспечивая высококачественные семантические эмбеддинги, хорошо подходящие для таких задач, как информационный поиск, кластеризация, оценка схожести и ранжирование текстов.
sentence-transformers/all-minilm-l6-v2
Модель эмбеддингов all-MiniLM-L6-v2 преобразует предложения и короткие абзацы в плотное векторное пространство размерности 384, обеспечивая высококачественные семантические представления, идеально подходящие для таких задач, как поиск информации, кластеризация, оценка сходства и ранжирование текстов.
qwen/qwen3-embedding-8b
Серия моделей Qwen3 Embedding — это новейшая проприетарная модель семейства Qwen, специально предназначенная для задач текстовых эмбеддингов и ранжирования. Эта серия наследует исключительные многоязычные способности, понимание длинных текстов и навыки рассуждения своей базовой модели. Серия Qwen3 Embedding представляет собой значительный прогресс в нескольких задачах текстовых эмбеддингов и ранжирования, включая поиск текста, поиск кода, классификацию текста, кластеризацию текста и извлечение двуязычных параллелей.
qwen/qwen3-embedding-4b
Серия моделей Qwen3 Embedding является последней проприетарной моделью семейства Qwen, специально разработанной для задач эмбеддинга текста и ранжирования. Эта серия наследует исключительные многоязычные возможности, понимание длинных текстов и навыки рассуждения своей базовой модели. Серия Qwen3 Embedding представляет значительные достижения в различных задачах эмбеддинга текста и ранжирования, включая поиск текста, поиск кода, классификацию текста, кластеризацию текста и извлечение двуязычных данных.
qwen/qwen3-vl-30b-a3b-instruct
Qwen3-VL-30B-A3B-Instruct — это мультимодальная модель, которая объединяет сильную генерацию текста с визуальным пониманием изображений и видео. Её вариант Instruct оптимизирует следование инструкциям для общих мультимодальных задач. Она превосходно справляется с восприятием реальных/синтетических категорий, пространственной привязкой в 2D/3D и длинным визуальным пониманием, достигая конкурентоспособных результатов в мультимодальных бенчмарках. Для агентного использования она обрабатывает многораундовые инструкции с несколькими изображениями, выравнивание временной шкалы видео, автоматизацию GUI и визуальное кодирование от эскизов до отлаженного UI. Текстовая производительность соответствует флагманским моделям Qwen3, что подходит для AI документов, OCR, UI-помощи, пространственных задач и агентных исследований.
z-ai/glm-4.6
По сравнению с GLM-4.5, это поколение включает несколько ключевых улучшений: Более длинное контекстное окно: размер контекстного окна был расширен с 128K до 200K токенов, что позволяет модели справляться с более сложными агентными задачами. Превосходная производительность в кодировании: модель достигает более высоких результатов в бенчмарках для кода и демонстрирует лучшую реальную производительность в таких приложениях, как Claude Code, Cline, Roo Code и Kilo Code, включая улучшения в генерации визуально отполированных фронтенд-страниц. Продвинутые рассуждения: GLM-4.6 демонстрирует явное улучшение в способности к рассуждениям и поддерживает использование инструментов во время вывода, что приводит к более сильной общей функциональности. Более способные агенты: GLM-4.6 показывает более высокую производительность в агентах, использующих инструменты и поиск, и более эффективно интегрируется в агентные фреймворки. Улучшенный стиль письма: лучше соответствует человеческим предпочтениям в стиле и читабельности, а также ведёт себя более естественно в сценариях ролевых игр.
qwen/qwen3-vl-235b-a22b-instruct
Qwen3-VL-235B-A22B Instruct — это мультимодальная модель с открытыми весами, объединяющая сильную генерацию текста с визуальным пониманием изображений и видео. Модель Instruct ориентирована на универсальные сценарии применения в области зрения и языка (VQA, разбор документов, извлечение данных из диаграмм и таблиц, многоязычный OCR). Серия подчеркивает надежное восприятие (распознавание разнообразных реальных и синтетических категорий), пространственное понимание (2D/3D-grounding) и длительное визуальное понимание, демонстрируя конкурентоспособные результаты на публичных мультимодальных бенчмарках как по восприятию, так и по рассуждению. Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: модель может следовать сложным инструкциям в многоизображных и многоходовых диалогах; согласовывать текст с видеошкалой времени для точных временных запросов; а также управлять элементами GUI для задач автоматизации. Модели также обеспечивают рабочие процессы визуального кодирования — превращая эскизы или макеты в код и помогая с отладкой UI — сохраняя при этом высокую производительность при работе только с текстом, сопоставимую с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL пригодными для производственных сценариев, охватывающих AI документов, многоязычный OCR, помощь в разработке ПО/UI, пространственные/воплощенные задачи и исследования агентов на основе зрения и языка.
qwen/qwen3-next-80b-a3b-instruct
Qwen3-Next-80B-A3B-Instruct — это инструктивно-настроенная чат-модель из серии Qwen3-Next, оптимизированная для быстрых и стабильных ответов без следов «размышлений». Она нацелена на сложные задачи, включая рассуждение, генерацию кода, знания QA и многоязычное использование, оставаясь при этом устойчивой к согласованию и форматированию. По сравнению с предыдущими инструктивными вариантами Qwen3, она фокусируется на более высокой пропускной способности и стабильности на сверхдлинных входах и многоходовых диалогах, что делает её хорошо подходящей для RAG, использования инструментов и агентных рабочих процессов, требующих последовательных финальных ответов, а не видимой цепочки рассуждений. Модель использует эффективное с точки зрения масштабирования обучение и декодирование для улучшения эффективности параметров и скорости инференса, и была проверена на широком наборе публичных бенчмарков, где она достигает или приближается к более крупным системам Qwen3 в нескольких категориях, превосходя при этом более ранние модели среднего размера. Её лучше всего использовать как универсального ассистента, помощника по коду и решателя задач с длинным контекстом в производственных средах, где предпочтительны детерминированные выводы, следующие инструкциям.
deepseek/deepseek-chat-v3.1
DeepSeek-V3.1 — это крупная гибридная модель рассуждений (671B параметров, 37B активных), поддерживающая как режим размышлений, так и режим без размышлений с помощью шаблонов подсказок. Она расширяет базовую модель DeepSeek-V3 двухэтапным процессом обучения на длинных контекстах, достигая до 128K токенов, и использует масштабирование FP8 для эффективного вывода. Пользователи могут управлять поведением рассуждений с помощью логического значения reasoning enabled. Подробнее в нашей документации Модель улучшает использование инструментов, генерацию кода и эффективность рассуждений, достигая производительности, сравнимой с DeepSeek-R1 на сложных бенчмарках, при этом отвечая быстрее. Она поддерживает структурированные вызовы инструментов, кодовых агентов и поисковых агентов, что делает её подходящей для исследовательских, кодовых и агентных сценариев. Она является преемником модели DeepSeek V3-0324 и хорошо справляется с разнообразными задачами.
openai/gpt-oss-120b
gpt-oss-120b — это модель языка с открытым весом, на 117B параметров, архитектуры Mixture-of-Experts (MoE) от OpenAI, предназначенная для производственных сценариев с высокими требованиями к рассуждению, агентных и универсальных задач. Она активирует 5.1B параметров за прямой проход и оптимизирована для работы на одном H100 GPU с нативной квантизацией MXFP4. Модель поддерживает настраиваемую глубину рассуждений, полный доступ к цепочке рассуждений и нативное использование инструментов, включая вызов функций, просмотр веб-страниц и генерацию структурированных выходных данных.
openai/gpt-oss-20b
gpt-oss-20b — это модель с открытыми весами, выпущенная OpenAI с 21B параметрами под лицензией Apache 2.0. В ней используется архитектура смеси экспертов (MoE) с 3.6B активными параметрами на прямой проход, что обеспечивает более низкую задержку вывода и возможность развертывания на потребительском или однопроцессорном оборудовании GPU. Модель обучается в формате ответов Harmony от OpenAI и поддерживает настройку уровня рассуждений, дообучение, а также агентные возможности, включая вызов функций, использование инструментов и структурированные выходные данные.
qwen/qwen3-coder
Qwen3-Coder-480B-A35B-Instruct — это модель генерации кода, основанная на архитектуре смеси экспертов (MoE), разработанная командой Qwen. Она оптимизирована для агентных задач кодирования, таких как вызов функций, использование инструментов и длинноконтекстное рассуждение по репозиториям. Модель имеет 480 миллиардов параметров, из которых 35 миллиардов активны во время каждого прямого прохода (8 из 160 экспертов). Цены на конечные точки Alibaba варьируются в зависимости от длины контекста. Если длина запроса превышает 128k входных токенов, применяется более высокая цена.
qwen/qwen3-235b-a22b-2507
Qwen3-235B-A22B-Instruct-2507 — это многоязычная языковая модель, настроенная на инструкции и основанная на архитектуре смеси экспертов Qwen3-235B, с 22B активными параметрами за один прямой проход. Она оптимизирована для генерации текста общего назначения, включая следование инструкциям, логические рассуждения, математику, код и использование инструментов. Модель поддерживает нативную длину контекста 262K и не реализует «режим мышления» (блоки thinking). По сравнению с базовой версией, эта версия обеспечивает значительные улучшения в охвате знаний, рассуждениях на длинном контексте, бенчмарках программирования и согласованности с открытыми задачами. Она особенно сильна в многоязычном понимании, математических рассуждениях (например, AIME, HMMT) и оценках согласованности, таких как Arena-Hard и WritingBench.
mistralai/mistral-small-3.2-24b-instruct
Mistral-Small-3.2-24B-Instruct-2506 — это обновленная модель с 24B параметрами от Mistral, оптимизированная для следования инструкциям, снижения повторений и улучшенного вызова функций. По сравнению с релизом 3.1, версия 3.2 значительно улучшает точность на WildBench и Arena Hard, сокращает бесконечные генерации и обеспечивает прирост в использовании инструментов и задачах со структурированным выводом. Он поддерживает ввод изображений и текста со структурированными выводами, вызов функций/инструментов, а также высокую производительность в области программирования (HumanEval+, MBPP), STEM (MMLU, MATH, GPQA) и бенчмарках компьютерного зрения (ChartQA, DocVQA).
deepseek/deepseek-r1-0528
28-е обновление к оригиналу DeepSeek R1 — производительность на уровне OpenAI o1, но с открытым исходным кодом и полностью открытыми токенами рассуждения. Размер модели — 671B параметров, при этом в ходе инференса активно задействовано 37B. Полностью открытая модель.
meta-llama/llama-guard-4-12b
Llama Guard 4 — это мультимодальная предобученная модель, полученная на основе Llama 4 Scout, доработанная для классификации безопасности контента. Как и предыдущие версии, она может использоваться для классификации контента как во входных данных LLM (классификация промптов), так и в ответах LLM (классификация ответов). Она действует как LLM, генерируя в выходных данных текст, указывающий, является ли данный промпт или ответ безопасным или небезопасным, а если небезопасным, то также перечисляет категории контента, которые были нарушены. Llama Guard 4 была согласована для защиты от стандартизированной таксономии опасностей MLCommons и разработана для поддержки мультимодальных возможностей Llama 4. В частности, она объединяет функции предыдущих моделей Llama Guard, обеспечивая модерацию контента на английском и нескольких поддерживаемых языках, а также расширенные возможности для обработки смешанных текстово-изображенческих промптов, включая несколько изображений. Кроме того, Llama Guard 4 интегрирована в API модерации Llama API, расширяя надежную классификацию безопасности на текст и изображения.
qwen/qwen3-30b-a3b
Qwen3, новейшее поколение в серии больших языковых моделей Qwen, отличается как плотной, так и смешанной архитектурой экспертов (MoE), что позволяет достигать выдающихся результатов в рассуждениях, многоязычной поддержке и продвинутых агентных задачах. Его уникальная способность плавно переключаться между режимом мышления для сложных рассуждений и режимом без мышления для эффективного диалога обеспечивает универсальную высококачественную производительность. Значительно превосходя предыдущие модели, такие как QwQ и Qwen2.5, Qwen3 обеспечивает превосходные возможности в математике, программировании, здравом смысле, творческом письме и интерактивном диалоге. Вариант Qwen3-30B-A3B включает 30.5 миллиардов параметров (3.3 миллиардов активируется), 48 слоёв, 128 экспертов (8 активируется для каждой задачи) и поддерживает контексты до 131K токенов с YaRN, устанавливая новый стандарт среди моделей с открытым исходным кодом.
qwen/qwen3-14b
Qwen3-14B — это плотная языковая модель с 14.8B параметрами из серии Qwen3, предназначенная как для сложных рассуждений, так и для эффективного диалога. Она поддерживает плавное переключение между режимом «размышления» для задач, требующих математики, программирования и логических выводов, и режимом «без размышлений» для обычного общения. Модель доработана для следования инструкциям, использования инструментов агентами, творческого письма и многоязычных задач на 100+ языках и диалектах. Она изначально поддерживает контекст до 32K токенов и может быть расширена до 131K токенов с помощью масштабирования на основе YaRN.
qwen/qwen3-32b
Qwen3-32B — это плотная 32.8B-параметрическая каузальная языковая модель из серии Qwen3, оптимизированная как для сложных рассуждений, так и для эффективного диалога. Она поддерживает плавное переключение между режимом «размышления» для задач математики, программирования и логического вывода, а также режимом «без размышлений» для более быстрых общих бесед. Модель демонстрирует высокую производительность в следовании инструкциям, использовании агентских инструментов, творческом написании и многоязычных задачах на более чем 100 языках и диалектах. Она изначально работает с контекстами до 32K токенов и может быть расширена до 131K токенов с помощью масштабирования на основе YaRN.
meta-llama/llama-4-maverick
Llama 4 Maverick 17B Instruct (128E) — это высокопроизводительная мультимодальная языковая модель от Meta, построенная на архитектуре смеси экспертов (MoE) с 128 экспертами и 17 миллиардами активных параметров на один прямой проход (всего 400B). Она поддерживает многоязычный текстовый и графический ввод и создаёт многоязычный текст и код на 12 поддерживаемых языках. Оптимизированная для задач зрения и языка, Maverick доработана с помощью инструкций для поведения, подобного ассистенту, логических рассуждений над изображениями и универсального мультимодального взаимодействия. Maverick отличается ранним слиянием для нативной мультимодальности и контекстным окном на 1 миллионов токенов. Модель обучалась на тщательно подобранной смеси публичных, лицензированных и данных платформы Meta, охватывающей примерно 22 триллионов токенов, с датой отсечения знаний — август 2024. Выпущенная в апреле 5, 2025 под лицензией сообщества Llama 4, Maverick подходит для исследовательских и коммерческих приложений, требующих продвинутого мультимодального понимания и высокой пропускной способности модели.
meta-llama/llama-4-scout
Llama 4 Scout 17B Instruct (16E) — это языковая модель со смешанной экспертной архитектурой (MoE), разработанная компанией Meta, которая активирует 17 миллиарда параметров из общего числа 109B. Модель поддерживает нативный мультимодальный ввод (текст и изображения) и многоязычный вывод (текст и код) на 12 поддерживаемых языках. Созданная для ассистентского взаимодействия и визуального рассуждения, Scout использует 16 экспертов за один прямой проход и имеет длину контекста в 10 миллиона токенов, с обучающим корпусом объёмом около 40 триллионов токенов. Разработанная для высокой эффективности и локального или коммерческого развёртывания, Llama 4 Scout включает раннее слияние для бесшовной интеграции модальностей. Модель дообучена на инструкциях для использования в многоязычных чатах, генерации подписей и задачах понимания изображений. Выпущена под лицензией Llama 4 Community License, модель последний раз обучалась на данных, актуальных по август 2024, и была публично запущена в апреле 5, 2025.
deepseek/deepseek-chat-v3-0324
DeepSeek V3, модель со смешанными экспертами с 685B параметрами, является новейшей итерацией флагманского семейства чат-моделей команды DeepSeek. Она приходит на смену модели DeepSeek V3 и отлично справляется с самыми разными задачами.
google/gemma-3-4b-it
Gemma 3 вводит мультимодальность, поддерживая ввод вида «изображение-текст» и вывод текста. Он обрабатывает контекстные окна до 128k токенов, понимает более 140 языков и предлагает улучшенные возможности для математики, логических рассуждений и чата, включая структурированные выходные данные и вызов функций.
google/gemma-3-12b-it
Gemma 3 вводит мультимодальность, поддерживая ввод на основе зрения и языка и текстовый вывод. Он обрабатывает контекстные окна до 128k токенов, понимает более 140 языков и предлагает улучшенные возможности для математики, рассуждений и чата, включая структурированные выходные данные и вызовы функций. Gemma 3 12B является второй по величине моделью в семействе Gemma 3 после Gemma 3 27B
google/gemma-3-27b-it
Gemma 3 вводит мультимодальность, поддерживая визуально-языковой ввод и текстовые выводы. Он обрабатывает контекстные окна до 128k токенов, понимает более 140 языков и предлагает улучшенные возможности в области математики, рассуждений и чата, включая структурированные выводы и вызовы функций. Gemma 3 27B — это последняя модель с открытым исходным кодом от Google, преемница Gemma 2
mistralai/mistral-small-24b-instruct-2501
Mistral Small 3 — это языковая модель с 24B параметрами, оптимизированная для низкой задержки при выполнении типовых задач AI. Выпущенная под лицензией Apache 2.0, она включает как предобученную, так и инструктивную версии, предназначенные для эффективного локального развертывания. Модель достигает точности 81% на бенчмарке MMLU и показывает конкурентоспособные результаты по сравнению с более крупными моделями, такими как Llama 3.3 70B и Qwen 32B, работая при этом в три раза быстрее на эквивалентном оборудовании. Прочитайте статью в блоге об этой модели здесь.
microsoft/phi-4
Microsoft Research Phi-4 разработана для достижения высоких результатов в сложных задачах рассуждения и может эффективно работать в условиях ограниченной памяти или когда требуются быстрые ответы. Модель с 14 миллиардами параметров была обучена на смеси высококачественных синтетических наборов данных, данных с курируемых веб-сайтов и академических материалов. Она прошла тщательную доработку, чтобы точно следовать инструкциям и поддерживать высокие стандарты безопасности. Она лучше всего работает с входными данными на английском языке. Для получения дополнительной информации см. Phi-4 Technical Report
deepseek/deepseek-chat
DeepSeek-V3 — новейшая модель команды DeepSeek, развивающая способности предыдущих версий к следованию инструкциям и написанию кода. Предобученная на почти 15 триллионах токенов, модель, согласно опубликованным оценкам, превосходит другие открытые модели и конкурирует с ведущими закрытыми моделями. Подробности о модели см. в репозитории DeepSeek-V3 или в анонсе запуска.
meta-llama/llama-3.3-70b-instruct
Многоязычная большая языковая модель Meta Llama 3.3 (LLM) — это предобученная и инструкционно настроенная генеративная модель в 70B (текст на входе/текст на выходе). Модель Llama 3.3, инструкционно настроенная и работающая только с текстом, оптимизирована для многоязычных диалоговых сценариев и превосходит многие доступные открытые и закрытые чат-модели на распространённых отраслевых бенчмарках. Поддерживаемые языки: английский, немецкий, французский, итальянский, португальский, хинди, испанский и тайский. Model Card
qwen/qwen-2.5-72b-instruct
Qwen2.5 72B — последняя серия больших языковых моделей Qwen. Qwen2.5 обеспечивает следующие улучшения по сравнению с Qwen2: Значительно больше знаний и улучшенные возможности в программировании и математике благодаря нашим специализированным моделям в этих областях. Значительные улучшения в следовании инструкциям, генерации длинных текстов (более 8K токенов), понимании структурированных данных (например, таблиц) и создании структурированных результатов, особенно JSON. Повышенная устойчивость к разнообразию системных промптов, улучшение реализации ролевых сценариев и условий для чат-ботов. Поддержка длинного контекста до 128K токенов и возможность генерации до 8K токенов. Многоязычная поддержка более 29 языков, включая китайский, английский, французский, испанский, португальский, немецкий, итальянский, русский, японский, корейский, вьетнамский, тайский, арабский и другие. Использование этой модели регулируется условиями Tongyi Qianwen LICENSE AGREEMENT.
sao10k/l3.1-euryale-70b
Euryale L3.1 70B v2.2 — это модель, ориентированная на творческую ролевую игру от Sao10k. Она является преемником Euryale L3 70B v2.1.
nousresearch/hermes-3-llama-3.1-70b
Hermes 3 — это универсальная языковая модель со множеством улучшений по сравнению с Hermes 2, включая продвинутые агентные возможности, гораздо лучшее ролевое моделирование, рассуждение, многоходовые диалоги, связность длинного контекста и улучшения во всех областях. Hermes 3 70B — это конкурентоспособная, если не превосходящая тонкая настройка базовой модели Llama-3.1 70B, ориентированная на приведение LLMs в соответствие с пользователем, с мощными возможностями управления и контролем, предоставленным конечному пользователю. Серия Hermes 3 развивает и расширяет набор возможностей Hermes 2, включая более мощные и надёжные вызовы функций и возможности структурированного вывода, универсальные ассистентские возможности и улучшенные навыки генерации кода.
nousresearch/hermes-3-llama-3.1-405b
Hermes 3 представляет собой универсальную языковую модель со множеством улучшений по сравнению с Hermes 2, включая расширенные агентные возможности, значительно лучшее взаимодействие в ролевых сценариях, рассуждение, многоходовые диалоги, связность при длинном контексте и улучшения по всем направлениям. Hermes 3 405B — это модель передового уровня, полная тонкая настройка всех параметров на основе базовой модели Llama-3.1 405B, направленная на приведение LLMs в соответствие с пользователем, с мощными возможностями управления и контролем, предоставляемым конечному пользователю. Серия Hermes 3 развивает и расширяет набор возможностей Hermes 2, включая более мощный и надежный вызов функций и структурированный вывод, универсальные ассистентские возможности и улучшенные навыки генерации кода. Hermes 3 конкурентоспособна, если не превосходит, модели Llama-3.1 Instruct по общим возможностям, с различающимися сильными и слабыми сторонами, присущими обеим.
sao10k/l3-lunaris-8b
Lunaris 8B — это универсальная модель для ролевых игр, основанная на Llama 3. Она представляет собой стратегическое объединение нескольких моделей, созданное для баланса между креативностью и улучшенной логикой. Созданная Sao10k, эта модель нацелена на улучшение опыта по сравнению со Stheno v3.2, с повышенной креативностью и логическим мышлением. Для наилучших результатов используйте шаблон контекста инструкций Llama 3, температуру 1.4 и min_p 0.1.
meta-llama/llama-3.1-70b-instruct
Последняя модель класса Meta (Llama 3.1), выпущенная в нескольких размерах и вариантах. Эта версия, оптимизированная для инструкций 70B, предназначена для высококачественных диалоговых сценариев. Она показала высокую производительность по сравнению с ведущими закрытыми моделями в оценках с участием людей. Чтобы узнать больше о выпуске модели, нажмите здесь. Использование этой модели регулируется Политикой допустимого использования Meta.
meta-llama/llama-3.1-8b-instruct
Последний класс моделей Meta (Llama 3.1) был выпущен в различных размерах и вариантах. Эта версия 8B, настроенная по инструкциям, быстрая и эффективная. Она продемонстрировала высокую производительность по сравнению с ведущими закрытыми моделями в оценках людьми. Чтобы узнать больше о выпуске модели, нажмите здесь. Использование этой модели регулируется Политикой допустимого использования Meta.
mistralai/mistral-nemo
Модель с параметрами 12B и длиной контекста 128k токенов, созданная Mistral в сотрудничестве с NVIDIA. Модель является многоязычной и поддерживает английский, французский, немецкий, испанский, итальянский, португальский, китайский, японский, корейский, арабский и хинди. Она поддерживает вызов функций и выпущена под лицензией Apache 2.0.
gryphe/mythomax-l2-13b
Одна из самых производительных и популярных тонких настроек Llama 2 13B с богатыми описаниями и ролевой игрой. #merge