Sakana AI
Sakana AI обслуживает эти модели как инфраструктурный провайдер. Авторы моделей указаны отдельно в списке.
470
моделей в каталоге
Модели на хостинге Sakana AI
В списке показаны только включённые модели из публичного каталога GoRouter.
google/gemini-3.8-flash
Gemini 3.8 Flash — это самая интеллектуальная модель Flash от Google со значительными улучшениями благодаря 3.7 Flash в разработке ПО, агентных задачах и многошаговых рассуждениях.
minimax/hailuo-3-max
MiniMax H3 Max — это модель генерации видео от MiniMax, выпущенная совместно с fal.ai. Созданная путём дополнительного обучения на основе MiniMax H3, она предназначена для более быстрой генерации видео из текста и из изображения с управляемыми ключевыми кадрами первого или последнего кадра.
anthropic/claude-fable-5.1
Claude Fable 5.1 превосходит Claude Fable 5 по всем направлениям, при этом наибольший прогресс наблюдается в агентном программировании, длительных агентных рабочих процессах и интеллектуальной работе: особенно в длительном рефакторинге кода, генерации front-end и визуального кода, а также в финансовых и аналитических задачах. Он также, как правило, более лаконичен, чем Fable 5, в своих планах и сводках. Мы рекомендуем протестировать его как прямое обновление везде, где вы сегодня используете Fable 5, а также вместе с Opus 5 для задач, требующих сложных рассуждений.
inception/mercury-2.5-preview
Mercury 2.5 — это самая быстрая рассуждающая LLM и новейшая диффузионная LLM (dLLM) от Inception. Вместо последовательной генерации токенов Mercury 2.5 создаёт и уточняет несколько токенов параллельно, достигая 1,107 tokens/sec на стандартном GPUs. Она обеспечивает скачок интеллекта на 10+ пунктов по сравнению с Mercury 2, при этом качество сопоставимо с оптимизированными по стоимости фронтирными моделями, такими как GPT-5, 6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5. Mercury 2.5 поддерживает настраиваемые уровни рассуждений, параллельные вызовы инструментов и вывод JSON, согласованный со схемой. Он создан для производственных нагрузок, где задержка накапливается: поисковые агенты, голосовые конвейеры и кодирующие субагенты.
ibm-granite/granite-4.2-8b
Granite 4.2 8B — это плотная модель рассуждений от IBM. Она подходит для математики, генерации кода, многоязычного диалога и агентных рабочих процессов, требующих многошаговых рассуждений. Она поддерживает режимы полного, низкого усилия и без размышлений. Модель поддерживает 12 языков: английский, немецкий, испанский, французский, японский, португальский, арабский, чешский, итальянский, корейский, нидерландский и китайский.
tencent/hy4-preview
Tencent: Hy4 preview — это модель смеси экспертов от Tencent, с 49B активными параметрами из 770B общих. Она предназначена для агентов кодирования, сложных рабочих процессов с использованием инструментов и задач производительности, которые требуют планирования, непрерывности контекста и устойчивого многошагового выполнения.
alibaba/wan-3.0-prime
Wan 3.0 Prime — это быстрый вариант Wan 3.0 от Alibaba. Поддерживает генерацию видео из текста и из первого кадра изображения.
~z-ai/glm-flash-latest
Эта модель всегда перенаправляет на последнюю модель в семействе GLM Flash.
qwen/qwen3.8-flash
Qwen3.8 Flash — это мультимодальная модель рассуждений от Alibaba. Она подходит для помощи в написании кода, агентных рабочих процессов, визуального понимания, анализа документов и кодовой базы, взаимодействия с рабочим столом, анализа графиков и анализа длинных видео.
meta/muse-image
Muse Image — это агентная модель генерации изображений от Meta, которая создаёт и редактирует изображения по тексту и референсным изображениям. В отличие от однопроходных моделей изображений, она рассуждает перед рендерингом, разбивая составные запросы и уточняя свой результат в цепочке рассуждений, а также вызывает веб-поиск для фактической точности по запросам, требующим глубоких знаний. Модель поддерживает генерацию изображений по тексту, точечное редактирование изображений, композицию из нескольких изображений, управление по референсному изображению для согласованности стиля и объекта в серии, а также точный рендеринг текста внутри сгенерированных изображений. Итеративное редактирование работает путём передачи предыдущего выходного изображения обратно с новой инструкцией.
z-ai/glm-5.3-flash
GLM-5.3-Flash — это нативная мультимодальная модель от Z.ai. Она подходит для эффективного программирования и долгосрочных агентных задач. Её гибридная архитектура разрежённого и линейного внимания сохраняет точное поведение при работе с длинным контекстом, одновременно снижая вычислительные накладные расходы.
recraft/recraft-v4-styles-pro
Recraft V4 Styles Pro — это модель генерации изображений с согласованным стилем от Recraft. Каждый запрос требует по крайней мере одно референсное изображение стиля и создаёт новое изображение, которое воспроизводит технику рендеринга, цвет, текстуру и композицию референса, а не редактирует его. Модель создаёт растровые изображения с разрешением примерно 2K. Примечание: от 1 до 10 референсных изображений в формате PNG, JPG или WEBP, каждое размером не менее 256 px по короткой стороне. Цена состоит из двух частей: $0.10 за изображение плюс одноразовая плата $0.005 за создание стиля для каждого запроса, независимо от того, сколько изображений возвращает этот запрос. Запрос с одним изображением стоит $0.105, а запрос с шестью изображениями — $0.605.
recraft/recraft-v4-styles-vector
Recraft V4 Styles Vector — это модель генерации изображений с единым стилем от Recraft. Каждый запрос требует как минимум одно референсное изображение стиля и генерирует новое изображение, которое воспроизводит технику рендеринга, цвет, текстуру и композицию референса, а не редактирует его. Она обеспечивает вывод SVG для графики, которой нужно чисто масштабироваться. Примечание: от 1 до 10 референсных изображений в форматах PNG, JPG или WEBP, каждое не менее 256 пикселей по короткой стороне. Цена состоит из двух частей: $0.05 за изображение плюс разовый сбор $0.005 за создание стиля на каждый запрос, независимо от того, сколько изображений возвращает этот запрос. Запрос одного изображения стоит $0.055, а запрос шести изображений — $0.305.
recraft/recraft-v4-styles-pro-vector
Recraft V4 Styles Pro Vector — это модель генерации изображений с сохранением стиля от Recraft. Каждый запрос требует как минимум одно референсное изображение стиля и создаёт новое изображение, воспроизводящее технику рендеринга, цвет, текстуру и композицию референса, а не редактирующее его. Она выдаёт результат в формате SVG для графики, которая должна масштабироваться без потери качества. Примечание: 1–10 референсных изображений в форматах PNG, JPG или WEBP, каждое размером не менее 256 px по короткой стороне. Ценообразование состоит из двух частей: $0.12 за изображение плюс разовый сбор в размере $0.005 за создание стиля на каждый запрос, независимо от количества изображений, возвращаемых этим запросом. Запрос на одно изображение стоит $0.125, а запрос на шесть изображений — $0.725.
recraft/recraft-v4-styles
Recraft V4 Styles — это модель генерации изображений с согласованным стилем от Recraft. Каждый запрос требует как минимум одного референсного изображения стиля и генерирует новое изображение, которое воспроизводит технику рендеринга, цвет, текстуру и композицию референса, а не редактирует его. Она создаёт растровые изображения с разрешением примерно 1K. Примечание: от 1 до 10 референсных изображений в PNG, JPG или WEBP, каждое размером не менее 256 пикселей по короткой стороне. Цена состоит из двух частей: $0.035 за изображение плюс разовый сбор $0.005 за создание стиля за запрос, независимо от того, сколько изображений возвращает запрос. Запрос на одно изображение стоит $0.040, а запрос на шесть изображений — $0.215.
alibaba/wan-3.0
Wan 3.0 — это модель генерации видео от Alibaba для генерации видео из текста, изображений и по эталону. Она создаёт видео с разрешением 480p, 720p или 1080p длительностью от 2 до 30 секунд.
heygen/avatar-iv
HeyGen: Avatar IV — это модель преобразования изображения в видео, которая оживляет одно фото, превращая его в выразительное видео с говорящей головой и синхронизацией губ. Вместо простого подбора формы губ под слова, она интерпретирует вокальный тон, ритм и эмоции аудио, чтобы управлять движениями головы, мимикой и жестами, создавая результат с разрешением до 1080p. Озвучка берётся из одного из двух источников: текстовый сценарий, который модель озвучивает с помощью синтеза речи HeyGen, либо предоставленная аудиодорожка, под которую изображение синхронизирует губы напрямую. Сквозные параметры позволяют выбрать голос, настроить параметры голоса, задать выразительность, указать конкретные движения, заменить или удалить фон, добавить субтитры и задать название видео.
meta/muse-spark-1.2-contributor
Muse Spark 1.2 contributor tier — это модель рассуждения от Meta, предназначенная для разработчиков, которые хотят начать создавать приложения с еще более низкими затратами. Она значительно дешевле, чем Muse Spark 1.2. Ваши запросы и результаты могут использоваться для улучшения продуктов Meta, что делает эту модель идеальной для экспериментов, обучения и проектов на ранних стадиях, не беспокоясь о расходах. Это модель рассуждения от Meta, предназначенная для сложных агентных задач. Она принимает текст, изображения, видео, аудио и документы в формате PDF, возвращает текст и предлагает контекстное окно на 1M токенов. Модель создана для поддержки многоагентных рабочих процессов, выступая либо как основной агент, который планирует и распределяет задачи, либо как субагент, выполняющий задачи параллельно. Она работает с различными средами разработки кода и поддерживает структурированный вывод, параллельные вызовы функций и настраиваемое усилие рассуждения. В тестировании Meta модель показывает хорошие результаты при многофайловом рефакторинге, длительных сессиях отладки, генерации целых репозиториев и задачах, выходящих далеко за пределы одного запроса.
deepseek/deepseek-v4-flash-vision-exp
DeepSeek V4 Flash Vision Exp — это экспериментальная версия с поддержкой зрения DeepSeek V4 Flash 0731 от DeepSeek, добавляющая понимание изображений, сохраняя при этом уровень базовой модели в работе с текстом, включая агентные сценарии и рассуждения. Это разреженная модель на основе смеси экспертов с 13B активными параметрами из общего числа 284B. Она подходит для понимания документов и диаграмм, ответов на вопросы по изображениям и мультимодальных агентных рабочих процессов, объединяющих текст и изображения.
tencent/hy-mt2-1.8b
Hy-MT2-1.8B — это компактная 1.8B-параметрическая модель перевода от Tencent. Она поддерживает 33 языковых пар и пять пар китайских диалектов и языков меньшинств, а также рабочие процессы для структурированного перевода, перевода на основе разделителей, контекстного перевода, перевода с использованием глоссария и перевода с управлением стилем.
tencent/hy-mt2-30b-a3b
Hy-MT2-30B-A3B — это флагманская модель перевода Tencent в семействе MT2. Она поддерживает языковые пары 33, а также пять пар китайских диалектов и миноритарных языков, с рабочими процессами для структурированного перевода, перевода на основе разделителей, перевода с использованием глоссариев и стилизованного перевода. В ней используется 3B активных параметров из 30B общего числа.
black-forest-labs/flux-video-upscale
FLUX Video Upscale — это модель масштабирования видео от Black Forest Labs. Она увеличивает одно исходное видео в 1.5× до 3×, сохраняя его длительность, с опциональным промптом и режимами обработки — точным или творческим.
~z-ai/glm-latest
Эта модель всегда перенаправляет на последнюю модель GLM от Z.ai.
tencent/hy-mt2-7b
Hy-MT2-7B — это модель перевода с 7B параметров от Tencent. Она поддерживает 33 языковых пар, а также пять пар для китайских диалектов и языков меньшинств, с рабочими процессами для структурированного, разделительного, контекстного, глоссарного и стилистически управляемого перевода.
z-ai/glm-5.3
GLM-5.3 — это крупномасштабная модель рассуждения от Z.ai, созданная для сложной разработки программного обеспечения и долгосрочных агентных задач. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и превосходит GLM-5.2 в кодировании, а также в балансе между производительностью и эффективностью использования токенов. Рассуждение всегда включено и не может быть отключено. Поддерживаются уровни усилий рассуждения low, high и max; по умолчанию используется max.
qwen/qwen3.8-27b
Qwen3.8 27B — это открытая модель с публичными весами, относящаяся к классу плотных мультимодальных моделей «зрение-язык» от компании Qwen. Она подходит для задач программирования, профессиональных рабочих процессов, исследований, мультимодального взаимодействия и длительных агентских задач, поддерживая гибкий режим рассуждений, который можно включать или отключать.
nvidia/nemotron-3.5-asr-streaming-multilingual-0.6b
Nemotron 3.5 ASR Streaming Multilingual 0.6B — это модель распознавания речи от NVIDIA. Её архитектура FastConformer-RNNT, учитывающая промпты и кэш, нацелена на транскрипцию с низкой задержкой более чем на 40 языках для субтитров в реальном времени, голосовых агентов и конвейеров многоязычной транскрипции.
mistralai/voxtral-small-24b-2507-stt
Voxtral Small 24B 2507 STT — это модель транскрипции речи от Mistral AI. Она подходит для задач транскрипции, перевода и понимания аудио, которым выгодна её большая ёмкость модели.
mistralai/voxtral-mini-3b-2507
Voxtral Mini 3B 2507 — это модель для распознавания речи и аудио от Mistral AI. Она подходит для задач транскрипции, перевода и компактной обработки аудио.
bytedance-seed/seedream-5-0-lite
Seedream 5.0 Lite — это модель генерации изображений от ByteDance Seed. Она подходит для профессионального визуального творчества, которому способствуют веб-подключённый поиск, понимание сложных промптов, визуальные референсы и широкий охват знаний.
google/gemini-3.7-flash
Gemini 3.7 Flash — это мультимодальная модель от Google для быстрых агентных процессов, написания кода и сложных многошаговых рассуждений. Она предназначена для задач, требующих отзывчивой производительности и надёжного многошагового решения проблем.
voyageai/voyage-code-4
voyage-code-4 — это модель встраивания кода от Voyage AI, компании MongoDB. Она предназначена для агентов кодирования и поиска кода, с матрёшечными встраиваниями размерностей 2048, 1024, 512 и 256 и несколькими вариантами квантования. Узнайте больше о voyage-code-4 здесь: blog.voyageai.com/2026/08/13/voyage-code-4
qwen/qwen3-reranker-8b
Qwen3 Reranker 8B — это модель реранжирования текста от Alibaba Cloud, построенная на архитектуре Qwen3. Она оценивает пары запрос-документ, формируя оценки релевантности для использования в пайплайнах поиска и RAG. Поддерживает более 100 языков и языков программирования, а также инструктивное реранжирование, позволяющее настраивать критерии оценки под конкретную задачу. Обеспечивает высокую производительность на мультиязычных бенчмарках, включая MTEB, CMTEB и MMTEB.
qwen/qwen3-asr-1.7b
Qwen3 ASR 1.7B — это модель автоматического распознавания речи от Qwen. Она поддерживает многоязычную идентификацию языка и транскрипцию для 30 языков и 22 китайских диалектов, с потоковым и автономным выводом, а также временными метками на уровне сегментов и слов.
qwen/qwen3-asr-0.6b
Qwen3 ASR 0.6B — это компактная модель автоматического распознавания речи от Qwen. Она поддерживает многоязычную идентификацию языка и транскрипцию на 30 языках и 22 китайских диалектах, с потоковым и офлайн-инференсом, а также таймстампами на уровне сегментов и слов.
bytedance-seed/seedream-5-0-pro
Seedream 5.0 Pro — это модель генерации и редактирования изображений от ByteDance Seed. Она подходит для коммерческих рабочих процессов визуального производства, требующих точного контроля редактирования, реалистичных сцен и естественного рендеринга.
bytedance/seedance-2.0-mini
Seedance 2.0 Mini — это модель генерации видео от ByteDance. Она поддерживает генерацию видео из текста, генерацию видео из изображения с контролем первого и последнего кадра, а также мультимодальную генерацию видео по ссылке с входными данными в виде изображения, видео и аудио. Она поддерживает вывод в разрешении 480p и 720p для видео длительностью 4-15 секунд. Количество токенов вычисляется по формуле: (высота выходного видео ширина выходного видео длительность * 24) / 1024.
bytedance-seed/seed-2-1-turbo
Seed 2.1 Turbo — это мультимодальная модель от ByteDance Seed для кодинга и долгосрочных агентных рабочих процессов. Она подходит для сквозной поставки программного обеспечения, выполнения многошаговых задач и понимания визуального и видеоконтента, с возможностями планирования, отладки и самокоррекции.
qwen/qwen3.8-2.4t-a95b
Qwen3.8 2.4T A95B — это открытая по весам разреженная модель смеси экспертов от Qwen и открытая по весам версия Qwen3.8 Max, с 95 миллиардами активных параметров из 2.4 триллионов всего. Она подходит для программирования, исследований, сложных рассуждений и агентных рабочих процессов.
bytedance-seed/seed-2.0-code
Seed 2.0 Code — это модель от ByteDance Seed, оптимизированная для агентного программирования. Она подходит для разработки фронтенда, многоязычных задач программирования и рабочих процессов с кодинг-агентами в таких инструментах, как Claude Code, Kilo и OpenCode.
deepseek/deepseek-v4-pro-0813
DeepSeek V4 Pro 0813 — это крупномасштабная модель смеси экспертов от DeepSeek. Это GA-й выпуск DeepSeek V4 Pro.
x-ai/grok-4.6
Grok 4.6 — самая умная модель SpaceXAI с передовой производительностью в программировании, работе со знаниями и STEM.
x-ai/grok-imagine-image-2.0
Grok Imagine Image 2.0 — это модель генерации и редактирования изображений от xAI. Она подходит для создания изображений по текстовым запросам и редактирования изображений по референсам, с режимами низкого и среднего качества.
nvidia/nemotron-3.5-lightning
NVIDIA Nemotron 3.5 Lightning — открытая модель смеси экспертов от NVIDIA, с 3B активными параметрами из 30B общих. Она подходит для высоконагруженных агентных рабочих нагрузок и специализированных задач, которым выгодна настройка под конкретную предметную область.
sakana/sakana-namazu
Sakana Namazu — это специализированная для японского языка модель рассуждений от Sakana AI, основанная на Kimi K2.6 с дополнительным обучением для японского языка и бизнес-контекстов. Она подходит для выполнения японских инструкций, делового письма, математики, программирования, исследований и многошаговых агентных рабочих процессов. Sakana AI может использовать входные данные для обучения и улучшения модели по умолчанию, с возможностью отказа в консоли Sakana. Полная обработка в пределах Японии не гарантируется.
upstage/solar-pro4
Solar Pro 4 — это экономичная большая языковая модель от Upstage, с контекстным окном 524K. Она создана для долгосрочных задач и агентных рабочих процессов, с сильными возможностями в офисной продуктивности, работе с документами и программировании.
meta/muse-glimmer-30b
Muse Glimmer 30B — это плотная мультимодальная модель с открытыми весами от Meta Superintelligence Labs, дистиллированная из Muse Spark и оптимизированная для автономных агентов на потребительском оборудовании. Она подходит для долгосрочных агентных и программных рабочих процессов, обеспечивая многошаговые рассуждения, надёжное использование инструментов, восстановление после сбоев, понимание изображений и многоязычную поддержку более чем 100 языков.
bytedance/seedance-2.5
Seedance 2.5 — это модель генерации видео от ByteDance. Она подходит для длительного повествования, мультимодальной генерации на основе референсов, редактирования видео и расширения видео. Поддерживает управление по первому кадру и по первому и последнему кадрам, до 50 изображений, видео и аудио-референсов, необязательное генерируемое аудио и многоязычную аудиовизуальную генерацию.
openai/gpt-transcribe
GPT Transcribe — это высокоточная модель распознавания речи от OpenAI. Она подходит для записанного аудио, транскрипции потоковых файлов и завершённых Realtime-сеансов, с поддержкой контекста в свободной форме, подсказок по ключевым словам и множественных языковых подсказок для специализированных терминов и многоязычной речи.
meta/muse-spark-1.2
Muse Spark 1.2 — это модель рассуждений от Meta, предназначенная для сложных агентных задач. Она принимает текст, изображения, видео, аудио и документы PDF, возвращает текст и предлагает окно контекста на 1M токенов. Модель создана для поддержки мультиагентных рабочих процессов — либо в роли основного агента, который планирует и делегирует, либо в роли субагента, выполняющего задачи параллельно. Она работает в нескольких средах для кодирования и поддерживает структурированный вывод, параллельный вызов функций и настраиваемое усилие рассуждений. В тестировании Meta она хорошо справляется с рефакторингом нескольких файлов, длительными сеансами отладки, генерацией целого репозитория и задачами, выходящими далеко за пределы одного запроса.
qwen/qwen-image-3
Qwen Image 3 — это унифицированная модель генерации и редактирования изображений от Qwen. Она поддерживает точное отображение текста и деталей размером до 10px, а также более богатую базу знаний о мире, чем предыдущие поколения.
qwen/qwen-image-3-pro
Qwen Image 3 Pro — это модель генерации и редактирования изображений от Qwen. Она поддерживает точное отображение текста и деталей размером до 10px, а также обладает более глубокими знаниями о мире по сравнению с предыдущими поколениями.
black-forest-labs/flux-3-video
FLUX.3 Video — это модель генерации видео от Black Forest Labs. Она поддерживает генерацию из текста, создание видео по изображению с начальным и конечным ключевыми кадрами, а также сценарии продолжения видео, что делает её подходящей для контролируемого творческого производства, анимации сцен и расширения существующих клипов. Модель может генерировать синхронизированный звук вместе с видео.
qwen/qwen3.8-max
Qwen3.8 Max — флагманская модель в серии Qwen3.8 от Alibaba, общедоступный преемник предварительной версии Qwen3.8 Max Preview. Это мультимодальная модель рассуждений, предназначенная для сложных рассуждений, визуального понимания, написания кода и агентских рабочих процессов.
~deepseek/deepseek-v4-flash-latest
Эта модель всегда перенаправляет на последнюю модель семейства DeepSeek V4 Flash.
deepseek/deepseek-v4-flash-0731
DeepSeek V4 Flash 0731 — это разреженная модель смеси экспертов от DeepSeek, с 13B активными параметрами из 284B общих. Эта переобученная версия подходит для задач кодирования, рассуждений и агентных рабочих процессов. Это GA-релиз DeepSeek V4 Flash.
thinkingmachines/inkling-small
Inkling Small — это открытая мультимодальная модель смеси экспертов с открытыми весами от лаборатории Thinking Machines, с 12B активными параметрами из 276B общих. Она позиционируется как меньший и более эффективный представитель семейства Inkling и подходит для рассуждений, программирования, агентных рабочих процессов, генерации с дополнением на основе поиска, следования инструкциям и многоязычного общения.
minimax/hailuo-3
MiniMax H3 — это легковесная модель генерации видео с открытыми весами от MiniMax. Она предназначена для точного мультимодального редактирования и управляемой генерации контента, включая редактирование по текстовым инструкциям, отрисовку текста и брендов, а также перенос движения между видео. Модель подходит для коммерческих творческих процессов в рекламе, электронной коммерции, геймдеве и дизайне интерфейсов, обеспечивая нативный аудиовизуальный вывод при генерации на основе референсов.
fish-audio/transcribe-1
Transcribe 1 — это модель преобразования речи в текст от Fish Audio. Она подходит для транскрипции аудио с автоматическим определением языка и может возвращать сегменты с временными метками на уровне слов, если запрошено выравнивание.
fish-audio/s1
S1 — это многоязычная модель синтеза речи от Fish Audio. Она подходит для голосовых приложений, требующих широкой эмоциональной выразительности, с использованием скобочных управляющих элементов для направления стиля речи на поддерживаемых языках.
fish-audio/s2-pro
S2 Pro — это многоязычная модель синтеза речи от Fish Audio. Она подходит для выразительной речи и многоголосых диалогов, с естественными средствами управления стилем произношения и эмоциями.
fish-audio/s2.1-pro
S2.1 Pro — это ориентированная на производство модель преобразования текста в речь от Fish Audio. Она подходит для многоязычных голосовых приложений, выразительного озвучивания и синтеза диалогов, с открытыми управляющими командами на естественном языке для стиля речи и эмоций.
runway/aleph-2
Runway Aleph 2.0 — это модель редактирования видео в контексте от Runway. Она применяет текстовые инструкции и редактирование на основе ключевых кадров к существующему видео, сохраняя детали, которые не должны изменяться. Она подходит для добавления, удаления или замены объектов и предметов, изменения фона или одежды, изменения освещения сцен, изменения погоды или времени суток, изменения стиля видео и расширения кадра до нового соотношения сторон.
runway/gen-4.5
Runway Gen-4.5 — это модель генерации видео от Runway для workflows «текст-в-видео» и «изображение-в-видео». Она предназначена для создания кинематографичных сцен с высоким качеством движения, визуальной точностью и соблюдением запросов. Модель способна координировать сложные последовательности действий, детализированное движение камеры, точный тайминг событий и атмосферные изменения, что делает её подходящей для повествовательных кадров, демонстрации продуктов и управляемой анимации изображений.
qwen/qwen3.7-flash
Qwen3.7 Flash — это модель визуально-языкового рассуждения от Alibaba. Она подходит для мультимодальных агентов, визуального программирования, поиска и компьютерного взаимодействия, с сильными сторонами в распознавании объектов, пространственном понимании и восприятии реального мира.
voyageai/rerank-2.5-lite
rerank-2.5-lite — это реранкер, оптимизированный как по задержке, так и по качеству, обеспечивающий улучшение точности поиска на 7.16% по сравнению с Cohere Rerank v3.5 на 93 наборах данных. Он также превзошёл Cohere Rerank v3.5 на 10.36% в тесте Massive Instructed Retrieval Benchmark (MAIR). Модель поддерживает суммарный контекст длиной до 32K токенов на пару запрос-документ, включая до 8K токенов для запроса, что обеспечивает более точный поиск по более длинным документам. Кроме того, rerank-2.5-lite поддерживает следование инструкциям, позволяя пользователям управлять оценкой релевантности с помощью подсказок на естественном языке. Узнайте больше о rerank-2.5-lite здесь: blog.voyageai.com/2025/08/11/rerank-2-5
voyageai/rerank-2.5
rerank-2.5 — это передовой реранкер, оптимизированный для качества, обеспечивающий улучшение точности поиска на 7.94% по сравнению с Cohere Rerank v3.5 на 93 наборах данных. Он также превзошёл Cohere Rerank v3.5 на 12.70% на Massive Instructed Retrieval Benchmark (MAIR). Модель поддерживает объединённую длину контекста в 32K токенов на пару запрос–документ, включая до 8K токенов для запроса, что обеспечивает более точный поиск по более длинным документам. Кроме того, rerank-2.5 поддерживает следование инструкциям, позволяя пользователям управлять оценкой релевантности с помощью подсказок на естественном языке. Узнайте больше о rerank-2.5 здесь: https://blog.voyageai.com/2025/08/11/rerank-2-5.
voyageai/voyage-multimodal-3.5
voyage-multimodal-3.5 — это современная мультимодальная эмбеддинг-модель, способная векторизовать не только текст, изображения и видео по отдельности, но и контент, в котором все три модальности переплетаются. Она обеспечивает отличную производительность для поиска по смешанным модальностям, включающего текст и визуальный контент, такой как PDF скриншоты, рисунки, таблицы, видео и другое. Благодаря Matryoshka-обучению и обучению с учётом квантования, voyage-multimodal-3.5 поддерживает эмбеддинги размерности 2048, 1024, 512 и 256, с несколькими вариантами квантования. Узнайте больше о voyage-multimodal-3.5 здесь: blog.voyageai.com/2026/01/15/voyage-multimodal-3-5
voyageai/voyage-4-lite
voyage-4-lite — это легковесная универсальная модель для получения эмбеддингов, оптимизированная под низкую задержку и стоимость. Благодаря обучению по методу Матрёшки и обучению с учётом квантования, voyage-4-lite поддерживает эмбеддинги размерностей 2048, 1024, 512 и 256, с несколькими вариантами квантования. Узнайте больше о voyage-4-lite здесь: blog.voyageai.com/2026/01/15/voyage-4
voyageai/voyage-4
voyage-4 — это универсальная (включая многоязычную) модель эмбеддингов, оптимизированная для задач поиска/retrieval и приложений AI. voyage-4 поддерживает эмбеддинги размерностей 2048, 1024, 512 и 256, с несколькими вариантами квантования. Узнайте больше о voyage-4 здесь: blog.voyageai.com/2026/01/15/voyage-4
voyageai/voyage-4-large
Модель voyage-4-large является современной универсальной и многоязычной эмбеддинг-моделью, оптимизированной для качества поиска. Благодаря обучению с использованием Matryoshka-метода и обучению с учётом квантования, voyage-4-large поддерживает эмбеддинги размерности 2048, 1024, 512 и 256, с несколькими вариантами квантования. Узнайте больше о voyage-4-large здесь: blog.voyageai.com/2026/01/15/voyage-4
anthropic/claude-opus-5
Claude Opus 5 — флагманская модель компании Anthropic для сложных задач рассуждения, программирования и длительной агентной работы. Она особенно сильна в сквозных программных задачах, ревью кода и поиске ошибок, визуальном анализе диаграмм и документов, подготовке сложных офисных результатов и координации параллельных субагентов. Модель сохраняет высокое качество следования инструкциям и использования инструментов при выполнении длительных задач, оставаясь эффективной в условиях пониженных вычислительных затрат для рабочих нагрузок, где важны задержка и эффективность использования токенов.
microsoft/mai-image-2.5-pro
MAI-Image-2.5 от Microsoft — это высококачественная модель генерации изображений, доступная через Azure AI Foundry. Она создает фотореалистичные и художественные изображения по текстовым запросам с поддержкой различных соотношений сторон.
microsoft/mai-voice-2-flash
MAI-Voice-2-Flash — это модель преобразования текста в речь с низкой задержкой от Microsoft для голосовых агентов, ассистентов, контакт-центров, озвучивания, доступности и других интерактивных приложений. Она генерирует выразительную монофоническую речь 24 kHz на 15 языках и в 18 локалях с точным контролем тона и подачи. Голосовой промптинг и клонирование требуют доступа, одобренного Microsoft, и соответствующего согласия говорящего.
inclusionai/ling-3.0-flash
Ling-3.0-flash — это модель со смесью экспертов (MoE) с 124B параметрами, при этом на каждый токен активируется примерно 5.1B параметров. Модель разработана с приоритетом эффективности использования токенов и продакшн-масштабного агентного инференса, что позволяет разработчикам выполнять больше полезной работы в рамках ограниченных бюджетов на токены, задержку и стоимость обслуживания.
qwen/qwen-audio-3.0-tts-flash
Qwen-Audio-3.0-TTS Flash — это быстрая и экономичная модель синтеза речи от Alibaba, которая генерирует аудио из текста с помощью речевого синтезатора DashScope API.
qwen/qwen-audio-3.0-tts-plus
Qwen-Audio-3.0-TTS Plus — это модель синтеза речи более высокого качества от Alibaba, которая генерирует звуковую речь из текста через синтезатор речи DashScope API.
x-ai/grok-stt-1.0
Grok STT — это модель преобразования речи в текст от SpaceXAI, доступная через конечную точку REST /v1/stt. Она поддерживает транскрипцию с временными метками на уровне слов, необязательную диаризацию говорящих и многоканальное аудио.
poolside/laguna-s-2.1
Laguna S 2.1 — это новейшая модель кодинг-агента от Poolside. Laguna S 2.1 — это модель с общим количеством параметров 118B и 8B активными параметрами, показавшая результат 70.2% в Terminal-Bench 2.1 и 40.4% в DeepSWE, что делает её одной из самых сильных моделей для кодинга в своей категории. Открытые веса под лицензией OpenMDW-1.1. Laguna S 2.1 предназначена для случаев использования в разработке программного обеспечения и агентном кодинге, и вы несёте ответственность за подтверждение того, что она подходит для вашего предполагаемого применения. Laguna S 2.1 подпадает под действие OpenMDW-1.1 License и должна использоваться в соответствии с Acceptable Use Policy компании Poolside. Мы советуем не обходить защитные меры безопасности Laguna S 2.1, не внедрив по существу эквивалентные меры компенсации, подходящие для вашего случая использования. Пожалуйста, сообщайте об уязвимостях безопасности или проблемах безопасности на security@poolside.ai. Если вы используете Laguna S 2.1 бесплатно, мы можем использовать ваши входные и выходные данные для обучения и улучшения наших моделей.
google/gemini-3.6-flash
Gemini 3.6 Flash — это высокоэффективная модель от Google для программирования, агентных рабочих процессов, а также веб- и прикладной разработки. Она создана для получения аккуратных результатов с меньшим числом лишних правок и меньшей осторожностью в формулировках, при этом снижая расход токенов и количество обращений к модели, необходимых для выполнения задачи.
google/gemini-3.5-flash-lite
Gemini 3.5 Flash Lite — это высокоэффективная модель от Google с улучшенными агентными возможностями. Она подходит для субагентов, выполняющих сфокусированные задачи в сложных мультиагентных рабочих процессах.
krea/krea-2-large
Krea 2 Large — это модель генерации изображений с высокой производительностью от Krea, более чем вдвое превышающая по размеру Krea 2 Medium. Более лёгкая постобработка придаёт изображениям более сырой, фактурный и гибкий характер, что делает её особенно подходящей для фотореализма, выразительных художественных стилей, размытия движения, зернистости и изображений с низким динамическим диапазоном.
krea/krea-2-medium
Krea 2 Medium — это сбалансированная и экономичная модель генерации изображений от Krea, а также практичная отправная точка для широкого круга задач. Её обширное постобучение обеспечивает стабильную и согласованную генерацию, с особыми преимуществами в иллюстрации, аниме, живописи и других выразительных художественных стилях.
krea/krea-2-medium-turbo
Krea 2 Medium Turbo — это дистиллированная, ориентированная на скорость версия модели Krea 2 Medium от Krea. Она создана для быстрой итерации и исследования графического дизайна, где приоритетом является скорость генерации.
meituan/longcat-2.0
LongCat 2.0 — это разреженная модель языка на основе смеси экспертов от Meituan, с 48B активными параметрами из 1.6T общих. Она подходит для написания кода, изменений на уровне репозитория, решения долгосрочных задач и агентных сценариев.
x-ai/grok-imagine-video-1.5
Grok Imagine Video 1.5 — это модель генерации видео от SpaceXAI. Она создаёт видео по текстовым запросам, с возможностью использования стартового изображения для направления сцены. Модель может управлять движением объектов и камеры, темпом, атмосферой и физическим поведением, сохраняя визуальную непрерывность, а также генерировать синхронизированные звуковые эффекты, фоновую атмосферу и диалоги.
thinkingmachines/inkling
Inkling — это мультимодальная модель со смесью экспертов и открытыми весами от лаборатории Thinking Machines, с 41B активными параметрами из 975B общих. Она предназначена для универсальных рассуждений, написания кода, использования в агентных системах и инструментальных средах, дополнения с检索-усиленной генерацией, следования инструкциям, а также для многоязычных диалоговых сценариев. Встроенное понимание изображений и звука позволяет модели обрабатывать мультимодальные данные наряду с текстом.
deepgram/aura-2
Aura-2 — это многоязычная модель преобразования текста в речь от Deepgram. Она поддерживает канонический каталог голосов Aura-2 от Deepgram для синтеза речи на нескольких языках.
moonshotai/kimi-k3
Kimi K3 — это мультимодальная модель рассуждений с открытыми весами на 2.8T параметров от Moonshot AI. Она подходит для сложного программирования, работы со знаниями и длительных агентных сценариев, а особенно сильна в навигации по крупным репозиториям, использовании инструментов, отладке и итеративной работе с изображениями, логами, тестами и обратной связью от выполнения. В её архитектуре используются KDA и Attention Residuals для вычислительной эффективности.
meta/muse-spark-1.1
Muse Spark 1.1 — это мультимодальная модель рассуждения от Meta, созданная для агентных задач. Она принимает текст, изображения, видео, аудио и PDF документы и возвращает текст, с контекстным окном в 1M токенов. Модель предназначена для оркестрации мультиагентных рабочих процессов, выступая либо в роли основного агента, который планирует и делегирует задачи, либо в роли субагента, и без дополнительного обучения обобщается на новые инструменты, MCP серверы и пользовательские навыки. Она поддерживает структурированный вывод, параллельный вызов функций, встроенный поиск с цитированием и настраиваемые усилия при рассуждении. Meta сообщает о высокой производительности в реальных задачах программирования в крупных кодовых базах, сценариях использования компьютера и генерации кода из визуальных данных.
minimax/speech-2.8-hd
MiniMax Speech 2.8 HD — это модель преобразования текста в речь от MiniMax. Она подходит для приложений, которые генерируют аудио из текста и принимают произвольный MiniMax голос IDs.
minimax/speech-2.8-turbo
MiniMax Speech 2.8 Turbo — это модель преобразования текста в речь от MiniMax. Она подходит для приложений, которые генерируют аудио из текста, и принимает произвольный голос MiniMax IDs.
deepgram/nova-3
Deepgram Nova-3 универсальная модель преобразования речи в текст с поддержкой одноязычной и многоязычной транскрипции.
kwaipilot/kat-coder-pro-v2.5
KAT-Coder-Pro V2.5 — это флагманская модель агентного кодирования, которой можно напрямую передать целую задачу или целый бизнес-процесс, позволяя ей автономно находить и вносить изменения и выполнять весь процесс в реальном репозитории. В то же время она бесшовно интегрирует несколько экспертов, чтобы полностью сохранить способность генерации фронтенд-эстетики V2.
openai/gpt-5.6-luna-pro
GPT-5.6 Luna Pro — это та же базовая модель, что и GPT-5.6 Luna, обслуживаемая с параметром reasoning.mode, установленным в значение pro, для получения более качественных ответов на сложных задачах. Подробнее в документации OpenAI: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode
openai/gpt-5.6-luna
GPT-5.6 Luna — это быстрая и экономически эффективная модель в серии OpenAI GPT-5.6. Она подходит для высоконагруженных задач, чувствительных к задержке, таких как чат, классификация и лёгкие агентные рабочие процессы, обеспечивая достойные рассуждения для своего ценового сегмента.
openai/gpt-5.6-terra-pro
GPT-5.6 Terra Pro — это та же базовая модель, что и GPT-5.6 Terra, предоставляемая с reasoning.mode, установленным в pro, для более качественных ответов на сложных задачах. Подробнее в документации OpenAI: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode
openai/gpt-5.6-terra
GPT-5.6 Terra — сбалансированная модель в серии OpenAI GPT-5.6, занимающая позицию между флагманским уровнем Sol и экономичным уровнем Luna. Она подходит для повседневных задач программирования, рассуждений и агентных сценариев, где требуется баланс между производительностью и стоимостью, обеспечивая высокую эффективность примерно вдвое дешевле, чем Sol.
openai/gpt-5.6-sol-pro
GPT-5.6 Sol Pro — это та же базовая модель, что и GPT-5.6 Sol, предоставляемая с параметром reasoning.mode, установленным в pro, для более качественных ответов на сложных задачах. Узнайте больше в документации OpenAI: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode
openai/gpt-5.6-sol
GPT-5.6 Sol — флагманская модель в серии GPT-5.6 от OpenAI. Она подходит для сложных рассуждений, написания кода и агентских рабочих процессов, и особенно сильна в задачах командной строки, многошаговых задачах кодирования и решении задач с длинным горизонтом.
x-ai/grok-4.5
Grok 4.5 — это модель от SpaceXAI с передовой производительностью в программировании, работе со знаниями и STEM.
~x-ai/grok-latest
Эта модель всегда перенаправляет на последнюю модель Grok от xAI.
aion-labs/aion-3.0-mini
Aion-3.0 Mini — это мультимодельная система для ролевых игр и повествования от AionLabs, построенная на семействе моделей DeepSeek. Она использует совместный процесс генерации, в котором несколько специализированных моделей вносят вклад в ответ, обеспечивая более сильную структуру повествования и более убедительные напряжение и конфликт.
aion-labs/aion-3.0
Aion-3.0 — это мультимодельная система ролевых игр и повествования от AionLabs, построенная на семействе моделей GLM. Она использует совместный процесс генерации, в котором несколько специализированных моделей каждая вносят свой вклад в ответ, создавая более сильную повествовательную структуру и более захватывающие напряжение и конфликт.
tencent/hy3
Hy3 — это модель смеси экспертов (Mixture-of-Experts) с 295B параметрами от Tencent (активно 21B, 192 экспертов с маршрутизацией top-8), предназначенная для рассуждений, агентных рабочих процессов и реального производственного использования. Она поддерживает настраиваемое усилие рассуждения: по умолчанию — прямой режим без размышлений, а также режимы цепочки рассуждений с низким и высоким уровнем для сложных задач по математике, программированию и многошаговых проблем. С контекстным окном 256K, Hy3 нацелена на задачи с длинным горизонтом, включая улучшенное разрешение кореферентности, отслеживание ограничений в многоходовых диалогах и стабильный вызов инструментов, который обобщается на различные агентные каркасы. Tencent позиционирует её как надёжный и экономически эффективный вариант для программирования, обработки документов, финансового анализа, разработки игр и дизайна фронтенда, с сильным акцентом на обоснованное поведение, препятствующее галлюцинациям: модель отвечает, когда есть основание, и сигнализирует об отсутствии доказательств, а не выдумывает.
poolside/laguna-xs-2.1
Laguna XS 2.1 — это новейшая модель агента-кодера в категории 33B-A3B от Poolside, представляющая собой шаг вперёд по сравнению с их моделью Laguna XS.2 (выпущенной в апреле 2026). Она сочетает вызов инструментов и возможности рассуждения с компактным размером, предлагая контекстное окно 256K и до 32K выходных токенов. Квантована до FP8 для быстрых и экономичных агентных процессов кодирования. Laguna XS 2.1 предназначена для случаев использования в программной инженерии и агентном кодировании, и вы несёте ответственность за подтверждение того, что она подходит для вашего целевого применения. Laguna XS 2.1 регулируется OpenMDW-1.1 License и должна использоваться в соответствии с Acceptable Use Policy компании Poolside. Мы рекомендуем не обходить защитные механизмы безопасности Laguna XS 2.1 без внедрения существенно эквивалентных мер защиты, соответствующих вашему случаю использования. Пожалуйста, сообщайте об уязвимостях безопасности или проблемах безопасности на security@poolside.ai. Если вы используете Laguna XS 2.1 бесплатно, мы можем использовать ваши входные и выходные данные для обучения и улучшения наших моделей.
anthropic/claude-sonnet-5
Sonnet 5 — это самая мощная модель Anthropic класса Sonnet, с передовой производительностью в программировании, агентных задачах и профессиональной работе. Она поддерживает адаптивное мышление с выбираемым уровнем рассуждений (низкий, средний, высокий, максимальный и сверхвысокий), контекстное окно на 1M токенов, а также ввод текста, изображений и файлов. Sonnet 5 использует обновлённый токенизатор и включает киберзащиту в реальном времени, блокирующую определённые виды деятельности двойного назначения с высоким риском.
google/gemini-3.1-flash-lite-image
Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image) — у Google это самая быстрая и экономичная Gemini модель генерации изображений, созданная для высокоскоростных конвейеров разработки и быстрых визуальных исследований. Она обеспечивает генерацию из текста в изображение примерно за 4 секунд — примерно в 2.7 раз быстрее, чем Gemini 3.1 Flash Image, — сохраняя при этом согласованность персонажей, точное редактирование и знания о реальном мире, характерные для семейства Nano Banana. Единый API, подключаемый без изменений, обрабатывает генерацию из текста в изображение, редактирование изображений и создание композиций из нескольких изображений. Будучи мультимодальной моделью, она также возвращает текст вместе с изображениями. Результаты генерируются в разрешении 1K при 14 соотношениях сторон и содержат невидимый водяной знак SynthID, позволяющий идентифицировать их как AI-generated. Позиционируясь как лучший баланс качества и скорости в линейке Nano Banana 2, она позволяет генерировать тысячи изображений по стоимости, составляющей лишь малую долю затрат на более тяжёлые производственные модели, — идеально для прототипирования, приложений реального времени и масштабных визуальных рабочих процессов.
nex-agi/nex-n2-mini
Nex-N2-Mini — это открытая агентная модель со смешанной архитектурой экспертов от Nex AGI, младшая модель в серии Nex-N2. Она принимает текстовый и графический ввод и предназначена для написания кода, работы с инструментами, глубоких исследований и длительных агентных сценариев, с контекстным окном на 262K токенов и встроенной поддержкой рассуждений.
sakana/fugu-ultra
Fugu Ultra — это модель с более высокой производительностью в семействе Sakana AI's Fugu. Вместо единой монолитной модели, Fugu представляет собой обученную мультиагентную систему оркестрации: языковая модель, обученная направлять задачи через сменяемый пул базовых моделей и рекурсивно вызывать свои собственные экземпляры.\n\nFugu Ultra уделяет приоритет качеству ответов в сложных многошаговых рассуждениях, программировании и агентных рабочих процессах. Она поддерживает настраиваемые усилия по рассуждению, вызов инструментов и встроенный веб-поиск. Токены оркестрации, потребляемые системой, тарифицируются как стандартные входные/выходные токены.
alibaba/happyhorse-1.1
HappyHorse 1.1 — это модель генерации видео от Alibaba. Она создает короткие видеоролики на основе текстового запроса, одного стартового изображения или набора референсных изображений, с выходом до 1080p и длительностью от 3 до 15 секунд. Она подходит для творческого контента, клипов для социальных сетей и анимации на основе изображений, а также превосходит предыдущую версию за счет более точного следования запросу, более плавных движений и более стабильных персонажей в кадрах.
openai/gpt-image-2
OpenAI's последняя модель генерации изображений. Поддерживает высококачественную генерацию и редактирование изображений с помощью специальных Images API.
openai/gpt-image-1
GPT Image 1 от OpenAI создаёт и редактирует изображения через специальные Image API. Отличается точным рендерингом текста, прозрачными фонами и поддержкой до 16 референсных изображений для редактирования.
openai/gpt-image-1-mini
Экономичный вариант GPT Image 1 для высококачественной генерации изображений с уменьшенной задержкой и стоимостью посредством специализированных Images от OpenAI API.
alibaba/happyhorse-1.0
HappyHorse 1.0 — это модель генерации видео от Alibaba. Она создаёт короткие видеоролики по текстовому запросу, одному стартовому изображению или набору референсных изображений, с выходом до 1080p и длительностью от 3 до 15 секунд. Модель подходит для творческого контента, клипов для социальных сетей и анимации на основе изображений при различных соотношениях сторон.
google/gemini-3.1-flash-image
Gemini 3.1 Flash Image, также известная как «Nano Banana 2», — это новейшая модель генерации и редактирования изображений уровня Pro от Google, обеспечивающая визуальное качество уровня Pro на скорости Flash. Она сочетает расширенное понимание контекста с быстрым и экономически эффективным выводом, что делает сложную генерацию изображений и итеративное редактирование значительно более доступными. Соотношением сторон можно управлять с помощью параметра image_config API.
google/gemini-3-pro-image
Nano Banana Pro — самая передовая модель генерации и редактирования изображений от Google, построенная на базе Gemini 3 Pro. Она расширяет возможности оригинальной Nano Banana за счёт значительно улучшенного мультимодального рассуждения, привязки к реальному миру и высокоточной визуальной генерации. Модель создаёт насыщенные по контексту графические материалы — от инфографики и диаграмм до кинематографичных композиций — и может использовать информацию в реальном времени через привязку к поиску. Модель обеспечивает лучшую в отрасли передачу текста в изображениях (включая длинные фрагменты и многоязычные макеты), согласованное смешивание нескольких изображений и точное сохранение индивидуальности до пяти объектов. Nano Banana Pro добавляет тонкие творческие настройки, такие как локальные правки, регулировка освещения и фокуса, трансформации камеры, а также поддержку выходных форматов 2K/4K и гибких соотношений сторон. Она предназначена для профессионального дизайна, визуализации продуктов, раскадровки и сложных многоэлементных композиций, оставаясь при этом эффективной для обычных задач создания изображений.
z-ai/glm-5.2
GLM 5.2 — это крупномасштабная модель рассуждения от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и подходит для долгосрочных агентных рабочих процессов, разработки программного обеспечения на уровне проектов и сложной многоэтапной автоматизации. Поддерживаются уровни усилий рассуждения high и xhigh; xhigh соответствует максимальному уровню рассуждения. Модель особенно сильна в написании кода и использовании инструментов в длительных задачах, способна сохранять инженерный контекст и последовательно следовать стандартам на протяжении всего цикла разработки — от требований до развертывания на нескольких платформах — в рамках одной задачи.
moonshotai/kimi-k2.7-code
MoonshotAI: Kimi K2.7 Code — это модель, ориентированная на программирование, из семейства Kimi K2 от Moonshot AI, созданная для надёжного выполнения комплексных задач программирования в условиях длинных контекстов. Она использует нативную мультимодальную архитектуру смеси экспертов, которая принимает текст и изображения на входе, и всегда работает в режиме мышления, сохраняя полное содержимое рассуждений при многоходовых диалогах. С контекстным окном в 256K токенов модель нацелена на долгосрочное программирование, декомпозицию агентских задач и многоходовые диалоги. Модель активирует 32B параметров из примерно 1T общих.
~anthropic/claude-fable-latest
Эта модель всегда перенаправляет на последнюю модель в семействе Claude Fable.
anthropic/claude-fable-5
Claude Fable 5 — это модель класса Mythos от Anthropic, созданная для автономной работы со знаниями и кодирования. Она поддерживает ввод текста, изображений и файлов с выводом текста, поддержку рассуждений и окно контекста на 1M токенов. Она подходит для длительных, сложных и асинхронных задач, которые ранее требовали частых проверок человеком. Она особенно сильна в сквозной работе, которая в противном случае заняла бы у человека часы, дни или недели — берясь за проблемы, которые являются длительными, неоднозначными или многоэтапными. Она выполняет четко очерченные задачи с небольшим количеством ошибок, автоматически самокорректируется через циклы проверки и поставляется с надежными мерами защиты.
nex-agi/nex-n2-pro
Nex-N2-Pro — это агентная модель смеси экспертов от Nex AGI с 17B активными параметрами из общего числа 397B. Основанная на архитектуре Qwen3.5, она принимает на вход текст и изображения и выдает текстовые выводы, а также поддерживает рассуждения, вызов функций и структурированные выводы. Она предназначена для программирования, использования инструментов, глубоких исследований и долгосрочных агентных рабочих процессов, объединяя планирование, реализацию кода, отладку и итерации в единый цикл выполнения.
sourceful/riverflow-v2.5-pro
Riverflow V2.5 Pro — самая мощная версия линейки Sourceful Riverflow 2.5, оптимальная для задач, требующих максимального контроля и чувствительных к качеству результатов. Серия Riverflow 2.5 — это единое семейство моделей для генерации и редактирования изображений, которое рассматривает генерацию как производственный процесс: встроенная модель рассуждения планирует многошаговые правки и оценивает кандидатов перед выбором итогового результата. Riverflow 2.5 объединяет эти рассуждения с набором закрытых и открытых диффузионных моделей изображений, обеспечивая более высокую точность и управляемость. Уровень рассуждений регулируется параметром reasoning (low/medium/high/xhigh). Более высокие уровни выполняют больше проходов правки и применяют более строгую внутреннюю оценку; режим xhigh подходит для пакетной обработки, где требуется высокая воспроизводимость. Модель генерирует изображения с разрешением 1K, 2K и 4K и принимает до 10 входных изображений для редактирования. Ценообразование динамическое: стоимость финализируется по завершении задания на основе выставленного счёта, поэтому она масштабируется в зависимости от усилий на рассуждение, разрешения и сложности редактирования, а не фиксирована за изображение. Дополнительные возможности (через image_config): Рендеринг пользовательских шрифтов через font_inputs (максимум 2) для точного соответствия начертанию, межбуквенному интервалу и насыщенности брендового текста. Пользовательская оценка через scoring_prompt и scoring_rubric, чтобы модель рассуждения оценивала и направляла каждый вариант по заданным вами критериям. Управление фоном через background_mode (оригинальный, прозрачный, однотонный) и background_hex_color. Подробнее см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation. Примечание: Sourceful устанавливает ограничение на размер запроса 4.5MB, поэтому настоятельно рекомендуется передавать изображение URLs вместо данных Base64.
sourceful/riverflow-v2.5-fast
Riverflow V2.5 Fast — это оптимизированная по скорости версия линейки Riverflow 2.5 от Sourceful, лучше всего подходящая для продакшен-развертываний и рабочих процессов, критичных к задержке. Серия Riverflow 2.5 — это единое семейство для генерации текста в изображение и изображения в изображение, которое рассматривает генерацию как производственный процесс, используя интегрированную модель рассуждения для планирования многошаговых правок и оценки кандидатов перед принятием результата. Riverflow 2.5 сочетает их рассуждение с набором открытых диффузионных моделей изображений, обеспечивая большую точность и управляемость. Уровень усилий рассуждения управляется через параметр reasoning (low/medium/high) — более высокие уровни выполняют больше проходов редактирования и применяют более строгого внутреннего судью, тогда как более низкие уровни возвращают результат быстрее для раннего исследования. Генерация выполняется в разрешениях 1K и 2K (без 4K) и принимает до 4 входных изображений для редактирования. Ценообразование динамическое: стоимость окончательно определяется для каждой задачи по завершении на основе оплачиваемой обработки, поэтому она масштабируется в зависимости от усилий рассуждения, разрешения и сложности редактирования, а не фиксированной ставки за изображение. Дополнительные возможности (через image_config): Настраиваемый рендеринг шрифтов через font_inputs (максимум 2) для соответствия фирменному начертанию, межбуквенному интервалу и насыщенности Настраиваемая оценка через scoring_prompt и scoring_rubric, чтобы модель рассуждения оценивала и направляла каждого кандидата в соответствии с важными для вас критериями Управление фоном через background_mode (original, transparent, solid) и background_hex_color См. документацию по генерации изображений для подробностей: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: Sourceful накладывает ограничение на размер запроса 4.5MB, поэтому настоятельно рекомендуется передавать URLs изображений вместо данных Base64.
nvidia/nemotron-3-ultra-550b-a55b
NVIDIA Nemotron 3 Ultra — открытая модель фронтьерного рассуждения и оркестрации от NVIDIA, с 55B активными параметрами из 550B общих (MoE). Построенная на гибридной архитектуре Transformer-Mamba смеси экспертов, она поддерживает ввод и вывод текста с окном контекста до 1M токенов. Она подходит для длительных агентных рабочих процессов, включая оркестрацию агентов, агентов программирования, глубокие исследования и сложные корпоративные задачи. Модель особенно сильна в многошаговом рассуждении и планировании, с высокопроизводительным инференсом, разработанным для высокообъёмных агентных конвейеров. Она является частью семейства открытых моделей NVIDIA Nemotron для агентных AI.
qwen/qwen3.7-plus
Qwen3.7-Plus — это экономичная модель в серии Alibaba Qwen3.7. Она поддерживает ввод текста и изображений с выводом текста, развивая текстовые возможности серии за счёт всестороннего улучшения визуально-языковых способностей, сохраняя при этом полностековый интеллект агентного уровня для программирования, использования инструментов и рабочих процессов продуктивности. Её отличительная черта — мультимодальная интерактивная гибридная агентная способность: она может воспринимать реальные сцены, читать экраны и взаимодействовать с GUIs, генерировать код по визуальным ссылкам и выполнять сквозную навигацию внутри мобильных приложений.
microsoft/mai-voice-2
MAI-Voice-2 — это выразительная модель синтеза речи от Microsoft. Она подходит для разговорных ассистентов, озвучивания медиа, доступности, образования и других голосовых приложений длинного формата. Она поддерживает 15 языков в 18 локалях, обеспечивает детальную настройку тона и подачи, многоголосую генерацию и генерацию по голосовому образцу из коротких аудиофрагментов без дообучения. Модель ставит естественность и выразительность выше генерации, критичной к задержке.
microsoft/mai-transcribe-1.5
MAI-Transcribe 1.5 — это многоязычная модель преобразования речи в текст от Microsoft AI. Она подходит для субтитров, транскрибации звонков, создания субтитров, обеспечения доступности и других голосовых приложений, обеспечивая надежную транскрибацию на 43 языках, различных акцентах и зашумленном реальном аудио. Она поддерживает автоматическое определение языка и смещение ключевых слов для доменной терминологии, а также повышает скорость транскрибации длинных аудио по сравнению с MAI-Transcribe-1. Диаризация говорящих не поддерживается.
microsoft/mai-image-2.5
MAI-Image-2.5 от Microsoft — это высококачественная модель генерации изображений, доступная через Azure AI Foundry. Она создаёт фотореалистичные и художественные изображения по текстовым запросам с поддержкой различных соотношений сторон.
minimax/minimax-m3
MiniMax-M3 — это мультимодальная фундаментальная модель от MiniMax. Она поддерживает ввод текста, изображений и видео с выводом текста, имеет контекстное окно в 1M токенов и предназначена для длительных агентных задач, программирования и использования инструментов. Модель построена на основе MiniMax Sparse Attention (MSA), которая заменяет полное внимание на KV-block-выборку, сокращая вычислительные затраты на токен при длинном контексте — примерно на 1/20 по сравнению с предыдущим поколением при 1M токенах, обеспечивая значительно более быструю предварительную обработку и декодирование без потери качества на большинстве задач. Обученная как нативная мультимодальная модель на перемежённых данных и оптимизированная для многоходового, производственно-ориентированного взаимодействия через интерактивный симулятор пользователя, модель ориентирована на длительные, многошаговые задачи, а не на одноразовое выполнение.
stepfun/step-3.7-flash
Step 3.7 Flash — последняя высокоэффективная мультимодальная модель архитектуры Mixture-of-Experts от StepFun. Она объединяет языковую основу с 196B параметрами и визуальный энкодер для нативного понимания изображений и видео, активируя примерно 11B параметров на токен. Модель поддерживает контекстное окно в 256K и предоставляет выбираемые уровни рассуждения (высокий/средний/низкий), позволяя вызывающим сторонам балансировать скорость, стоимость и глубину рассуждений. Разработана для написания кода, агентных сценариев, структурированных выходных данных и задач продуктивности с длинным контекстом.
anthropic/claude-opus-4.8
Claude Opus 4.8 — это наиболее мощная общедоступная модель в семействе Opus от Anthropic. Она поддерживает ввод текста, изображений и файлов с выводом текста, поддерживает рассуждения и контекстное окно на 1M токенов. Она подходит для высокоавтономных агентов, долгосрочной агентной работы, работы со знаниями и задач, связанных с памятью, где важна согласованность в течение длительных сессий. Она особенно сильна в многошаговых рассуждениях, сложном кодировании и сквозной оркестрации проектов - больших базах кода, многоэтапной отладке и длительных асинхронных конвейерах агентов. Помимо кодирования, она справляется с работой со знаниями, такой как составление документов, создание презентаций и анализ данных, сохраняя качество при очень длинных выводах.
nvidia/parakeet-tdt-0.6b-v3
Parakeet TDT 0.6B v3 — это мультиязычная модель преобразования речи в текст с 600M параметрами от NVIDIA, построенная на архитектуре FastConformer-TDT. Обученная на датасете Granary (более 670,000 часов аудио), она поддерживает автоматическое определение языка для всех официальных языков EU и достигает среднего показателя частоты ошибок в словах 6.34% на лидерборде HuggingFace Open ASR. Возвращает транскрибированный текст с пунктуацией и временными метками сегментов.
qwen/qwen3.7-max
Qwen3.7-Max — флагманская модель в серии Alibaba Qwen3.7. Она поддерживает ввод и вывод текста и предназначена для агентно-ориентированных рабочих нагрузок, с особыми преимуществами в программировании, офисных и продуктивных задачах, а также в длительном автономном выполнении. Модель демонстрирует заметные улучшения в программировании и агентной производительности по сравнению с предыдущими поколениями Qwen и поддерживает явное кэширование промптов для эффективного повторного использования контекста.
x-ai/grok-build-0.1
Grok Build 0.1 — это быстрая модель для написания кода от SpaceXAI, специально обученная для агентных сценариев разработки программного обеспечения. Она поддерживает текстовые и графические входные данные с выводом текста и оптимизирована для интерактивных агентов, работы с инструментами и многошаговых задач разработки. Модель обеспечивает работу SpaceXAI Grok Build CLI и имеет контекстное окно 256K без ограничения на объём выводимого текста, что делает её хорошо подходящей для длительных задач программирования и автоматизации. В настоящее время доступна в режиме раннего доступа.
google/gemini-embedding-2
Gemini Embedding 2 — это первая мультимодальная эмбеддинг-модель от Google. В настоящее время мы поддерживаем отображение текста и изображений в единое векторное пространство для семантического поиска и генерации с дополнением по извлечённым данным (RAG). Модель поддерживает входной контекст до 8,192 токенов и гибкие размерности выходных векторов от 128 до 3,072 (рекомендуемые: 768, 1536 или 3,072). Она разработана для кросс-модального сравнения — вы можете эмбеддить текстовый запрос и получать наиболее релевантные изображения, или наоборот, — что делает её хорошо подходящей для мультимодального поиска, рекомендаций и пайплайнов понимания документов.
google/gemini-3.5-flash
Gemini 3.5 Flash — это высокоэффективная мультимодальная модель от Google, обеспечивающая почти уровень Pro в написании кода и рассуждениях при затратах и скорости уровня Flash. Она оптимизирована для высокой компетентности в программировании и параллельных агентных циклах выполнения, поддерживая ввод текста, изображений, видео, аудио и PDF. По умолчанию используется средний уровень усилия мышления для более быстрых и экономичных ответов, с полной поддержкой уровней мышления (минимальный, низкий, средний, высокий) для тонкой настройки компромиссов между стоимостью и производительностью.
x-ai/grok-imagine-video
Grok Imagine Video — это модель генерации видео от SpaceXAI с учётом текста, изображений и референсов. Она создаёт короткие видеоролики (1–15 секунд, 24 fps) в разрешении 480p или 720p при семи соотношениях сторон: 1:1, 16:9, 9:16, 4:3, 3:4, 3:2 и 2:3. Модель поддерживает три режима генерации: «текст-в-видео» — только по запросу; «изображение-в-видео» — анимирует статичное входное изображение; и «референс-в-видео» — использует до семи референсных изображений для согласованности персонажей, стилей или окружения.
x-ai/grok-imagine-image-quality
Grok Imagine Image Quality — это быстрая модель генерации и редактирования изображений с высокой точностью от SpaceXAI. Она принимает текстовые подсказки и опциональные референсные изображения, создавая фотореалистичные результаты в разрешении 1K или 2K для широкого диапазона соотношений сторон, включая гибкую настройку референсных изображений. Модель делает акцент на реалистичных деталях — естественном освещении и физике, точных текстурах и согласованном рендеринге именованных сущностей, таких как бренды, публичные личности и конкретные места. Она поддерживает качественный многоязычный рендеринг текста внутри изображений, что делает её лучшим выбором для плакатов, упаковки, рекламы, меню и графики для соцсетей. При наличии референсных изображений она сохраняет идентичность и структуру для размещения продуктов, вариаций в соответствии с брендом и преемственности персонажей между сценами.
mistralai/voxtral-mini-transcribe
Voxtral Mini Transcribe — это модель преобразования речи в текст от Mistral, производная от семейства Voxtral Mini. Она принимает аудиовход и возвращает транскрибированный текст через стандартный API транскрипции. Подходит для транскрибации совещаний, голосовых заметок, подкастов и другого устного контента.
x-ai/grok-voice-tts-1.0
Grok Voice TTS 1.0 — это модель преобразования текста в речь от SpaceXAI. Она преобразует текст в озвученное аудио на более чем 20 языках с автоматическим определением языка и предлагает пять встроенных голосов (Eve, Ara, Rex, Sal, Leo), охватывающих различные тональности. Встроенные речевые теги позволяют управлять паузами, ударением, высотой тона и стилем голоса. Выходной аудиофайл доступен в форматах MP3, WAV, PCM, μ-law и A-law с частотой дискретизации от 8 kHz до 48 kHz, при этом до 15,000 символов на запрос.
qwen/qwen3-asr-flash-2026-02-10
Qwen3-ASR-Flash — это сервис автоматического распознавания речи компании Alibaba, построенный на основе Qwen3-Omni и обученный на десятках миллионов часов мультимодальных речевых данных. Модель поддерживает 11 языков, включая китайский (с кантонским, сычуаньским, миньнаньским и у диалектами), английский, арабский, французский, немецкий, испанский, итальянский, португальский, русский, японский и корейский, с автоматическим определением языка, поэтому для аудио со смешанными языками не требуется ручная настройка. Модель предназначена для сложных акустических условий: она транскрибирует текст песен на фоне музыки, обрабатывает шумные и удалённые записи, отфильтровывает тишину и неречевые звуки, а также принимает произвольный контекстный текст (имена, жаргон, доменную терминологию) для смещения распознавания в сторону конкретной лексики.
recraft/recraft-v4.1-pro-vector
Recraft V4.1 Pro Vector — это векторный (SVG) вариант Recraft V4.1 Pro, оптимизированный для высокой эстетики. Он поддерживает ввод текста и изображений и создаёт вывод изображений SVG более высокого разрешения для различных соотношений сторон, при этом типичная генерация занимает около 15 секунд. Вывод масштабируется без потерь, что делает его подходящим для иконок, логотипов и другой графики. V4.1 добавляет больше индивидуальности тексту и иллюстрациям, обеспечивает более плавные градиенты и более точное следование коротким промптам по сравнению с V4 Pro. Подходит для иллюстраций более высокого разрешения и производственной графики, где результат должен быть разработан, а не сфотографирован. Поддерживает следующие параметры image_config: strength (управляет степенью отклонения вывода от исходного изображения), rgb_colors (задаёт цветовую палитру) и background_rgb_color (задаёт цвет фона). Подробнее см. документацию по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.
recraft/recraft-v4.1-vector
Recraft V4.1 Vector — это векторный (SVG) вариант модели Recraft V4.1, оптимизированный для высокой эстетики. Он поддерживает текстовые запросы и изображения на входе и создаёт выходное изображение SVG с различными соотношениями сторон, при этом типичная генерация занимает около 10 секунд. Выходное изображение хорошо масштабируется, что делает его подходящим для иконок, логотипов и другой графики. V4.1 добавляет больше индивидуальности тексту и иллюстрациям, обеспечивает более плавные градиенты и лучшее следование коротким запросам по сравнению с V4. Подходит для повседневной иллюстрационной работы, где результат должен быть дизайном, а не фотографией. Поддерживает следующие параметры image_config: strength (управляет степенью отклонения результата от исходного изображения), rgb_colors (задаёт цветовую палитру) и background_rgb_color (задаёт цвет фона). Подробности см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.
recraft/recraft-v4.1-utility-pro
Recraft V4.1 Utility Pro — универсальная модель генерации изображений от Recraft. Она поддерживает текстовые и графические входные данные с выводом изображения в разрешении примерно 2K при нескольких соотношениях сторон — вдвое выше разрешения V4.1 Utility — при типичном времени генерации около 10 секунд. Как и V4.1 Utility, она спроектирована с расчётом на сдержанность как эстетический выбор — плоское освещение, фронтальная композиция и простые, контролируемые сцены — с более высокой точностью для производственных сценариев использования. Улучшения V4.1 по сравнению с V4 Pro включают более естественное понимание объектов, более чёткие мокапы, более аккуратные стандартные иконки и более точное следование промпту при более коротких промптах. Подходит для изображений товаров, электронной коммерции и структурированных визуальных материалов, где важна качество изображения, а линия V4.1 Pro с высокой эстетикой была бы слишком выразительной. Поддерживает следующие параметры image_config: strength (управляет тем, насколько результат отклоняется от исходного изображения), rgb_colors (задаёт цветовую палитру) и background_rgb_color (задаёт цвет фона). Подробнее см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.
recraft/recraft-v4.1-utility
Recraft V4.1 Utility — это универсальная модель генерации изображений от Recraft. Она поддерживает текстовые и графические входные данные с выводом изображений разрешением около 1K при различных соотношениях сторон, при этом типичное время генерации составляет около 6 секунд. Линейка Utility ориентирована на сдержанность как эстетический выбор: ровное освещение, фронтальная композиция и простые контролируемые сцены — что делает её практичным решением для изображений товаров, макетов и структурированных визуалов, где слишком выразительная линейка V4.1 была бы излишней. Улучшения в V4.1 по сравнению с V4 включают более естественное понимание объектов, более чёткие макеты, более аккуратные иконки по умолчанию и более точное следование коротким промптам. Поддерживаются следующие параметры image_config: strength (управляет степенью отклонения выходного изображения от исходного), rgb_colors (задаёт цветовую палитру) и background_rgb_color (устанавливает цвет фона). Подробнее см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.
recraft/recraft-v4.1-pro
Recraft V4.1 Pro — это модель генерации изображений от Recraft, настроенная на высокую эстетику. Она поддерживает ввод текста и изображений с выводом изображения с разрешением около ~2K при различных соотношениях сторон — вдвое больше разрешения, чем у V4.1 — при типичной генерации за около 10 секунд. Она разделяет визуальную чувствительность V4.1 при более высокой точности и плотности деталей, с более естественным фотореализмом, более плавным 3D-рендерингом и градиентами, а также более сильным следованием коротким промптам, чем V4 Pro. Подходит для продакшн-работы, где качество изображения является приоритетом, и идея выигрывает от большего разрешения, чтобы дышать. Поддерживает следующие параметры image_config: strength (контролирует, насколько выходное изображение отклоняется от исходного), rgb_colors (задает цветовую палитру) и background_rgb_color (задает цвет фона). Подробнее см. документацию по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.
recraft/recraft-v4.1
Recraft V4.1 — это модель генерации изображений от Recraft, настроенная на высокую эстетику. Она поддерживает текстовые и графические входные данные с выводом изображений при разрешении примерно 1K в различных соотношениях сторон, с типичной генерацией около 6 секунд. По сравнению с V4, фотореализм ощущается более естественным с более спокойными фонами и целенаправленным освещением, 3D-рендеринг и мягкие градиенты становятся более плавными, а модель более надёжно следует более коротким подсказкам. Подходит для исследований, концептуальной работы и повседневной творческой работы, где важны скорость и стоимость. Поддерживает следующие параметры image_config: strength (контролирует, насколько выходное изображение отклоняется от исходного), rgb_colors (устанавливает цветовую палитру) и background_rgb_color (устанавливает цвет фона). Подробнее см. документацию по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.
recraft/recraft-v4-pro-vector
Recraft V4 Pro Vector — это векторный (SVG) вариант VRecraft V4 Pro. Он поддерживает ввод текста и изображений и создает векторные изображения в различных соотношениях сторон на уровне более высокого качества Pro. Вывод предоставляется в формате SVG, подходящем для иконок, логотипов и другой графики, которую нужно масштабировать без потери качества. V4 Pro обеспечивает более высокое качество и плотность деталей, чем V4, с более сильным композиционным суждением, согласованностью цветов и читаемым встроенным текстом по сравнению с V3. Поддерживаются следующие параметры image_config: strength (контролирует степень отклонения вывода от исходного изображения), rgb_colors (задает цветовую палитру) и background_rgb_color (задает цвет фона). См. документацию по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.
recraft/recraft-v4-vector
Recraft V4 Vector — это векторный (SVG) вариант модели Recraft V4. Он поддерживает ввод текста и изображений и создает векторное изображение на выходе для различных соотношений сторон. По сравнению с растровой моделью V4, выходные данные предоставляются в виде SVG, подходящего для иконок, логотипов и другой графики, которую нужно масштабировать без потери качества. V4 обеспечивает более сильное чувство композиции, цветовую согласованность и читаемый встроенный текст по сравнению с V3. Поддерживаются следующие параметры image_config: strength (управляет степенью отклонения выходного изображения от исходного), rgb_colors (задает цветовую палитру) и background_rgb_color (задает цвет фона). Дополнительную информацию см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.
perceptron/perceptron-mk1
Perceptron Mk1 (Mark One) — это зрение-языковая модель высочайшего качества от Perceptron для видео и воплощённого рассуждения.** Она принимает изображения и видео вместе с запросами на естественном языке и выдаёт подробные ответы с пониманием визуальной информации — либо в структурированной форме, либо на естественном языке. Она превосходно справляется с задачами понимания видео, такими как видео QA, суммаризация и обнаружение событий. Для изображений она развивает точечную привязку по примерам из мультимодальных подсказок, OCR и разбор документов на «зашумлённых» реальных входных данных, обнаружение и подсчёт объектов с открытым словарём, а также оценку позы рук. Рассуждение может быть включено по запросу, чтобы обменять задержку на более глубокий анализ более сложных задач. Структурированные аннотации выводятся в тексте только в том случае, если это явно запрошено через параметр annotation_format (передайте "point", "box" или "polygon" для пространственной локализации на изображениях, или "clip" (временные метки начала/конца) для временных сегментов в видео). Без annotation_format модель возвращает только текст на естественном языке.
recraft/recraft-v4-pro
Recraft V4 Pro — это модель генерации изображений от Recraft. Она поддерживает ввод текста и изображений с выводом изображения с разрешением ~2K при нескольких соотношениях сторон, что вдвое превышает разрешение V4. Она обеспечивает более высокую достоверность и плотность деталей, чем V4, и подходит для производственных сценариев, где качество изображения является приоритетом. Поддерживаются следующие параметры image_config: strength (управляет степенью отклонения вывода от исходного изображения), rgb_colors (задает цветовую палитру) и background_rgb_color (задает цвет фона). Подробнее см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.
recraft/recraft-v4
Recraft V4 — это модель генерации изображений от Recraft. Она поддерживает ввод текста и изображений с выводом изображения с разрешением около 1K при нескольких соотношениях сторон. По сравнению с V3 она обеспечивает более сильное композиционное суждение, согласованность цветов и читаемый встроенный текст, что делает её подходящей для инфографики, вывесок и упаковки. Поддерживает следующие параметры image_config: strength (контролирует степень отклонения вывода от исходного изображения), rgb_colors (задаёт цветовую палитру) и background_rgb_color (задаёт цвет фона). Подробности см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.
recraft/recraft-v3
Recraft V3 — это модель генерации изображений от Recraft. Она поддерживает ввод текста и изображений с выводом изображения в разрешении ~1K при различных соотношениях сторон. Поддерживаются следующие параметры image_config: strength (управляет степенью отклонения выходного изображения от исходного), style (применяет художественный стиль), text_layout (размещает текст в определённых позициях), rgb_colors (задаёт цветовую палитру) и background_rgb_color (задаёт цвет фона). См. документацию по генерации изображений для подробностей: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.
google/gemini-3.1-flash-lite
Gemini 3.1 Flash Lite — это GA высокоэффективная мультимодальная модель от Google, оптимизированная для низкой задержки и больших объёмов рабочих нагрузок. Она поддерживает ввод текста, изображений, видео, аудио и PDF и предназначена для лёгких агентных рабочих процессов, простого извлечения данных и приложений, где основными ограничениями являются отзывчивость и стоимость API. Поддерживает полные уровни мышления (минимальный, низкий, средний, высокий) для тонкой настройки компромиссов между стоимостью и производительностью. Цена составляет половину стоимости Gemini 3 Flash.
openai/gpt-chat-latest
GPT Chat Latest указывает на стабильный псевдоним chat-latest модели API от OpenAI, который всегда разрешается в актуальную модель Instant-чата, используемую в ChatGPT. По мере того как OpenAI в будущем выпускает новые обновления модели Instant, они автоматически направляются через этот слаг. Дополнительная информация: https://developers.openai.com/api/docs/models/chat-latest
google/chirp-3
Chirp 3 — новейшая многоязычная модель распознавания речи от Google. Она обеспечивает повышенную точность транскрипции для 24 GA языков и 77+ языков в предварительном доступе, с поддержкой автоматического определения языка, автоматической пунктуации и встроенного шумоподавителя для более чистой обработки аудио.
openai/gpt-4o-mini-transcribe
GPT-4o Mini Transcribe — это меньшая и экономичная модель распознавания речи от OpenAI, построенная на аудиовозможностях GPT-4o Mini. Она тарифицируется за токен (вход и выход), что делает её подходящей для высокообъёмных процессов транскрипции, которым выгодна прозрачность оплаты на уровне токенов при более низкой стоимости.
openai/whisper-large-v3
Whisper Large V3 — это открытая модель автоматического распознавания речи от OpenAI, которая обеспечивает как транскрибацию аудио, так и перевод. Она поддерживает 99+ языков и принимает распространённые аудиоформаты, включая mp3, mp4, wav, webm, flac и ogg. С 1,550M параметрами модель достигает показателя ошибок в 10.3% слов и хорошо подходит для помехоустойчивой многоязычной транскрибации в сложных условиях. Поддерживается детализация временных меток на уровне слов и сегментов.
openai/whisper-large-v3-turbo
Whisper Large V3 Turbo — это оптимизированная версия модели распознавания речи OpenAI's Whisper Large V3, разработанная для скорости и экономической эффективности. Она поддерживает транскрипцию на 99+ языках с коэффициентом ошибок в словах 12% и принимает распространённые аудиоформаты, включая mp3, mp4, wav, webm, flac и ogg. Достигает коэффициентов реального времени до 216x, что делает её хорошо подходящей для задач транскрипции, чувствительных к задержке и с высокой пропускной способностью.
x-ai/grok-4.3
Grok 4.3 — это модель рассуждения от SpaceXAI. Она принимает текстовые и графические входные данные и выдает текст, подходит для агентских рабочих процессов, задач следования инструкциям и приложений, требующих высокой фактической точности. Уровень рассуждения можно настроить: отсутствует/низкий/средний/высокий (по умолчанию низкий). Поддерживается контекстное окно в 1 миллионов токенов без ограничения на выходные токены, что делает её хорошо подходящей для анализа длинных документов, глубоких исследований и многоэтапных агентских задач. Цены многоуровневые: запросы, превышающие 200k суммарных токенов, тарифицируются по более высокой ставке.
ibm-granite/granite-4.1-8b
Granite 4.1 8B — это плотная языковая модель с архитектурой только декодер, содержащая 8 миллиардов параметров, от компании IBM, входящая в семейство Granite 4.1. Она поддерживает окно контекста в 131K токенов и предназначена для корпоративных задач, включая вызов инструментов, генерацию с дополнением на основе поиска (RAG), генерацию кода с поддержкой заполнения середины (fill-in-the-middle), суммаризацию текста, классификацию и извлечение информации. Модель работает с 12 языками (английский, немецкий, испанский, французский, японский, португальский, арабский, чешский, итальянский, корейский, нидерландский и китайский) и реализует совместимый с OpenAI вызов инструментов. Выпущена под лицензией Apache 2.0.
mistralai/mistral-medium-3-5
Mistral Medium 3.5 — это плотная модель 128B, следующая инструкциям, от Mistral AI. Она поддерживает текстовые и графические входные данные с текстовым выводом и предназначена для агентных сценариев, программирования и сложных многошаговых рассуждений. Модель особенно сильна в надёжных множественных вызовах инструментов и долгосрочных задачах, обладает контекстным окном на 256K, настраиваемой интенсивностью рассуждений для каждого запроса и собственным визуальным энкодером, который обрабатывает изображения переменного размера и с разным соотношением сторон. Разворачивается самостоятельно всего на четырёх GPUs и доступна с открытыми весами.
kwaivgi/kling-v3.0-pro
Kling v3.0 Pro — это премиальная модель генерации видео от Kuaishou, обеспечивающая более высокое визуальное качество по сравнению со стандартным уровнем. Она поддерживает рабочие процессы «текст в видео» и «изображение в видео», с контролем первого и последнего кадра для точной компоновки сцены. Длительность клипов варьируется от 3 до 15 секунд при соотношениях сторон 16:9, 9:16 или 1:1. Нативную генерацию аудио можно включить как опцию.
kwaivgi/kling-v3.0-std
Kling v3.0 Standard — это модель генерации видео от Kuaishou. Она поддерживает рабочие процессы «текст в видео» и «изображение в видео», а также управление по первому и последнему кадру для направленной композиции сцен. Ролики могут длиться от 3 до 15 секунд при соотношениях сторон 16:9, 9:16 или 1:1. Опционально доступна генерация нативного аудио.
openai/whisper-1
Whisper — это модель автоматического распознавания речи с открытым исходным кодом от OpenAI, доступная через API как whisper-1. Она поддерживает транскрипцию и перевод для 50+ языков из аудиофайлов размером до 25 MB. Принимает форматы, включая mp3, mp4, wav и webm. Цена рассчитывается за минуту аудиодлительности, с округлением до ближайшей секунды.
openai/gpt-4o-transcribe
GPT-4o Transcribe — это высококачественная модель распознавания речи от OpenAI, построенная на аудио-возможностях GPT-4o. Она тарифицируется за токен (вход и выход), что делает её подходящей для рабочих процессов, которые выигрывают от прозрачности биллинга на уровне токенов.
~anthropic/claude-haiku-latest
Эта модель всегда перенаправляет на последнюю модель в семействе Anthropic Claude Haiku.
~openai/gpt-mini-latest
Эта модель всегда перенаправляет на последнюю модель в семействе OpenAI GPT Mini.
~google/gemini-pro-latest
Эта модель всегда перенаправляет на последнюю модель в семействе Google Gemini Pro.
~moonshotai/kimi-latest
Эта модель всегда перенаправляет на последнюю модель в семействе MoonshotAI Kimi.
~google/gemini-flash-latest
Эта модель всегда перенаправляет на самую последнюю модель в семействе Google Gemini Flash.
~anthropic/claude-sonnet-latest
Эта модель всегда перенаправляет на последнюю модель семейства Anthropic Claude Sonnet.
~openai/gpt-latest
Эта модель всегда перенаправляет на последнюю модель в семействе OpenAI GPT.
qwen/qwen3.5-plus-20260420
Qwen3.5 Plus (апрель 2026) — это крупномасштабная мультимодальная языковая модель от Alibaba. Она принимает текст, изображения и видео на входе и генерирует текстовый вывод с контекстным окном в 1M токенов. Это обновлённая версия Qwen3.5 Plus с многоуровневым ценообразованием: стоимость зависит от количества токенов, превышающего 256K.
qwen/qwen3.6-flash
Qwen3.6 Flash — это быстрая и эффективная языковая модель из серии Alibaba Qwen 3.6. Она поддерживает ввод текста, изображений и видео с контекстным окном в 1M токенов. Начиная с 256K токенов действует многоуровневое ценообразование. Поддерживается кэширование подсказок, включая тарификацию как за явное чтение кэша, так и за его создание.
qwen/qwen3.6-35b-a3b
Qwen3.6-35B-A3B — это мультимодальная модель с открытыми весами от Alibaba Cloud с 35 миллиардами параметров суммарно и 3 миллиардами активных параметров на токен. Она использует гибридную разреженную архитектуру смеси экспертов, сочетающую гейтированное линейное внимание DeltaNet со стандартными гейтированными слоями внимания, что обеспечивает эффективный инференс за небольшую долю вычислительных затрат. Модель поддерживает нативное окно контекста на 262K токенов (расширяемое до 1M с помощью YaRN) и принимает текстовые, графические и видеовходные данные. В неё встроен режим размышления с сохранением следов рассуждений в многоходовых беседах, вызов функций и структурированный вывод. Модель выпущена под лицензией Apache 2.0.
qwen/qwen3.6-max-preview
Qwen3.6-Max-Preview — это проприетарная передовая модель от Alibaba Cloud, построенная на разреженной архитектуре смеси экспертов с примерно 1 триллионами параметров. Она оптимизирована для агентного программирования, использования инструментов и рассуждений в длинном контексте, поддерживая окно контекста в 262K токенов. Модель включает встроенный режим мышления, который сохраняет цепочки рассуждений в многоходовых диалогах, и поддерживает структурированный вывод и вызов функций. Доступ предоставляется исключительно через Alibaba Cloud Model Studio и Qwen Studio APIs; открытые веса не предоставляются.
qwen/qwen3.6-27b
Qwen3.6 27B — это плотная языковая модель с 27 миллиардами параметров от команды Qwen в Alibaba, выпущенная в апреле 2026. Она обладает гибридными мультимодальными возможностями — принимает текстовые, графические и видео входные данные — и поддерживает контекстное окно на 262,144 токенов. Модель предназначена для агентных задач кодирования и рассуждений, с особой силой в понимании кода на уровне репозитория, рабочих процессах фронтенд-разработки и многошаговом решении проблем. Она включает встроенный режим мышления для расширенного рассуждения и сохраняет контекст мышления в истории разговора. Qwen3.6 27B поддерживает 201 языков и диалектов и выпущена под лицензией Apache 2.0.
openai/gpt-5.5-pro
GPT-5.5 Pro — это высокопроизводительная модель OpenAI, оптимизированная для глубокого рассуждения и точности в решении сложных задач с высокой ответственностью. Она оснащена контекстным окном на 1M+ токенов (вход — 922K, выход — 128K) и поддерживает ввод текста и изображений. Модель предназначена для долгосрочного решения проблем, агентного программирования и точного выполнения многошаговых рабочих процессов.
openai/gpt-5.5
GPT-5.5 — это фронтирная модель от OpenAI, разработанная для сложных профессиональных задач, развивающаяся на основе GPT-5.4 с более сильными рассуждениями, повышенной надёжностью и улучшенной эффективностью токенов на сложных задачах. Она оснащена контекстным окном размером 1M+ токенов (922K на вход, 128K на выход) с поддержкой текстовых и графических входных данных, что обеспечивает масштабные рассуждения, программирование и мультимодальные рабочие процессы в одной системе.
deepseek/deepseek-v4-pro
DeepSeek V4 Pro — это крупномасштабная модель смеси экспертов от DeepSeek с общим количеством параметров 1.6T и активными параметрами 49B, поддерживающая контекстное окно в 1M токенов. Модель предназначена для сложных задач рассуждения, программирования и длительных агентных сценариев, демонстрируя высокую производительность в области знаний, математики и программной инженерии. Основанная на той же архитектуре, что и DeepSeek V4 Flash, она использует гибридную систему внимания для эффективной обработки длинных контекстов. Поддерживаются уровни рассуждения high и xhigh; xhigh соответствует максимальному режиму рассуждения. Модель хорошо подходит для ресурсоёмких задач, таких как анализ всего кодового репозитория, многошаговая автоматизация и крупномасштабный синтез информации, где критически важны как производительность, так и эффективность.
deepseek/deepseek-v4-flash
DeepSeek V4 Flash — это оптимизированная по эффективности модель Mixture-of-Experts от DeepSeek с 284B общим количеством параметров и 13B активируемых параметров, поддерживающая контекстное окно в 1M токенов. Она предназначена для быстрого вывода и высокопроизводительных рабочих нагрузок, сохраняя при этом высокую производительность в рассуждениях и написании кода. Модель включает гибридное внимание для эффективной обработки длинного контекста. Поддерживаются режимы рассуждений high и xhigh; xhigh соответствует максимальному режиму рассуждений. Она хорошо подходит для таких приложений, как ассистенты программирования, чат-системы и агентные рабочие процессы, где важны отзывчивость и экономическая эффективность.
google/gemini-3.1-flash-tts-preview
Gemini 3.1 Flash TTS Preview — это модель преобразования текста в речь от Google, и значительный шаг вперед по сравнению с Gemini 2.5 Flash TTS. Она принимает текстовый ввод и создает аудиовыход на 70+ языках — почти в 3× больше языков, чем у ее предшественницы. Главное дополнение — это система из 200+ встроенных аудиотегов (например, [whispers], [laughs], [excited]), которые позволяют разработчикам управлять подачей, эмоциями и темпом прямо в середине предложения, а также рабочий процесс «режиссерского кресла» в студии Google AI для определения аудиопрофилей для каждого персонажа и контекста сцены. Она поддерживает до двух говорящих с независимой настройкой голоса и стиля для каждого, выводит аудио PCM в формате 24 kHz / 16-бит моно и автоматически добавляет водяной знак SynthID ко всем выходам. Окно контекста — 32k токенов.
google/veo-3.1-fast
Модель генерации видео среднего уровня от Google, сочетающая скорость и качество. Veo 3.1 Fast генерирует высококачественное видео по текстовым или графическим запросам с синхронизированным звуком, обеспечивая более быструю выдачу результата, чем Veo 3.1, при более низкой стоимости. Поддерживает управление по первому и последнему кадру, несколько разрешений и соотношений сторон, а также нанесение водяных знаков SynthID.
canopylabs/orpheus-3b-0.1-ft
Orpheus 3B — это англоязычная модель синтеза речи от Canopy Labs, тонко настроенная для естественной просодии и выразительного озвучивания. Она предлагает 7 предустановленных голосов и подходит для озвучивания повествований, голосовых ассистентов и интерактивных приложений, где приоритетом является естественность речи.
sesame/csm-1b
CSM 1B — это разговорная речевая модель от Sesame. Она принимает текстовый ввод и генерирует англоязычную речь, с вариантами голоса, охватывающими разговорный и чтение-речевой стили. При 1B параметрах она подходит для приложений, ориентированных на диалог, таких как голосовые ассистенты и интерактивные агенты.
hexgrad/kokoro-82m
Kokoro 82M — это легковесная модель синтеза речи с открытыми весами от hexgrad. Она преобразует текст в речь на 8 языках (американский и британский английский, испанский, французский, хинди, итальянский, японский, португальский и китайский) с использованием 54 предустановленных голосов, сгруппированных по языку и полу. При 82M параметрах она хорошо подходит для многоязычных TTS развертываний, где важны компактность и эффективность затрат.
google/veo-3.1-lite
Наиболее экономически эффективная модель генерации видео от Google, предназначенная для высоконагруженных приложений и быстрой итерации. Veo 3.1 Lite генерирует видео разрешением 720p и 1080p по текстовым или графическим промптам со встроенным синхронизированным звуком менее чем за 50% стоимости Veo 3.1 Fast. Поддерживает клипы длительностью 4–8 секунд в альбомном (16:9) и портретном (9:16) форматах, с водяным знаком SynthID. Идеально подходит для контентных платформ, создания коротких видео и автоматизированной генерации медиа.
tencent/hy3-preview
Hy3 preview — это высокоэффективная модель смеси экспертов от Tencent, предназначенная для агентных рабочих процессов и производственного использования. Она поддерживает настраиваемые уровни рассуждения в режимах «отключено», «низкий» и «высокий», что позволяет балансировать между скоростью и глубиной в зависимости от задачи, обеспечивая при этом высокое качество генерации кода и надёжную работу в многошаговых реальных сценариях.
xiaomi/mimo-v2.5-pro
MiMo-V2.5-Pro — флагманская модель Xiaomi, обеспечивающая высокую производительность в общих агентных возможностях, сложной программной инженерии и задачах с длинным горизонтом планирования, занимая верхние строчки в бенчмарках, таких как ClawEval, GDPVal и SWE-bench Pro. Модель способна независимо и автономно выполнять профессиональные задачи, на которые у экспертов-людей ушли бы дни или недели, задействуя более тысячи вызовов инструментов. Длина контекста до 1M делает её хорошо подходящей для интеграции с широким спектром агентных фреймворков.
xiaomi/mimo-v2.5
MiMo-V2.5 — это нативная омнимодальная модель от Xiaomi. Она обеспечивает производительность агентного уровня Pro примерно при вдвое меньших затратах на инференс, превосходя MiMo-V2-Omni в мультимодальном восприятии при решении задач понимания изображений и видео. Её контекстное окно 1M поддерживает полные документы, протяжённые диалоги и сложные контексты задач за один проход, что делает её идеальной для интеграции с агентными фреймворками, где важны сильные рассуждения, богатое восприятие и экономическая эффективность.
openai/gpt-5.4-image-2
GPT-5.4 Image 2 объединяет модель GPT-5.4 от OpenAI с передовыми возможностями генерации изображений от GPT Image 2. Это обеспечивает богатые мультимодальные рабочие процессы, позволяя пользователям беспрепятственно переключаться между рассуждением, программированием и генерацией изображений в рамках одного взаимодействия.
~anthropic/claude-opus-latest
Эта модель всегда перенаправляет на последнюю модель семейства Claude Opus.
kwaivgi/kling-video-o1
Kling Video O1 — это модель генерации видео от Kuaishou. Она поддерживает ввод текста и изображений с выводом видео, что позволяет использовать сценарии «текст-в-видео» и «изображение-в-видео». Модель подходит для создания кинематографичного контента, обеспечивая контроль над первым и последним кадрами для точной композиции сцены. Она генерирует клипы длительностью 5 или 10 секунд с соотношениями сторон 16:9, 9:16 или 1:1.
minimax/hailuo-2.3
Hailuo 2.3 — это модель генерации видео от MiniMax. Она принимает текстовые подсказки и референсные изображения на вход и генерирует видео на выходе, поддерживая как сценарии «текст-в-видео», так и «изображение-в-видео». Она подходит для создания креативного контента, генерации кинематографичных сцен и анимации персонажей, с акцентом на реалистичное движение и выразительную отрисовку персонажей.
moonshotai/kimi-k2.6
Kimi K2.6 — это мультимодальная модель следующего поколения от Moonshot AI, предназначенная для долгосрочного программирования, генерации UI/UX на основе кода и мультиагентной оркестрации. Она справляется со сложными сквозными задачами программирования на Python, Rust и Go, а также может преобразовывать промпты и визуальные входные данные в готовые к эксплуатации интерфейсы. Её архитектура роя агентов масштабируется до сотен параллельных субагентов для автономной декомпозиции задач — создавая документы, веб-сайты и электронные таблицы за один запуск без участия человека.
mistralai/voxtral-mini-tts-2603
Voxtral Mini TTS — это модель преобразования текста в речь от Mistral, поддерживающая клонирование голоса без обучения (zero-shot) и многоязычность. Она преобразует текстовый ввод в естественно звучащий аудиовыход.
google/gemini-embedding-2-preview
Gemini Embedding 2 Preview — первая мультимодальная модель встраивания от Google. В настоящее время мы поддерживаем сопоставление текста и изображений в едином векторном пространстве для семантического поиска и поисковой дополненной генерации (RAG). Она поддерживает входной контекст до 8,192 токенов и гибкие размеры выходных векторов от 128 до 3,072 (рекомендуется: 768, 1536 или 3,072). Разработана для кросс-модального сходства — вы можете встроить текстовый запрос и получить наиболее релевантные изображения или наоборот, — что делает её хорошо подходящей для мультимодального поиска, рекомендаций и конвейеров понимания документов.
anthropic/claude-opus-4.7
Opus 4.7 — это следующее поколение семейства Anthropic's Opus, созданное для долгоиграющих асинхронных агентов. Опираясь на сильные стороны кодирования и агентности Opus 4.6, оно обеспечивает более высокую производительность в сложных многошаговых задачах и более надежное агентное выполнение в расширенных рабочих процессах. Особенно эффективно для асинхронных агентных конвейеров, где задачи разворачиваются во времени — большие кодовые базы, многоэтапная отладка и сквозная оркестрация проектов. Помимо кодирования, Opus 4.7 расширяет возможности интеллектуальной работы — от составления документов и создания презентаций до анализа данных. Он поддерживает согласованность в очень длинных выводах и длительных сессиях, что делает его надежным выбором по умолчанию для задач, требующих настойчивости, суждения и доведения до конца. Для пользователей, переходящих с более ранних версий Opus, см. официальное руководство по миграции здесь.
alibaba/wan-2.7
Wan 2.7 — это модель генерации видео от Alibaba. Она поддерживает генерацию видео по тексту, по изображению с управлением первым и последним кадром, а также по референсам, где несколько референсных изображений задают стиль и содержание генерируемой сцены.
bytedance/seedance-2.0
Seedance 2.0 — это модель генерации видео от ByteDance. Она поддерживает генерацию видео из текста, из изображения с контролем первого и последнего кадра, а также мультимодальную генерацию по референсу. Она особенно сильна в сохранении согласованности персонажа, визуального стиля и движения камеры из референсного материала. Количество токенов вычисляется по формуле (высота выходного видео ширина выходного видео длительность * 24) / 1024.
bytedance/seedance-2.0-fast
Seedance 2.0 Fast — это модель генерации видео от ByteDance. Она поддерживает преобразование текста в видео, изображения в видео с управлением первым и последним кадром, а также мультимодальное преобразование референса в видео. Она ставит приоритет на скорость генерации и низкую стоимость, а не на максимальное качество вывода. Количество токенов определяется как (высота выходного видео ширина выходного видео длительность * 24) / 1024
z-ai/glm-5.1
GLM-5.1 обеспечивает значительный скачок в возможностях программирования, особенно заметный при работе с долгосрочными задачами. В отличие от предыдущих моделей, ориентированных на взаимодействие в масштабе минут, GLM-5.1 может работать независимо и непрерывно над одной задачей в течение более чем 8 часов, автономно планируя, выполняя и улучшая себя в процессе, в конечном итоге предоставляя полные результаты инженерного уровня.
cohere/rerank-4-pro
Поисковая фундаментальная модель AI от Cohere для повышения релевантности информации, отображаемой в поисковых и RAG-системах. Отличается контекстным окном 32K, многоязычной поддержкой более чем 100+ языков, отсутствием необходимости предварительной обработки данных, а также передовой производительностью с низкой задержкой.
cohere/rerank-4-fast
Поисковая фундаментальная модель AI от Cohere для повышения релевантности информации, отображаемой в поисковых и RAG-системах. Отличается контекстным окном 32K, многоязычной поддержкой на 100+ языках, отсутствием необходимости предварительной обработки данных и высокой производительностью с минимальной задержкой.
cohere/rerank-v3.5
Rerank v3.5 предназначена для переупорядочивания результатов поиска с целью повышения релевантности. Поддерживает реранжирование мультиаспектных и полуструктурированных данных на 100+ языках. Идеально подходит для уточнения результатов пайплайнов семантического или ключевого поиска.
google/gemma-4-26b-a4b-it
Gemma 4 26B A4B IT — это модель Mixture-of-Experts (MoE) с инструкционной настройкой от Google DeepMind. Несмотря на 25.2B общих параметров, во время инференса активируется только 3.8B на токен, что обеспечивает качество, близкое к -31B, при доле вычислительных затрат. Поддерживает мультимодальный ввод, включая текст, изображения и видео (до 60 секунд при 1fps). Имеет контекстное окно в 256K токенов, встроенный вызов функций, настраиваемый режим мышления/рассуждения и поддержку структурированного вывода. Выпущена под лицензией Apache 2.0.
google/gemma-4-31b-it
Gemma 4 31B Instruct — это 30.7B плотная мультимодальная модель Google DeepMind, поддерживающая ввод текста и изображений с выводом текста. Она имеет контекстное окно размером 256K токенов, настраиваемый режим мышления/рассуждений, встроенный вызов функций и многоязычную поддержку для 140+ языков. Сильна в задачах программирования, рассуждений и понимания документов. Лицензия Apache 2.0.
qwen/qwen3.6-plus
Qwen 3.6 Plus построена на гибридной архитектуре, сочетающей эффективное линейное внимание с маршрутизацией разреженных смесей экспертов, что обеспечивает высокую масштабируемость и высокопроизводительный вывод. По сравнению с серией 3.5 она обеспечивает значительные улучшения в агентном кодировании, фронтенд-разработке и общем рассуждении, а также значительно улучшенный опыт «вайб-кодинга». Модель превосходно справляется со сложными задачами, такими как 3D-сцены, игры и решение проблем на уровне репозитория, достигая оценки 78.8 на SWE-bench Verified. Она представляет собой значительный скачок как в чисто текстовых, так и в мультимодальных возможностях, работая на уровне ведущих современных моделей.
z-ai/glm-5v-turbo
GLM-5V-Turbo — первая нативная мультимодальная агентная фундаментальная модель Z.ai, созданная для задач визуального программирования и управления агентами. Она нативно обрабатывает изображения, видео и текстовые входные данные, превосходно справляется с долгосрочным планированием, сложным программированием и выполнением задач, а также бесшовно работает с агентами, замыкая полный цикл «восприятие → планирование → выполнение».
arcee-ai/trinity-large-thinking
Trinity Large Thinking — это мощная открытая модель рассуждений от команды Arcee AI. Она показывает высокую производительность в PinchBench, агентных нагрузках и задачах на рассуждение. Видео запуска: https://youtu.be/Gc82AXLa0Rg?si=4RLn6WBz33qT--B7 Эта модель оптимизирована для агентных рабочих процессов и показывает наилучшие результаты при сохранении рассуждений (так называемое перемежающееся мышление). Узнайте, как сохранять рассуждения, в нашей документации: https://openrouter.ai/docs/guides/best-practices/reasoning-tokens#preserving-reasoning
x-ai/grok-4.20-multi-agent
Grok 4.20 Multi-Agent — это вариант Grok 4.20 от SpaceXAI, предназначенный для совместных агентных рабочих процессов. Несколько агентов работают параллельно, чтобы проводить глубокое исследование, координировать использование инструментов и синтезировать информацию при решении сложных задач. Поведение уровня усилий рассуждения: low / medium: агенты 4 high / xhigh: агенты 16
x-ai/grok-4.20
Grok 4.20 — это модель рассуждения от SpaceXAI с ведущей в отрасли скоростью и возможностями агентного вызова инструментов. Она сочетает самый низкий на рынке уровень галлюцинаций со строгим следованием инструкциям, обеспечивая стабильно точные и правдивые ответы. Рассуждение можно включить/отключить с помощью параметра reasoning enabled в API. Подробнее в нашей документации
google/lyria-3-pro-preview
Полные песни оцениваются в $0.08 за песню. Lyria 3 — это семейство моделей генерации музыки от Google, доступное через Gemini API. С помощью Lyria 3 вы можете создавать высококачественное стереоаудио с частотой 48кГц на основе текстовых подсказок или изображений. Эти модели обеспечивают структурную целостность, включая вокал, синхронизированные по времени тексты песен и полные инструментальные аранжировки. Lyria 3 Pro могут генерировать полноформатные песни с куплетами, припевами и бриджами.
google/lyria-3-clip-preview
Клипы длительностью 30 секунд стоят $0.04 за клип. Lyria 3 — это семейство моделей генерации музыки от Google, доступное через Gemini API. С помощью Lyria 3 вы можете создавать высококачественное стереоаудио с частотой 48 кГц из текстовых подсказок или изображений. Эти модели обеспечивают структурную целостность, включая вокал, синхронизированные тексты песен и полные инструментальные аранжировки. Lyria 3 Clip могут генерировать короткие клипы, лупы, превью.
alibaba/wan-2.6
Alibaba's most advanced video generation model, supporting over 10 visual creation capabilities in a unified system. Wan 2.6 generates 1080p video at 24fps from text, images, reference videos, or audio, with native audio-visual synchronization and precise lip-sync. Key features include reference-to-video (insert a character's appearance and voice into new scenes), multi-shot storytelling from simple prompts, synchronized sound effects and music, and support for 16:9, 9:16, and 1:1 aspect ratios with clips up to 15 seconds.
kwaipilot/kat-coder-pro-v2
KAT-Coder-Pro V2 — это последняя высокопроизводительная модель в серии KwaiKAT KAT-Coder, предназначенная для сложной корпоративной разработки программного обеспечения и интеграции с SaaS. Она опирается на сильные стороны агентного кодирования предыдущих версий, с акцентом на крупномасштабные производственные среды, координацию множества систем и бесшовную интеграцию с современными программными стеками, а также поддерживает генерацию веб-эстетики для создания производственных лендингов и презентаций.
bytedance/seedance-1-5-pro
ByteDance — аудиовизуальная генеративная модель следующего поколения с архитектурой Dual-Branch Diffusion Transformer на 4.5B параметров. Seedance 1.5 Pro генерирует видео и аудио одновременно за один единый проход — это устраняет проблемы синхронизации при последовательном озвучивании. Поддерживает многоязычную синхронизацию губ (английский, мандаринский, японский, корейский, испанский и другие), кинематографическое управление камерой (панорамирование, наклон, масштабирование, орбитальное движение), диалоги нескольких персонажей и согласованность персонажей между кадрами. Pro создаёт клипы длительностью от 4 до 12 секунд с разрешением до 1080p. Количество токенов вычисляется по формуле: (высота выходного видео ширина выходного видео длительность * 24) / 1024
openai/sora-2-pro
OpenAI — флагманская модель генерации видео, создающая производственное видео с физически точным движением, синхронизированным аудио и сохранением состояния мира между кадрами. Sora 2 Pro следует сложным многосценным инструкциям, сохраняя согласованные пространственные соотношения — объекты не исчезают и не меняют форму между кадрами. Поддерживает преобразование текста в видео и изображения в видео, с синхронизированными фоновыми звуковыми ландшафтами, речью и звуковыми эффектами. Включает расширенную безопасность контента с метаданными происхождения C2PA и водяными знаками в стиле SynthID.
google/veo-3.1
Google — это передовая модель генерации видео, созданная для максимальной визуальной точности в финальных производственных версиях. Veo 3.1 генерирует высококачественное видео разрешением 1080p из текстовых или графических подсказок с нативным синхронизированным звуком — включая диалоги, эффекты окружения и фоновые звуки. Поддерживает расширение сцен (до 20 связанных клипов для повествований длительностью 140+ секунд), переходы между двумя изображениями, вертикальное видео для Shorts и апскейлинг 4K.
rekaai/reka-edge
Reka Edge — это чрезвычайно эффективная мультимодальная модель 7B, которая принимает изображения, видео и текст на входе и генерирует текстовые ответы. Модель оптимизирована специально для достижения ведущих в отрасли результатов в области понимания изображений, анализа видео, обнаружения объектов и использования инструментов агентами.
minimax/minimax-m2.7
MiniMax-M2.7 — это большая языковая модель нового поколения, предназначенная для автономной продуктивности в реальных условиях и постоянного совершенствования. Созданная для активного участия в собственной эволюции, M2.7 интегрирует передовые агентные возможности благодаря мультиагентному взаимодействию, что позволяет ей планировать, выполнять и уточнять сложные задачи в динамических средах. Обученная для работы на производственном уровне, M2.7 справляется с такими задачами, как живая отладка, анализ первопричин, финансовое моделирование и полная генерация документов в Word, Excel и PowerPoint. Она показывает высокие результаты на тестах, включая 56.2% на SWE-Pro и 57.0% на Terminal Bench 2, а также достигает 1495 ELO на GDPval-AA, устанавливая новый стандарт для мультиагентных систем, работающих в реальных цифровых процессах.
openai/gpt-5.4-nano
GPT-5.4 nano — самый легковесный и экономичный вариант семейства GPT-5.4, оптимизированный для задач, критичных к скорости и большим объёмам. Он поддерживает ввод текста и изображений и предназначен для сценариев с низкой задержкой, таких как классификация, извлечение данных, ранжирование и выполнение субагентов. Модель ставит приоритет на отзывчивость и эффективность, а не на глубокое рассуждение, что делает её идеальной для конвейеров, требующих быстрых и надёжных результатов в масштабе. GPT-5.4 nano хорошо подходит для фоновых задач, систем реального времени и распределённых агентных архитектур, где минимизация затрат и задержек критически важна.
openai/gpt-5.4-mini
GPT-5.4 mini переносит основные возможности GPT-5.4 в более быструю и эффективную модель, оптимизированную для высоконагруженных рабочих нагрузок. Она поддерживает ввод текста и изображений, обеспечивая высокую производительность в рассуждениях, написании кода и использовании инструментов, при этом снижая задержку и стоимость для масштабных развертываний. Модель предназначена для производственных сред, требующих баланса между производительностью и эффективностью, что делает её подходящей для чат-приложений, помощников по программированию и агентских рабочих процессов, работающих в масштабе. GPT-5.4 mini обеспечивает надёжное следование инструкциям, уверенные многошаговые рассуждения и стабильные результаты в различных задачах при улучшенной экономической эффективности.
mistralai/mistral-small-2603
Mistral Small 4 — это следующий крупный релиз в семействе Mistral Small, объединяющий возможности нескольких флагманских моделей Mistral в единую систему. Он сочетает в себе сильные рассуждения от Magistral, мультимодальное понимание от Pixtral и агентные возможности кодирования от Devstral, позволяя одной модели выполнять сложный анализ, разработку программного обеспечения и визуальные задачи в рамках одного рабочего процесса.
perplexity/pplx-embed-v1-4b
pplx-embed-v1 -4B — одна из современных моделей текстовых эмбеддингов Perplexity, созданных для реального веб-масштабного поиска. pplx-embed-v1 оптимизирована для стандартного плотного текстового поиска: модель с 4B параметрами максимизирует качество поиска.
perplexity/pplx-embed-v1-0.6b
pplx-embed-v1-0.6B — одна из передовых моделей встраивания текста от Perplexity, разработанная для реального поиска в веб-масштабе. pplx-embed-v1 оптимизирована для стандартного плотного текстового поиска с моделью с параметрами 0.6B, ориентированной на лёгкую и низколатентную генерацию встраиваний.
z-ai/glm-5-turbo
GLM-5 Turbo — это новая модель от Z.ai, предназначенная для быстрого вывода и высокой производительности в средах, управляемых агентами, таких как OpenClaw. Она глубоко оптимизирована для реальных рабочих процессов агентов, включая длинные цепочки выполнения, улучшенную обработку сложных инструкций, декомпозицию задач, использование инструментов, плановое и постоянное выполнение, а также общую стабильность при длительных задачах.
nvidia/nemotron-3-super-120b-a12b
NVIDIA Nemotron 3 Super — это открытая гибридная модель MoE с параметрами 120B, активирующая всего 12B параметров для максимальной вычислительной эффективности и точности в сложных мультиагентных приложениях. Построенная на гибридной архитектуре Mamba-Transformer Mixture-of-Experts с многотокенным предсказанием (MTP), она обеспечивает более чем 50% более высокую генерацию токенов по сравнению с ведущими открытыми моделями. Модель имеет контекстное окно в 1M токенов для долгосрочной когерентности агента, междокументного рассуждения и многошагового планирования задач. Латентный MoE позволяет вызывать 4 экспертов по стоимости вывода только одного, улучшая интеллект и обобщение. Многосредовое обучение RL на 10+ средах обеспечивает ведущую точность на бенчмарках, включая AIME 2025, TerminalBench и SWE-Bench Verified. Полностью открытая с весами, наборами данных и рецептами под открытой лицензией NVIDIA, Nemotron 3 Super позволяет легко настраивать и безопасно развертывать где угодно — от рабочей станции до облака.
bytedance-seed/seed-2.0-lite
Seed-2.0-Lite — это универсальная и экономичная корпоративная рабочая лошадка, которая обеспечивает мощные мультимодальные и агентные возможности при заметно более низкой задержке, что делает её практичным выбором по умолчанию для большинства производственных нагрузок, связанных с текстом, зрением и инструментами. Разработанная для высокочастотного визуального понимания и агентных рабочих процессов, она идеально подходит для масштабного развёртывания с минимальной задержкой.
qwen/qwen3.5-9b
Qwen3.5-9B — это мультимодальная фундаментальная модель из семейства Qwen3.5, разработанная для обеспечения сильных рассуждений, программирования и визуального понимания в эффективной архитектуре с 9B параметрами. Она использует унифицированный дизайн «зрение-язык» с ранним слиянием мультимодальных токенов, что позволяет модели обрабатывать и рассуждать над текстом и изображениями в одном контексте.
openai/gpt-5.4-pro
GPT-5.4 Pro — самая современная модель OpenAI, основанная на единой архитектуре GPT-5.4 с улучшенными возможностями рассуждения для сложных задач с высокими ставками. Она имеет контекстное окно на 1M+ токенов (922K на вход, 128K на выход) с поддержкой текстовых и графических входных данных. Оптимизированная для пошаговых рассуждений, следования инструкциям и точности, GPT-5.4 Pro превосходно справляется с агентным программированием, длинными контекстными рабочими процессами и многошаговым решением задач.
openai/gpt-5.4
GPT-5.4 — новейшая фронтирная модель OpenAI, объединяющая линейки Codex и GPT в единую систему. Она поддерживает контекстное окно размером 1M+ токенов (922K на входе, 128K на выходе) с поддержкой текстовых и графических входных данных, что позволяет выполнять рассуждения с большим контекстом, программирование и мультимодальный анализ в рамках одного рабочего процесса. Модель обеспечивает улучшенную производительность в программировании, понимании документов, использовании инструментов и следовании инструкциям. Она разработана как надёжное решение по умолчанию как для задач общего назначения, так и для программной инженерии, способна генерировать производственный код, синтезировать информацию из множества источников и выполнять сложные многошаговые рабочие процессы с меньшим количеством итераций и большей эффективностью использования токенов.
inception/mercury-2
Mercury 2 — это чрезвычайно быстрая модель рассуждений LLM и первая диффузионная модель рассуждений LLM (dLLM). Вместо последовательной генерации токенов Mercury 2 создаёт и уточняет несколько токенов параллельно, достигая >1,000 токенов/сек на стандартном GPUs. Mercury 2 работает в 5x+ раз быстрее, чем ведущие оптимизированные по скорости LLMs, такие как Claude 4.5 Haiku и GPT 5 Mini, при значительно меньшей стоимости. Mercury 2 поддерживает настраиваемые уровни рассуждений, контекст 128K, нативное использование инструментов и вывод JSON, соответствующий схеме. Создан для рабочих процессов программирования, где задержки накапливаются, для голосовых/поисковых операций в реальном времени и агентных циклов. Совместим с OpenAI API. Подробнее читайте в блог-посте.
google/gemini-3.1-flash-lite-preview
Gemini 3.1 Flash Lite Preview — это высокоэффективная модель Google, оптимизированная для сценариев с большими объёмами использования. Она превосходит Gemini 2.5 Flash Lite по общему качеству и приближается к производительности Gemini 2.5 Flash по ключевым возможностям. Улучшения охватывают аудиовход/ASR, ранжирование фрагментов RAG, перевод, извлечение данных и завершение кода. Поддерживаются все уровни мышления (минимальный, низкий, средний, высокий) для точной настройки соотношения затрат и производительности. Цена составляет половину стоимости Gemini 3 Flash.
bytedance-seed/seed-2.0-mini
Seed-2.0-mini ориентирован на сценарии с высокой чувствительностью к задержке, высокой степенью параллелизма и высокой чувствительностью к стоимости, с акцентом на быстрый ответ и гибкое развертывание инференса. Он обеспечивает производительность, сопоставимую с ByteDance-Seed-1.6, поддерживает контекст 256k, четыре режима усилия рассуждения (минимальный/низкий/средний/высокий), мультимодальное понимание и оптимизирован для легких задач, где приоритет отдается стоимости и скорости.
google/gemini-3.1-flash-image-preview
Gemini 3.1 Flash Image Preview, также известная как «Nano Banana 2», — это последняя модель генерации и редактирования изображений уровня state of the art от Google, обеспечивающая визуальное качество уровня Pro при скорости Flash. Она сочетает расширенное контекстное понимание с быстрым и экономичным инференсом, делая сложную генерацию изображений и итеративное редактирование значительно более доступными. Соотношение сторон можно контролировать с помощью параметра image_config API
qwen/qwen3.5-35b-a3b
Серия Qwen3.5 35B-A3B представляет собой нативную визуально-языковую модель, разработанную с гибридной архитектурой, которая объединяет механизмы линейного внимания и разреженную модель смеси экспертов, обеспечивая более высокую эффективность вывода. Её общая производительность сопоставима с производительностью Qwen3.5-27B.
qwen/qwen3.5-27b
Модель Qwen3.5 27B, основанная на плотном vision-language подходе, использует механизм линейного внимания, обеспечивая быструю реакцию при сохранении баланса между скоростью вывода и производительностью. Её общие возможности сопоставимы с характеристиками Qwen3.5-122B-A10B.
qwen/qwen3.5-122b-a10b
Нативная визуально-языковая модель Qwen3.5 122B-A10B построена на гибридной архитектуре, которая объединяет механизм линейного внимания с разреженной моделью смеси экспертов, обеспечивая более высокую эффективность инференса. По общей производительности эта модель уступает только Qwen3.5-397B-A17B. Её текстовые возможности значительно превосходят возможности Qwen3-235B-2507, а визуальные возможности превосходят Qwen3-VL-235B.
qwen/qwen3.5-flash-02-23
Нативные визуально-языковые Flash-модели Qwen3.5 построены на гибридной архитектуре, которая объединяет механизм линейного внимания с разреженной моделью смеси экспертов, обеспечивая более высокую эффективность инференса. По сравнению с серией 3 эти модели совершают скачок в производительности как для чисто текстовых, так и для мультимодальных задач, предлагая быстрое время отклика и одновременно балансируя скорость инференса и общую производительность.
google/gemini-3.1-pro-preview-customtools
Gemini 3.1 Pro Preview Custom Tools — это вариант Gemini 3.1 Pro, который улучшает поведение при выборе инструментов, предотвращая чрезмерное использование общего bash-инструмента, когда доступны более эффективные сторонние или пользовательские функции. Эта специализированная предварительная конечная точка значительно повышает надёжность вызова функций и гарантирует, что модель выбирает наиболее подходящий инструмент в программных агентах и сложных многоинструментальных рабочих процессах. Она сохраняет ключевые сильные стороны Gemini 3.1 Pro, включая мультимодальные рассуждения по тексту, изображениям, видео, аудио и коду, контекстное окно на 1M токенов и высокую производительность в разработке программного обеспечения.
openai/gpt-5.3-codex
GPT-5.3-Codex — это самая продвинутая агентная модель для написания кода от OpenAI, сочетающая передовую производительность в разработке программного обеспечения GPT-5.2-Codex с более широкими возможностями рассуждения и профессиональными знаниями GPT-5.2. Она достигает самых современных результатов на SWE-Bench Pro и высоких показателей в Terminal-Bench 2.0 и OSWorld-Verified, что отражает улучшенное многоязычное программирование, владение терминалом и навыки реального использования компьютера. Модель оптимизирована для длительных рабочих процессов с использованием инструментов и поддерживает интерактивное управление во время выполнения, что делает её подходящей для сложных задач разработки, отладки, развертывания и итеративной работы над продуктом. Помимо программирования, GPT-5.3-Codex показывает высокие результаты на бенчмарках структурированной работы со знаниями, таких как GDPval, поддерживая такие задачи, как составление документов, анализ электронных таблиц, создание слайдов и операционные исследования в различных областях. Она обучена с усиленным вниманием к кибербезопасности, включая возможности выявления уязвимостей, и развернута с дополнительными мерами защиты для случаев высокого риска. По сравнению с предыдущими моделями Codex, она более эффективно использует токены и примерно на 25% быстрее, ориентируясь на профессиональные сквозные рабочие процессы, охватывающие рассуждение, выполнение и взаимодействие с компьютером.
aion-labs/aion-2.0
Aion-2.0 — это вариант модели DeepSeek V3.2, оптимизированный для захватывающей ролевой игры и повествования. Она особенно сильна в создании напряжения, кризисов и конфликтов в историях, делая повествование более увлекательным. Кроме того, она обрабатывает зрелые и более тёмные темы с большей нюансировкой и глубиной.
google/gemini-3.1-pro-preview
Gemini 3.1 Pro Preview — это флагманская модель рассуждений от Google, обеспечивающая повышенную производительность в разработке ПО, улучшенную надежность агентов и более эффективное использование токенов в сложных рабочих процессах. Опираясь на мультимодальную основу серии Gemini 3, она сочетает высокоточные рассуждения по тексту, изображениям, видео, аудио и коду с контекстным окном на 1M токенов. Детали рассуждений сохраняются при использовании многошаговых вызовов инструментов, см. документацию: https://openrouter.ai/docs/use-cases/reasoning-tokens#preserving-reasoning. Обновление 3.1 обеспечивает измеримые улучшения в бенчмарках SWE и в реальных средах программирования, а также более сильное автономное выполнение задач в структурированных областях, таких как финансы и работа с электронными таблицами. Разработанная для продвинутых систем и агентных архитектур, Gemini 3.1 Pro Preview улучшает долгосрочную стабильность и оркестрацию инструментов, повышая при этом эффективность использования токенов. Она вводит новый средний уровень мышления для лучшего баланса между стоимостью, скоростью и производительностью. Модель отлично справляется с агентным программированием, структурированным планированием, мультимодальным анализом и автоматизацией рабочих процессов, что делает её идеальной для автономных агентов, финансового моделирования, работы с электронными таблицами и корпоративных задач с высоким контекстом.
anthropic/claude-sonnet-4.6
Sonnet 4.6 — это самая производительная модель Sonnet-класса от Anthropic, обеспечивающая передовую производительность в программировании, работе с агентами и профессиональных задачах. Она превосходно подходит для итеративной разработки, навигации по сложным кодовым базам, сквозного управления проектами с памятью, создания качественных документов и уверенного использования компьютера для веб-QA и автоматизации рабочих процессов.
qwen/qwen3.5-plus-02-15
Модели Plus нативной серии Qwen3.5 для vision-language построены на гибридной архитектуре, которая объединяет механизмы линейного внимания с разреженными моделями смеси экспертов, достигая более высокой эффективности вывода. В ходе разнообразных оценок задач серия 3.5 стабильно демонстрирует результаты на уровне современных передовых моделей. По сравнению с серией 3, эти модели показывают значительный прогресс как в работе с чистым текстом, так и в мультимодальных возможностях.
qwen/qwen3.5-397b-a17b
Серия Qwen3.5 (397B–A17B) — это нативная модель «Vision-Language», построенная на гибридной архитектуре, которая объединяет механизм линейного внимания с разреженной моделью «смесь экспертов», что обеспечивает более высокую эффективность вывода. Она демонстрирует производительность, сопоставимую с ведущими современными моделями, в широком спектре задач: понимание языка, логические рассуждения, генерация кода, агентные сценарии, понимание изображений и видео, а также взаимодействие с графическими интерфейсами (GUI). Благодаря развитым возможностям генерации кода и агентному подходу модель показывает высокую обобщающую способность в разнообразных прикладных областях.
minimax/minimax-m2.5
MiniMax-M2.5 — это большая языковая модель SOTA, предназначенная для реальной продуктивности. Обученная на разнообразных сложных реальных цифровых рабочих средах, M2.5 опирается на экспертизу в программировании M2.1, чтобы расшириться на общую офисную работу, достигая свободного владения генерацией и работой с файлами Word, Excel и Powerpoint, переключением контекста между разнообразными программными средами и работой в разных командах агентов и людей. Набрав 80.2% на SWE-Bench Verified, 51.3% на Multi-SWE-Bench и 76.3% на BrowseComp, M2.5 также более эффективен по токенам, чем предыдущие поколения, будучи обученным оптимизировать свои действия и вывод через планирование.
z-ai/glm-5
GLM-5 — это флагманская open-source базовая модель Z.ai, разработанная для проектирования сложных систем и долгосрочных агентных рабочих процессов. Созданная для опытных разработчиков, она обеспечивает производительность производственного уровня при решении крупномасштабных задач программирования, конкурируя с ведущими закрытыми моделями. Благодаря продвинутому агентному планированию, глубоким внутренним рассуждениям и итеративной самокоррекции GLM-5 выходит за рамки генерации кода, обеспечивая построение целых систем и автономное выполнение.
qwen/qwen3-max-thinking
Qwen3-Max-Thinking — это флагманская модель рассуждений в серии Qwen3, разработанная для ответственных когнитивных задач, требующих глубоких многошаговых рассуждений. Значительное масштабирование вычислительных мощностей модели и обучения с подкреплением обеспечивает существенный прирост фактической точности, сложности рассуждений, точности следования инструкциям, соответствия предпочтениям людей и агентного поведения.
anthropic/claude-opus-4.6
Opus 4.6 — это самая мощная модель Anthropic для программирования и длительных профессиональных задач. Она создана для агентов, работающих в рамках целых рабочих процессов, а не отдельных запросов, что делает её особенно эффективной для больших кодовых баз, сложных рефакторингов и многоэтапной отладки, разворачивающейся во времени. Модель демонстрирует более глубокое понимание контекста, более сильную декомпозицию задач и большую надёжность при решении сложных инженерных задач по сравнению с предыдущими поколениями. Помимо программирования, Opus 4.6 превосходно справляется с длительной интеллектуальной работой. Она создаёт документы, планы и аналитические материалы, готовые к использованию, за один проход, и сохраняет связность в очень длинных выходных данных и продолжительных сессиях. Это делает её надёжным выбором по умолчанию для задач, требующих настойчивости, суждения и доведения до конца, таких как техническое проектирование, планирование миграции и сквозное выполнение проектов. Для пользователей, переходящих с более ранних версий Opus, см. официальное руководство по миграции здесь
qwen/qwen3-coder-next
Qwen3-Coder-Next — это языковая модель с открытым весом и архитектурой причинно-следственного типа, оптимизированная для агентов кодинга и локальных рабочих процессов разработки. Она использует разреженную конструкцию MoE с 80B общими параметрами, из которых при обработке каждого токена активируется только 3B, что обеспечивает производительность, сопоставимую с моделями, имеющими в 10–20x более высокую активную вычислительную нагрузку. Это делает её хорошо подходящей для затратно-чувствительного и постоянно работающего развертывания агентов. Модель обучена с сильным акцентом на агентский сценарий и надёжно работает при выполнении длительных задач по кодингу, сложном использовании инструментов и восстановлении после сбоев выполнения. Благодаря собственному контекстному окну 256k она легко интегрируется в реальные среды CLI и IDE и хорошо адаптируется к распространённым агентским каркасам, используемым современными инструментами разработки. Модель работает исключительно в режиме без рассуждений и не генерирует блоки thinking, что упрощает интеграцию для производственных агентов кодинга.
sourceful/riverflow-v2-pro
Riverflow V2 Pro — это самая мощная версия линейки Sourceful Riverflow 2.0, обеспечивающая максимальный контроль и идеальное качество отрисовки текста. Серия Riverflow 2.0 представляет собой производительность уровня SOTA для задач генерации и редактирования изображений, используя интегрированную модель рассуждений для повышения надёжности и решения сложных задач. Цена составляет $0.15 за 1K/2K выходное изображение и $0.33 за 4K выходное изображение. Дополнительные возможности: Отрисовка пользовательских шрифтов через font_inputs ($0.03/шрифт, макс. 2) Улучшение изображений через super_resolution_references ($0.20/референс, макс. 4) Подробности см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: Sourceful накладывает ограничение на размер запроса в 4.5MB, поэтому настоятельно рекомендуется передавать URLs изображения вместо данных Base64.
sourceful/riverflow-v2-fast
Riverflow V2 Fast — самый быстрый вариант линейки Riverflow 2.0 от Sourceful, оптимален для продакшен-развёртываний и рабочих процессов, критичных к задержке. Серия Riverflow 2.0 представляет производительность SOTA в задачах генерации и редактирования изображений, используя интегрированную модель рассуждений для повышения надёжности и решения сложных задач. Цена составляет $0.02 за 1K выходное изображение и $0.04 за 2K выходное изображение. Не поддерживает вывод изображений 4K. Дополнительные возможности: Отрисовка пользовательских шрифтов через font_inputs ($0.03/шрифт, макс. 2) Улучшение изображений через super_resolution_references ($0.20/референс, макс. 4) Подробнее см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: Sourceful устанавливает ограничение на размер запроса 4.5MB, поэтому настоятельно рекомендуется передавать изображение URLs вместо данных Base64.
stepfun/step-3.5-flash
Step 3.5 Flash — это наиболее производительная открытая фундаментальная модель StepFun. Построенная на архитектуре разреженной смеси экспертов (MoE), она выборочно активирует только 11B из своих 196B параметров на каждый токен. Это модель рассуждений, которая невероятно эффективна по скорости даже при длинных контекстах.
moonshotai/kimi-k2.5
Kimi K2.5 — это нативная мультимодальная модель Moonshot AI, обеспечивающая передовые возможности визуального кодирования и самодостаточную парадигму роя агентов. Построенная на базе Kimi K2 с продолженным предобучением на примерно 15T смешанных визуальных и текстовых токенах, она демонстрирует высокую производительность в общем рассуждении, визуальном кодировании и агентном вызове инструментов.
upstage/solar-pro-3
Solar Pro 3 — это мощная языковая модель со смесью экспертов (MoE) от Upstage. С 102B общими параметрами и 12B активными параметрами за один прямой проход она обеспечивает исключительную производительность, сохраняя вычислительную эффективность. Оптимизирована для корейского языка с поддержкой японского и английского.
minimax/minimax-m2-her
MiniMax M2-her — это большая языковая модель, ориентированная в первую очередь на диалог и созданная для захватывающей ролевой игры, общения с персонажами и выразительных многоходовых бесед. Разработанная для сохранения последовательности в тоне и личности, она поддерживает расширенные роли сообщений (user_system, группа, sample_message_user, sample_message_ai) и может учиться на примерах диалогов, чтобы лучше соответствовать стилю и темпу вашего сценария, что делает её отличным выбором для повествования, компаньонов и разговорных сценариев, где важны естественный поток и яркое взаимодействие.
writer/palmyra-x5
Palmyra X5 — самая передовая модель Writer, специально созданная для разработки и масштабирования AI-агентов на уровне предприятия. Она обеспечивает ведущую в отрасли скорость и эффективность при работе с контекстными окнами до 1 миллионов токенов благодаря новой архитектуре трансформера и гибридным механизмам внимания. Это обеспечивает более быстрый вывод и расширенную память для обработки больших объёмов корпоративных данных, что критически важно для масштабирования AI-агентов.
openai/gpt-audio
Модель gpt-audio — это OpenAI первая общедоступная аудиомодель. Новый снимок модели включает улучшенный декодер для более естественного звучания голоса и лучшей согласованности голоса. Стоимость Audio составляет $32 за миллион входных токенов и $64 за миллион выходных токенов.
openai/gpt-audio-mini
Экономичная версия GPT Audio. Новая версия включает улучшенный декодер для более естественного звучания голоса и сохраняет лучшую согласованность голоса. Входные данные оцениваются в $0.60 за миллион токенов, а выходные — в $2.40 за миллион токенов.
z-ai/glm-4.7-flash
Являясь моделью класса 30B-SOTA, GLM-4.7-Flash предлагает новый вариант, который балансирует производительность и эффективность. Она дополнительно оптимизирована для агентских сценариев использования в кодинге, усиливая возможности программирования, планирования долгосрочных задач и взаимодействия с инструментами, и достигла ведущих показателей среди open-source моделей того же размера в нескольких актуальных публичных рейтингах бенчмарков.
black-forest-labs/flux.2-klein-4b
FLUX.2 [klein] 4B — самая быстрая и экономически эффективная модель в семействе FLUX.2, оптимизированная для сценариев с высокой пропускной способностью при сохранении отличного качества изображений. Ценообразование основано на выходном изображении. Первый сгенерированный мегапиксель стоит $0.014. Каждый последующий мегапиксель стоит $0.001.
openai/gpt-5.2-codex
GPT-5.2-Codex — это обновлённая версия GPT-5.1-Codex, оптимизированная для разработки программного обеспечения и рабочих процессов написания кода. Она предназначена как для интерактивных сессий разработки, так и для длительного независимого выполнения сложных инженерных задач. Модель поддерживает создание проектов с нуля, разработку функций, отладку, масштабный рефакторинг и проверку кода. По сравнению с GPT-5.1-Codex, 5.2-Codex более управляема, точно следует инструкциям разработчика и выдаёт более чистый и качественный код. Уровень рассуждений можно настраивать с помощью параметра reasoning.effort. Читайте документацию здесь. Codex интегрируется в среды разработки, включая CLI, расширения IDE, GitHub и облачные задачи. Он динамически адаптирует уровень рассуждений — обеспечивает быстрые ответы для небольших задач и поддерживает длительные многочасовые сессии для крупных проектов. Модель обучена проводить структурированные проверки кода, выявляя критические ошибки за счёт анализа зависимостей и проверки поведения на тестах. Она также поддерживает мультимодальные входные данные, такие как изображения или скриншоты, для разработки UI, и интегрирует использование инструментов для поиска, установки зависимостей и настройки окружения. Codex предназначен специально для агентных задач написания кода.
bytedance-seed/seedream-4.5
Seedream 4.5 — это новейшая внутренняя модель генерации изображений, разработанная ByteDance. По сравнению с Seedream 4.0 она обеспечивает комплексные улучшения, особенно в согласованности редактирования, включая лучшее сохранение деталей объекта, освещения и цветового тона. Также улучшает уточнение портретов и отрисовку мелкого текста. Возможности композиции с несколькими изображениями были значительно усилены, и как логические способности, так и визуальная эстетика продолжают развиваться, что позволяет создавать более точные и художественно выразительные изображения. Цена составляет $0.04 за выходное изображение, независимо от размера.
bytedance-seed/seed-1.6-flash
Seed 1.6 Flash — это сверхбыстрая мультимодальная модель глубокого мышления от ByteDance Seed, поддерживающая как текстовое, так и визуальное понимание. Она обладает контекстным окном 256k и может генерировать выходные данные объемом до 16k токенов.
bytedance-seed/seed-1.6
Seed 1.6 — это универсальная модель, выпущенная командой ByteDance Seed. Она включает мультимодальные возможности и адаптивное глубокое мышление с окном контекста 256K.
minimax/minimax-m2.1
MiniMax-M2.1 — это легковесная большая языковая модель современного уровня, оптимизированная для программирования, агентных рабочих процессов и разработки современных приложений. Имея всего 10 миллиарда активных параметров, она обеспечивает значительный скачок в реальной производительности, сохраняя при этом исключительную задержку, масштабируемость и экономическую эффективность. По сравнению с предшественником, M2.1 выдаёт более чистые и лаконичные результаты и более быстрое воспринимаемое время ответа. Она демонстрирует ведущую многоязычную производительность в области кодирования в основных системах и языках приложений, достигая 49.4% в Multi-SWE-Bench и 72.5% в SWE-Bench Multilingual, и служит универсальным «мозгом» агента для IDEs, инструментов кодирования и общей помощи. Чтобы не допустить ухудшения производительности этой модели, MiniMax настоятельно рекомендует сохранять рассуждения между ходами. Узнайте больше об использовании reasoning_details для передачи рассуждений в нашей документации.
z-ai/glm-4.7
GLM-4.7 — это последняя флагманская модель Z.ai, с улучшениями в двух ключевых областях: расширенные возможности программирования и более стабильное многошаговое рассуждение/исполнение. Она демонстрирует значительные улучшения в выполнении сложных агентных задач, обеспечивая при этом более естественное общение и превосходную эстетику интерфейса.
google/gemini-3-flash-preview
Gemini 3 Flash Preview — это высокоскоростная и высокоценная модель мышления, разработанная для агентных рабочих процессов, многоходового чата и помощи в программировании. Она обеспечивает рассуждения и использование инструментов почти уровня Pro с существенно меньшей задержкой, чем более крупные варианты Gemini, что делает её хорошо подходящей для интерактивной разработки, длительных агентных циклов и задач совместного программирования. По сравнению с Gemini 2.5 Flash она обеспечивает широкие улучшения качества в рассуждениях, мультимодальном понимании и надёжности. Модель поддерживает окно контекста в 1M токенов и мультимодальные входные данные, включая текст, изображения, аудио, видео и PDFs, с выводом текста. Она включает настраиваемые рассуждения через уровни мышления (минимальный, низкий, средний, высокий), структурированный вывод, использование инструментов и автоматическое кэширование контекста. Gemini 3 Flash Preview оптимизирована для пользователей, которые хотят сильных рассуждений и агентного поведения без затрат или задержек полномасштабных передовых моделей.
black-forest-labs/flux.2-max
FLUX.2 [max] — это новая топ-модель изображений от Black Forest Labs, поднимающая качество изображений, понимание промптов и согласованность редактирования на самый высокий уровень на сегодняшний день. Цены следующие, согласно документации: Вход: мы взимаем $0.03 за каждый мегапиксель на входе (т.е. референсные изображения для редактирования) Выход: первый сгенерированный мегапиксель стоит $0.07. Каждый последующий мегапиксель стоит $0.03.
nvidia/nemotron-3-nano-30b-a3b
NVIDIA Nemotron 3 Nano 30B A3B — это небольшая языковая MoE модель с наивысшей вычислительной эффективностью и точностью для разработчиков, создающих специализированные агентные AI системы. Модель полностью открыта: открытые веса, наборы данных и рецепты позволяют разработчикам легко настраивать, оптимизировать и разворачивать модель на своей инфраструктуре для максимальной конфиденциальности и безопасности.
openai/gpt-5.2-chat
GPT-5.2 Chat (AKA Instant) — это быстрый и легковесный представитель семейства 5.2, оптимизированный для чатов с низкой задержкой и при этом сохраняющий высокий общий интеллект. Он использует адаптивные рассуждения, чтобы выборочно «размышлять» над сложными запросами, повышая точность в математике, программировании и многошаговых задачах, не замедляя при этом типичные разговоры. По умолчанию модель более тёплая и разговорчивая, лучше следует инструкциям и демонстрирует более стабильные краткие рассуждения. GPT-5.2 Chat предназначен для высоконагруженных интерактивных сценариев, где скорость отклика и согласованность важнее глубоких размышлений.
openai/gpt-5.2-pro
GPT-5.2 Pro — это самая продвинутая модель OpenAI, предлагающая значительные улучшения в агентном программировании и работе с длинным контекстом по сравнению с GPT-5 Pro. Она оптимизирована для сложных задач, требующих пошаговых рассуждений, следования инструкциям и точности в сценариях с высокими ставками. Модель поддерживает функции маршрутизации во время тестирования и расширенное понимание промптов, включая указанные пользователем намерения, например «хорошенько подумай об этом». Улучшения включают снижение галлюцинаций, подхалимства и более высокую производительность в задачах, связанных с программированием, письмом и здоровьем.
openai/gpt-5.2
GPT-5.2 — это новейшая модель пограничного класса в серии GPT-5, обеспечивающая более высокую производительность в агентных сценариях и работе с длинным контекстом по сравнению с GPT-5.1. Она использует адаптивные рассуждения для динамического распределения вычислительных ресурсов, быстро отвечая на простые запросы и затрачивая больше глубины на сложные задачи. Созданная для широкого охвата задач, GPT-5.2 обеспечивает стабильный прирост в математике, программировании, научных и инструментальных рабочих нагрузках, предлагая более связные развёрнутые ответы и повышенную надёжность использования инструментов.
mistralai/devstral-2512
Devstral 2 — это современная открытая модель от Mistral AI, специализирующаяся на агентном написании кода. Это плотная трансформерная модель с 123B параметрами, поддерживающая контекстное окно 256K. Devstral 2 поддерживает исследование кодовых баз и координацию изменений в нескольких файлах, сохраняя контекст на уровне архитектуры. Она отслеживает зависимости фреймворков, обнаруживает сбои и повторяет попытки с исправлениями — решая такие задачи, как исправление ошибок и модернизация устаревших систем. Модель можно дообучать для приоритизации конкретных языков или оптимизации для крупных корпоративных кодовых баз. Она доступна под модифицированной лицензией MIT.
relace/relace-search
Модель relace-search использует инструменты 4-12, view_file и grep параллельно для исследования кодовой базы и возврата релевантных файлов по запросу пользователя. В отличие от RAG, relace-search выполняет агентные многошаговые рассуждения, чтобы получить высокоточные результаты в 4 раз быстрее, чем любая передовая модель. Она предназначена для работы в качестве субагента, который передаёт свои результаты «оракулу» — агенту-кодеру, координирующему и выполняющему остальную часть задачи по написанию кода. Для использования relace-search необходимо создать подходящую среду агента и parse полученный ответ для извлечения релевантной информации, которую нужно передать «оракулу». Подробнее об этом можно прочитать в Relace документации.
z-ai/glm-4.6v
GLM-4.6V — это большая мультимодальная модель, предназначенная для высокоточного визуального понимания и рассуждений в длинном контексте по изображениям, документам и смешанным медиа. Модель поддерживает до 128K токенов, обрабатывает сложные макеты страниц и диаграммы непосредственно как визуальные входные данные, а также интегрирует нативную мультимодальную функцию вызова для связи восприятия с последующим выполнением инструментов. Модель также обеспечивает чередующуюся генерацию изображений и текста и рабочие процессы реконструкции UI, включая синтез из скриншота в HTML и итеративное визуальное редактирование.
openai/gpt-5.1-codex-max
GPT-5.1-Codex-Max — это последняя агентная модель для написания кода от OpenAI, разработанная для длительных задач разработки программного обеспечения с большим контекстом. Она основана на обновлённой версии стека рассуждений 5.1 и обучена на агентных рабочих процессах, охватывающих разработку программного обеспечения, математику и исследования. GPT-5.1-Codex-Max обеспечивает более высокую производительность, улучшенные рассуждения и более высокую эффективность использования токенов на всём жизненном цикле разработки.
amazon/nova-2-lite-v1
Nova 2 Lite — это быстрая, экономичная модель рассуждений для повседневных задач, которая может обрабатывать текст, изображения и видео для генерации текста. Nova 2 Lite демонстрирует выдающиеся возможности в обработке документов, извлечении информации из видео, генерации кода, предоставлении точных обоснованных ответов и автоматизации многошаговых агентных рабочих процессов.
mistralai/ministral-14b-2512
Самая крупная модель в семействе Ministral 3, Ministral 3 14B предлагает передовые возможности и производительность, сравнимые с её более крупным Mistral Small 3.2 24B аналогом. Мощная и эффективная языковая модель с возможностями зрения.
mistralai/ministral-8b-2512
Сбалансированная модель в семействе Ministral 3, Ministral 3 8B — это мощная, эффективная крошечная языковая модель с возможностями зрения.
mistralai/ministral-3b-2512
Самая маленькая модель в семействе Ministral 3, Ministral 3 3B — это мощная, эффективная крошечная языковая модель с возможностями зрения.
mistralai/mistral-large-2512
Mistral Large 3 2512 — это самая производительная модель Mistral на сегодняшний день, использующая разреженную архитектуру смеси экспертов с 41B активными параметрами (675B всего) и выпущенная под лицензией Apache 2.0.
deepseek/deepseek-v3.2
DeepSeek-V3.2 — это большая языковая модель, предназначенная для гармоничного сочетания высокой вычислительной эффективности с сильными возможностями рассуждения и использования инструментов. Она внедряет DeepSeek Разреженное Внимание (DSA), механизм мелкозернистого разреженного внимания, который снижает затраты на обучение и вывод, сохраняя при этом качество в сценариях с длинным контекстом. Масштабируемая структура обучения с подкреплением дополнительно улучшает её, обеспечивая производительность в классе GPT-5 и демонстрируя результаты уровня золотой медали на 2025 IMO и IOI. V3.2 также использует крупномасштабный конвейер синтеза задач агентного типа, чтобы лучше интегрировать рассуждения в сценарии использования инструментов, повышая соответствие и обобщение в интерактивных средах. Пользователи могут управлять поведением рассуждения с помощью reasoning enabled логического параметра. Подробнее в нашей документации
black-forest-labs/flux.2-flex
FLUX.2 [flex] отлично справляется с отображением сложного текста, типографики и мелких деталей, а также поддерживает редактирование по множественным референсам в рамках единой архитектуры. Ценообразование следующее, согласно документации: Мы взимаем $0.06 за каждый мегапиксель как на входе, так и на выходе.
black-forest-labs/flux.2-pro
Высококлассная модель генерации и редактирования изображений, ориентированная на передовое качество визуала и надёжность. Она обеспечивает точное следование промпту, стабильное освещение, чёткие текстуры и согласованное воспроизведение персонажей/стиля при работе с несколькими референсными изображениями. Создана для продакшн-нагрузок, сбалансирована по скорости и качеству, поддерживает генерацию из текста и редактирование изображений с разрешением до 4 MP. Ценообразование следующее, согласно документации: Вход: мы взимаем $0.015 за каждый мегапиксель на входе (т.е. референсные изображения для редактирования) Выход: первый мегапиксель стоит $0.03, а каждый последующий MP будет стоить $0.015.
anthropic/claude-opus-4.5
Claude Opus 4.5 — это передовая модель рассуждений от Anthropic, оптимизированная для сложной разработки программного обеспечения, агентных рабочих процессов и длительного использования компьютера. Она обладает сильными мультимодальными возможностями, конкурентоспособной производительностью в реальных задачах кодирования и рассуждений, а также повышенной устойчивостью к инъекциям подсказок. Модель разработана для эффективной работы при различных уровнях усилий, позволяя разработчикам выбирать между скоростью, глубиной и использованием токенов в зависимости от требований задачи. Она поставляется с новым параметром для контроля эффективности токенов, который доступен через параметр OpenRouter Verbosity с уровнями low, medium или high. Opus 4.5 поддерживает расширенное использование инструментов, управление расширенным контекстом и скоординированные настройки мультиагентов, что делает её хорошо подходящей для автономных исследований, отладки, многошагового планирования и манипуляций с электронными таблицами/браузером. Она обеспечивает значительный прирост в структурированных рассуждениях, надежности выполнения и согласованности по сравнению с предыдущими поколениями Opus, при этом снижая накладные расходы на токены и улучшая производительность при длительных задачах.
google/gemini-3-pro-image-preview
Nano Banana Pro — это наиболее продвинутая модель генерации и редактирования изображений от Google, построенная на Gemini 3 Pro. Она расширяет возможности оригинальной модели Nano Banana за счет значительно улучшенного мультимодального рассуждения, привязки к реальному миру и высокоточной визуальной генерации. Модель создает контекстно-насыщенную графику — от инфографики и диаграмм до кинематографичных композиций — и может включать информацию в реальном времени через поисковую привязку. Она обеспечивает лидирующее в индустрии отображение текста в изображениях (включая длинные фрагменты и многоязычные макеты), согласованное смешивание нескольких изображений и точное сохранение идентичности до пяти объектов. Nano Banana Pro добавляет тонкие инструменты творческого контроля, такие как локальные правки, корректировка освещения и фокуса, трансформации камеры, а также поддержку выходных форматов 2K/4K и гибких соотношений сторон. Модель предназначена для профессионального дизайна, визуализации продуктов, раскадровки и сложных многоэлементных композиций, оставаясь при этом эффективной для стандартных рабочих процессов создания изображений.
thenlper/gte-base
Модель эмбеддингов gte-base кодирует английские предложения и абзацы в плотное векторное пространство размерности 768, обеспечивая эффективные и действенные семантические вложения, оптимизированные для задач семантического сходства, семантического поиска и кластеризации.
thenlper/gte-large
Модель встраивания gte-large преобразует английские предложения, абзацы и документы средней длины в плотное векторное пространство размерности 1024, обеспечивая высококачественные семантические встраивания, оптимизированные для задач поиска информации, семантического текстового сходства, реранжирования и кластеризации. Обученная с помощью многоэтапного контрастивного обучения на крупном корпусе релевантности, разнообразном по доменам, она обеспечивает отличную производительность в различных случаях использования встраиваний общего назначения.
intfloat/e5-large-v2
Модель эмбеддингов e5-large-v2 отображает английские предложения, абзацы и документы в плотное векторное пространство размерности 1024, обеспечивая высокоточные семантические векторы, оптимизированные для поиска, семантического поиска, реранжирования и задач оценки сходства.
intfloat/e5-base-v2
Модель эмбеддингов e5-base-v2 кодирует английские предложения и абзацы в плотное векторное пространство размерности 768, создавая эффективные и высококачественные семантические эмбеддинги, оптимизированные для таких задач, как семантический поиск, оценка схожести, поиск информации и кластеризация.
intfloat/multilingual-e5-large
Модель вложений multilingual-e5-large кодирует предложения, абзацы и документы на более чем 90 языках в плотное векторное пространство размерности 1024, обеспечивая надежные семантические вложения, оптимизированные для многоязычного поиска, кросс-языкового сходства и поиска по крупномасштабным данным.
sentence-transformers/paraphrase-minilm-l6-v2
Модель эмбеддингов paraphrase-MiniLM-L6-v2 преобразует предложения и короткие абзацы в плотное векторное пространство размерности 384, создавая высококачественные семантические эмбеддинги, оптимизированные для определения парафраз, оценки семантической схожести, кластеризации и облегченных задач поиска.
sentence-transformers/all-minilm-l12-v2
Модель эмбеддингов all-MiniLM-L12-v2 отображает предложения и короткие абзацы в плотное векторное пространство размерности 384, создавая эффективные и высококачественные семантические эмбеддинги, оптимизированные для таких задач, как семантический поиск, кластеризация и оценка сходства.
baai/bge-base-en-v1.5
Модель эмбеддингов bge-base-en-v1.5 преобразует английские предложения и абзацы в плотные векторы размерности 768, обеспечивая эффективные и качественные семантические эмбеддинги, оптимизированные для задач поиска, семантического поиска и сопоставления документов. Эта версия (v1.5) отличается улучшенным распределением оценки сходства и более высокой производительностью поиска из коробки.
sentence-transformers/multi-qa-mpnet-base-dot-v1
Модель эмбеддингов multi-qa-mpnet-base-dot-v1 преобразует предложения и короткие абзацы в плотное векторное пространство размерности 768, создавая высококачественные семантические эмбеддинги, оптимизированные для поиска по вопросам и ответам, семантического поиска и оценки сходства разнообразного контента.
baai/bge-large-en-v1.5
Модель вложений bge-large-en-v1.5 сопоставляет английские предложения, абзацы и документы с плотным векторным пространством размерности 1024, выдавая высокоточные семантические вложения, оптимизированные для семантического поиска, поиска документов и последующих задач NLP на английском языке.
baai/bge-m3
Модель эмбеддингов bge-m3 кодирует предложения, абзацы и длинные документы в плотное векторное пространство размерностью 1024, обеспечивая высококачественные семантические эмбеддинги, оптимизированные для многоязычного поиска, семантического поиска и приложений с большим контекстом.
sentence-transformers/all-mpnet-base-v2
Модель эмбеддингов all-mpnet-base-v2 кодирует предложения и короткие абзацы в плотное векторное пространство размерности 768, обеспечивая высококачественные семантические эмбеддинги, хорошо подходящие для таких задач, как информационный поиск, кластеризация, оценка схожести и ранжирование текстов.
sentence-transformers/all-minilm-l6-v2
Модель эмбеддингов all-MiniLM-L6-v2 преобразует предложения и короткие абзацы в плотное векторное пространство размерности 384, обеспечивая высококачественные семантические представления, идеально подходящие для таких задач, как поиск информации, кластеризация, оценка сходства и ранжирование текстов.
openai/gpt-5.1
GPT-5.1 — это модель передового уровня в серии GPT-5, обладающая более сильными универсальными рассуждениями, улучшенным следованием инструкциям и более естественным стилем общения по сравнению с GPT-5. Она использует адаптивные рассуждения для динамического распределения вычислительных ресурсов, быстро отвечая на простые запросы и выделяя больше ресурсов GPU для сложных задач. Модель дает более четкие и понятные объяснения с меньшим количеством жаргона, что упрощает восприятие даже технических или многошаговых проблем. Благодаря широкой сфере применения, GPT-5.1 обеспечивает стабильные результаты в математике, программировании и задачах со структурированными данными, предлагая более связные развернутые ответы и повышенную надежность при использовании инструментов. Кроме того, она отличается более точным следованием указаниям, обеспечивая более естественное и комфортное взаимодействие без ущерба для точности. GPT-5.1 — это основная модель полного цикла, пришедшая на смену GPT-5.
openai/gpt-5.1-codex
GPT-5.1-Codex — это специализированная версия GPT-5.1, оптимизированная для разработки программного обеспечения и рабочих процессов написания кода. Она предназначена как для интерактивных сессий разработки, так и для длительного автономного выполнения сложных инженерных задач. Модель поддерживает создание проектов с нуля, разработку функций, отладку, масштабный рефакторинг и ревью кода. По сравнению с GPT-5.1, Codex более управляема, строго следует инструкциям разработчика и выдаёт более чистый и качественный код. Уровень усилий на рассуждение можно регулировать с помощью параметра reasoning.effort. Документация доступна здесь Codex интегрируется в среды разработки, включая CLI, расширения IDE, GitHub и облачные задачи. Она динамически адаптирует усилия на рассуждение: обеспечивает быстрые ответы для небольших задач и поддерживает длительные многочасовые сессии для крупных проектов. Модель обучена выполнять структурированные ревью кода, выявляя критические недостатки путём анализа зависимостей и проверки поведения на соответствие тестам. Она также поддерживает мультимодальные входные данные, такие как изображения или скриншоты, для разработки UI, и интегрирует использование инструментов для поиска, установки зависимостей и настройки окружения. Codex предназначена специально для агентных задач написания кода.
openai/gpt-5.1-codex-mini
GPT-5.1-Codex-Mini — это меньшая и более быстрая версия GPT-5. 1-Codex
moonshotai/kimi-k2-thinking
Kimi K2 Thinking — это самая продвинутая открытая модель для рассуждений от Moonshot AI, расширяющая серию K2 до агентных и долгосрочных рассуждений. Построенная на триллионной архитектуре смеси экспертов (MoE), представленной в Kimi K2, она активирует 32 миллиардов параметров за проход и поддерживает контекстные окна в 256 тысяч токенов. Модель оптимизирована для устойчивого пошагового мышления, динамического вызова инструментов и сложных рабочих процессов рассуждений, охватывающих сотни витков. Она чередует пошаговые рассуждения с использованием инструментов, что позволяет автономно выполнять исследования, написание кода и текстов, сохраняя устойчивость на протяжении сотен последовательных действий без сбоев. Она устанавливает новые открытые эталоны в HLE, BrowseComp, SWE-Multilingual и LiveCodeBench, сохраняя стабильное мультиагентное поведение благодаря 200–300 вызовам инструментов. Построенная на крупномасштабной архитектуре MoE с оптимизацией MuonClip, модель сочетает глубокую способность к рассуждениям с высокой эффективностью вывода для сложных агентных и аналитических задач.
amazon/nova-premier-v1
Amazon Nova Premier — самая производительная мультимодальная модель Amazon для сложных задач рассуждения, а также лучший инструмент для дистилляции собственных моделей в роли учителя.
mistralai/mistral-embed-2312
Mistral Embed — это специализированная модель встраивания для текстовых данных, оптимизированная для семантического поиска и приложений RAG. Разработанная компанией Mistral AI в конце 2023 года, она создаёт векторы размерности 1024, которые эффективно улавливают семантические связи в тексте.
google/gemini-embedding-001
gemini-embedding-001 обеспечивает унифицированный передовой опыт в различных областях, включая науку, право, финансы и программирование. Эта модель эмбеддингов стабильно занимает высокие позиции в многоязычном рейтинге Massive Text Embedding Benchmark (MTEB) с момента экспериментального запуска в марте.
openai/text-embedding-ada-002
text-embedding-ada-002 — это устаревшая модель текстовых эмбеддингов от OpenAI.
mistralai/codestral-embed-2505
Mistral Codestral Embed специально разработана для кода, идеально подходит для эмбеддинга баз кода, репозиториев и обеспечения работы ассистентов по программированию с передовым поиском.
openai/text-embedding-3-large
text-embedding-3-large — это самая производительная модель встраивания OpenAI как для англоязычных, так и для неанглоязычных задач. Embedding представляют собой числовое представление текста, которое можно использовать для измерения связанности между двумя фрагментами текста. Embedding полезны для поиска, кластеризации, рекомендаций, обнаружения аномалий и задач классификации.
openai/text-embedding-3-small
text-embedding-3-small — это улучшенная, более производительная версия модели встраивания OpenAI. Embedding — это числовое представление текста, которое можно использовать для измерения схожести между двумя фрагментами текста. Embedding полезны для задач поиска, кластеризации, рекомендаций, обнаружения аномалий и классификации.
perplexity/sonar-pro-search
Эксклюзивно доступен на OpenRouter API, новый режим Pro Search от Sonar Pro — это самая продвинутая агентная поисковая система Perplexity. Он предназначен для более глубокого анализа и рассуждений. Ценообразование основано на токенах плюс $18 за тысячу запросов. Эта модель обеспечивает работу режима Pro Search на платформе Perplexity. Sonar Pro Search добавляет автономное многошаговое рассуждение к Sonar Pro. Таким образом, вместо просто одного запроса + синтеза, он планирует и выполняет целые исследовательские рабочие процессы с использованием инструментов.
mistralai/voxtral-small-24b-2507
Voxtral Small является улучшением Mistral Small 3, включая современные возможности ввода аудио, сохраняя при этом лучшую в своем классе производительность для текста. Он отлично справляется с транскрипцией речи, переводом и пониманием аудио. Входное аудио оценивается в $100 за миллион секунд.
openai/gpt-oss-safeguard-20b
gpt-oss-safeguard-20b — это модель для рассуждений в области безопасности от OpenAI, созданная на основе gpt-oss-20b. Эта модель с открытыми весами и архитектурой Mixture-of-Experts (MoE) с 21B параметрами обеспечивает более низкую задержку для задач безопасности, таких как классификация контента, фильтрация LLM и маркировка доверия и безопасности. Узнайте больше об этой модели в руководстве пользователя по gpt-oss-safeguard от OpenAI.
qwen/qwen3-embedding-8b
Серия моделей Qwen3 Embedding — это новейшая проприетарная модель семейства Qwen, специально предназначенная для задач текстовых эмбеддингов и ранжирования. Эта серия наследует исключительные многоязычные способности, понимание длинных текстов и навыки рассуждения своей базовой модели. Серия Qwen3 Embedding представляет собой значительный прогресс в нескольких задачах текстовых эмбеддингов и ранжирования, включая поиск текста, поиск кода, классификацию текста, кластеризацию текста и извлечение двуязычных параллелей.
qwen/qwen3-embedding-4b
Серия моделей Qwen3 Embedding является последней проприетарной моделью семейства Qwen, специально разработанной для задач эмбеддинга текста и ранжирования. Эта серия наследует исключительные многоязычные возможности, понимание длинных текстов и навыки рассуждения своей базовой модели. Серия Qwen3 Embedding представляет значительные достижения в различных задачах эмбеддинга текста и ранжирования, включая поиск текста, поиск кода, классификацию текста, кластеризацию текста и извлечение двуязычных данных.
minimax/minimax-m2
MiniMax-M2 — это компактная языковая модель с высокой производительностью, оптимизированная для кодирования и агентных задач. Благодаря архитектуре с 10 млрд активированных параметров (всего 230 млрд) модель обеспечивает производительность, близкую к передовым системам, в общем мышлении, работе с инструментами и многошаговых задачах, сохраняя при этом низкую задержку и эффективность развертывания. Модель отлично справляется с генерацией кода, редактированием нескольких файлов, циклами компиляции и исправления, а также проверкой тестами, показывая высокие результаты на SWE-Bench Verified, Multi-SWE-Bench и Terminal-Bench. Она также конкурентоспособна в агентных оценках, таких как BrowseComp и GAIA, эффективно обрабатывая долгосрочное планирование, поиск информации и восстановление после ошибок выполнения. По результатам тестов Artificial Analysis, MiniMax-M2 входит в число лучших открытых моделей по составному интеллекту, охватывающему математику, естественные науки и следование инструкциям. Небольшой объем активируемых параметров обеспечивает быстрый вывод, высокую конкурентность и улучшенную экономическую эффективность, что делает модель подходящей для крупномасштабных агентов, помощников разработчиков и приложений, требующих высокой скорости и эффективности затрат. Чтобы не снижать производительность модели, MiniMax настоятельно рекомендует сохранять рассуждения между шагами. Узнайте больше об использовании reasoning_details для передачи рассуждений в нашей документации.
qwen/qwen3-vl-32b-instruct
Qwen3-VL-32B-Instruct — это крупномасштабная мультимодальная модель «зрение-язык», предназначенная для высокоточной интерпретации и рассуждений по тексту, изображениям и видео. С количеством параметров в 32 миллиарда она сочетает глубокое визуальное восприятие с продвинутым пониманием текста, обеспечивая детальное пространственное рассуждение, анализ документов и сцен, а также понимание длительных видео. Надёжная поддержка OCR в 32 языках и улучшенное мультимодальное слияние с помощью архитектур Interleaved-MRoPE и DeepStack. Оптимизированная для агентного взаимодействия и использования визуальных инструментов, Qwen3-VL-32B обеспечивает передовую производительность для сложных реальных мультимодальных задач.
ibm-granite/granite-4.0-h-micro
Granite-4.0-H-Micro — это модель с 3B параметрами из семейства моделей Granite 4. Эти модели являются новейшими в серии моделей, выпущенных IBM. Они дообучены для вызова инструментов в длинном контексте.
openai/gpt-5-image-mini
GPT-5 Image Mini объединяет передовые языковые возможности OpenAI, основанные на GPT-5 Mini, с GPT Image 1 Mini для эффективной генерации изображений. Эта нативно мультимодальная модель отличается превосходным следованием инструкциям, отображением текста и детальным редактированием изображений при сниженной задержке и стоимости. Она превосходно справляется с созданием высококачественного визуального контента, сохраняя при этом сильное понимание текста, что делает её идеальной для приложений, требующих как эффективной генерации изображений, так и обработки текста в больших масштабах.
anthropic/claude-haiku-4.5
Claude Haiku 4.5 — самая быстрая и эффективная модель Anthropic, обеспечивающая интеллект почти фронтирного уровня при доле стоимости и задержки по сравнению с более крупными моделями Claude. Сопоставимая с производительностью Claude Sonnet 4 в задачах рассуждения, написания кода и использования компьютера, Haiku 4.5 выводит возможности фронтирного уровня в реальное время и приложения с высокими объёмами нагрузки. Она представляет расширенное мышление для линейки Haiku, обеспечивая контроль глубины рассуждений, суммаризированный или чередующийся вывод мыслей и рабочие процессы с инструментальной поддержкой, включая полную поддержку программирования, bash, веб-поиска и инструментов использования компьютера. Набрав >73% баллов в SWE-bench Verified, Haiku 4.5 занимает место среди лучших мировых моделей кодирования, сохраняя исключительную отзывчивость для сабагентов, параллельного выполнения и масштабируемого развёртывания.
qwen/qwen3-vl-8b-thinking
Qwen3-VL-8B-Thinking — это вариант мультимодальной модели Qwen3-VL-8B, оптимизированный для рассуждений, предназначенный для продвинутого визуального и текстового мышления при работе со сложными сценами, документами и временными последовательностями. Он объединяет улучшенное мультимодальное согласование и обработку длинного контекста (нативно 256K, расширяется до 1M токенов) для таких задач, как научный визуальный анализ, каузальный вывод и математические рассуждения по изображениям или видео. По сравнению с версией Instruct, версия Thinking вводит более глубокое слияние визуального и языкового и продуманные пути рассуждений, которые улучшают производительность в задачах длинных логических цепочек, решении задач STEM и многошаговом понимании видео. Она достигает более сильной временной привязки благодаря Interleaved-MRoPE и эмбеддингам с учётом временных меток, сохраняя при этом надёжное OCR, многоязычное понимание и генерацию текста на уровне крупных текстовых LLMs.
qwen/qwen3-vl-8b-instruct
Qwen3-VL-8B-Instruct — это мультимодальная модель vision-language из серии Qwen3-VL, созданная для высокоточной интерпретации и рассуждений в области текста, изображений и видео. Она отличается улучшенной мультимодальной интеграцией с Interleaved-MRoPE для долгосрочных временных рассуждений, DeepStack для точного выравнивания визуальных и текстовых данных, а также выравниванием текста по временным меткам для точной локализации событий. Модель поддерживает нативное контекстное окно на 256K токенов, расширяемое до 1M токенов, и обрабатывает как статические, так и динамические медиаданные для таких задач, как разбор документов, ответы на визуальные вопросы, пространственные рассуждения и управление GUI. Она достигает понимания текста, сравнимого с ведущими LLMs, расширяя при этом охват OCR до 32 языков и повышая устойчивость к разнообразным визуальным условиям.
openai/gpt-5-image
GPT-5 Image сочетает модель OpenAI's GPT-5 с современными возможностями генерации изображений. Это обеспечивает значительные улучшения в рассуждении, качестве кода и пользовательском опыте, а также включает превосходное следование инструкциям GPT Image 1, рендеринг текста и детализированное редактирование изображений.
google/gemini-2.5-flash-image
Gemini 2.5 Flash Image, также известная как "Nano Banana", теперь общедоступна. Это современная модель генерации изображений с контекстным пониманием. Она способна генерировать изображения, редактировать их и вести многоходовые диалоги. Соотношение сторон можно контролировать с помощью параметра image_config API.
qwen/qwen3-vl-30b-a3b-thinking
Qwen3-VL-30B-A3B-Thinking — это мультимодальная модель, объединяющая мощную генерацию текста с визуальным пониманием изображений и видео. Вариант Thinking улучшает рассуждения в STEM, математике и сложных задачах. Она превосходно справляется с восприятием реальных/синтетических категорий, пространственной привязкой 2D/3D и длинным визуальным пониманием, достигая конкурентоспособных результатов в мультимодальных бенчмарках. Для агентного использования она обрабатывает многообразные многоходовые инструкции, согласование временных линий видео, автоматизацию GUI и визуальное программирование от набросков до отлаженного UI. Текстовая производительность соответствует флагманским моделям Qwen3, подходя для обработки документов AI, OCR, помощи UI, пространственных задач и агентных исследований.
qwen/qwen3-vl-30b-a3b-instruct
Qwen3-VL-30B-A3B-Instruct — это мультимодальная модель, которая объединяет сильную генерацию текста с визуальным пониманием изображений и видео. Её вариант Instruct оптимизирует следование инструкциям для общих мультимодальных задач. Она превосходно справляется с восприятием реальных/синтетических категорий, пространственной привязкой в 2D/3D и длинным визуальным пониманием, достигая конкурентоспособных результатов в мультимодальных бенчмарках. Для агентного использования она обрабатывает многораундовые инструкции с несколькими изображениями, выравнивание временной шкалы видео, автоматизацию GUI и визуальное кодирование от эскизов до отлаженного UI. Текстовая производительность соответствует флагманским моделям Qwen3, что подходит для AI документов, OCR, UI-помощи, пространственных задач и агентных исследований.
openai/gpt-5-pro
GPT-5 Pro — самая продвинутая модель OpenAI, предлагающая значительные улучшения в рассуждении, качестве кода и пользовательском опыте. Она оптимизирована для сложных задач, требующих пошагового рассуждения, следования инструкциям и точности в сценариях с высокими ставками. Поддерживает функции маршрутизации во время тестирования и расширенное понимание подсказок, включая задаваемые пользователем намерения, такие как «хорошенько подумай над этим». Улучшения включают снижение галлюцинаций, подхалимства и более высокую производительность в задачах, связанных с программированием, письмом и здоровьем.
z-ai/glm-4.6
По сравнению с GLM-4.5, это поколение включает несколько ключевых улучшений: Более длинное контекстное окно: размер контекстного окна был расширен с 128K до 200K токенов, что позволяет модели справляться с более сложными агентными задачами. Превосходная производительность в кодировании: модель достигает более высоких результатов в бенчмарках для кода и демонстрирует лучшую реальную производительность в таких приложениях, как Claude Code, Cline, Roo Code и Kilo Code, включая улучшения в генерации визуально отполированных фронтенд-страниц. Продвинутые рассуждения: GLM-4.6 демонстрирует явное улучшение в способности к рассуждениям и поддерживает использование инструментов во время вывода, что приводит к более сильной общей функциональности. Более способные агенты: GLM-4.6 показывает более высокую производительность в агентах, использующих инструменты и поиск, и более эффективно интегрируется в агентные фреймворки. Улучшенный стиль письма: лучше соответствует человеческим предпочтениям в стиле и читабельности, а также ведёт себя более естественно в сценариях ролевых игр.
anthropic/claude-sonnet-4.5
Claude Sonnet 4.5 — это самая продвинутая модель Sonnet от Anthropic на сегодняшний день, оптимизированная для реальных агентов и рабочих процессов программирования. Она обеспечивает передовую производительность на бенчмарках кодинга, таких как SWE-bench Verified, с улучшениями в проектировании систем, безопасности кода и соблюдении спецификаций. Модель предназначена для длительной автономной работы, поддерживая непрерывность задач между сессиями и предоставляя отслеживание прогресса на основе фактов. Sonnet 4.5 также представляет более сильные агентные возможности, включая улучшенную оркестрацию инструментов, спекулятивное параллельное выполнение и более эффективное управление контекстом и памятью. Благодаря улучшенному отслеживанию контекста и контролю использования токенов при вызовах инструментов, она особенно хорошо подходит для многоконтекстных и длительных рабочих процессов. Варианты использования охватывают программную инженерию, кибербезопасность, финансовый анализ, исследовательских агентов и другие области, требующие устойчивого рассуждения и использования инструментов.
deepseek/deepseek-v3.2-exp
DeepSeek-V3.2-Exp — это экспериментальная большая языковая модель, выпущенная компанией DeepSeek в качестве промежуточного шага между V3.1 и будущими архитектурами. Она представляет DeepSeek Sparse Attention (DSA) — механизм мелкозернистого разреженного внимания, предназначенный для повышения эффективности обучения и инференса в сценариях с длинным контекстом при сохранении качества выходных данных. Пользователи могут управлять поведением рассуждения с помощью логического значения reasoning enabled. Узнайте больше в нашей документации Модель обучалась в условиях, согласованных с V3.1-Terminus, чтобы обеспечить прямое сравнение. Тестирование показывает, что производительность примерно находится на уровне V3.1 в задачах рассуждения, написания кода и агентного использования инструментов, с небольшими компромиссами и выигрышами в зависимости от области применения. Этот выпуск сосредоточен на проверке оптимизаций архитектуры для расшirенных длин контекста, а не на повышении точности задач как таковой, что делает модель в первую очередь исследовательской, предназначенной для изучения эффективных конструкций трансформеров.
thedrummer/cydonia-24b-v4.1
Модель без цензуры для творческого письма на основе Mistral Small 3.2 24B с хорошей памятью, соблюдением промпта и интеллектом.
relace/relace-apply-3
Relace Apply 3 — это специализированная LLM для исправления кода, которая объединяет правки AI-suggested прямо в ваши исходные файлы. Она может применять обновления из GPT-4o, Claude и других источников в ваши файлы со средней скоростью 10,000 токенов/сек. Модель требует, чтобы запрос имел следующий формат: {инструкция} {initial_code} {edit_snippet} Для Relace включено нулевое хранение данных. Подробнее об этой модели читайте в их документации
qwen/qwen3-vl-235b-a22b-thinking
Qwen3-VL-235B-A22B Thinking — это мультимодальная модель, объединяющая сильную генерацию текста с визуальным пониманием изображений и видео. Модель Thinking оптимизирована для мультимодальных рассуждений в STEM и математике. Серия подчеркивает надежное восприятие (распознавание разнообразных реальных и синтетических категорий), пространственное понимание (2D/3D привязка) и длительное визуальное восприятие, с конкурентоспособными результатами на публичных мультимодальных бенчмарках как для восприятия, так и для рассуждений. Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: он может следовать сложным инструкциям в многоизображных и многооборотных диалогах; согласовывать текст с видео-таймлайнами для точных временных запросов; и управлять элементами GUI для задач автоматизации. Модели также обеспечивают визуальные рабочие процессы кодирования, превращая наброски или макеты в код и помогая с отладкой UI, сохраняя при этом высокую производительность только для текста, сравнимую с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL подходящими для производственных сценариев, охватывающих AI документов, многоязычный OCR, помощь в разработке ПО/UI, пространственные/воплощенные задачи и исследования агентов зрения и языка.
qwen/qwen3-vl-235b-a22b-instruct
Qwen3-VL-235B-A22B Instruct — это мультимодальная модель с открытыми весами, объединяющая сильную генерацию текста с визуальным пониманием изображений и видео. Модель Instruct ориентирована на универсальные сценарии применения в области зрения и языка (VQA, разбор документов, извлечение данных из диаграмм и таблиц, многоязычный OCR). Серия подчеркивает надежное восприятие (распознавание разнообразных реальных и синтетических категорий), пространственное понимание (2D/3D-grounding) и длительное визуальное понимание, демонстрируя конкурентоспособные результаты на публичных мультимодальных бенчмарках как по восприятию, так и по рассуждению. Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: модель может следовать сложным инструкциям в многоизображных и многоходовых диалогах; согласовывать текст с видеошкалой времени для точных временных запросов; а также управлять элементами GUI для задач автоматизации. Модели также обеспечивают рабочие процессы визуального кодирования — превращая эскизы или макеты в код и помогая с отладкой UI — сохраняя при этом высокую производительность при работе только с текстом, сопоставимую с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL пригодными для производственных сценариев, охватывающих AI документов, многоязычный OCR, помощь в разработке ПО/UI, пространственные/воплощенные задачи и исследования агентов на основе зрения и языка.
qwen/qwen3-max
Qwen3-Max — это обновлённая версия, построенная на серии Qwen3, предлагающая значительные улучшения в рассуждениях, следовании инструкциям, многоязычной поддержке и покрытии редких знаний по сравнению с январской версией 2025. Она обеспечивает более высокую точность в задачах по математике, программированию, логике и науке, более надёжно следует сложным инструкциям на китайском и английском языках, снижает галлюцинации и выдаёт более качественные ответы для открытых вопросов, написания текстов и разговоров. Модель поддерживает более 100 языков с более сильным переводом и здравым смыслом, а также оптимизирована для генерации с дополнением извлечением (RAG) и вызова инструментов, хотя она не включает специальный режим «размышления».
qwen/qwen3-coder-plus
Qwen3 Coder Plus — это проприетарная версия Alibaba на основе открытого исходного кода Qwen3 Coder 480B A35B. Это мощная модель-агент для программирования, специализирующаяся на автономном написании кода с помощью вызова инструментов и взаимодействия со средой, сочетающая навыки программирования с универсальными возможностями общего назначения.
deepseek/deepseek-v3.1-terminus
DeepSeek-V3.1 Terminus — это обновление модели DeepSeek V3.1, которое сохраняет исходные возможности модели, одновременно устраняя проблемы, о которых сообщают пользователи, включая согласованность языка и возможности агентов, а также дополнительно оптимизируя производительность модели в задачах написания кода и поисковых агентов. Это большая гибридная модель рассуждений (671B параметров, 37B активны), которая поддерживает как режим мышления, так и режим без мышления. Она расширяет базу DeepSeek-V3 двухэтапным процессом обучения на длинном контексте, достигая до 128K токенов, и использует FP8 микроскейлинг для эффективного вывода. Пользователи могут управлять поведением рассуждений с помощью логического значения reasoning enabled. Подробнее в нашей документации Модель улучшает использование инструментов, генерацию кода и эффективность рассуждений, достигая производительности, сравнимой с DeepSeek-R1 на сложных бенчмарках, при этом отвечая быстрее. Она поддерживает структурированные вызовы инструментов, агентов для работы с кодом и поисковых агентов, что делает её подходящей для исследовательских, кодовых и агентных рабочих процессов.
qwen/qwen3-coder-flash
Qwen3 Coder Flash — это быстрая и экономически эффективная версия проприетарной модели Qwen3 Coder Plus от Alibaba. Это мощная модель-агент для написания кода, специализирующаяся на автономном программировании с помощью вызова инструментов и взаимодействия с окружением, сочетающая владение программированием с разносторонними возможностями общего назначения.
qwen/qwen3-next-80b-a3b-thinking
Qwen3-Next-80B-A3B-Thinking — это чат-модель с приоритетом рассуждений в линейке Qwen3-Next, которая по умолчанию выводит структурированные «трассы мышления». Она предназначена для сложных многошаговых задач: математических доказательств, синтеза и отладки кода, логики и агентного планирования — и показывает сильные результаты в оценках знаний, рассуждений, программирования, согласованности и многоязычности. По сравнению с предыдущими вариантами Qwen3 она делает акцент на стабильности при длинных цепочках рассуждений и эффективном масштабировании во время инференса, а также настроена на следование сложным инструкциям при снижении повторяющегося или нецелевого поведения. Модель подходит для агентных фреймворков и использования инструментов (вызов функций), рабочих процессов с интенсивным поиском информации и стандартизированного бенчмаркинга, где требуются пошаговые решения. Она поддерживает длинные детализированные ответы и использует ориентированные на пропускную способность техники (например, предсказание нескольких токенов) для более быстрой генерации. Обратите внимание, что она работает только в режиме мышления.
qwen/qwen3-next-80b-a3b-instruct
Qwen3-Next-80B-A3B-Instruct — это инструктивно-настроенная чат-модель из серии Qwen3-Next, оптимизированная для быстрых и стабильных ответов без следов «размышлений». Она нацелена на сложные задачи, включая рассуждение, генерацию кода, знания QA и многоязычное использование, оставаясь при этом устойчивой к согласованию и форматированию. По сравнению с предыдущими инструктивными вариантами Qwen3, она фокусируется на более высокой пропускной способности и стабильности на сверхдлинных входах и многоходовых диалогах, что делает её хорошо подходящей для RAG, использования инструментов и агентных рабочих процессов, требующих последовательных финальных ответов, а не видимой цепочки рассуждений. Модель использует эффективное с точки зрения масштабирования обучение и декодирование для улучшения эффективности параметров и скорости инференса, и была проверена на широком наборе публичных бенчмарков, где она достигает или приближается к более крупным системам Qwen3 в нескольких категориях, превосходя при этом более ранние модели среднего размера. Её лучше всего использовать как универсального ассистента, помощника по коду и решателя задач с длинным контекстом в производственных средах, где предпочтительны детерминированные выводы, следующие инструкциям.
qwen/qwen-plus-2025-07-28
Qwen Plus 0728, созданная на основе фундаментальной модели Qwen3, представляет собой гибридную модель рассуждений с контекстом в 1 миллионов токенов, отличающуюся сбалансированным сочетанием производительности, скорости и стоимости.
moonshotai/kimi-k2-0905
Kimi K2 0905 — это сентябрьское обновление модели Kimi K2 0711. Это крупномасштабная языковая модель на основе смеси экспертов (MoE), разработанная компанией Moonshot AI, с 1 триллионами параметров суммарно и 32 миллиардами активных параметров на каждом прямом проходе. Она поддерживает вывод с длинным контекстом до 256k токенов, что расширено с предыдущих 128k. Это обновление улучшает агентное программирование с более высокой точностью и лучшей обобщаемостью на различных каркасах, а также улучшает фронтенд-разработку, обеспечивая более эстетичные и функциональные результаты для веб-задач, задач 3D и смежных областей. Kimi K2 оптимизирована для агентных возможностей, включая продвинутое использование инструментов, рассуждение и синтез кода. Модель превосходно показывает себя в тестах на программирование (LiveCodeBench, SWE-bench), рассуждение (ZebraLogic, GPQA) и использование инструментов (Tau2, AceBench). Модель обучена с использованием нового стека, включающего оптимизатор MuonClip для стабильного крупномасштабного обучения MoE.
qwen/qwen3-30b-a3b-thinking-2507
Qwen3-30B-A3B-Thinking-2507 — это 30B-параметрическая модель смеси экспертов, оптимизированная для сложных задач, требующих многошаговых рассуждений. Модель специально разработана для «режима мышления», где внутренние цепочки рассуждений отделены от итоговых ответов. По сравнению с предыдущими версиями Qwen3-30B, данная версия показывает улучшенные результаты в логических рассуждениях, математике, естественных науках, программировании и многоязычных тестах. Также она демонстрирует более сильные навыки следования инструкциям, использования инструментов и согласования с человеческими предпочтениями. Благодаря повышенной эффективности рассуждений и расширенным бюджетам вывода, модель лучше всего подходит для передовых исследований, решения сложных задач и агентных приложений, требующих структурированных длинных контекстов.
nousresearch/hermes-4-70b
Hermes 4 70B — это гибридная модель рассуждений от Nous Research, построенная на основе Meta-Llama-3.1-70B. Она использует тот же гибридный режим, что и более крупная версия 405B, позволяя модели либо отвечать напрямую, либо генерировать явные цепочки рассуждений перед ответом. Пользователи могут управлять поведением рассуждений с помощью логического параметра reasoning enabled. Подробнее в нашей документации Этот вариант 70B обучен на расширенном корпусе пост-обучения (~60B токенов) с акцентом на проверенные данные рассуждений, что привело к улучшениям в математике, программировании, STEM, логике и структурированных выводах, сохраняя при этом производительность общего ассистента. Он поддерживает режим JSON, соблюдение схем, вызов функций и использование инструментов, а также обеспечивает большую управляемость и сниженную частоту отказов.
nousresearch/hermes-4-405b
Hermes 4 — это крупномасштабная модель рассуждений, построенная на Meta-Llama-3.1-405B и выпущенная исследовательской группой Nous Research. Она вводит гибридный режим рассуждений, в котором модель может выбирать между внутренним обдумыванием с трассировками thinking... response и прямым ответом, обеспечивая гибкость между скоростью и глубиной. Пользователи могут управлять поведением рассуждений с помощью логического параметра reasoning enabled. Подробнее в нашей документации Модель дообучена по инструкциям с расширенным пост-тренировочным корпусом (~60B токенов), с акцентом на трассировки рассуждений, что улучшает производительность в математике, программировании, STEM и логических рассуждениях, сохраняя при этом широкую ассистентскую функциональность. Она также поддерживает структурированные выходные данные, включая режим JSON, соблюдение схем, вызов функций и использование инструментов. Hermes 4 обучена на управляемость, более низкий уровень отказов и согласование с нейтральным, ориентированным на пользователя поведением.
deepseek/deepseek-chat-v3.1
DeepSeek-V3.1 — это крупная гибридная модель рассуждений (671B параметров, 37B активных), поддерживающая как режим размышлений, так и режим без размышлений с помощью шаблонов подсказок. Она расширяет базовую модель DeepSeek-V3 двухэтапным процессом обучения на длинных контекстах, достигая до 128K токенов, и использует масштабирование FP8 для эффективного вывода. Пользователи могут управлять поведением рассуждений с помощью логического значения reasoning enabled. Подробнее в нашей документации Модель улучшает использование инструментов, генерацию кода и эффективность рассуждений, достигая производительности, сравнимой с DeepSeek-R1 на сложных бенчмарках, при этом отвечая быстрее. Она поддерживает структурированные вызовы инструментов, кодовых агентов и поисковых агентов, что делает её подходящей для исследовательских, кодовых и агентных сценариев. Она является преемником модели DeepSeek V3-0324 и хорошо справляется с разнообразными задачами.
mistralai/mistral-medium-3.1
Mistral Medium 3.1 — обновленная версия Mistral Medium 3, которая представляет собой высокопроизводительную языковую модель корпоративного класса, предназначенную для обеспечения возможностей передового уровня при значительно сниженных эксплуатационных затратах. Она сочетает современные возможности рассуждения и мультимодальную производительность со стоимостью в 8× ниже по сравнению с традиционными большими моделями, что делает ее пригодной для масштабируемого развертывания в профессиональных и промышленных сценариях использования. Модель превосходно проявляет себя в таких областях, как написание кода, STEM-рассуждения и корпоративная адаптация. Она поддерживает гибридные, локальные (on-prem) и внутри-VPC-развертывания и оптимизирована для интеграции в пользовательские рабочие процессы. Mistral Medium 3.1 обеспечивает конкурентоспособную точность по сравнению с более крупными моделями, такими как Claude Sonnet 3.5/3.7, Llama 4 Maverick и Command R+, сохраняя при этом широкую совместимость с облачными средами.
z-ai/glm-4.5v
GLM-4.5V — это фундаментальная модель зрения и языка для мультимодальных агентных приложений. Построенная на архитектуре Mixture-of-Experts (MoE) с 106B параметрами и 12B активируемыми параметрами, она достигает передовых результатов в понимании видео, ответах на вопросы по изображениям, OCR и разборе документов, со значительными улучшениями во фронтенд-веб-кодинге, grounding и пространственном мышлении. Она предлагает гибридный режим инференса: «режим мышления» для глубокого рассуждения и «режим без мышления» для быстрых ответов. Поведение рассуждения можно переключать через логическое значение reasoning enabled. Узнайте больше в нашей документации
openai/gpt-5
GPT-5 — это самая продвинутая модель от OpenAI, предлагающая значительные улучшения в рассуждении, качестве кода и пользовательском опыте. Она оптимизирована для сложных задач, требующих пошагового мышления, следования инструкциям и точности в ответственных сценариях. Модель поддерживает функции маршрутизации на этапе тестирования и расширенное понимание намерений пользователя, включая такие запросы, как «обдумай это тщательно». Среди улучшений — снижение количества галлюцинаций и сикофантии, а также повышение производительности в задачах, связанных с программированием, письмом и медициной.
openai/gpt-5-mini
GPT-5 Mini — это компактная версия GPT-5, предназначенная для решения менее ресурсоёмких задач рассуждения. Она обеспечивает те же преимущества следования инструкциям и безопасности тонкой настройки, что и GPT-5, но с меньшей задержкой и стоимостью. GPT-5 Mini — это преемник модели o4-mini от OpenAI.
openai/gpt-5-nano
GPT-5-Nano — это самая компактная и быстрая вариация в системе GPT-5, оптимизированная для инструментов разработчика, быстрых взаимодействий и сред со сверхнизкой задержкой. Несмотря на ограниченную глубину рассуждений по сравнению с более крупными аналогами, она сохраняет ключевые функции следования инструкциям и безопасности. Она является преемницей GPT-4.1-nano и предлагает облегченный вариант для приложений с ограниченным бюджетом или работающих в реальном времени.
openai/gpt-oss-120b
gpt-oss-120b — это модель языка с открытым весом, на 117B параметров, архитектуры Mixture-of-Experts (MoE) от OpenAI, предназначенная для производственных сценариев с высокими требованиями к рассуждению, агентных и универсальных задач. Она активирует 5.1B параметров за прямой проход и оптимизирована для работы на одном H100 GPU с нативной квантизацией MXFP4. Модель поддерживает настраиваемую глубину рассуждений, полный доступ к цепочке рассуждений и нативное использование инструментов, включая вызов функций, просмотр веб-страниц и генерацию структурированных выходных данных.
openai/gpt-oss-20b
gpt-oss-20b — это модель с открытыми весами, выпущенная OpenAI с 21B параметрами под лицензией Apache 2.0. В ней используется архитектура смеси экспертов (MoE) с 3.6B активными параметрами на прямой проход, что обеспечивает более низкую задержку вывода и возможность развертывания на потребительском или однопроцессорном оборудовании GPU. Модель обучается в формате ответов Harmony от OpenAI и поддерживает настройку уровня рассуждений, дообучение, а также агентные возможности, включая вызов функций, использование инструментов и структурированные выходные данные.
anthropic/claude-opus-4.1
Claude Opus 4.1 является обновленной версией флагманской модели Anthropic, предлагающей улучшенную производительность в задачах кодирования, рассуждения и агентных задач. Она достигает 74.5% на SWE-bench Verified и демонстрирует заметные улучшения в рефакторинге многофайлового кода, точности отладки и детальном рассуждении. Модель поддерживает расширенное мышление до 64K токенов и оптимизирована для задач, связанных с исследованиями, анализом данных и рассуждениями с использованием инструментов.
mistralai/codestral-2508
Mistral — передовая языковая модель для программирования, выпущенная в конце июля 2025. Codestral специализируется на задачах с низкой задержкой и высокой частотой, таких как fill-in-the-middle (FIM), исправление кода и генерация тестов. Blog Post
qwen/qwen3-coder-30b-a3b-instruct
Qwen3-Coder-30B-A3B-Instruct — это модель смеси экспертов (MoE) с параметрами 30.5B, содержащая 128 экспертов (8 активны на каждом прямом проходе), предназначенная для продвинутой генерации кода, понимания на уровне репозитория и агентного использования инструментов. Построенная на архитектуре Qwen3, она поддерживает нативную длину контекста в 256K токенов (расширяемую до 1M с помощью Yarn) и показывает высокие результаты в задачах, включающих вызовы функций, использование браузера и структурированное завершение кода. Эта модель оптимизирована для следования инструкциям без «режима размышлений» и хорошо интегрируется с форматами использования инструментов, совместимыми с OpenAI.
qwen/qwen3-30b-a3b-instruct-2507
Qwen3-30B-A3B-Instruct-2507 — это языковая модель смеси экспертов с 30.5B параметрами от Qwen, с 3.3B активными параметрами на каждый вывод. Она работает в режиме без мышления и предназначена для качественного следования инструкциям, многоязычного понимания и использования агентных инструментов. Дообученная на инструкциях, она демонстрирует конкурентоспособные результаты в бенчмарках рассуждений (AIME, ZebraLogic), кодирования (MultiPL-E, LiveCodeBench) и согласованности (IFEval, WritingBench). Она превосходит свою версию без инструкций в субъективных и открытых задачах, сохраняя при этом высокую фактическую точность и производительность в кодировании.
z-ai/glm-4.5
GLM-4.5 — это наша новейшая флагманская базовая модель, специально разработанная для агентных приложений. Она использует архитектуру смеси экспертов (MoE) и поддерживает длину контекста до 128k токенов. GLM-4.5 обеспечивает значительно расширенные возможности в рассуждении, генерации кода и выравнивании агентов. Она поддерживает гибридный режим логического вывода с двумя опциями: «режим мышления», предназначенный для сложных рассуждений и использования инструментов, и «режим без мышления», оптимизированный для мгновенных ответов. Пользователи могут управлять поведением рассуждения с помощью булева параметра reasoning enabled. Подробнее в нашей документации
z-ai/glm-4.5-air
GLM-4.5-Air — это облегченная версия нашей последней серии флагманских моделей, специально созданная для агентных приложений. Как и GLM-4.5, она использует архитектуру «смесь экспертов» (MoE), но с более компактным размером параметров. GLM-4.5-Air также поддерживает гибридные режимы вывода, предлагая «режим мышления» для сложных рассуждений и использования инструментов, а также «режим без мышления» для взаимодействия в реальном времени. Пользователи могут управлять поведением рассуждений с помощью логического параметра reasoning enabled. Подробнее в нашей документации
qwen/qwen3-235b-a22b-thinking-2507
Qwen3-235B-A22B-Thinking-2507 — это высокопроизводительная открытая языковая модель архитектуры Mixture-of-Experts (MoE), оптимизированная для сложных задач рассуждения. Она активирует 22B из своих 235B параметров за один прямой проход и изначально поддерживает до 262,144 токенов контекста. Этот вариант «только для размышлений» улучшает структурированные логические рассуждения, математику, естественные науки и длительную генерацию текста, демонстрируя сильные результаты в бенчмарках AIME, SuperGPQA, LiveCodeBench и MMLU-Redux. Модель принудительно использует специальный режим рассуждения (response) и предназначена для генерации большого количества токенов (до 81,920 токенов) в сложных областях. Модель дообучена на инструкциях и превосходно справляется с пошаговыми рассуждениями, использованием инструментов, агентными сценариями работы и многоязычными задачами. Этот релиз представляет собой самую производительную открытую версию в серии Qwen3-235B, превосходящую многие закрытые модели в сценариях структурированных рассуждений.
qwen/qwen3-coder
Qwen3-Coder-480B-A35B-Instruct — это модель генерации кода, основанная на архитектуре смеси экспертов (MoE), разработанная командой Qwen. Она оптимизирована для агентных задач кодирования, таких как вызов функций, использование инструментов и длинноконтекстное рассуждение по репозиториям. Модель имеет 480 миллиардов параметров, из которых 35 миллиардов активны во время каждого прямого прохода (8 из 160 экспертов). Цены на конечные точки Alibaba варьируются в зависимости от длины контекста. Если длина запроса превышает 128k входных токенов, применяется более высокая цена.
bytedance/ui-tars-1.5-7b
UI-TARS-1.5 — это мультимодальный визуально-языковой агент, оптимизированный для сред GUI-based, включая интерфейсы рабочего стола, веб-браузеры, мобильные системы и игры. Созданный компанией ByteDance, он основан на фреймворке UI-TARS с рассуждением на основе обучения с подкреплением, что обеспечивает надежное планирование действий и их выполнение в виртуальных интерфейсах. Эта модель достигает самых современных результатов на ряде интерактивных и grounding-бенчмарков, включая OSworld, WebVoyager, AndroidWorld и ScreenSpot. Она также демонстрирует полное выполнение задач в разнообразных играх Poki и превосходит предыдущие модели в задачах агента Minecraft. UI-TARS-1.5 поддерживает декомпозицию мышления во время инференса и демонстрирует сильное масштабирование по вариантам, причем версия 1.5 заметно превосходит по производительности более ранние чекпоинты 72B и 7B.
google/gemini-2.5-flash-lite
Gemini 2.5 Flash-Lite — это легковесная модель рассуждений в семействе Gemini 2.5, оптимизированная для сверхнизкой задержки и экономической эффективности. Она обеспечивает улучшенную пропускную способность, более быструю генерацию токенов и лучшую производительность в общих бенчмарках по сравнению с более ранними моделями Flash. По умолчанию «мышление» (т.е. многопроходные рассуждения) отключено для приоритета скорости, но разработчики могут включить его через параметр Reasoning API, чтобы избирательно обменивать стоимость на интеллект.
qwen/qwen3-235b-a22b-2507
Qwen3-235B-A22B-Instruct-2507 — это многоязычная языковая модель, настроенная на инструкции и основанная на архитектуре смеси экспертов Qwen3-235B, с 22B активными параметрами за один прямой проход. Она оптимизирована для генерации текста общего назначения, включая следование инструкциям, логические рассуждения, математику, код и использование инструментов. Модель поддерживает нативную длину контекста 262K и не реализует «режим мышления» (блоки thinking). По сравнению с базовой версией, эта версия обеспечивает значительные улучшения в охвате знаний, рассуждениях на длинном контексте, бенчмарках программирования и согласованности с открытыми задачами. Она особенно сильна в многоязычном понимании, математических рассуждениях (например, AIME, HMMT) и оценках согласованности, таких как Arena-Hard и WritingBench.
moonshotai/kimi-k2
Kimi K2 Instruct — это большая масштабируемая языковая модель на основе смеси экспертов (MoE), разработанная компанией Moonshot AI, с общим количеством параметров в 1 триллиона, из которых 32 миллиардов активны при каждом прямом проходе. Она оптимизирована для агентных возможностей, включая продвинутое использование инструментов, рассуждение и генерацию кода. Kimi K2 превосходит широкий круг бенчмарков, особенно в задачах программирования (LiveCodeBench, SWE-bench), рассуждения (ZebraLogic, GPQA) и использования инструментов (Tau2, AceBench). Она поддерживает инференс с длинным контекстом до 128K токенов и спроектирована с новым тренировочным стеком, включающим оптимизатор MuonClip для стабильного крупномасштабного обучения MoE.
cognitivecomputations/dolphin-mistral-24b-venice-edition
Venice Uncensored Dolphin Mistral 24B Venice Edition — это тонко настроенный вариант модели Mistral-Small-24B-Instruct-2501, разработанный компанией dphn.ai совместно с Venice.ai. Данная модель создана как «нецензурированная» LLM с инструктивной настройкой, сохраняющая контроль пользователя над выравниванием, системными подсказками и поведением. Предназначенная для продвинутых и неограниченных сценариев использования, Venice Uncensored делает акцент на управляемости и прозрачном поведении, убирая стандартные слои безопасности и выравнивания, обычно присутствующие в массовых ассистентских моделях.
tencent/hunyuan-a13b-instruct
Hunyuan-A13B — это языковая модель Mixture-of-Experts (MoE) с 13B активными параметрами, разработанная Tencent, с общим количеством параметров 80B и поддержкой рассуждений через цепочку мыслей. Она демонстрирует конкурентоспособные результаты в бенчмарках по математике, естественным наукам, программированию и многошаговым задачам рассуждений, сохраняя высокую эффективность инференса благодаря Grouped Query Attention (GQA) и поддержке квантования (FP8, GPTQ и т. д.).
morph/morph-v3-large
Модель высокоточной обработки Morph для сложных правок кода. ~4,500 токенов/сек с точностью 98% для точных преобразований кода. Модель требует, чтобы запрос был в следующем формате: {instruction} {initial_code} {edit_snippet} Для Morph включено нулевое хранение данных. Узнайте больше об этой модели в их документации.
morph/morph-v3-fast
Morph — самая быстрая модель для правок кода. ~10,500 токенов/сек с точностью 96% для быстрых преобразований кода. Модель требует, чтобы prompt был в следующем формате: {instruction} {initial_code} {edit_snippet} Нулевое хранение данных включено для Morph. Подробнее об этой модели в документации
baidu/ernie-4.5-vl-424b-a47b
ERNIE-4.5-VL-424B-A47B — это мультимодальная модель с архитектурой «смесь экспертов» (MoE) из серии ERNIE 4.5 от Baidu, имеющая 424B всего параметров и 47B активных на каждый токен. Модель обучается совместно на текстовых и графических данных с использованием гетерогенной архитектуры MoE и изолированной маршрутизации по модальностям, что обеспечивает высокоточные межмодальные рассуждения, понимание изображений и генерацию длинного контекста (до 131k токенов). Благодаря тонкой настройке с такими методами, как SFT, DPO, UPO и RLVR, модель поддерживает как режимы «размышления», так и режимы без размышлений. Предназначенная для задач зрения и языка на английском и китайском, модель оптимизирована для эффективного масштабирования и может работать с квантованием в 4-бит и 8-бит.
mistralai/mistral-small-3.2-24b-instruct
Mistral-Small-3.2-24B-Instruct-2506 — это обновленная модель с 24B параметрами от Mistral, оптимизированная для следования инструкциям, снижения повторений и улучшенного вызова функций. По сравнению с релизом 3.1, версия 3.2 значительно улучшает точность на WildBench и Arena Hard, сокращает бесконечные генерации и обеспечивает прирост в использовании инструментов и задачах со структурированным выводом. Он поддерживает ввод изображений и текста со структурированными выводами, вызов функций/инструментов, а также высокую производительность в области программирования (HumanEval+, MBPP), STEM (MMLU, MATH, GPQA) и бенчмарках компьютерного зрения (ChartQA, DocVQA).
minimax/minimax-m1
MiniMax-M1 — это крупномасштабная модель с открытым весом, предназначенная для рассуждений, оптимизированная для длинного контекста и эффективного вывода. Она использует гибридную архитектуру смеси экспертов (MoE) в сочетании с пользовательским механизмом «молниеносного внимания», позволяющим обрабатывать длинные последовательности — до 1 миллионов токенов — при сохранении конкурентоспособной эффективности FLOP. При общем количестве 456 миллиардов параметров и 45.9B активных параметров на токен этот вариант оптимизирован для сложных многошаговых задач рассуждения. Обученная с помощью пользовательского конвейера обучения с подкреплением (CISPO), модель M1 превосходно справляется с пониманием длинного контекста, разработкой программного обеспечения, автономным использованием инструментов и математическими рассуждениями. Бенчмарки демонстрируют высокую производительность в задачах FullStackBench, SWE-bench, MATH, GPQA и TAU-Bench, часто превосходя другие открытые модели, такие как DeepSeek R1 и Qwen3-235B.
google/gemini-2.5-flash
Gemini 2.5 Flash — это передовая основная модель Google, специально разработанная для сложных задач рассуждения, программирования, математики и науки. Она включает встроенные возможности «мышления», позволяющие давать ответы с большей точностью и тонкой обработкой контекста. Кроме того, Gemini 2.5 Flash настраивается через параметр "max tokens for reasoning", как описано в документации (https://openrouter.ai/docs/use-cases/reasoning-tokens#max-tokens-for-reasoning).
google/gemini-2.5-pro
Gemini 2.5 Pro — это передовая модель Google AI, предназначенная для решения сложных задач в области логики, программирования, математики и науки. Модель использует возможности «мышления», что позволяет ей рассуждать при формировании ответов с повышенной точностью и тонким пониманием контекста. Gemini 2.5 Pro достигает результатов высшего уровня на множестве бенчмарков, включая первое место в рейтинге LMArena, что отражает превосходное соответствие человеческим предпочтениям и способность решать сложные проблемы.
openai/o3-pro
Модели серии o обучаются с помощью обучения с подкреплением, чтобы обдумывать ответ перед тем, как ответить, и выполнять сложные рассуждения. Модель o3-pro использует больше вычислений, чтобы думать усерднее и давать стабильно лучшие ответы. Обратите внимание, что для этой модели требуется BYOK. Настройка здесь: https://openrouter.ai/settings/integrations
google/gemini-2.5-pro-preview
Gemini 2.5 Pro — это передовая модель AI от Google, предназначенная для решения сложных задач рассуждения, программирования, математики и научных задач. Она использует возможности «мышления», позволяющие ей обдумывать ответы с повышенной точностью и тонким пониманием контекста. Gemini 2.5 Pro достигает результатов высшего уровня на многих бенчмарках, включая первое место в рейтинге LMArena, что отражает превосходное соответствие человеческим предпочтениям и способность решать сложные задачи.
deepseek/deepseek-r1-0528
28-е обновление к оригиналу DeepSeek R1 — производительность на уровне OpenAI o1, но с открытым исходным кодом и полностью открытыми токенами рассуждения. Размер модели — 671B параметров, при этом в ходе инференса активно задействовано 37B. Полностью открытая модель.
anthropic/claude-opus-4
Claude Opus 4 признана по результатам бенчмарков лучшей моделью для написания кода в мире на момент выпуска, обеспечивая стабильную производительность в сложных длительных задачах и агентных рабочих процессах. Она устанавливает новые рекорды в разработке программного обеспечения, достигая ведущих результатов на SWE-bench (72.5%) и Terminal-bench (43.2%). Opus 4 поддерживает расширенные агентные сценарии, обрабатывая тысячи шагов задач непрерывно в течение часов без деградации. Подробнее в публикации в блоге
anthropic/claude-sonnet-4
Claude Sonnet 4 значительно расширяет возможности своего предшественника, Sonnet 3.7, превосходя его как в задачах программирования, так и в рассуждениях, обеспечивая повышенную точность и управляемость. Достигая передовых результатов на SWE-bench (72.7%), Sonnet 4 сочетает производительность и вычислительную эффективность, что делает его подходящим для широкого спектра применений — от рутинных задач кодирования до сложных проектов разработки программного обеспечения. Ключевые улучшения включают улучшенную автономную навигацию по кодовой базе, снижение частоты ошибок в агентных рабочих процессах и повышенную надёжность при выполнении сложных инструкций. Sonnet 4 оптимизирован для практического повседневного использования, обеспечивая расширенные возможности рассуждений при сохранении эффективности и отзывчивости в различных внутренних и внешних сценариях. Подробнее в публикации в блоге
mistralai/mistral-medium-3
Mistral Medium 3 — это высокопроизводительная языковая модель корпоративного уровня, предназначенная для предоставления возможностей передового уровня при значительно сниженных эксплуатационных расходах. Она сочетает современные рассуждения и мультимодальную производительность с 8× более низкой стоимостью по сравнению с традиционными большими моделями, что делает её подходящей для масштабируемых развёртываний в профессиональных и промышленных сценариях использования. Модель превосходно работает в таких областях, как программирование, STEM-рассуждения и корпоративная адаптация. Она поддерживает гибридные, локальные (on-prem) и внутри-VPC развёртывания и оптимизирована для интеграции в пользовательские рабочие процессы. Mistral Medium 3 обеспечивает конкурентоспособную точность по сравнению с более крупными моделями, такими как Claude Sonnet 3.5/3.7, Llama 4 Maverick и Command R+, сохраняя широкую совместимость с облачными средами.
google/gemini-2.5-pro-preview-05-06
Gemini 2.5 Pro — это самая современная модель AI от Google, предназначенная для решения сложных задач в области рассуждений, программирования, математики и научных исследований. Она использует возможности «мышления», позволяющие ей логически выстраивать ответы с повышенной точностью и тонким пониманием контекста. Gemini 2.5 Pro показывает высочайшую производительность в многочисленных тестах, включая первое место в таблице лидеров LMArena, что отражает превосходное соответствие человеческим предпочтениям и способность решать сложные задачи.
meta-llama/llama-guard-4-12b
Llama Guard 4 — это мультимодальная предобученная модель, полученная на основе Llama 4 Scout, доработанная для классификации безопасности контента. Как и предыдущие версии, она может использоваться для классификации контента как во входных данных LLM (классификация промптов), так и в ответах LLM (классификация ответов). Она действует как LLM, генерируя в выходных данных текст, указывающий, является ли данный промпт или ответ безопасным или небезопасным, а если небезопасным, то также перечисляет категории контента, которые были нарушены. Llama Guard 4 была согласована для защиты от стандартизированной таксономии опасностей MLCommons и разработана для поддержки мультимодальных возможностей Llama 4. В частности, она объединяет функции предыдущих моделей Llama Guard, обеспечивая модерацию контента на английском и нескольких поддерживаемых языках, а также расширенные возможности для обработки смешанных текстово-изображенческих промптов, включая несколько изображений. Кроме того, Llama Guard 4 интегрирована в API модерации Llama API, расширяя надежную классификацию безопасности на текст и изображения.
qwen/qwen3-30b-a3b
Qwen3, новейшее поколение в серии больших языковых моделей Qwen, отличается как плотной, так и смешанной архитектурой экспертов (MoE), что позволяет достигать выдающихся результатов в рассуждениях, многоязычной поддержке и продвинутых агентных задачах. Его уникальная способность плавно переключаться между режимом мышления для сложных рассуждений и режимом без мышления для эффективного диалога обеспечивает универсальную высококачественную производительность. Значительно превосходя предыдущие модели, такие как QwQ и Qwen2.5, Qwen3 обеспечивает превосходные возможности в математике, программировании, здравом смысле, творческом письме и интерактивном диалоге. Вариант Qwen3-30B-A3B включает 30.5 миллиардов параметров (3.3 миллиардов активируется), 48 слоёв, 128 экспертов (8 активируется для каждой задачи) и поддерживает контексты до 131K токенов с YaRN, устанавливая новый стандарт среди моделей с открытым исходным кодом.
qwen/qwen3-8b
Qwen3-8B — это плотная причинная языковая модель с 8.2B параметрами из серии Qwen3, предназначенная как для задач, требующих интенсивных рассуждений, так и для эффективного диалога. Она поддерживает плавное переключение между режимом «размышления» для математики, программирования и логических выводов, и режимом «без размышлений» для обычного общения. Модель доработана для следования инструкциям, интеграции с агентами, творческого письма и многоязычного использования на 100+ языках и диалектах. Она изначально поддерживает контекстное окно в 32K токенов и может быть расширена до 131K токенов с помощью масштабирования YaRN.
qwen/qwen3-14b
Qwen3-14B — это плотная языковая модель с 14.8B параметрами из серии Qwen3, предназначенная как для сложных рассуждений, так и для эффективного диалога. Она поддерживает плавное переключение между режимом «размышления» для задач, требующих математики, программирования и логических выводов, и режимом «без размышлений» для обычного общения. Модель доработана для следования инструкциям, использования инструментов агентами, творческого письма и многоязычных задач на 100+ языках и диалектах. Она изначально поддерживает контекст до 32K токенов и может быть расширена до 131K токенов с помощью масштабирования на основе YaRN.
qwen/qwen3-32b
Qwen3-32B — это плотная 32.8B-параметрическая каузальная языковая модель из серии Qwen3, оптимизированная как для сложных рассуждений, так и для эффективного диалога. Она поддерживает плавное переключение между режимом «размышления» для задач математики, программирования и логического вывода, а также режимом «без размышлений» для более быстрых общих бесед. Модель демонстрирует высокую производительность в следовании инструкциям, использовании агентских инструментов, творческом написании и многоязычных задачах на более чем 100 языках и диалектах. Она изначально работает с контекстами до 32K токенов и может быть расширена до 131K токенов с помощью масштабирования на основе YaRN.
qwen/qwen3-235b-a22b
Qwen3-235B-A22B — это модель смеси экспертов (MoE) с 235B параметрами, разработанная компанией Qwen и активирующая 22B параметров за один прямой проход. Она поддерживает бесшовное переключение между режимом «мышления» для сложных рассуждений, математики и задач программирования и режимом «без мышления» для общей эффективности диалога. Модель демонстрирует высокую способность к рассуждению, многоязычную поддержку (100+ языков и диалектов), продвинутое следование инструкциям и возможности вызова агентских инструментов. Она нативно обрабатывает контекстное окно в 32K токенов и расширяется до 131K токенов с помощью масштабирования на основе YaRN.
openai/o4-mini-high
OpenAI o4-mini-high — это та же модель, что и o4-mini, но с reasoning_effort, установленным на high. OpenAI o4-mini — это компактная модель рассуждений в серии o, оптимизированная для быстрой и экономичной работы при сохранении сильных мультимодальных и агентных возможностей. Она поддерживает использование инструментов и демонстрирует конкурентоспособную производительность в рассуждениях и написании кода на таких бенчмарках, как AIME (99.5% с Python) и SWE-bench, превосходя своего предшественника o3-mini и даже приближаясь к o3 в некоторых областях. Несмотря на меньший размер, o4-mini показывает высокую точность в задачах STEM, решении визуальных задач (например, MathVista, MMMU) и редактировании кода. Он особенно хорошо подходит для сценариев с высокой пропускной способностью, где критически важны задержка или стоимость. Благодаря эффективной архитектуре и усовершенствованному обучению с подкреплением o4-mini может объединять инструменты в цепочки, генерировать структурированные выходные данные и решать многошаговые задачи с минимальной задержкой — часто менее чем за минуту.
openai/o3
o3 — это разносторонняя и мощная модель, работающая во многих областях. Она задаёт новый стандарт для задач по математике, естественным наукам, программированию и визуальному мышлению. Также она отлично справляется с техническим письмом и выполнением инструкций. Используйте её для обдумывания многошаговых задач, требующих анализа текста, кода и изображений.
openai/o4-mini
OpenAI o4-mini — это компактная модель рассуждения из серии o, оптимизированная для быстрой и экономичной работы при сохранении сильных мультимодальных и агентных возможностей. Она поддерживает использование инструментов и демонстрирует конкурентоспособную производительность в рассуждениях и кодировании на таких бенчмарках, как AIME (99.5% с Python) и SWE-bench, превосходя своего предшественника o3-mini и даже приближаясь к o3 в некоторых областях. Несмотря на меньший размер, o4-mini показывает высокую точность в задачах STEM, решении визуальных задач (например, MathVista, MMMU) и редактировании кода. Он особенно хорошо подходит для сценариев с высокой пропускной способностью, где критически важны задержка или стоимость. Благодаря эффективной архитектуре и усовершенствованному обучению с подкреплением, o4-mini может связывать инструменты, генерировать структурированные выходные данные и решать многошаговые задачи с минимальной задержкой — часто менее чем за минуту.
openai/gpt-4.1
GPT-4.1 — это большая языковая модель, оптимизированная для продвинутого следования инструкциям, реальной разработки ПО и рассуждений с длинным контекстом. Она поддерживает контекстное окно в 1 миллионов токенов и превосходит GPT-4o и GPT-4.5 в бенчмарках по кодингу (54.6% SWE-bench Verified), соблюдению инструкций (87.4% IFEval) и мультимодальному пониманию. Она настроена для точных диффов кода, надежности агентов и высокой точности извлечения в больших документах, что делает ее идеальной для агентов, инструментов IDE и корпоративного поиска знаний.
openai/gpt-4.1-mini
GPT-4.1 Mini представляет собой модель среднего размера, обеспечивающую производительность, сопоставимую с GPT-4o, при значительно меньшей задержке и стоимости. Она сохраняет контекстное окно в 1 миллионов токенов и набирает 45.1% на сложных инструкционных тестах, 35.8% на MultiChallenge и 84.1% на IFEval. Mini также демонстрирует высокие способности к программированию (например, 31.6% в бенчмарке Aider polyglot diff) и понимание изображений, что делает её подходящей для интерактивных приложений с жёсткими ограничениями по производительности.
openai/gpt-4.1-nano
Для задач, требующих низкой задержки, GPT‑4.1 nano — самая быстрая и дешёвая модель в серии GPT-4.1. Она обеспечивает исключительную производительность при небольшом размере благодаря контекстному окну в 1 миллионов токенов и набирает 80.1% на MMLU, 50.3% на GPQA и 9.8% на Aider polyglot coding — даже выше, чем GPT‑4o mini. Она идеально подходит для таких задач, как классификация или автодополнение.
meta-llama/llama-4-maverick
Llama 4 Maverick 17B Instruct (128E) — это высокопроизводительная мультимодальная языковая модель от Meta, построенная на архитектуре смеси экспертов (MoE) с 128 экспертами и 17 миллиардами активных параметров на один прямой проход (всего 400B). Она поддерживает многоязычный текстовый и графический ввод и создаёт многоязычный текст и код на 12 поддерживаемых языках. Оптимизированная для задач зрения и языка, Maverick доработана с помощью инструкций для поведения, подобного ассистенту, логических рассуждений над изображениями и универсального мультимодального взаимодействия. Maverick отличается ранним слиянием для нативной мультимодальности и контекстным окном на 1 миллионов токенов. Модель обучалась на тщательно подобранной смеси публичных, лицензированных и данных платформы Meta, охватывающей примерно 22 триллионов токенов, с датой отсечения знаний — август 2024. Выпущенная в апреле 5, 2025 под лицензией сообщества Llama 4, Maverick подходит для исследовательских и коммерческих приложений, требующих продвинутого мультимодального понимания и высокой пропускной способности модели.
meta-llama/llama-4-scout
Llama 4 Scout 17B Instruct (16E) — это языковая модель со смешанной экспертной архитектурой (MoE), разработанная компанией Meta, которая активирует 17 миллиарда параметров из общего числа 109B. Модель поддерживает нативный мультимодальный ввод (текст и изображения) и многоязычный вывод (текст и код) на 12 поддерживаемых языках. Созданная для ассистентского взаимодействия и визуального рассуждения, Scout использует 16 экспертов за один прямой проход и имеет длину контекста в 10 миллиона токенов, с обучающим корпусом объёмом около 40 триллионов токенов. Разработанная для высокой эффективности и локального или коммерческого развёртывания, Llama 4 Scout включает раннее слияние для бесшовной интеграции модальностей. Модель дообучена на инструкциях для использования в многоязычных чатах, генерации подписей и задачах понимания изображений. Выпущена под лицензией Llama 4 Community License, модель последний раз обучалась на данных, актуальных по август 2024, и была публично запущена в апреле 5, 2025.
deepseek/deepseek-chat-v3-0324
DeepSeek V3, модель со смешанными экспертами с 685B параметрами, является новейшей итерацией флагманского семейства чат-моделей команды DeepSeek. Она приходит на смену модели DeepSeek V3 и отлично справляется с самыми разными задачами.
openai/o1-pro
Модели серии o1 обучаются с помощью обучения с подкреплением, чтобы обдумывать ответ перед его выдачей и выполнять сложные рассуждения. Модель o1-pro использует больше вычислительных ресурсов, чтобы думать глубже и давать стабильно более качественные ответы.
mistralai/mistral-small-3.1-24b-instruct
Mistral Small 3.1 24B — это улучшенная версия Mistral Small 3 (2501), обладающая 24 миллиардами параметров и расширенными мультимодальными возможностями. Она обеспечивает передовую производительность в текстовых задачах и визуальном анализе, включая обработку изображений, программирование, многоязычные рассуждения и поддержку десятков языков. Оснащённая обширным контекстным окном 128k и оптимизированная для эффективного локального вывода, модель поддерживает такие сценарии, как диалоговые агенты, вызов функций, понимание длинных документов и развёртывание в условиях ограниченной конфиденциальности. Обновлённая версия доступна как Mistral Small 3.2.
google/gemma-3-4b-it
Gemma 3 вводит мультимодальность, поддерживая ввод вида «изображение-текст» и вывод текста. Он обрабатывает контекстные окна до 128k токенов, понимает более 140 языков и предлагает улучшенные возможности для математики, логических рассуждений и чата, включая структурированные выходные данные и вызов функций.
google/gemma-3-12b-it
Gemma 3 вводит мультимодальность, поддерживая ввод на основе зрения и языка и текстовый вывод. Он обрабатывает контекстные окна до 128k токенов, понимает более 140 языков и предлагает улучшенные возможности для математики, рассуждений и чата, включая структурированные выходные данные и вызовы функций. Gemma 3 12B является второй по величине моделью в семействе Gemma 3 после Gemma 3 27B
cohere/command-a
Command A — это модель с открытыми весами, имеющая 111B параметров и контекстное окно 256k, ориентированная на обеспечение высокой производительности в агентных, многоязычных и программных сценариях использования. По сравнению с другими ведущими проприетарными моделями и моделями с открытыми весами Command A обеспечивает максимальную производительность при минимальных аппаратных затратах, превосходно справляясь с критически важными для бизнеса агентными и многоязычными задачами.
rekaai/reka-flash-3
Reka Flash 3 — это универсальная языковая модель большого размера, настроенная на выполнение инструкций, с 21 миллиардами параметров, разработанная компанией Reka. Она отлично справляется с общими диалогами, задачами программирования, следованием инструкциям и вызовом функций. Благодаря контекстной длине 32K и оптимизации с помощью обучения с подкреплением (RLOO) модель обеспечивает производительность, сопоставимую с проприетарными моделями, при меньшем количестве параметров. Reka Flash 3 идеально подходит для развертывания с низкой задержкой, локального или на устройстве: она компактна, поддерживает эффективное квантование (вплоть до 11GB с точностью 4 бит) и использует явные теги рассуждений ("") для обозначения внутреннего мыслительного процесса. Reka Flash 3 — это в первую очередь англоязычная модель с ограниченными возможностями многоязычного понимания. Веса модели выпущены под лицензией Apache 2.0.
google/gemma-3-27b-it
Gemma 3 вводит мультимодальность, поддерживая визуально-языковой ввод и текстовые выводы. Он обрабатывает контекстные окна до 128k токенов, понимает более 140 языков и предлагает улучшенные возможности в области математики, рассуждений и чата, включая структурированные выводы и вызовы функций. Gemma 3 27B — это последняя модель с открытым исходным кодом от Google, преемница Gemma 2
thedrummer/skyfall-36b-v2
Skyfall 36B v2 — это улучшенная итерация Mistral Small 2501, специально доработанная для повышения креативности, нюансированного письма, ролевой игры и связного повествования.
perplexity/sonar-reasoning-pro
Примечание: цена Sonar Pro включает стоимость поиска Perplexity. См. подробнее здесь Sonar Reasoning Pro — это ведущая модель рассуждений на базе DeepSeek R1 с цепочкой рассуждений (CoT). Разработана для сложных сценариев использования, поддерживает углублённые многошаговые запросы, увеличенный контекст и может выводить больше ссылок на поиск, обеспечивая более полные и расширяемые ответы.
perplexity/sonar-pro
Примечание: Sonar Pro ценообразование включает Perplexity поиск. Подробнее здесь Для предприятий, которым требуются более продвинутые возможности, Sonar Pro API могут обрабатывать многоэтапные запросы с расширенной функциональностью, например, вдвое больше цитируемых источников на поиск по сравнению с Sonar в среднем. Кроме того, увеличенное контекстное окно позволяет обрабатывать более длинные и сложные запросы, а также уточняющие вопросы.
perplexity/sonar-deep-research
Sonar Deep Research — это модель, ориентированная на исследования, предназначенная для многоэтапного поиска, синтеза и рассуждений по сложным темам. Она автономно ищет, читает и оценивает источники, уточняя свой подход по мере сбора информации. Это позволяет создавать комплексные отчёты в таких областях, как финансы, технологии, здравоохранение и текущие события. Примечания по ценообразованию (Источник) Входные токены включают токены подсказки (пользовательский запрос) + токены цитирования (это обработанные токены из выполненных поисковых запросов) Deep Research выполняет несколько поисковых запросов для проведения исчерпывающего исследования. Поисковые запросы оцениваются в $5 за 1000 поисковых запросов. Запрос, выполняющий 30 поисковых запросов, будет стоить $0.15 на этом этапе. Рассуждение — это отдельный этап в Deep Research, поскольку он выполняет обширные автоматизированные рассуждения по всему материалу, собранному на этапе исследования. Токены рассуждения здесь немного отличаются от CoTs в ответе — это токены, которые мы используем для рассуждения о исследовательском материале перед генерацией результатов через CoTs. Токены рассуждения оцениваются в $3 за 1M токенов
mistralai/mistral-saba
Mistral Saba — это языковая модель с 24B параметрами, специально разработанная для Ближнего Востока и Южной Азии, обеспечивающая точные и контекстуально релевантные ответы при сохранении эффективной производительности. Обученная на курируемых региональных наборах данных, она поддерживает несколько языков индийского происхождения, включая тамильский и малаялам, наряду с арабским. Это делает её универсальным вариантом для широкого круга региональных и многоязычных приложений. Подробнее в блоге здесь.
openai/o3-mini-high
OpenAI o3-mini-high — это та же модель, что и o3-mini, но с параметром reasoning_effort, установленным в значение high. o3-mini — это экономичная языковая модель, оптимизированная для задач STEM-рассуждений, особенно сильная в науке, математике и программировании. Модель предлагает три настраиваемых уровня усилий рассуждения и поддерживает ключевые возможности для разработчиков, включая вызов функций, структурированные выходные данные и потоковую передачу, однако не включает возможности обработки изображений. Модель демонстрирует значительные улучшения по сравнению с предыдущей версией: экспертные тестировщики предпочитают её ответы в 56% случаев и отмечают снижение 39% серьёзных ошибок при решении сложных вопросов. При среднем уровне усилий рассуждения o3-mini соответствует производительности более крупной модели o1 на сложных оценочных тестах рассуждений, таких как AIME и GPQA, сохраняя при этом более низкую задержку и стоимость.
aion-labs/aion-rp-llama-3.1-8b
Aion-RP-Llama-3.1-8B — это бенчмарк, в котором оценивается качество ответов. Он относится к категории ролевых сценариев и является вариантом теста RPBench-Auto, где LLMs оценивают ответы друг друга. Это тонко настроенная базовая модель, а не инструктивная, предназначенная для создания более естественных и разнообразных текстов.
qwen/qwen2.5-vl-72b-instruct
Qwen2.5-VL умеет распознавать распространённые объекты, такие как цветы, птицы, рыбы и насекомые. Кроме того, она отлично справляется с анализом текстов, диаграмм, иконок, графики и макетов в изображениях.
qwen/qwen-plus
Qwen-Plus, основанная на базовой модели Qwen2.5, представляет собой модель с контекстом 131K, обладающую сбалансированным сочетанием производительности, скорости и стоимости.
openai/o3-mini
OpenAI o3-mini — это экономичная языковая модель, оптимизированная для задач STEM-рассуждений, особенно эффективная в естественных науках, математике и программировании. Модель поддерживает параметр reasoning_effort, который можно задать как «high», «medium» или «low» для управления временем размышлений модели. По умолчанию используется значение «medium». OpenRouter также предлагает слаг модели openai/o3-mini-high, чтобы по умолчанию установить параметр в «high». Модель имеет три регулируемых уровня усилий при рассуждении и поддерживает ключевые возможности разработчиков, включая вызов функций, структурированные выходные данные и потоковую передачу, однако не включает возможности обработки изображений. Модель демонстрирует значительные улучшения по сравнению со своим предшественником: экспертные тестировщики предпочитают её ответы 56% случаев и отмечают снижение 39% серьёзных ошибок на сложных вопросах. При среднем уровне усилий рассуждения o3-mini соответствует производительности более крупной модели o1 на сложных оценочных тестах, таких как AIME и GPQA, сохраняя при этом меньшую задержку и стоимость.
mistralai/mistral-small-24b-instruct-2501
Mistral Small 3 — это языковая модель с 24B параметрами, оптимизированная для низкой задержки при выполнении типовых задач AI. Выпущенная под лицензией Apache 2.0, она включает как предобученную, так и инструктивную версии, предназначенные для эффективного локального развертывания. Модель достигает точности 81% на бенчмарке MMLU и показывает конкурентоспособные результаты по сравнению с более крупными моделями, такими как Llama 3.3 70B и Qwen 32B, работая при этом в три раза быстрее на эквивалентном оборудовании. Прочитайте статью в блоге об этой модели здесь.
perplexity/sonar
Sonar легкий, доступный, быстрый и простой в использовании — теперь с цитатами и возможностью настройки источников. Он предназначен для компаний, стремящихся интегрировать легкие функции вопросов и ответов, оптимизированные для скорости.
deepseek/deepseek-r1-distill-llama-70b
DeepSeek R1 Distill Llama 70B — это дистиллированная большая языковая модель, основанная на Llama-3.3-70B-Instruct и использующая выходные данные DeepSeek R1. Модель объединяет передовые методы дистилляции для достижения высокой производительности по множеству бенчмарков, включая: AIME 2024 pass@1: 70.0 MATH-500 pass@1: 94.5 CodeForces Rating: 1633 Модель использует точную настройку на выходных данных DeepSeek R1, что обеспечивает конкурентоспособную производительность, сравнимую с более крупными передовыми моделями.
deepseek/deepseek-r1
DeepSeek R1 на месте: производительность на уровне OpenAI o1, но с открытым исходным кодом и полностью открытыми токенами рассуждений. Размер — 671B параметров, из которых 37B активны во время прохода вывода. Полностью открытая модель и технический отчет. Лицензия MIT: свободно дистиллируйте и коммерциализируйте!
minimax/minimax-01
MiniMax-01 — это комбинированная модель, объединяющая MiniMax-Text-01 для генерации текста и MiniMax-VL-01 для понимания изображений. Она имеет 456 миллиардов параметров, при этом 45.9 миллиардов параметров активируется за один вывод, и может обрабатывать контекст до 4 миллионов токенов. Текстовая модель использует гибридную архитектуру, сочетающую Lightning Attention, Softmax Attention и Mixture-of-Experts (MoE). Модель изображений использует фреймворк «ViT-MLP-LLM» и обучается поверх текстовой модели. Чтобы узнать больше о релизе, см.: https://www.minimaxi.com/en/news/minimax-01-series-2
microsoft/phi-4
Microsoft Research Phi-4 разработана для достижения высоких результатов в сложных задачах рассуждения и может эффективно работать в условиях ограниченной памяти или когда требуются быстрые ответы. Модель с 14 миллиардами параметров была обучена на смеси высококачественных синтетических наборов данных, данных с курируемых веб-сайтов и академических материалов. Она прошла тщательную доработку, чтобы точно следовать инструкциям и поддерживать высокие стандарты безопасности. Она лучше всего работает с входными данными на английском языке. Для получения дополнительной информации см. Phi-4 Technical Report
deepseek/deepseek-chat
DeepSeek-V3 — новейшая модель команды DeepSeek, развивающая способности предыдущих версий к следованию инструкциям и написанию кода. Предобученная на почти 15 триллионах токенов, модель, согласно опубликованным оценкам, превосходит другие открытые модели и конкурирует с ведущими закрытыми моделями. Подробности о модели см. в репозитории DeepSeek-V3 или в анонсе запуска.
sao10k/l3.3-euryale-70b
Euryale L3.3 70B — модель, ориентированная на творческую ролевую игру, от Sao10k. Она является преемницей Euryale L3 70B v2.2.
openai/o1
Последнее и самое мощное семейство моделей от OpenAI, o1 разработано для того, чтобы тратить больше времени на размышления перед ответом. Серия моделей o1 обучается с помощью масштабного обучения с подкреплением, чтобы рассуждать, используя цепочку мыслей. Модели o1 оптимизированы для математики, науки, программирования и других задач STEM-related. Они стабильно демонстрируют точность уровня PhD на бенчмарках по физике, химии и биологии. Подробнее в анонсе о запуске.
cohere/command-r7b-12-2024
Command R7B (12-2024) — это небольшое и быстрое обновление модели Command R+, выпущенное в декабре 2024. Она отлично справляется с задачами, требующими сложных рассуждений и многошаговых действий, такими как RAG, использование инструментов, работа с агентами и аналогичными сценариями. Использование данной модели регулируется Политикой использования и Соглашением SaaS компании Cohere.
meta-llama/llama-3.3-70b-instruct
Многоязычная большая языковая модель Meta Llama 3.3 (LLM) — это предобученная и инструкционно настроенная генеративная модель в 70B (текст на входе/текст на выходе). Модель Llama 3.3, инструкционно настроенная и работающая только с текстом, оптимизирована для многоязычных диалоговых сценариев и превосходит многие доступные открытые и закрытые чат-модели на распространённых отраслевых бенчмарках. Поддерживаемые языки: английский, немецкий, французский, итальянский, португальский, хинди, испанский и тайский. Model Card
amazon/nova-lite-v1
Amazon Nova Lite 1.0 — это очень недорогая мультимодальная модель от Amazon, которая ориентирована на быструю обработку изображений, видео и текстовых входных данных для генерации текстового вывода. Amazon Nova Lite может обрабатывать взаимодействия с клиентами в реальном времени, анализ документов и задачи визуальных вопросов-ответов с высокой точностью. При входном контексте в 300K токенов она может анализировать несколько изображений или до 30 минут видео за один вход.
amazon/nova-micro-v1
Amazon Nova Micro 1.0 — это текстовая модель, обеспечивающая минимальную задержку ответов среди моделей семейства Amazon Nova при очень низкой стоимости. С длиной контекста в 128K токенов и оптимизацией под скорость и цену, Amazon Nova Micro превосходно справляется с такими задачами, как суммаризация текста, перевод, классификация контента, интерактивный чат и генерация идей. Она обладает простыми математическими рассуждениями и способностями к программированию.
amazon/nova-pro-v1
Amazon Nova Pro 1.0 — это мощная мультимодальная модель от Amazon, ориентированная на предоставление сочетания точности, скорости и стоимости для широкого круга задач. По состоянию на декабрь 2024 она достигает передовых результатов на ключевых бенчмарках, включая ответы на визуальные вопросы (TextVQA) и понимание видео (VATEX). Amazon Nova Pro демонстрирует сильные возможности в обработке как визуальной, так и текстовой информации, а также в анализе финансовых документов. NOTE: Видеовход в настоящее время не поддерживается.
openai/gpt-4o-2024-11-20
Версия 2024-11-20 модели GPT-4o предлагает улучшенные способности к творческому письму с более естественным, увлекательным и адаптированным текстом для повышения релевантности и удобочитаемости. Она также лучше работает с загруженными файлами, предоставляя более глубокие аналитические выводы и более тщательные ответы. GPT-4o ("o" — от "omni") — это последняя модель AI от OpenAI, поддерживающая как текстовые, так и графические входные данные с текстовыми выходными данными. Она сохраняет уровень интеллекта GPT-4 Turbo, будучи при этом вдвое быстрее и на 50% экономичнее. GPT-4o также обеспечивает улучшенную обработку неанглийских языков и расширенные визуальные возможности.
mistralai/mistral-large-2407
Это флагманская модель Mistral AI, Mistral Large 2 (версия mistral-large-2407). Это проприетарная модель с открытыми весами, которая превосходно справляется с рассуждениями, кодом, JSON, чатом и многим другим. Прочитайте анонс запуска здесь. Она поддерживает десятки языков, включая французский, немецкий, испанский, итальянский, португальский, арабский, хинди, русский, китайский, японский и корейский, а также более 80 языков программирования, включая Python, Java, C, C++, JavaScript и Bash. Её длинное контекстное окно позволяет точно извлекать информацию из больших документов.
qwen/qwen-2.5-coder-32b-instruct
Qwen2.5-Coder — это последняя серия больших языковых моделей Qwen, специализированных на коде (ранее известных как CodeQwen). Qwen2.5-Coder представляет следующие улучшения по сравнению с CodeQwen1.5: Значительные улучшения в генерации кода, рассуждении о коде и исправлении кода. Более комплексная основа для реальных приложений, таких как кодовые агенты. Не только улучшение возможностей кодирования, но и сохранение сильных сторон в математике и общих компетенциях. Чтобы узнать больше о результатах оценки, посмотрите блог Qwen 2.5 Coder.
thedrummer/unslopnemo-12b
UnslopNemo v4.1 является новейшим дополнением от создателя Rocinante, предназначенным для написания приключений и сценариев ролевых игр.
anthracite-org/magnum-v4-72b
Это серия моделей, предназначенных для воспроизведения качества прозы моделей Claude 3, в частности Sonnet(https://openrouter.ai/anthropic/claude-3.5-sonnet) и Opus(https://openrouter.ai/anthropic/claude-3-opus). Модель дообучена на основе Qwen2.5 72B.
qwen/qwen-2.5-7b-instruct
Qwen2.5 7B — новейшая серия больших языковых моделей Qwen. Qwen2.5 вносит следующие улучшения по сравнению с Qwen2: Значительно больше знаний и значительно улучшенные возможности в программировании и математике благодаря нашим специализированным экспертным моделям в этих областях. Значительные улучшения в следовании инструкциям, генерации длинных текстов (более 8K токенов), понимании структурированных данных (например, таблиц) и генерации структурированных выходных данных, особенно JSON. Повышенная устойчивость к разнообразию системных промптов, улучшающая реализацию ролевых игр и установку условий для чат-ботов. Поддержка длинного контекста до 128K токенов и возможность генерации до 8K токенов. Многоязычная поддержка более 29 языков, включая китайский, английский, французский, испанский, португальский, немецкий, итальянский, русский, японский, корейский, вьетнамский, тайский, арабский и другие. Использование этой модели регулируется условиями Tongyi Qianwen LICENSE AGREEMENT.
meta-llama/llama-3.2-1b-instruct
Llama 3.2 1B — это языковая модель с 1 миллиардами параметров, ориентированная на эффективное выполнение задач обработки естественного языка, таких как суммаризация, диалоги и многоязычный анализ текста. Меньший размер позволяет ей эффективно работать в средах с ограниченными ресурсами, сохраняя при этом высокую производительность. Поддерживая восемь основных языков и допуская дообучение для дополнительных языков, Llama 1.3B идеально подходит для бизнеса или разработчиков, которые ищут лёгкие, но мощные решения типа AI, способные работать в различных многоязычных средах без высоких вычислительных затрат, характерных для более крупных моделей. Нажмите здесь: оригинальная карточка модели. Использование данной модели регулируется Политикой допустимого использования Meta.
meta-llama/llama-3.2-3b-instruct
Llama 3.2 3B — это многоязычная большая языковая модель с 3 миллиардами параметров, оптимизированная для продвинутых задач обработки естественного языка, таких как генерация диалогов, рассуждение и суммаризация. Разработанная с использованием новейшей архитектуры трансформера, она поддерживает восемь языков, включая английский, испанский и хинди, и может быть адаптирована для дополнительных языков. Обученная на 9 триллионах токенов, модель Llama 3.2 3B превосходно справляется с выполнением инструкций, сложными рассуждениями и использованием инструментов. Её сбалансированная производительность делает её идеальной для приложений, требующих точности и эффективности в генерации текста в многоязычных средах. Нажмите здесь для оригинальной карточки модели. Использование этой модели регулируется Политикой допустимого использования Meta.
qwen/qwen-2.5-72b-instruct
Qwen2.5 72B — последняя серия больших языковых моделей Qwen. Qwen2.5 обеспечивает следующие улучшения по сравнению с Qwen2: Значительно больше знаний и улучшенные возможности в программировании и математике благодаря нашим специализированным моделям в этих областях. Значительные улучшения в следовании инструкциям, генерации длинных текстов (более 8K токенов), понимании структурированных данных (например, таблиц) и создании структурированных результатов, особенно JSON. Повышенная устойчивость к разнообразию системных промптов, улучшение реализации ролевых сценариев и условий для чат-ботов. Поддержка длинного контекста до 128K токенов и возможность генерации до 8K токенов. Многоязычная поддержка более 29 языков, включая китайский, английский, французский, испанский, португальский, немецкий, итальянский, русский, японский, корейский, вьетнамский, тайский, арабский и другие. Использование этой модели регулируется условиями Tongyi Qianwen LICENSE AGREEMENT.
cohere/command-r-08-2024
command-r-08-2024 — это обновление Command R с улучшенной производительностью для многоязычной поисково-дополненной генерации (RAG) и использования инструментов. В более широком смысле, она лучше в математике, коде и рассуждениях и конкурентоспособна с предыдущей версией более крупной модели Command R+. Читайте анонс здесь. Использование этой модели регулируется Политикой использования компании Cohere и Соглашением SaaS.
cohere/command-r-plus-08-2024
command-r-plus-08-2024 — это обновление Command R+ с примерно 50% более высокой пропускной способностью и 25% более низкими задержками по сравнению с предыдущей версией Command R+, при сохранении тех же аппаратных требований. Читайте пост о запуске здесь. Использование этой модели регулируется Политикой использования компании Cohere и SaaS Соглашением.
sao10k/l3.1-euryale-70b
Euryale L3.1 70B v2.2 — это модель, ориентированная на творческую ролевую игру от Sao10k. Она является преемником Euryale L3 70B v2.1.
nousresearch/hermes-3-llama-3.1-70b
Hermes 3 — это универсальная языковая модель со множеством улучшений по сравнению с Hermes 2, включая продвинутые агентные возможности, гораздо лучшее ролевое моделирование, рассуждение, многоходовые диалоги, связность длинного контекста и улучшения во всех областях. Hermes 3 70B — это конкурентоспособная, если не превосходящая тонкая настройка базовой модели Llama-3.1 70B, ориентированная на приведение LLMs в соответствие с пользователем, с мощными возможностями управления и контролем, предоставленным конечному пользователю. Серия Hermes 3 развивает и расширяет набор возможностей Hermes 2, включая более мощные и надёжные вызовы функций и возможности структурированного вывода, универсальные ассистентские возможности и улучшенные навыки генерации кода.
nousresearch/hermes-3-llama-3.1-405b
Hermes 3 представляет собой универсальную языковую модель со множеством улучшений по сравнению с Hermes 2, включая расширенные агентные возможности, значительно лучшее взаимодействие в ролевых сценариях, рассуждение, многоходовые диалоги, связность при длинном контексте и улучшения по всем направлениям. Hermes 3 405B — это модель передового уровня, полная тонкая настройка всех параметров на основе базовой модели Llama-3.1 405B, направленная на приведение LLMs в соответствие с пользователем, с мощными возможностями управления и контролем, предоставляемым конечному пользователю. Серия Hermes 3 развивает и расширяет набор возможностей Hermes 2, включая более мощный и надежный вызов функций и структурированный вывод, универсальные ассистентские возможности и улучшенные навыки генерации кода. Hermes 3 конкурентоспособна, если не превосходит, модели Llama-3.1 Instruct по общим возможностям, с различающимися сильными и слабыми сторонами, присущими обеим.
sao10k/l3-lunaris-8b
Lunaris 8B — это универсальная модель для ролевых игр, основанная на Llama 3. Она представляет собой стратегическое объединение нескольких моделей, созданное для баланса между креативностью и улучшенной логикой. Созданная Sao10k, эта модель нацелена на улучшение опыта по сравнению со Stheno v3.2, с повышенной креативностью и логическим мышлением. Для наилучших результатов используйте шаблон контекста инструкций Llama 3, температуру 1.4 и min_p 0.1.
openai/gpt-4o-2024-08-06
Версия 2024-08-06 модели GPT-4o обеспечивает improved производительность в структурированных выходных данных, позволяя передавать схему JSON в respone_format. Подробнее здесь. GPT-4o ("o" от "omni") — последняя модель OpenAI линейки AI, поддерживающая как текстовые, так и графические входные данные с текстовыми выходными данными. Она сохраняет уровень интеллекта модели GPT-4 Turbo, будучи при этом вдвое быстрее и на 50% экономичнее. GPT-4o также обеспечивает improved производительность при обработке неанглийских языков и enhanced визуальные возможности. Для сравнения с другими моделями она на короткое время была названа "im-also-a-good-gpt2-chatbot"
meta-llama/llama-3.1-70b-instruct
Последняя модель класса Meta (Llama 3.1), выпущенная в нескольких размерах и вариантах. Эта версия, оптимизированная для инструкций 70B, предназначена для высококачественных диалоговых сценариев. Она показала высокую производительность по сравнению с ведущими закрытыми моделями в оценках с участием людей. Чтобы узнать больше о выпуске модели, нажмите здесь. Использование этой модели регулируется Политикой допустимого использования Meta.
meta-llama/llama-3.1-8b-instruct
Последний класс моделей Meta (Llama 3.1) был выпущен в различных размерах и вариантах. Эта версия 8B, настроенная по инструкциям, быстрая и эффективная. Она продемонстрировала высокую производительность по сравнению с ведущими закрытыми моделями в оценках людьми. Чтобы узнать больше о выпуске модели, нажмите здесь. Использование этой модели регулируется Политикой допустимого использования Meta.
mistralai/mistral-nemo
Модель с параметрами 12B и длиной контекста 128k токенов, созданная Mistral в сотрудничестве с NVIDIA. Модель является многоязычной и поддерживает английский, французский, немецкий, испанский, итальянский, португальский, китайский, японский, корейский, арабский и хинди. Она поддерживает вызов функций и выпущена под лицензией Apache 2.0.
openai/gpt-4o-mini
GPT-4o mini — это новейшая модель OpenAI после GPT-4 Omni, поддерживающая как ввод изображений, так и текста с выводом текста. Будучи их самой продвинутой малой моделью, она во много раз доступнее других недавних моделей前沿 и более чем на 60% дешевле, чем GPT-3.5 Turbo. Она сохраняет интеллект SOTA, будучи при этом значительно более экономичной. GPT-4o mini достигает результата 82% по MMLU и в настоящее время занимает более высокое место, чем GPT-4, в чат-предпочтениях на общих рейтингах. Ознакомьтесь с анонсом запуска, чтобы узнать больше. мультимодальность
openai/gpt-4o-mini-2024-07-18
GPT-4o mini — это новейшая модель OpenAI после GPT-4 Omni, поддерживающая ввод как текста, так и изображений с выводом текста. Будучи их самой продвинутой малой моделью, она в несколько раз доступнее других последних передовых моделей и более чем на 60% дешевле, чем GPT-3.5 Turbo. Она сохраняет интеллект SOTA, оставаясь при этом значительно более экономичной. GPT-4o mini достигает результата 82% в MMLU и в настоящее время занимает более высокое место, чем GPT-4, в рейтингах предпочтений пользователей общие таблицы лидеров. Ознакомьтесь с анонсом запуска, чтобы узнать больше. multimodal
google/gemma-2-27b-it
Gemma 2 27B от Google — это открытая модель, созданная на основе тех же исследований и технологий, что и модели Gemini. Модели Gemma хорошо подходят для множества задач генерации текста, включая ответы на вопросы, суммаризацию и рассуждение. Подробнее см. в объявлении о запуске. Использование Gemma регулируется условиями использования Gemma от Google.
openai/gpt-4o
GPT-4o ("o" — от "omni") — последняя модель AI от OpenAI, принимающая на вход текст и изображения и выдающая текст. Она сохраняет уровень интеллекта GPT-4 Turbo, при этом работая вдвое быстрее и будучи на 50% экономичнее. GPT-4o также обеспечивает улучшенную производительность при обработке неанглийских языков и расширенные визуальные возможности. Для сравнения с другими моделями она кратко называлась "im-also-a-good-gpt2-chatbot" multimodal
openai/gpt-4o-2024-05-13
GPT-4o (буква «o» означает «omni») — последняя модель OpenAI AI, поддерживающая ввод текста и изображений с выводом текста. Она сохраняет уровень интеллекта GPT-4 Turbo, будучи при этом вдвое быстрее и на 50% экономичнее. Кроме того, GPT-4o демонстрирует улучшенную производительность при обработке неанглийских языков и расширенные визуальные возможности. Для сравнения с другими моделями она кратко называлась "im-also-a-good-gpt2-chatbot" мультимодальность
mistralai/mixtral-8x22b-instruct
Официальная инструктивная тонконастроенная версия Mixtral 8x22B от Mistral. Она использует 39B активных параметров из 141B, обеспечивая непревзойденную экономическую эффективность для своего размера. Ее сильные стороны включают: сильная математика, программирование и рассуждение большой контекст (64k) свободное владение английским, французским, итальянским, немецким и испанским См. бенчмарки в анонсе здесь. moe
microsoft/wizardlm-2-8x22b
WizardLM-2 8x22B — самая продвинутая модель Microsoft AI. Она демонстрирует высокую конкурентоспособность по сравнению с ведущими проприетарными моделями и стабильно превосходит все существующие открытые модели. Это инструктивная тонкая настройка Mixtral 8x22B. Подробнее о выпуске модели читайте здесь. moe
openai/gpt-4-turbo
Новейшая модель GPT-4 Turbo с поддержкой возможностей зрения. Запросы с изображениями теперь могут использовать режим JSON и вызов функций. Обучающие данные: до декабря 2023.
anthropic/claude-3-haiku
Claude 3 Haiku — самая быстрая и компактная модель Anthropic для почти мгновенного отклика. Быстрая и точная целевая производительность. Смотрите анонс запуска и результаты тестов здесь multimodal
mistralai/mistral-large
Это флагманская модель Mistral AI — Mistral Large 2 (версия mistral-large-2407). Это проприетарная модель с доступными весами, которая отлично справляется с рассуждениями, кодом, JSON, чатом и многим другим. Прочитайте анонс запуска здесь. Она поддерживает десятки языков, включая французский, немецкий, испанский, итальянский, португальский, арабский, хинди, русский, китайский, японский и корейский, а также 80+ языков программирования, включая Python, Java, C, C++, JavaScript и Bash. Длинное окно контекста позволяет точно извлекать информацию из больших документов.
openai/gpt-3.5-turbo-0613
GPT-3.5 Turbo — самая быстрая модель OpenAI. Она может понимать и генерировать естественный язык или код, и оптимизирована для чата и традиционных задач завершения. Данные для обучения до сентября 2021.
openai/gpt-4-turbo-preview
Предварительная версия модели GPT-4 с улучшенным следованием инструкциям, режимом JSON, воспроизводимыми выходами, параллельным вызовом функций и многим другим. Данные обучения: до декабря 2023. Примечание: в предварительной версии действует строгое ограничение частоты запросов OpenAI.
openai/gpt-3.5-turbo-instruct
Эта модель — вариант GPT-3.5 Turbo, настроенный на инструкционные запросы и исключающий оптимизации, связанные с чатом. Обучающие данные: по сентябрь 2021.
openai/gpt-3.5-turbo-16k
Эта модель предлагает четырехкратную длину контекста по сравнению с gpt-3.5-turbo, позволяя обрабатывать примерно 20 страниц текста в одном запросе при более высокой стоимости. Данные для обучения: до сентября 2021.
mancer/weaver
Попытка воссоздать стиль многословия Claude, но не ожидайте того же уровня связности или памяти. Предназначено для использования в ролевых/повествовательных ситуациях.
undi95/remm-slerp-l2-13b
Попытка воссоздания оригинальной MythoMax-L2-B13, но с обновлёнными моделями. #merge
gryphe/mythomax-l2-13b
Одна из самых производительных и популярных тонких настроек Llama 2 13B с богатыми описаниями и ролевой игрой. #merge
openai/gpt-3.5-turbo
GPT-3.5 Turbo — самая быстрая модель OpenAI. Она может понимать и генерировать естественный язык или код и оптимизирована для чата и традиционных задач завершения. Обучающие данные до сентября 2021.
openai/gpt-4
Флагманская модель OpenAI, GPT-4, — это крупномасштабная мультимодальная языковая модель, способная решать сложные задачи с большей точностью, чем предыдущие модели, благодаря более широким общим знаниям и расширенным возможностям рассуждения. Обучающие данные: до сентября 2021.