Хостинг-провайдер

Google AI Studio

Google AI Studio обслуживает эти модели как инфраструктурный провайдер. Авторы моделей указаны отдельно в списке.

470

моделей в каталоге

Модели на хостинге Google AI Studio

В списке показаны только включённые модели из публичного каталога GoRouter.

Google: Gemini 3.8 Flash

google/gemini-3.8-flash

Gemini 3.8 Flash — это самая интеллектуальная модель Flash от Google со значительными улучшениями благодаря 3.7 Flash в разработке ПО, агентных задачах и многошаговых рассуждениях.

автор google2 сент. 2026 г.92,83 ₽ / 1 млн входных464,16 ₽ / 1 млн выходных
MiniMax: H3 Max

minimax/hailuo-3-max

MiniMax H3 Max — это модель генерации видео от MiniMax, выпущенная совместно с fal.ai. Созданная путём дополнительного обучения на основе MiniMax H3, она предназначена для более быстрой генерации видео из текста и из изображения с управляемыми ключевыми кадрами первого или последнего кадра.

автор minimax2 сент. 2026 г.от 7,74 ₽ за секунду
Anthropic: Claude Fable 5.1

anthropic/claude-fable-5.1

Claude Fable 5.1 превосходит Claude Fable 5 по всем направлениям, при этом наибольший прогресс наблюдается в агентном программировании, длительных агентных рабочих процессах и интеллектуальной работе: особенно в длительном рефакторинге кода, генерации front-end и визуального кода, а также в финансовых и аналитических задачах. Он также, как правило, более лаконичен, чем Fable 5, в своих планах и сводках. Мы рекомендуем протестировать его как прямое обновление везде, где вы сегодня используете Fable 5, а также вместе с Opus 5 для задач, требующих сложных рассуждений.

автор anthropic1 сент. 2026 г.1 237,76 ₽ / 1 млн входных6 188,78 ₽ / 1 млн выходных
Inception: Mercury 2.5 Preview

inception/mercury-2.5-preview

Mercury 2.5 — это самая быстрая рассуждающая LLM и новейшая диффузионная LLM (dLLM) от Inception. Вместо последовательной генерации токенов Mercury 2.5 создаёт и уточняет несколько токенов параллельно, достигая 1,107 tokens/sec на стандартном GPUs. Она обеспечивает скачок интеллекта на 10+ пунктов по сравнению с Mercury 2, при этом качество сопоставимо с оптимизированными по стоимости фронтирными моделями, такими как GPT-5, 6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5. Mercury 2.5 поддерживает настраиваемые уровни рассуждений, параллельные вызовы инструментов и вывод JSON, согласованный со схемой. Он создан для производственных нагрузок, где задержка накапливается: поисковые агенты, голосовые конвейеры и кодирующие субагенты.

автор inception31 авг. 2026 г.4,95 ₽ / 1 млн входных18,57 ₽ / 1 млн выходных
IBM: Granite 4.2 8B

ibm-granite/granite-4.2-8b

Granite 4.2 8B — это плотная модель рассуждений от IBM. Она подходит для математики, генерации кода, многоязычного диалога и агентных рабочих процессов, требующих многошаговых рассуждений. Она поддерживает режимы полного, низкого усилия и без размышлений. Модель поддерживает 12 языков: английский, немецкий, испанский, французский, японский, португальский, арабский, чешский, итальянский, корейский, нидерландский и китайский.

автор ibm-granite31 авг. 2026 г.12,38 ₽ / 1 млн входных18,57 ₽ / 1 млн выходных
Tencent: Hy4 preview

tencent/hy4-preview

Tencent: Hy4 preview — это модель смеси экспертов от Tencent, с 49B активными параметрами из 770B общих. Она предназначена для агентов кодирования, сложных рабочих процессов с использованием инструментов и задач производительности, которые требуют планирования, непрерывности контекста и устойчивого многошагового выполнения.

автор tencent28 авг. 2026 г.103,23 ₽ / 1 млн входных309,56 ₽ / 1 млн выходных
Alibaba: Wan 3.0 Prime

alibaba/wan-3.0-prime

Wan 3.0 Prime — это быстрый вариант Wan 3.0 от Alibaba. Поддерживает генерацию видео из текста и из первого кадра изображения.

автор alibaba27 авг. 2026 г.от 9,82 ₽ за секунду
Z.ai: GLM Flash Latest

~z-ai/glm-flash-latest

Эта модель всегда перенаправляет на последнюю модель в семействе GLM Flash.

автор ~z-ai27 авг. 2026 г.9,28 ₽ / 1 млн входных30,94 ₽ / 1 млн выходных
Qwen: Qwen3.8 Flash

qwen/qwen3.8-flash

Qwen3.8 Flash — это мультимодальная модель рассуждений от Alibaba. Она подходит для помощи в написании кода, агентных рабочих процессов, визуального понимания, анализа документов и кодовой базы, взаимодействия с рабочим столом, анализа графиков и анализа длинных видео.

автор qwen26 авг. 2026 г.18,57 ₽ / 1 млн входных58,17 ₽ / 1 млн выходных
Meta: Muse Image

meta/muse-image

Muse Image — это агентная модель генерации изображений от Meta, которая создаёт и редактирует изображения по тексту и референсным изображениям. В отличие от однопроходных моделей изображений, она рассуждает перед рендерингом, разбивая составные запросы и уточняя свой результат в цепочке рассуждений, а также вызывает веб-поиск для фактической точности по запросам, требующим глубоких знаний. Модель поддерживает генерацию изображений по тексту, точечное редактирование изображений, композицию из нескольких изображений, управление по референсному изображению для согласованности стиля и объекта в серии, а также точный рендеринг текста внутри сгенерированных изображений. Итеративное редактирование работает путём передачи предыдущего выходного изображения обратно с новой инструкцией.

автор meta26 авг. 2026 г.1,24 ₽ за изображение
Z.ai: GLM 5.3 Flash

z-ai/glm-5.3-flash

GLM-5.3-Flash — это нативная мультимодальная модель от Z.ai. Она подходит для эффективного программирования и долгосрочных агентных задач. Её гибридная архитектура разрежённого и линейного внимания сохраняет точное поведение при работе с длинным контекстом, одновременно снижая вычислительные накладные расходы.

автор z-ai26 авг. 2026 г.9,28 ₽ / 1 млн входных30,94 ₽ / 1 млн выходных
Recraft: Recraft V4 Styles Pro

recraft/recraft-v4-styles-pro

Recraft V4 Styles Pro — это модель генерации изображений с согласованным стилем от Recraft. Каждый запрос требует по крайней мере одно референсное изображение стиля и создаёт новое изображение, которое воспроизводит технику рендеринга, цвет, текстуру и композицию референса, а не редактирует его. Модель создаёт растровые изображения с разрешением примерно 2K. Примечание: от 1 до 10 референсных изображений в формате PNG, JPG или WEBP, каждое размером не менее 256 px по короткой стороне. Цена состоит из двух частей: $0.10 за изображение плюс одноразовая плата $0.005 за создание стиля для каждого запроса, независимо от того, сколько изображений возвращает этот запрос. Запрос с одним изображением стоит $0.105, а запрос с шестью изображениями — $0.605.

автор recraft26 авг. 2026 г.12,38 ₽ за изображение
Recraft: Recraft V4 Styles Vector

recraft/recraft-v4-styles-vector

Recraft V4 Styles Vector — это модель генерации изображений с единым стилем от Recraft. Каждый запрос требует как минимум одно референсное изображение стиля и генерирует новое изображение, которое воспроизводит технику рендеринга, цвет, текстуру и композицию референса, а не редактирует его. Она обеспечивает вывод SVG для графики, которой нужно чисто масштабироваться. Примечание: от 1 до 10 референсных изображений в форматах PNG, JPG или WEBP, каждое не менее 256 пикселей по короткой стороне. Цена состоит из двух частей: $0.05 за изображение плюс разовый сбор $0.005 за создание стиля на каждый запрос, независимо от того, сколько изображений возвращает этот запрос. Запрос одного изображения стоит $0.055, а запрос шести изображений — $0.305.

автор recraft26 авг. 2026 г.6,19 ₽ за изображение
Recraft: Recraft V4 Styles Pro Vector

recraft/recraft-v4-styles-pro-vector

Recraft V4 Styles Pro Vector — это модель генерации изображений с сохранением стиля от Recraft. Каждый запрос требует как минимум одно референсное изображение стиля и создаёт новое изображение, воспроизводящее технику рендеринга, цвет, текстуру и композицию референса, а не редактирующее его. Она выдаёт результат в формате SVG для графики, которая должна масштабироваться без потери качества. Примечание: 1–10 референсных изображений в форматах PNG, JPG или WEBP, каждое размером не менее 256 px по короткой стороне. Ценообразование состоит из двух частей: $0.12 за изображение плюс разовый сбор в размере $0.005 за создание стиля на каждый запрос, независимо от количества изображений, возвращаемых этим запросом. Запрос на одно изображение стоит $0.125, а запрос на шесть изображений — $0.725.

автор recraft26 авг. 2026 г.14,85 ₽ за изображение
Recraft: Recraft V4 Styles

recraft/recraft-v4-styles

Recraft V4 Styles — это модель генерации изображений с согласованным стилем от Recraft. Каждый запрос требует как минимум одного референсного изображения стиля и генерирует новое изображение, которое воспроизводит технику рендеринга, цвет, текстуру и композицию референса, а не редактирует его. Она создаёт растровые изображения с разрешением примерно 1K. Примечание: от 1 до 10 референсных изображений в PNG, JPG или WEBP, каждое размером не менее 256 пикселей по короткой стороне. Цена состоит из двух частей: $0.035 за изображение плюс разовый сбор $0.005 за создание стиля за запрос, независимо от того, сколько изображений возвращает запрос. Запрос на одно изображение стоит $0.040, а запрос на шесть изображений — $0.215.

автор recraft26 авг. 2026 г.4,33 ₽ за изображение
Alibaba: Wan 3.0

alibaba/wan-3.0

Wan 3.0 — это модель генерации видео от Alibaba для генерации видео из текста, изображений и по эталону. Она создаёт видео с разрешением 480p, 720p или 1080p длительностью от 2 до 30 секунд.

автор alibaba24 авг. 2026 г.от 6,14 ₽ за секунду
HeyGen: Avatar IV

heygen/avatar-iv

HeyGen: Avatar IV — это модель преобразования изображения в видео, которая оживляет одно фото, превращая его в выразительное видео с говорящей головой и синхронизацией губ. Вместо простого подбора формы губ под слова, она интерпретирует вокальный тон, ритм и эмоции аудио, чтобы управлять движениями головы, мимикой и жестами, создавая результат с разрешением до 1080p. Озвучка берётся из одного из двух источников: текстовый сценарий, который модель озвучивает с помощью синтеза речи HeyGen, либо предоставленная аудиодорожка, под которую изображение синхронизирует губы напрямую. Сквозные параметры позволяют выбрать голос, настроить параметры голоса, задать выразительность, указать конкретные движения, заменить или удалить фон, добавить субтитры и задать название видео.

автор heygen24 авг. 2026 г.7,22 ₽ за секунду
Meta: Muse Spark 1.2 Contributor

meta/muse-spark-1.2-contributor

Muse Spark 1.2 contributor tier — это модель рассуждения от Meta, предназначенная для разработчиков, которые хотят начать создавать приложения с еще более низкими затратами. Она значительно дешевле, чем Muse Spark 1.2. Ваши запросы и результаты могут использоваться для улучшения продуктов Meta, что делает эту модель идеальной для экспериментов, обучения и проектов на ранних стадиях, не беспокоясь о расходах. Это модель рассуждения от Meta, предназначенная для сложных агентных задач. Она принимает текст, изображения, видео, аудио и документы в формате PDF, возвращает текст и предлагает контекстное окно на 1M токенов. Модель создана для поддержки многоагентных рабочих процессов, выступая либо как основной агент, который планирует и распределяет задачи, либо как субагент, выполняющий задачи параллельно. Она работает с различными средами разработки кода и поддерживает структурированный вывод, параллельные вызовы функций и настраиваемое усилие рассуждения. В тестировании Meta модель показывает хорошие результаты при многофайловом рефакторинге, длительных сессиях отладки, генерации целых репозиториев и задачах, выходящих далеко за пределы одного запроса.

автор meta21 авг. 2026 г.12,38 ₽ / 1 млн входных24,76 ₽ / 1 млн выходных
DeepSeek: DeepSeek V4 Flash Vision Exp

deepseek/deepseek-v4-flash-vision-exp

DeepSeek V4 Flash Vision Exp — это экспериментальная версия с поддержкой зрения DeepSeek V4 Flash 0731 от DeepSeek, добавляющая понимание изображений, сохраняя при этом уровень базовой модели в работе с текстом, включая агентные сценарии и рассуждения. Это разреженная модель на основе смеси экспертов с 13B активными параметрами из общего числа 284B. Она подходит для понимания документов и диаграмм, ответов на вопросы по изображениям и мультимодальных агентных рабочих процессов, объединяющих текст и изображения.

автор deepseek21 авг. 2026 г.от 27,23 ₽ / 1 млн входныхот 81,69 ₽ / 1 млн выходных
Tencent: Hy-MT2-1.8B

tencent/hy-mt2-1.8b

Hy-MT2-1.8B — это компактная 1.8B-параметрическая модель перевода от Tencent. Она поддерживает 33 языковых пар и пять пар китайских диалектов и языков меньшинств, а также рабочие процессы для структурированного перевода, перевода на основе разделителей, контекстного перевода, перевода с использованием глоссария и перевода с управлением стилем.

автор tencent20 авг. 2026 г.5,45 ₽ / 1 млн входных21,91 ₽ / 1 млн выходных
Tencent: Hy-MT2-30B-A3B

tencent/hy-mt2-30b-a3b

Hy-MT2-30B-A3B — это флагманская модель перевода Tencent в семействе MT2. Она поддерживает языковые пары 33, а также пять пар китайских диалектов и миноритарных языков, с рабочими процессами для структурированного перевода, перевода на основе разделителей, перевода с использованием глоссариев и стилизованного перевода. В ней используется 3B активных параметров из 30B общего числа.

автор tencent20 авг. 2026 г.9,16 ₽ / 1 млн входных36,51 ₽ / 1 млн выходных
Black Forest Labs: FLUX Video Upscale

black-forest-labs/flux-video-upscale

FLUX Video Upscale — это модель масштабирования видео от Black Forest Labs. Она увеличивает одно исходное видео в 1.5× до 3×, сохраняя его длительность, с опциональным промптом и режимами обработки — точным или творческим.

автор black-forest-labs19 авг. 2026 г.от 10,83 ₽ за мегапиксель-секунду
Z.ai: GLM Latest

~z-ai/glm-latest

Эта модель всегда перенаправляет на последнюю модель GLM от Z.ai.

автор ~z-ai19 авг. 2026 г.173,29 ₽ / 1 млн входных544,61 ₽ / 1 млн выходных
Tencent: Hy-MT2-7B

tencent/hy-mt2-7b

Hy-MT2-7B — это модель перевода с 7B параметров от Tencent. Она поддерживает 33 языковых пар, а также пять пар для китайских диалектов и языков меньшинств, с рабочими процессами для структурированного, разделительного, контекстного, глоссарного и стилистически управляемого перевода.

автор tencent19 авг. 2026 г.9,16 ₽ / 1 млн входных36,51 ₽ / 1 млн выходных
Z.ai: GLM 5.3

z-ai/glm-5.3

GLM-5.3 — это крупномасштабная модель рассуждения от Z.ai, созданная для сложной разработки программного обеспечения и долгосрочных агентных задач. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и превосходит GLM-5.2 в кодировании, а также в балансе между производительностью и эффективностью использования токенов. Рассуждение всегда включено и не может быть отключено. Поддерживаются уровни усилий рассуждения low, high и max; по умолчанию используется max.

автор z-ai18 авг. 2026 г.173,29 ₽ / 1 млн входных544,61 ₽ / 1 млн выходных
Qwen: Qwen3.8 27B

qwen/qwen3.8-27b

Qwen3.8 27B — это открытая модель с публичными весами, относящаяся к классу плотных мультимодальных моделей «зрение-язык» от компании Qwen. Она подходит для задач программирования, профессиональных рабочих процессов, исследований, мультимодального взаимодействия и длительных агентских задач, поддерживая гибкий режим рассуждений, который можно включать или отключать.

автор qwen14 авг. 2026 г.52,60 ₽ / 1 млн входных315,63 ₽ / 1 млн выходных
NVIDIA: Nemotron 3.5 ASR Streaming Multilingual 0.6B

nvidia/nemotron-3.5-asr-streaming-multilingual-0.6b

Nemotron 3.5 ASR Streaming Multilingual 0.6B — это модель распознавания речи от NVIDIA. Её архитектура FastConformer-RNNT, учитывающая промпты и кэш, нацелена на транскрипцию с низкой задержкой более чем на 40 языках для субтитров в реальном времени, голосовых агентов и конвейеров многоязычной транскрипции.

автор nvidia13 авг. 2026 г.< 0,01 ₽ за секунду
Mistral: Voxtral Small 24B 2507 STT

mistralai/voxtral-small-24b-2507-stt

Voxtral Small 24B 2507 STT — это модель транскрипции речи от Mistral AI. Она подходит для задач транскрипции, перевода и понимания аудио, которым выгодна её большая ёмкость модели.

автор mistralai13 авг. 2026 г.< 0,01 ₽ за секунду
Mistral: Voxtral Mini 3B 2507

mistralai/voxtral-mini-3b-2507

Voxtral Mini 3B 2507 — это модель для распознавания речи и аудио от Mistral AI. Она подходит для задач транскрипции, перевода и компактной обработки аудио.

автор mistralai13 авг. 2026 г.< 0,01 ₽ за секунду
ByteDance Seed: Seedream 5.0 Lite

bytedance-seed/seedream-5-0-lite

Seedream 5.0 Lite — это модель генерации изображений от ByteDance Seed. Она подходит для профессионального визуального творчества, которому способствуют веб-подключённый поиск, понимание сложных промптов, визуальные референсы и широкий охват знаний.

автор bytedance-seed13 авг. 2026 г.4,33 ₽ за изображение
Google: Gemini 3.7 Flash

google/gemini-3.7-flash

Gemini 3.7 Flash — это мультимодальная модель от Google для быстрых агентных процессов, написания кода и сложных многошаговых рассуждений. Она предназначена для задач, требующих отзывчивой производительности и надёжного многошагового решения проблем.

автор google13 авг. 2026 г.92,83 ₽ / 1 млн входных464,16 ₽ / 1 млн выходных

voyage-code-4 — это модель встраивания кода от Voyage AI, компании MongoDB. Она предназначена для агентов кодирования и поиска кода, с матрёшечными встраиваниями размерностей 2048, 1024, 512 и 256 и несколькими вариантами квантования. Узнайте больше о voyage-code-4 здесь: blog.voyageai.com/2026/08/13/voyage-code-4

автор voyageai13 авг. 2026 г.14,85 ₽ за 1 млн токенов
Qwen3 Reranker 8B

qwen/qwen3-reranker-8b

Qwen3 Reranker 8B — это модель реранжирования текста от Alibaba Cloud, построенная на архитектуре Qwen3. Она оценивает пары запрос-документ, формируя оценки релевантности для использования в пайплайнах поиска и RAG. Поддерживает более 100 языков и языков программирования, а также инструктивное реранжирование, позволяющее настраивать критерии оценки под конкретную задачу. Обеспечивает высокую производительность на мультиязычных бенчмарках, включая MTEB, CMTEB и MMTEB.

автор qwen13 авг. 2026 г.24,76 ₽ за 1 млн входных токенов
Qwen: Qwen3 ASR 1.7B

qwen/qwen3-asr-1.7b

Qwen3 ASR 1.7B — это модель автоматического распознавания речи от Qwen. Она поддерживает многоязычную идентификацию языка и транскрипцию для 30 языков и 22 китайских диалектов, с потоковым и автономным выводом, а также временными метками на уровне сегментов и слов.

автор qwen13 авг. 2026 г.< 0,01 ₽ за секунду
Qwen: Qwen3 ASR 0.6B

qwen/qwen3-asr-0.6b

Qwen3 ASR 0.6B — это компактная модель автоматического распознавания речи от Qwen. Она поддерживает многоязычную идентификацию языка и транскрипцию на 30 языках и 22 китайских диалектах, с потоковым и офлайн-инференсом, а также таймстампами на уровне сегментов и слов.

автор qwen13 авг. 2026 г.< 0,01 ₽ за секунду
ByteDance Seed: Seedream 5.0 Pro

bytedance-seed/seedream-5-0-pro

Seedream 5.0 Pro — это модель генерации и редактирования изображений от ByteDance Seed. Она подходит для коммерческих рабочих процессов визуального производства, требующих точного контроля редактирования, реалистичных сцен и естественного рендеринга.

автор bytedance-seed12 авг. 2026 г.5,57 ₽ за изображение
ByteDance: Seedance 2.0 Mini

bytedance/seedance-2.0-mini

Seedance 2.0 Mini — это модель генерации видео от ByteDance. Она поддерживает генерацию видео из текста, генерацию видео из изображения с контролем первого и последнего кадра, а также мультимодальную генерацию видео по ссылке с входными данными в виде изображения, видео и аудио. Она поддерживает вывод в разрешении 480p и 720p для видео длительностью 4-15 секунд. Количество токенов вычисляется по формуле: (высота выходного видео ширина выходного видео длительность * 24) / 1024.

автор bytedance12 авг. 2026 г.от 2,36 ₽ за секунду
ByteDance Seed: Seed 2.1 Turbo

bytedance-seed/seed-2-1-turbo

Seed 2.1 Turbo — это мультимодальная модель от ByteDance Seed для кодинга и долгосрочных агентных рабочих процессов. Она подходит для сквозной поставки программного обеспечения, выполнения многошаговых задач и понимания визуального и видеоконтента, с возможностями планирования, отладки и самокоррекции.

автор bytedance-seed12 авг. 2026 г.61,89 ₽ / 1 млн входных309,44 ₽ / 1 млн выходных
Qwen: Qwen3.8 2.4T A95B

qwen/qwen3.8-2.4t-a95b

Qwen3.8 2.4T A95B — это открытая по весам разреженная модель смеси экспертов от Qwen и открытая по весам версия Qwen3.8 Max, с 95 миллиардами активных параметров из 2.4 триллионов всего. Она подходит для программирования, исследований, сложных рассуждений и агентных рабочих процессов.

автор qwen12 авг. 2026 г.247,55 ₽ / 1 млн входных742,65 ₽ / 1 млн выходных
ByteDance Seed: Seed-2.0-Code

bytedance-seed/seed-2.0-code

Seed 2.0 Code — это модель от ByteDance Seed, оптимизированная для агентного программирования. Она подходит для разработки фронтенда, многоязычных задач программирования и рабочих процессов с кодинг-агентами в таких инструментах, как Claude Code, Kilo и OpenCode.

автор bytedance-seed12 авг. 2026 г.от 61,89 ₽ / 1 млн входныхот 371,33 ₽ / 1 млн выходных
DeepSeek: DeepSeek V4 Pro 0813

deepseek/deepseek-v4-pro-0813

DeepSeek V4 Pro 0813 — это крупномасштабная модель смеси экспертов от DeepSeek. Это GA-й выпуск DeepSeek V4 Pro.

автор deepseek12 авг. 2026 г.163,38 ₽ / 1 млн входных490,15 ₽ / 1 млн выходных
SpaceXAI: Grok 4.6

x-ai/grok-4.6

Grok 4.6 — самая умная модель SpaceXAI с передовой производительностью в программировании, работе со знаниями и STEM.

автор x-ai12 авг. 2026 г.от 247,55 ₽ / 1 млн входныхот 742,65 ₽ / 1 млн выходных
xAI: Grok Imagine Image 2.0

x-ai/grok-imagine-image-2.0

Grok Imagine Image 2.0 — это модель генерации и редактирования изображений от xAI. Она подходит для создания изображений по текстовым запросам и редактирования изображений по референсам, с режимами низкого и среднего качества.

автор x-ai11 авг. 2026 г.от 4,95 ₽ за изображение
NVIDIA: Nemotron 3.5 Lightning

nvidia/nemotron-3.5-lightning

NVIDIA Nemotron 3.5 Lightning — открытая модель смеси экспертов от NVIDIA, с 3B активными параметрами из 30B общих. Она подходит для высоконагруженных агентных рабочих нагрузок и специализированных задач, которым выгодна настройка под конкретную предметную область.

автор nvidia11 авг. 2026 г.9,90 ₽ / 1 млн входных24,76 ₽ / 1 млн выходных
Sakana: Sakana Namazu

sakana/sakana-namazu

Sakana Namazu — это специализированная для японского языка модель рассуждений от Sakana AI, основанная на Kimi K2.6 с дополнительным обучением для японского языка и бизнес-контекстов. Она подходит для выполнения японских инструкций, делового письма, математики, программирования, исследований и многошаговых агентных рабочих процессов. Sakana AI может использовать входные данные для обучения и улучшения модели по умолчанию, с возможностью отказа в консоли Sakana. Полная обработка в пределах Японии не гарантируется.

автор sakana11 авг. 2026 г.117,59 ₽ / 1 млн входных495,10 ₽ / 1 млн выходных
Upstage: Solar Pro 4

upstage/solar-pro4

Solar Pro 4 — это экономичная большая языковая модель от Upstage, с контекстным окном 524K. Она создана для долгосрочных задач и агентных рабочих процессов, с сильными возможностями в офисной продуктивности, работе с документами и программировании.

автор upstage10 авг. 2026 г.3,71 ₽ / 1 млн входных14,85 ₽ / 1 млн выходных
Meta: Muse Glimmer 30B

meta/muse-glimmer-30b

Muse Glimmer 30B — это плотная мультимодальная модель с открытыми весами от Meta Superintelligence Labs, дистиллированная из Muse Spark и оптимизированная для автономных агентов на потребительском оборудовании. Она подходит для долгосрочных агентных и программных рабочих процессов, обеспечивая многошаговые рассуждения, надёжное использование инструментов, восстановление после сбоев, понимание изображений и многоязычную поддержку более чем 100 языков.

автор meta9 авг. 2026 г.37,13 ₽ / 1 млн входных148,53 ₽ / 1 млн выходных
ByteDance: Seedance 2.5

bytedance/seedance-2.5

Seedance 2.5 — это модель генерации видео от ByteDance. Она подходит для длительного повествования, мультимодальной генерации на основе референсов, редактирования видео и расширения видео. Поддерживает управление по первому кадру и по первому и последнему кадрам, до 50 изображений, видео и аудио-референсов, необязательное генерируемое аудио и многоязычную аудиовизуальную генерацию.

автор bytedance7 авг. 2026 г.от 15,91 ₽ за секунду
OpenAI: GPT Transcribe

openai/gpt-transcribe

GPT Transcribe — это высокоточная модель распознавания речи от OpenAI. Она подходит для записанного аудио, транскрипции потоковых файлов и завершённых Realtime-сеансов, с поддержкой контекста в свободной форме, подсказок по ключевым словам и множественных языковых подсказок для специализированных терминов и многоязычной речи.

автор openai5 авг. 2026 г.0,56 ₽ за минуту
Meta: Muse Spark 1.2

meta/muse-spark-1.2

Muse Spark 1.2 — это модель рассуждений от Meta, предназначенная для сложных агентных задач. Она принимает текст, изображения, видео, аудио и документы PDF, возвращает текст и предлагает окно контекста на 1M токенов. Модель создана для поддержки мультиагентных рабочих процессов — либо в роли основного агента, который планирует и делегирует, либо в роли субагента, выполняющего задачи параллельно. Она работает в нескольких средах для кодирования и поддерживает структурированный вывод, параллельный вызов функций и настраиваемое усилие рассуждений. В тестировании Meta она хорошо справляется с рефакторингом нескольких файлов, длительными сеансами отладки, генерацией целого репозитория и задачами, выходящими далеко за пределы одного запроса.

автор meta5 авг. 2026 г.154,72 ₽ / 1 млн входных526,05 ₽ / 1 млн выходных
Qwen: Qwen Image 3

qwen/qwen-image-3

Qwen Image 3 — это унифицированная модель генерации и редактирования изображений от Qwen. Она поддерживает точное отображение текста и деталей размером до 10px, а также более богатую базу знаний о мире, чем предыдущие поколения.

автор qwen5 авг. 2026 г.от 3,71 ₽ за изображение
Qwen: Qwen Image 3 Pro

qwen/qwen-image-3-pro

Qwen Image 3 Pro — это модель генерации и редактирования изображений от Qwen. Она поддерживает точное отображение текста и деталей размером до 10px, а также обладает более глубокими знаниями о мире по сравнению с предыдущими поколениями.

автор qwen5 авг. 2026 г.от 4,95 ₽ за изображение
Black Forest Labs: FLUX.3 Video

black-forest-labs/flux-3-video

FLUX.3 Video — это модель генерации видео от Black Forest Labs. Она поддерживает генерацию из текста, создание видео по изображению с начальным и конечным ключевыми кадрами, а также сценарии продолжения видео, что делает её подходящей для контролируемого творческого производства, анимации сцен и расширения существующих клипов. Модель может генерировать синхронизированный звук вместе с видео.

автор black-forest-labs4 авг. 2026 г.от 24,55 ₽ за секунду
Qwen: Qwen3.8 Max

qwen/qwen3.8-max

Qwen3.8 Max — флагманская модель в серии Qwen3.8 от Alibaba, общедоступный преемник предварительной версии Qwen3.8 Max Preview. Это мультимодальная модель рассуждений, предназначенная для сложных рассуждений, визуального понимания, написания кода и агентских рабочих процессов.

автор qwen3 авг. 2026 г.247,55 ₽ / 1 млн входных742,65 ₽ / 1 млн выходных
DeepSeek V4 Flash Latest

~deepseek/deepseek-v4-flash-latest

Эта модель всегда перенаправляет на последнюю модель семейства DeepSeek V4 Flash.

автор ~deepseek1 авг. 2026 г.13,41 ₽ / 1 млн входных37,13 ₽ / 1 млн выходных
DeepSeek: DeepSeek V4 Flash 0731

deepseek/deepseek-v4-flash-0731

DeepSeek V4 Flash 0731 — это разреженная модель смеси экспертов от DeepSeek, с 13B активными параметрами из 284B общих. Эта переобученная версия подходит для задач кодирования, рассуждений и агентных рабочих процессов. Это GA-релиз DeepSeek V4 Flash.

автор deepseek31 июл. 2026 г.13,41 ₽ / 1 млн входных37,13 ₽ / 1 млн выходных
Thinking Machines: Inkling Small

thinkingmachines/inkling-small

Inkling Small — это открытая мультимодальная модель смеси экспертов с открытыми весами от лаборатории Thinking Machines, с 12B активными параметрами из 276B общих. Она позиционируется как меньший и более эффективный представитель семейства Inkling и подходит для рассуждений, программирования, агентных рабочих процессов, генерации с дополнением на основе поиска, следования инструкциям и многоязычного общения.

автор thinkingmachines30 июл. 2026 г.55,70 ₽ / 1 млн входных148,53 ₽ / 1 млн выходных
MiniMax: H3

minimax/hailuo-3

MiniMax H3 — это легковесная модель генерации видео с открытыми весами от MiniMax. Она предназначена для точного мультимодального редактирования и управляемой генерации контента, включая редактирование по текстовым инструкциям, отрисовку текста и брендов, а также перенос движения между видео. Модель подходит для коммерческих творческих процессов в рекламе, электронной коммерции, геймдеве и дизайне интерфейсов, обеспечивая нативный аудиовизуальный вывод при генерации на основе референсов.

автор minimax29 июл. 2026 г.20,11 ₽ за секунду
Fish Audio: Transcribe 1

fish-audio/transcribe-1

Transcribe 1 — это модель преобразования речи в текст от Fish Audio. Она подходит для транскрипции аудио с автоматическим определением языка и может возвращать сегменты с временными метками на уровне слов, если запрошено выравнивание.

автор fish-audio29 июл. 2026 г.0,01 ₽ за секунду
Fish Audio: S1

fish-audio/s1

S1 — это многоязычная модель синтеза речи от Fish Audio. Она подходит для голосовых приложений, требующих широкой эмоциональной выразительности, с использованием скобочных управляющих элементов для направления стиля речи на поддерживаемых языках.

автор fish-audio29 июл. 2026 г.1 856,63 ₽ за 1 млн байт UTF-8
Fish Audio: S2 Pro

fish-audio/s2-pro

S2 Pro — это многоязычная модель синтеза речи от Fish Audio. Она подходит для выразительной речи и многоголосых диалогов, с естественными средствами управления стилем произношения и эмоциями.

автор fish-audio29 июл. 2026 г.1 856,63 ₽ за 1 млн байт UTF-8
Fish Audio: S2.1 Pro

fish-audio/s2.1-pro

S2.1 Pro — это ориентированная на производство модель преобразования текста в речь от Fish Audio. Она подходит для многоязычных голосовых приложений, выразительного озвучивания и синтеза диалогов, с открытыми управляющими командами на естественном языке для стиля речи и эмоций.

автор fish-audio29 июл. 2026 г.1 856,63 ₽ за 1 млн байт UTF-8
Runway: Aleph 2.0

runway/aleph-2

Runway Aleph 2.0 — это модель редактирования видео в контексте от Runway. Она применяет текстовые инструкции и редактирование на основе ключевых кадров к существующему видео, сохраняя детали, которые не должны изменяться. Она подходит для добавления, удаления или замены объектов и предметов, изменения фона или одежды, изменения освещения сцен, изменения погоды или времени суток, изменения стиля видео и расширения кадра до нового соотношения сторон.

автор runway29 июл. 2026 г.40,43 ₽ за секунду
Runway: Gen-4.5

runway/gen-4.5

Runway Gen-4.5 — это модель генерации видео от Runway для workflows «текст-в-видео» и «изображение-в-видео». Она предназначена для создания кинематографичных сцен с высоким качеством движения, визуальной точностью и соблюдением запросов. Модель способна координировать сложные последовательности действий, детализированное движение камеры, точный тайминг событий и атмосферные изменения, что делает её подходящей для повествовательных кадров, демонстрации продуктов и управляемой анимации изображений.

автор runway29 июл. 2026 г.17,33 ₽ за секунду
Qwen: Qwen3.7 Flash

qwen/qwen3.7-flash

Qwen3.7 Flash — это модель визуально-языкового рассуждения от Alibaba. Она подходит для мультимодальных агентов, визуального программирования, поиска и компьютерного взаимодействия, с сильными сторонами в распознавании объектов, пространственном понимании и восприятии реального мира.

автор qwen27 июл. 2026 г.от 3,71 ₽ / 1 млн входныхот 16,09 ₽ / 1 млн выходных
VoyageAI by MongoDB: rerank-2.5-lite

voyageai/rerank-2.5-lite

rerank-2.5-lite — это реранкер, оптимизированный как по задержке, так и по качеству, обеспечивающий улучшение точности поиска на 7.16% по сравнению с Cohere Rerank v3.5 на 93 наборах данных. Он также превзошёл Cohere Rerank v3.5 на 10.36% в тесте Massive Instructed Retrieval Benchmark (MAIR). Модель поддерживает суммарный контекст длиной до 32K токенов на пару запрос-документ, включая до 8K токенов для запроса, что обеспечивает более точный поиск по более длинным документам. Кроме того, rerank-2.5-lite поддерживает следование инструкциям, позволяя пользователям управлять оценкой релевантности с помощью подсказок на естественном языке. Узнайте больше о rerank-2.5-lite здесь: blog.voyageai.com/2025/08/11/rerank-2-5

автор voyageai27 июл. 2026 г.2,48 ₽ за 1 млн входных токенов

rerank-2.5 — это передовой реранкер, оптимизированный для качества, обеспечивающий улучшение точности поиска на 7.94% по сравнению с Cohere Rerank v3.5 на 93 наборах данных. Он также превзошёл Cohere Rerank v3.5 на 12.70% на Massive Instructed Retrieval Benchmark (MAIR). Модель поддерживает объединённую длину контекста в 32K токенов на пару запрос–документ, включая до 8K токенов для запроса, что обеспечивает более точный поиск по более длинным документам. Кроме того, rerank-2.5 поддерживает следование инструкциям, позволяя пользователям управлять оценкой релевантности с помощью подсказок на естественном языке. Узнайте больше о rerank-2.5 здесь: https://blog.voyageai.com/2025/08/11/rerank-2-5.

автор voyageai27 июл. 2026 г.6,19 ₽ за 1 млн входных токенов
VoyageAI by MongoDB: voyage-multimodal-3.5

voyageai/voyage-multimodal-3.5

voyage-multimodal-3.5 — это современная мультимодальная эмбеддинг-модель, способная векторизовать не только текст, изображения и видео по отдельности, но и контент, в котором все три модальности переплетаются. Она обеспечивает отличную производительность для поиска по смешанным модальностям, включающего текст и визуальный контент, такой как PDF скриншоты, рисунки, таблицы, видео и другое. Благодаря Matryoshka-обучению и обучению с учётом квантования, voyage-multimodal-3.5 поддерживает эмбеддинги размерности 2048, 1024, 512 и 256, с несколькими вариантами квантования. Узнайте больше о voyage-multimodal-3.5 здесь: blog.voyageai.com/2026/01/15/voyage-multimodal-3-5

автор voyageai27 июл. 2026 г.14,85 ₽ за 1 млн токенов

voyage-4-lite — это легковесная универсальная модель для получения эмбеддингов, оптимизированная под низкую задержку и стоимость. Благодаря обучению по методу Матрёшки и обучению с учётом квантования, voyage-4-lite поддерживает эмбеддинги размерностей 2048, 1024, 512 и 256, с несколькими вариантами квантования. Узнайте больше о voyage-4-lite здесь: blog.voyageai.com/2026/01/15/voyage-4

автор voyageai27 июл. 2026 г.2,48 ₽ за 1 млн токенов

voyage-4 — это универсальная (включая многоязычную) модель эмбеддингов, оптимизированная для задач поиска/retrieval и приложений AI. voyage-4 поддерживает эмбеддинги размерностей 2048, 1024, 512 и 256, с несколькими вариантами квантования. Узнайте больше о voyage-4 здесь: blog.voyageai.com/2026/01/15/voyage-4

автор voyageai27 июл. 2026 г.7,43 ₽ за 1 млн токенов

Модель voyage-4-large является современной универсальной и многоязычной эмбеддинг-моделью, оптимизированной для качества поиска. Благодаря обучению с использованием Matryoshka-метода и обучению с учётом квантования, voyage-4-large поддерживает эмбеддинги размерности 2048, 1024, 512 и 256, с несколькими вариантами квантования. Узнайте больше о voyage-4-large здесь: blog.voyageai.com/2026/01/15/voyage-4

автор voyageai27 июл. 2026 г.14,85 ₽ за 1 млн токенов
Claude Opus 5

anthropic/claude-opus-5

Claude Opus 5 — флагманская модель компании Anthropic для сложных задач рассуждения, программирования и длительной агентной работы. Она особенно сильна в сквозных программных задачах, ревью кода и поиске ошибок, визуальном анализе диаграмм и документов, подготовке сложных офисных результатов и координации параллельных субагентов. Модель сохраняет высокое качество следования инструкциям и использования инструментов при выполнении длительных задач, оставаясь эффективной в условиях пониженных вычислительных затрат для рабочих нагрузок, где важны задержка и эффективность использования токенов.

автор anthropic24 июл. 2026 г.618,88 ₽ / 1 млн входных3 094,39 ₽ / 1 млн выходных
Microsoft: MAI-Image-2.5 Pro

microsoft/mai-image-2.5-pro

MAI-Image-2.5 от Microsoft — это высококачественная модель генерации изображений, доступная через Azure AI Foundry. Она создает фотореалистичные и художественные изображения по текстовым запросам с поддержкой различных соотношений сторон.

автор microsoft23 июл. 2026 г.13 367,76 ₽ за 1 млн токенов
Microsoft: MAI-Voice-2-Flash

microsoft/mai-voice-2-flash

MAI-Voice-2-Flash — это модель преобразования текста в речь с низкой задержкой от Microsoft для голосовых агентов, ассистентов, контакт-центров, озвучивания, доступности и других интерактивных приложений. Она генерирует выразительную монофоническую речь 24 kHz на 15 языках и в 18 локалях с точным контролем тона и подачи. Голосовой промптинг и клонирование требуют доступа, одобренного Microsoft, и соответствующего согласия говорящего.

автор microsoft23 июл. 2026 г.1 856,63 ₽ за 1 млн символов
Ling-3.0-flash

inclusionai/ling-3.0-flash

Ling-3.0-flash — это модель со смесью экспертов (MoE) с 124B параметрами, при этом на каждый токен активируется примерно 5.1B параметров. Модель разработана с приоритетом эффективности использования токенов и продакшн-масштабного агентного инференса, что позволяет разработчикам выполнять больше полезной работы в рамках ограниченных бюджетов на токены, задержку и стоимость обслуживания.

автор inclusionai23 июл. 2026 г.2,60 ₽ / 1 млн входных7,80 ₽ / 1 млн выходных
Qwen: Qwen-Audio-3.0-TTS Flash

qwen/qwen-audio-3.0-tts-flash

Qwen-Audio-3.0-TTS Flash — это быстрая и экономичная модель синтеза речи от Alibaba, которая генерирует аудио из текста с помощью речевого синтезатора DashScope API.

автор qwen23 июл. 2026 г.1 856,63 ₽ за 1 млн символов
Qwen: Qwen-Audio-3.0-TTS Plus

qwen/qwen-audio-3.0-tts-plus

Qwen-Audio-3.0-TTS Plus — это модель синтеза речи более высокого качества от Alibaba, которая генерирует звуковую речь из текста через синтезатор речи DashScope API.

автор qwen23 июл. 2026 г.2 475,51 ₽ за 1 млн символов
SpaceXAI: Grok STT 1.0

x-ai/grok-stt-1.0

Grok STT — это модель преобразования речи в текст от SpaceXAI, доступная через конечную точку REST /v1/stt. Она поддерживает транскрипцию с временными метками на уровне слов, необязательную диаризацию говорящих и многоканальное аудио.

автор x-ai23 июл. 2026 г.12,38 ₽ за час
Poolside: Laguna S 2.1

poolside/laguna-s-2.1

Laguna S 2.1 — это новейшая модель кодинг-агента от Poolside. Laguna S 2.1 — это модель с общим количеством параметров 118B и 8B активными параметрами, показавшая результат 70.2% в Terminal-Bench 2.1 и 40.4% в DeepSWE, что делает её одной из самых сильных моделей для кодинга в своей категории. Открытые веса под лицензией OpenMDW-1.1. Laguna S 2.1 предназначена для случаев использования в разработке программного обеспечения и агентном кодинге, и вы несёте ответственность за подтверждение того, что она подходит для вашего предполагаемого применения. Laguna S 2.1 подпадает под действие OpenMDW-1.1 License и должна использоваться в соответствии с Acceptable Use Policy компании Poolside. Мы советуем не обходить защитные меры безопасности Laguna S 2.1, не внедрив по существу эквивалентные меры компенсации, подходящие для вашего случая использования. Пожалуйста, сообщайте об уязвимостях безопасности или проблемах безопасности на security@poolside.ai. Если вы используете Laguna S 2.1 бесплатно, мы можем использовать ваши входные и выходные данные для обучения и улучшения наших моделей.

автор poolside21 июл. 2026 г.11,14 ₽ / 1 млн входных22,28 ₽ / 1 млн выходных
Google: Gemini 3.6 Flash

google/gemini-3.6-flash

Gemini 3.6 Flash — это высокоэффективная модель от Google для программирования, агентных рабочих процессов, а также веб- и прикладной разработки. Она создана для получения аккуратных результатов с меньшим числом лишних правок и меньшей осторожностью в формулировках, при этом снижая расход токенов и количество обращений к модели, необходимых для выполнения задачи.

автор google21 июл. 2026 г.92,83 ₽ / 1 млн входных464,16 ₽ / 1 млн выходных
Google: Gemini 3.5 Flash Lite

google/gemini-3.5-flash-lite

Gemini 3.5 Flash Lite — это высокоэффективная модель от Google с улучшенными агентными возможностями. Она подходит для субагентов, выполняющих сфокусированные задачи в сложных мультиагентных рабочих процессах.

автор google21 июл. 2026 г.37,13 ₽ / 1 млн входных309,44 ₽ / 1 млн выходных
Krea: Krea 2 Large

krea/krea-2-large

Krea 2 Large — это модель генерации изображений с высокой производительностью от Krea, более чем вдвое превышающая по размеру Krea 2 Medium. Более лёгкая постобработка придаёт изображениям более сырой, фактурный и гибкий характер, что делает её особенно подходящей для фотореализма, выразительных художественных стилей, размытия движения, зернистости и изображений с низким динамическим диапазоном.

автор krea20 июл. 2026 г.7,43 ₽ за изображение
Krea: Krea 2 Medium

krea/krea-2-medium

Krea 2 Medium — это сбалансированная и экономичная модель генерации изображений от Krea, а также практичная отправная точка для широкого круга задач. Её обширное постобучение обеспечивает стабильную и согласованную генерацию, с особыми преимуществами в иллюстрации, аниме, живописи и других выразительных художественных стилях.

автор krea20 июл. 2026 г.3,71 ₽ за изображение
Krea: Krea 2 Medium Turbo

krea/krea-2-medium-turbo

Krea 2 Medium Turbo — это дистиллированная, ориентированная на скорость версия модели Krea 2 Medium от Krea. Она создана для быстрой итерации и исследования графического дизайна, где приоритетом является скорость генерации.

автор krea20 июл. 2026 г.1,86 ₽ за изображение
Meituan: LongCat 2.0

meituan/longcat-2.0

LongCat 2.0 — это разреженная модель языка на основе смеси экспертов от Meituan, с 48B активными параметрами из 1.6T общих. Она подходит для написания кода, изменений на уровне репозитория, решения долгосрочных задач и агентных сценариев.

автор meituan20 июл. 2026 г.37,13 ₽ / 1 млн входных148,53 ₽ / 1 млн выходных
SpaceXAI: Grok Imagine Video 1.5

x-ai/grok-imagine-video-1.5

Grok Imagine Video 1.5 — это модель генерации видео от SpaceXAI. Она создаёт видео по текстовым запросам, с возможностью использования стартового изображения для направления сцены. Модель может управлять движением объектов и камеры, темпом, атмосферой и физическим поведением, сохраняя визуальную непрерывность, а также генерировать синхронизированные звуковые эффекты, фоновую атмосферу и диалоги.

автор x-ai20 июл. 2026 г.от 11,55 ₽ за секунду
Thinking Machines: Inkling

thinkingmachines/inkling

Inkling — это мультимодальная модель со смесью экспертов и открытыми весами от лаборатории Thinking Machines, с 41B активными параметрами из 975B общих. Она предназначена для универсальных рассуждений, написания кода, использования в агентных системах и инструментальных средах, дополнения с检索-усиленной генерацией, следования инструкциям, а также для многоязычных диалоговых сценариев. Встроенное понимание изображений и звука позволяет модели обрабатывать мультимодальные данные наряду с текстом.

автор thinkingmachines17 июл. 2026 г.123,78 ₽ / 1 млн входных501,29 ₽ / 1 млн выходных
Deepgram: Aura-2

deepgram/aura-2

Aura-2 — это многоязычная модель преобразования текста в речь от Deepgram. Она поддерживает канонический каталог голосов Aura-2 от Deepgram для синтеза речи на нескольких языках.

автор deepgram16 июл. 2026 г.3 713,27 ₽ за 1 млн символов
MoonshotAI: Kimi K3

moonshotai/kimi-k3

Kimi K3 — это мультимодальная модель рассуждений с открытыми весами на 2.8T параметров от Moonshot AI. Она подходит для сложного программирования, работы со знаниями и длительных агентных сценариев, а особенно сильна в навигации по крупным репозиториям, использовании инструментов, отладке и итеративной работе с изображениями, логами, тестами и обратной связью от выполнения. В её архитектуре используются KDA и Attention Residuals для вычислительной эффективности.

автор moonshotai16 июл. 2026 г.371,33 ₽ / 1 млн входных1 856,63 ₽ / 1 млн выходных
Meta: Muse Spark 1.1

meta/muse-spark-1.1

Muse Spark 1.1 — это мультимодальная модель рассуждения от Meta, созданная для агентных задач. Она принимает текст, изображения, видео, аудио и PDF документы и возвращает текст, с контекстным окном в 1M токенов. Модель предназначена для оркестрации мультиагентных рабочих процессов, выступая либо в роли основного агента, который планирует и делегирует задачи, либо в роли субагента, и без дополнительного обучения обобщается на новые инструменты, MCP серверы и пользовательские навыки. Она поддерживает структурированный вывод, параллельный вызов функций, встроенный поиск с цитированием и настраиваемые усилия при рассуждении. Meta сообщает о высокой производительности в реальных задачах программирования в крупных кодовых базах, сценариях использования компьютера и генерации кода из визуальных данных.

автор meta16 июл. 2026 г.154,72 ₽ / 1 млн входных526,05 ₽ / 1 млн выходных
MiniMax: Speech 2.8 HD

minimax/speech-2.8-hd

MiniMax Speech 2.8 HD — это модель преобразования текста в речь от MiniMax. Она подходит для приложений, которые генерируют аудио из текста и принимают произвольный MiniMax голос IDs.

автор minimax16 июл. 2026 г.12 377,55 ₽ за 1 млн символов
MiniMax: Speech 2.8 Turbo

minimax/speech-2.8-turbo

MiniMax Speech 2.8 Turbo — это модель преобразования текста в речь от MiniMax. Она подходит для приложений, которые генерируют аудио из текста, и принимает произвольный голос MiniMax IDs.

автор minimax16 июл. 2026 г.7 426,53 ₽ за 1 млн символов
Deepgram: Nova-3

deepgram/nova-3

Deepgram Nova-3 универсальная модель преобразования речи в текст с поддержкой одноязычной и многоязычной транскрипции.

автор deepgram15 июл. 2026 г.0,53 ₽ за минуту
Kwaipilot: KAT-Coder-Pro V2.5

kwaipilot/kat-coder-pro-v2.5

KAT-Coder-Pro V2.5 — это флагманская модель агентного кодирования, которой можно напрямую передать целую задачу или целый бизнес-процесс, позволяя ей автономно находить и вносить изменения и выполнять весь процесс в реальном репозитории. В то же время она бесшовно интегрирует несколько экспертов, чтобы полностью сохранить способность генерации фронтенд-эстетики V2.

автор kwaipilot10 июл. 2026 г.91,59 ₽ / 1 млн входных366,38 ₽ / 1 млн выходных
OpenAI: GPT-5.6 Luna Pro

openai/gpt-5.6-luna-pro

GPT-5.6 Luna Pro — это та же базовая модель, что и GPT-5.6 Luna, обслуживаемая с параметром reasoning.mode, установленным в значение pro, для получения более качественных ответов на сложных задачах. Подробнее в документации OpenAI: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode

автор openai9 июл. 2026 г.от 12,38 ₽ / 1 млн входныхот 74,27 ₽ / 1 млн выходных
OpenAI: GPT-5.6 Luna

openai/gpt-5.6-luna

GPT-5.6 Luna — это быстрая и экономически эффективная модель в серии OpenAI GPT-5.6. Она подходит для высоконагруженных задач, чувствительных к задержке, таких как чат, классификация и лёгкие агентные рабочие процессы, обеспечивая достойные рассуждения для своего ценового сегмента.

автор openai9 июл. 2026 г.от 12,38 ₽ / 1 млн входныхот 74,27 ₽ / 1 млн выходных
OpenAI: GPT-5.6 Terra Pro

openai/gpt-5.6-terra-pro

GPT-5.6 Terra Pro — это та же базовая модель, что и GPT-5.6 Terra, предоставляемая с reasoning.mode, установленным в pro, для более качественных ответов на сложных задачах. Подробнее в документации OpenAI: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode

автор openai9 июл. 2026 г.от 123,78 ₽ / 1 млн входныхот 742,65 ₽ / 1 млн выходных
OpenAI: GPT-5.6 Terra

openai/gpt-5.6-terra

GPT-5.6 Terra — сбалансированная модель в серии OpenAI GPT-5.6, занимающая позицию между флагманским уровнем Sol и экономичным уровнем Luna. Она подходит для повседневных задач программирования, рассуждений и агентных сценариев, где требуется баланс между производительностью и стоимостью, обеспечивая высокую эффективность примерно вдвое дешевле, чем Sol.

автор openai9 июл. 2026 г.от 123,78 ₽ / 1 млн входныхот 742,65 ₽ / 1 млн выходных
OpenAI: GPT-5.6 Sol Pro

openai/gpt-5.6-sol-pro

GPT-5.6 Sol Pro — это та же базовая модель, что и GPT-5.6 Sol, предоставляемая с параметром reasoning.mode, установленным в pro, для более качественных ответов на сложных задачах. Узнайте больше в документации OpenAI: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode

автор openai9 июл. 2026 г.от 247,55 ₽ / 1 млн входныхот 1 237,76 ₽ / 1 млн выходных
OpenAI: GPT-5.6 Sol

openai/gpt-5.6-sol

GPT-5.6 Sol — флагманская модель в серии GPT-5.6 от OpenAI. Она подходит для сложных рассуждений, написания кода и агентских рабочих процессов, и особенно сильна в задачах командной строки, многошаговых задачах кодирования и решении задач с длинным горизонтом.

автор openai9 июл. 2026 г.от 123,78 ₽ / 1 млн входныхот 618,88 ₽ / 1 млн выходных
SpaceXAI: Grok 4.5

x-ai/grok-4.5

Grok 4.5 — это модель от SpaceXAI с передовой производительностью в программировании, работе со знаниями и STEM.

автор x-ai8 июл. 2026 г.от 247,55 ₽ / 1 млн входныхот 742,65 ₽ / 1 млн выходных
xAI: Grok Latest

~x-ai/grok-latest

Эта модель всегда перенаправляет на последнюю модель Grok от xAI.

автор ~x-ai8 июл. 2026 г.от 247,55 ₽ / 1 млн входныхот 742,65 ₽ / 1 млн выходных
AionLabs: Aion-3.0-Mini

aion-labs/aion-3.0-mini

Aion-3.0 Mini — это мультимодельная система для ролевых игр и повествования от AionLabs, построенная на семействе моделей DeepSeek. Она использует совместный процесс генерации, в котором несколько специализированных моделей вносят вклад в ответ, обеспечивая более сильную структуру повествования и более убедительные напряжение и конфликт.

автор aion-labs7 июл. 2026 г.86,64 ₽ / 1 млн входных173,29 ₽ / 1 млн выходных
AionLabs: Aion-3.0

aion-labs/aion-3.0

Aion-3.0 — это мультимодельная система ролевых игр и повествования от AionLabs, построенная на семействе моделей GLM. Она использует совместный процесс генерации, в котором несколько специализированных моделей каждая вносят свой вклад в ответ, создавая более сильную повествовательную структуру и более захватывающие напряжение и конфликт.

автор aion-labs7 июл. 2026 г.371,33 ₽ / 1 млн входных742,65 ₽ / 1 млн выходных
Tencent: Hy3

tencent/hy3

Hy3 — это модель смеси экспертов (Mixture-of-Experts) с 295B параметрами от Tencent (активно 21B, 192 экспертов с маршрутизацией top-8), предназначенная для рассуждений, агентных рабочих процессов и реального производственного использования. Она поддерживает настраиваемое усилие рассуждения: по умолчанию — прямой режим без размышлений, а также режимы цепочки рассуждений с низким и высоким уровнем для сложных задач по математике, программированию и многошаговых проблем. С контекстным окном 256K, Hy3 нацелена на задачи с длинным горизонтом, включая улучшенное разрешение кореферентности, отслеживание ограничений в многоходовых диалогах и стабильный вызов инструментов, который обобщается на различные агентные каркасы. Tencent позиционирует её как надёжный и экономически эффективный вариант для программирования, обработки документов, финансового анализа, разработки игр и дизайна фронтенда, с сильным акцентом на обоснованное поведение, препятствующее галлюцинациям: модель отвечает, когда есть основание, и сигнализирует об отсутствии доказательств, а не выдумывает.

автор tencent6 июл. 2026 г.от 11,35 ₽ / 1 млн входныхот 45,38 ₽ / 1 млн выходных
Poolside: Laguna XS 2.1

poolside/laguna-xs-2.1

Laguna XS 2.1 — это новейшая модель агента-кодера в категории 33B-A3B от Poolside, представляющая собой шаг вперёд по сравнению с их моделью Laguna XS.2 (выпущенной в апреле 2026). Она сочетает вызов инструментов и возможности рассуждения с компактным размером, предлагая контекстное окно 256K и до 32K выходных токенов. Квантована до FP8 для быстрых и экономичных агентных процессов кодирования. Laguna XS 2.1 предназначена для случаев использования в программной инженерии и агентном кодировании, и вы несёте ответственность за подтверждение того, что она подходит для вашего целевого применения. Laguna XS 2.1 регулируется OpenMDW-1.1 License и должна использоваться в соответствии с Acceptable Use Policy компании Poolside. Мы рекомендуем не обходить защитные механизмы безопасности Laguna XS 2.1 без внедрения существенно эквивалентных мер защиты, соответствующих вашему случаю использования. Пожалуйста, сообщайте об уязвимостях безопасности или проблемах безопасности на security@poolside.ai. Если вы используете Laguna XS 2.1 бесплатно, мы можем использовать ваши входные и выходные данные для обучения и улучшения наших моделей.

автор poolside2 июл. 2026 г.7,43 ₽ / 1 млн входных14,85 ₽ / 1 млн выходных
Anthropic: Claude Sonnet 5

anthropic/claude-sonnet-5

Sonnet 5 — это самая мощная модель Anthropic класса Sonnet, с передовой производительностью в программировании, агентных задачах и профессиональной работе. Она поддерживает адаптивное мышление с выбираемым уровнем рассуждений (низкий, средний, высокий, максимальный и сверхвысокий), контекстное окно на 1M токенов, а также ввод текста, изображений и файлов. Sonnet 5 использует обновлённый токенизатор и включает киберзащиту в реальном времени, блокирующую определённые виды деятельности двойного назначения с высоким риском.

автор anthropic30 июн. 2026 г.247,55 ₽ / 1 млн входных1 237,76 ₽ / 1 млн выходных

Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image) — у Google это самая быстрая и экономичная Gemini модель генерации изображений, созданная для высокоскоростных конвейеров разработки и быстрых визуальных исследований. Она обеспечивает генерацию из текста в изображение примерно за 4 секунд — примерно в 2.7 раз быстрее, чем Gemini 3.1 Flash Image, — сохраняя при этом согласованность персонажей, точное редактирование и знания о реальном мире, характерные для семейства Nano Banana. Единый API, подключаемый без изменений, обрабатывает генерацию из текста в изображение, редактирование изображений и создание композиций из нескольких изображений. Будучи мультимодальной моделью, она также возвращает текст вместе с изображениями. Результаты генерируются в разрешении 1K при 14 соотношениях сторон и содержат невидимый водяной знак SynthID, позволяющий идентифицировать их как AI-generated. Позиционируясь как лучший баланс качества и скорости в линейке Nano Banana 2, она позволяет генерировать тысячи изображений по стоимости, составляющей лишь малую долю затрат на более тяжёлые производственные модели, — идеально для прототипирования, приложений реального времени и масштабных визуальных рабочих процессов.

автор google30 июн. 2026 г.3 713,27 ₽ за 1 млн токенов
Nex AGI: Nex-N2-Mini

nex-agi/nex-n2-mini

Nex-N2-Mini — это открытая агентная модель со смешанной архитектурой экспертов от Nex AGI, младшая модель в серии Nex-N2. Она принимает текстовый и графический ввод и предназначена для написания кода, работы с инструментами, глубоких исследований и длительных агентных сценариев, с контекстным окном на 262K токенов и встроенной поддержкой рассуждений.

автор nex-agi24 июн. 2026 г.3,09 ₽ / 1 млн входных12,38 ₽ / 1 млн выходных
Sakana: Fugu Ultra

sakana/fugu-ultra

Fugu Ultra — это модель с более высокой производительностью в семействе Sakana AI's Fugu. Вместо единой монолитной модели, Fugu представляет собой обученную мультиагентную систему оркестрации: языковая модель, обученная направлять задачи через сменяемый пул базовых моделей и рекурсивно вызывать свои собственные экземпляры.\n\nFugu Ultra уделяет приоритет качеству ответов в сложных многошаговых рассуждениях, программировании и агентных рабочих процессах. Она поддерживает настраиваемые усилия по рассуждению, вызов инструментов и встроенный веб-поиск. Токены оркестрации, потребляемые системой, тарифицируются как стандартные входные/выходные токены.

автор sakana24 июн. 2026 г.от 618,88 ₽ / 1 млн входныхот 3 713,27 ₽ / 1 млн выходных
Alibaba: HappyHorse 1.1

alibaba/happyhorse-1.1

HappyHorse 1.1 — это модель генерации видео от Alibaba. Она создает короткие видеоролики на основе текстового запроса, одного стартового изображения или набора референсных изображений, с выходом до 1080p и длительностью от 3 до 15 секунд. Она подходит для творческого контента, клипов для социальных сетей и анимации на основе изображений, а также превосходит предыдущую версию за счет более точного следования запросу, более плавных движений и более стабильных персонажей в кадрах.

автор alibaba24 июн. 2026 г.от 14,27 ₽ за секунду
OpenAI: GPT Image 2

openai/gpt-image-2

OpenAI's последняя модель генерации изображений. Поддерживает высококачественную генерацию и редактирование изображений с помощью специальных Images API.

автор openai24 июн. 2026 г.3 713,27 ₽ за 1 млн токенов
OpenAI: GPT Image 1

openai/gpt-image-1

GPT Image 1 от OpenAI создаёт и редактирует изображения через специальные Image API. Отличается точным рендерингом текста, прозрачными фонами и поддержкой до 16 референсных изображений для редактирования.

автор openai24 июн. 2026 г.4 951,02 ₽ за 1 млн токенов
OpenAI: GPT Image 1 Mini

openai/gpt-image-1-mini

Экономичный вариант GPT Image 1 для высококачественной генерации изображений с уменьшенной задержкой и стоимостью посредством специализированных Images от OpenAI API.

автор openai24 июн. 2026 г.990,20 ₽ за 1 млн токенов
Alibaba: HappyHorse 1.0

alibaba/happyhorse-1.0

HappyHorse 1.0 — это модель генерации видео от Alibaba. Она создаёт короткие видеоролики по текстовому запросу, одному стартовому изображению или набору референсных изображений, с выходом до 1080p и длительностью от 3 до 15 секунд. Модель подходит для творческого контента, клипов для социальных сетей и анимации на основе изображений при различных соотношениях сторон.

автор alibaba24 июн. 2026 г.от 14,27 ₽ за секунду

Gemini 3.1 Flash Image, также известная как «Nano Banana 2», — это новейшая модель генерации и редактирования изображений уровня Pro от Google, обеспечивающая визуальное качество уровня Pro на скорости Flash. Она сочетает расширенное понимание контекста с быстрым и экономически эффективным выводом, что делает сложную генерацию изображений и итеративное редактирование значительно более доступными. Соотношением сторон можно управлять с помощью параметра image_config API.

автор google18 июн. 2026 г.7 426,53 ₽ за 1 млн токенов

Nano Banana Pro — самая передовая модель генерации и редактирования изображений от Google, построенная на базе Gemini 3 Pro. Она расширяет возможности оригинальной Nano Banana за счёт значительно улучшенного мультимодального рассуждения, привязки к реальному миру и высокоточной визуальной генерации. Модель создаёт насыщенные по контексту графические материалы — от инфографики и диаграмм до кинематографичных композиций — и может использовать информацию в реальном времени через привязку к поиску. Модель обеспечивает лучшую в отрасли передачу текста в изображениях (включая длинные фрагменты и многоязычные макеты), согласованное смешивание нескольких изображений и точное сохранение индивидуальности до пяти объектов. Nano Banana Pro добавляет тонкие творческие настройки, такие как локальные правки, регулировка освещения и фокуса, трансформации камеры, а также поддержку выходных форматов 2K/4K и гибких соотношений сторон. Она предназначена для профессионального дизайна, визуализации продуктов, раскадровки и сложных многоэлементных композиций, оставаясь при этом эффективной для обычных задач создания изображений.

автор google18 июн. 2026 г.14 853,07 ₽ за 1 млн токенов
Z.ai: GLM 5.2

z-ai/glm-5.2

GLM 5.2 — это крупномасштабная модель рассуждения от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1M токенов и подходит для долгосрочных агентных рабочих процессов, разработки программного обеспечения на уровне проектов и сложной многоэтапной автоматизации. Поддерживаются уровни усилий рассуждения high и xhigh; xhigh соответствует максимальному уровню рассуждения. Модель особенно сильна в написании кода и использовании инструментов в длительных задачах, способна сохранять инженерный контекст и последовательно следовать стандартам на протяжении всего цикла разработки — от требований до развертывания на нескольких платформах — в рамках одной задачи.

автор z-ai16 июн. 2026 г.164,92 ₽ / 1 млн входных518,32 ₽ / 1 млн выходных
MoonshotAI: Kimi K2.7 Code

moonshotai/kimi-k2.7-code

MoonshotAI: Kimi K2.7 Code — это модель, ориентированная на программирование, из семейства Kimi K2 от Moonshot AI, созданная для надёжного выполнения комплексных задач программирования в условиях длинных контекстов. Она использует нативную мультимодальную архитектуру смеси экспертов, которая принимает текст и изображения на входе, и всегда работает в режиме мышления, сохраняя полное содержимое рассуждений при многоходовых диалогах. С контекстным окном в 256K токенов модель нацелена на долгосрочное программирование, декомпозицию агентских задач и многоходовые диалоги. Модель активирует 32B параметров из примерно 1T общих.

автор moonshotai12 июн. 2026 г.81,69 ₽ / 1 млн входных420,84 ₽ / 1 млн выходных
Anthropic: Claude Fable Latest

~anthropic/claude-fable-latest

Эта модель всегда перенаправляет на последнюю модель в семействе Claude Fable.

автор ~anthropic9 июн. 2026 г.1 237,76 ₽ / 1 млн входных6 188,78 ₽ / 1 млн выходных
Anthropic: Claude Fable 5

anthropic/claude-fable-5

Claude Fable 5 — это модель класса Mythos от Anthropic, созданная для автономной работы со знаниями и кодирования. Она поддерживает ввод текста, изображений и файлов с выводом текста, поддержку рассуждений и окно контекста на 1M токенов. Она подходит для длительных, сложных и асинхронных задач, которые ранее требовали частых проверок человеком. Она особенно сильна в сквозной работе, которая в противном случае заняла бы у человека часы, дни или недели — берясь за проблемы, которые являются длительными, неоднозначными или многоэтапными. Она выполняет четко очерченные задачи с небольшим количеством ошибок, автоматически самокорректируется через циклы проверки и поставляется с надежными мерами защиты.

автор anthropic9 июн. 2026 г.1 237,76 ₽ / 1 млн входных6 188,78 ₽ / 1 млн выходных
Nex AGI: Nex-N2-Pro

nex-agi/nex-n2-pro

Nex-N2-Pro — это агентная модель смеси экспертов от Nex AGI с 17B активными параметрами из общего числа 397B. Основанная на архитектуре Qwen3.5, она принимает на вход текст и изображения и выдает текстовые выводы, а также поддерживает рассуждения, вызов функций и структурированные выводы. Она предназначена для программирования, использования инструментов, глубоких исследований и долгосрочных агентных рабочих процессов, объединяя планирование, реализацию кода, отладку и итерации в единый цикл выполнения.

автор nex-agi8 июн. 2026 г.30,94 ₽ / 1 млн входных123,78 ₽ / 1 млн выходных
Sourceful: Riverflow V2.5 Pro

sourceful/riverflow-v2.5-pro

Riverflow V2.5 Pro — самая мощная версия линейки Sourceful Riverflow 2.5, оптимальная для задач, требующих максимального контроля и чувствительных к качеству результатов. Серия Riverflow 2.5 — это единое семейство моделей для генерации и редактирования изображений, которое рассматривает генерацию как производственный процесс: встроенная модель рассуждения планирует многошаговые правки и оценивает кандидатов перед выбором итогового результата. Riverflow 2.5 объединяет эти рассуждения с набором закрытых и открытых диффузионных моделей изображений, обеспечивая более высокую точность и управляемость. Уровень рассуждений регулируется параметром reasoning (low/medium/high/xhigh). Более высокие уровни выполняют больше проходов правки и применяют более строгую внутреннюю оценку; режим xhigh подходит для пакетной обработки, где требуется высокая воспроизводимость. Модель генерирует изображения с разрешением 1K, 2K и 4K и принимает до 10 входных изображений для редактирования. Ценообразование динамическое: стоимость финализируется по завершении задания на основе выставленного счёта, поэтому она масштабируется в зависимости от усилий на рассуждение, разрешения и сложности редактирования, а не фиксирована за изображение. Дополнительные возможности (через image_config): Рендеринг пользовательских шрифтов через font_inputs (максимум 2) для точного соответствия начертанию, межбуквенному интервалу и насыщенности брендового текста. Пользовательская оценка через scoring_prompt и scoring_rubric, чтобы модель рассуждения оценивала и направляла каждый вариант по заданным вами критериям. Управление фоном через background_mode (оригинальный, прозрачный, однотонный) и background_hex_color. Подробнее см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation. Примечание: Sourceful устанавливает ограничение на размер запроса 4.5MB, поэтому настоятельно рекомендуется передавать изображение URLs вместо данных Base64.

автор sourceful4 июн. 2026 г.от 16,09 ₽ за изображение
Sourceful: Riverflow V2.5 Fast

sourceful/riverflow-v2.5-fast

Riverflow V2.5 Fast — это оптимизированная по скорости версия линейки Riverflow 2.5 от Sourceful, лучше всего подходящая для продакшен-развертываний и рабочих процессов, критичных к задержке. Серия Riverflow 2.5 — это единое семейство для генерации текста в изображение и изображения в изображение, которое рассматривает генерацию как производственный процесс, используя интегрированную модель рассуждения для планирования многошаговых правок и оценки кандидатов перед принятием результата. Riverflow 2.5 сочетает их рассуждение с набором открытых диффузионных моделей изображений, обеспечивая большую точность и управляемость. Уровень усилий рассуждения управляется через параметр reasoning (low/medium/high) — более высокие уровни выполняют больше проходов редактирования и применяют более строгого внутреннего судью, тогда как более низкие уровни возвращают результат быстрее для раннего исследования. Генерация выполняется в разрешениях 1K и 2K (без 4K) и принимает до 4 входных изображений для редактирования. Ценообразование динамическое: стоимость окончательно определяется для каждой задачи по завершении на основе оплачиваемой обработки, поэтому она масштабируется в зависимости от усилий рассуждения, разрешения и сложности редактирования, а не фиксированной ставки за изображение. Дополнительные возможности (через image_config): Настраиваемый рендеринг шрифтов через font_inputs (максимум 2) для соответствия фирменному начертанию, межбуквенному интервалу и насыщенности Настраиваемая оценка через scoring_prompt и scoring_rubric, чтобы модель рассуждения оценивала и направляла каждого кандидата в соответствии с важными для вас критериями Управление фоном через background_mode (original, transparent, solid) и background_hex_color См. документацию по генерации изображений для подробностей: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: Sourceful накладывает ограничение на размер запроса 4.5MB, поэтому настоятельно рекомендуется передавать URLs изображений вместо данных Base64.

автор sourceful4 июн. 2026 г.от 2,35 ₽ за изображение
NVIDIA: Nemotron 3 Ultra

nvidia/nemotron-3-ultra-550b-a55b

NVIDIA Nemotron 3 Ultra — открытая модель фронтьерного рассуждения и оркестрации от NVIDIA, с 55B активными параметрами из 550B общих (MoE). Построенная на гибридной архитектуре Transformer-Mamba смеси экспертов, она поддерживает ввод и вывод текста с окном контекста до 1M токенов. Она подходит для длительных агентных рабочих процессов, включая оркестрацию агентов, агентов программирования, глубокие исследования и сложные корпоративные задачи. Модель особенно сильна в многошаговом рассуждении и планировании, с высокопроизводительным инференсом, разработанным для высокообъёмных агентных конвейеров. Она является частью семейства открытых моделей NVIDIA Nemotron для агентных AI.

автор nvidia4 июн. 2026 г.77,36 ₽ / 1 млн входных386,80 ₽ / 1 млн выходных
Qwen: Qwen3.7 Plus

qwen/qwen3.7-plus

Qwen3.7-Plus — это экономичная модель в серии Alibaba Qwen3.7. Она поддерживает ввод текста и изображений с выводом текста, развивая текстовые возможности серии за счёт всестороннего улучшения визуально-языковых способностей, сохраняя при этом полностековый интеллект агентного уровня для программирования, использования инструментов и рабочих процессов продуктивности. Её отличительная черта — мультимодальная интерактивная гибридная агентная способность: она может воспринимать реальные сцены, читать экраны и взаимодействовать с GUIs, генерировать код по визуальным ссылкам и выполнять сквозную навигацию внутри мобильных приложений.

автор qwen3 июн. 2026 г.от 39,61 ₽ / 1 млн входныхот 158,43 ₽ / 1 млн выходных
Microsoft: MAI-Voice-2

microsoft/mai-voice-2

MAI-Voice-2 — это выразительная модель синтеза речи от Microsoft. Она подходит для разговорных ассистентов, озвучивания медиа, доступности, образования и других голосовых приложений длинного формата. Она поддерживает 15 языков в 18 локалях, обеспечивает детальную настройку тона и подачи, многоголосую генерацию и генерацию по голосовому образцу из коротких аудиофрагментов без дообучения. Модель ставит естественность и выразительность выше генерации, критичной к задержке.

автор microsoft2 июн. 2026 г.2 723,06 ₽ за 1 млн символов
Microsoft: MAI-Transcribe 1.5

microsoft/mai-transcribe-1.5

MAI-Transcribe 1.5 — это многоязычная модель преобразования речи в текст от Microsoft AI. Она подходит для субтитров, транскрибации звонков, создания субтитров, обеспечения доступности и других голосовых приложений, обеспечивая надежную транскрибацию на 43 языках, различных акцентах и зашумленном реальном аудио. Она поддерживает автоматическое определение языка и смещение ключевых слов для доменной терминологии, а также повышает скорость транскрибации длинных аудио по сравнению с MAI-Transcribe-1. Диаризация говорящих не поддерживается.

автор microsoft2 июн. 2026 г.44,56 ₽ за час
Microsoft: MAI-Image-2.5

microsoft/mai-image-2.5

MAI-Image-2.5 от Microsoft — это высококачественная модель генерации изображений, доступная через Azure AI Foundry. Она создаёт фотореалистичные и художественные изображения по текстовым запросам с поддержкой различных соотношений сторон.

автор microsoft2 июн. 2026 г.5 817,45 ₽ за 1 млн токенов
MiniMax: MiniMax M3

minimax/minimax-m3

MiniMax-M3 — это мультимодальная фундаментальная модель от MiniMax. Она поддерживает ввод текста, изображений и видео с выводом текста, имеет контекстное окно в 1M токенов и предназначена для длительных агентных задач, программирования и использования инструментов. Модель построена на основе MiniMax Sparse Attention (MSA), которая заменяет полное внимание на KV-block-выборку, сокращая вычислительные затраты на токен при длинном контексте — примерно на 1/20 по сравнению с предыдущим поколением при 1M токенах, обеспечивая значительно более быструю предварительную обработку и декодирование без потери качества на большинстве задач. Обученная как нативная мультимодальная модель на перемежённых данных и оптимизированная для многоходового, производственно-ориентированного взаимодействия через интерактивный симулятор пользователя, модель ориентирована на длительные, многошаговые задачи, а не на одноразовое выполнение.

автор minimax31 мая 2026 г.37,13 ₽ / 1 млн входных148,53 ₽ / 1 млн выходных
StepFun: Step 3.7 Flash

stepfun/step-3.7-flash

Step 3.7 Flash — последняя высокоэффективная мультимодальная модель архитектуры Mixture-of-Experts от StepFun. Она объединяет языковую основу с 196B параметрами и визуальный энкодер для нативного понимания изображений и видео, активируя примерно 11B параметров на токен. Модель поддерживает контекстное окно в 256K и предоставляет выбираемые уровни рассуждения (высокий/средний/низкий), позволяя вызывающим сторонам балансировать скорость, стоимость и глубину рассуждений. Разработана для написания кода, агентных сценариев, структурированных выходных данных и задач продуктивности с длинным контекстом.

автор stepfun28 мая 2026 г.24,76 ₽ / 1 млн входных142,34 ₽ / 1 млн выходных
Anthropic: Claude Opus 4.8

anthropic/claude-opus-4.8

Claude Opus 4.8 — это наиболее мощная общедоступная модель в семействе Opus от Anthropic. Она поддерживает ввод текста, изображений и файлов с выводом текста, поддерживает рассуждения и контекстное окно на 1M токенов. Она подходит для высокоавтономных агентов, долгосрочной агентной работы, работы со знаниями и задач, связанных с памятью, где важна согласованность в течение длительных сессий. Она особенно сильна в многошаговых рассуждениях, сложном кодировании и сквозной оркестрации проектов - больших базах кода, многоэтапной отладке и длительных асинхронных конвейерах агентов. Помимо кодирования, она справляется с работой со знаниями, такой как составление документов, создание презентаций и анализ данных, сохраняя качество при очень длинных выводах.

автор anthropic27 мая 2026 г.618,88 ₽ / 1 млн входных3 094,39 ₽ / 1 млн выходных
NVIDIA: Parakeet TDT 0.6B v3

nvidia/parakeet-tdt-0.6b-v3

Parakeet TDT 0.6B v3 — это мультиязычная модель преобразования речи в текст с 600M параметрами от NVIDIA, построенная на архитектуре FastConformer-TDT. Обученная на датасете Granary (более 670,000 часов аудио), она поддерживает автоматическое определение языка для всех официальных языков EU и достигает среднего показателя частоты ошибок в словах 6.34% на лидерборде HuggingFace Open ASR. Возвращает транскрибированный текст с пунктуацией и временными метками сегментов.

автор nvidia27 мая 2026 г.0,19 ₽ за минуту
Qwen: Qwen3.7 Max

qwen/qwen3.7-max

Qwen3.7-Max — флагманская модель в серии Alibaba Qwen3.7. Она поддерживает ввод и вывод текста и предназначена для агентно-ориентированных рабочих нагрузок, с особыми преимуществами в программировании, офисных и продуктивных задачах, а также в длительном автономном выполнении. Модель демонстрирует заметные улучшения в программировании и агентной производительности по сравнению с предыдущими поколениями Qwen и поддерживает явное кэширование промптов для эффективного повторного использования контекста.

автор qwen21 мая 2026 г.182,57 ₽ / 1 млн входных547,71 ₽ / 1 млн выходных
SpaceXAI: Grok Build 0.1

x-ai/grok-build-0.1

Grok Build 0.1 — это быстрая модель для написания кода от SpaceXAI, специально обученная для агентных сценариев разработки программного обеспечения. Она поддерживает текстовые и графические входные данные с выводом текста и оптимизирована для интерактивных агентов, работы с инструментами и многошаговых задач разработки. Модель обеспечивает работу SpaceXAI Grok Build CLI и имеет контекстное окно 256K без ограничения на объём выводимого текста, что делает её хорошо подходящей для длительных задач программирования и автоматизации. В настоящее время доступна в режиме раннего доступа.

автор x-ai20 мая 2026 г.от 123,78 ₽ / 1 млн входныхот 247,55 ₽ / 1 млн выходных
Google: Gemini Embedding 2

google/gemini-embedding-2

Gemini Embedding 2 — это первая мультимодальная эмбеддинг-модель от Google. В настоящее время мы поддерживаем отображение текста и изображений в единое векторное пространство для семантического поиска и генерации с дополнением по извлечённым данным (RAG). Модель поддерживает входной контекст до 8,192 токенов и гибкие размерности выходных векторов от 128 до 3,072 (рекомендуемые: 768, 1536 или 3,072). Она разработана для кросс-модального сравнения — вы можете эмбеддить текстовый запрос и получать наиболее релевантные изображения, или наоборот, — что делает её хорошо подходящей для мультимодального поиска, рекомендаций и пайплайнов понимания документов.

автор google20 мая 2026 г.24,76 ₽ за 1 млн токенов
Google: Gemini 3.5 Flash

google/gemini-3.5-flash

Gemini 3.5 Flash — это высокоэффективная мультимодальная модель от Google, обеспечивающая почти уровень Pro в написании кода и рассуждениях при затратах и скорости уровня Flash. Она оптимизирована для высокой компетентности в программировании и параллельных агентных циклах выполнения, поддерживая ввод текста, изображений, видео, аудио и PDF. По умолчанию используется средний уровень усилия мышления для более быстрых и экономичных ответов, с полной поддержкой уровней мышления (минимальный, низкий, средний, высокий) для тонкой настройки компромиссов между стоимостью и производительностью.

автор google19 мая 2026 г.185,66 ₽ / 1 млн входных1 113,98 ₽ / 1 млн выходных
SpaceXAI: Grok Imagine Video

x-ai/grok-imagine-video

Grok Imagine Video — это модель генерации видео от SpaceXAI с учётом текста, изображений и референсов. Она создаёт короткие видеоролики (1–15 секунд, 24 fps) в разрешении 480p или 720p при семи соотношениях сторон: 1:1, 16:9, 9:16, 4:3, 3:4, 3:2 и 2:3. Модель поддерживает три режима генерации: «текст-в-видео» — только по запросу; «изображение-в-видео» — анимирует статичное входное изображение; и «референс-в-видео» — использует до семи референсных изображений для согласованности персонажей, стилей или окружения.

автор x-ai18 мая 2026 г.от 7,22 ₽ за секунду
SpaceXAI: Grok Imagine Image Quality

x-ai/grok-imagine-image-quality

Grok Imagine Image Quality — это быстрая модель генерации и редактирования изображений с высокой точностью от SpaceXAI. Она принимает текстовые подсказки и опциональные референсные изображения, создавая фотореалистичные результаты в разрешении 1K или 2K для широкого диапазона соотношений сторон, включая гибкую настройку референсных изображений. Модель делает акцент на реалистичных деталях — естественном освещении и физике, точных текстурах и согласованном рендеринге именованных сущностей, таких как бренды, публичные личности и конкретные места. Она поддерживает качественный многоязычный рендеринг текста внутри изображений, что делает её лучшим выбором для плакатов, упаковки, рекламы, меню и графики для соцсетей. При наличии референсных изображений она сохраняет идентичность и структуру для размещения продуктов, вариаций в соответствии с брендом и преемственности персонажей между сценами.

автор x-ai18 мая 2026 г.от 6,19 ₽ за изображение
Mistral: Voxtral Mini Transcribe

mistralai/voxtral-mini-transcribe

Voxtral Mini Transcribe — это модель преобразования речи в текст от Mistral, производная от семейства Voxtral Mini. Она принимает аудиовход и возвращает транскрибированный текст через стандартный API транскрипции. Подходит для транскрибации совещаний, голосовых заметок, подкастов и другого устного контента.

автор mistralai15 мая 2026 г.0,37 ₽ за минуту
SpaceXAI: Grok Voice TTS 1.0

x-ai/grok-voice-tts-1.0

Grok Voice TTS 1.0 — это модель преобразования текста в речь от SpaceXAI. Она преобразует текст в озвученное аудио на более чем 20 языках с автоматическим определением языка и предлагает пять встроенных голосов (Eve, Ara, Rex, Sal, Leo), охватывающих различные тональности. Встроенные речевые теги позволяют управлять паузами, ударением, высотой тона и стилем голоса. Выходной аудиофайл доступен в форматах MP3, WAV, PCM, μ-law и A-law с частотой дискретизации от 8 kHz до 48 kHz, при этом до 15,000 символов на запрос.

автор x-ai15 мая 2026 г.1 856,63 ₽ за 1 млн символов
Qwen: Qwen3 ASR Flash

qwen/qwen3-asr-flash-2026-02-10

Qwen3-ASR-Flash — это сервис автоматического распознавания речи компании Alibaba, построенный на основе Qwen3-Omni и обученный на десятках миллионов часов мультимодальных речевых данных. Модель поддерживает 11 языков, включая китайский (с кантонским, сычуаньским, миньнаньским и у диалектами), английский, арабский, французский, немецкий, испанский, итальянский, португальский, русский, японский и корейский, с автоматическим определением языка, поэтому для аудио со смешанными языками не требуется ручная настройка. Модель предназначена для сложных акустических условий: она транскрибирует текст песен на фоне музыки, обрабатывает шумные и удалённые записи, отфильтровывает тишину и неречевые звуки, а также принимает произвольный контекстный текст (имена, жаргон, доменную терминологию) для смещения распознавания в сторону конкретной лексики.

автор qwen14 мая 2026 г.< 0,01 ₽ за секунду
Recraft: Recraft V4.1 Pro Vector

recraft/recraft-v4.1-pro-vector

Recraft V4.1 Pro Vector — это векторный (SVG) вариант Recraft V4.1 Pro, оптимизированный для высокой эстетики. Он поддерживает ввод текста и изображений и создаёт вывод изображений SVG более высокого разрешения для различных соотношений сторон, при этом типичная генерация занимает около 15 секунд. Вывод масштабируется без потерь, что делает его подходящим для иконок, логотипов и другой графики. V4.1 добавляет больше индивидуальности тексту и иллюстрациям, обеспечивает более плавные градиенты и более точное следование коротким промптам по сравнению с V4 Pro. Подходит для иллюстраций более высокого разрешения и производственной графики, где результат должен быть разработан, а не сфотографирован. Поддерживает следующие параметры image_config: strength (управляет степенью отклонения вывода от исходного изображения), rgb_colors (задаёт цветовую палитру) и background_rgb_color (задаёт цвет фона). Подробнее см. документацию по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.

автор recraft13 мая 2026 г.37,13 ₽ за изображение
Recraft: Recraft V4.1 Vector

recraft/recraft-v4.1-vector

Recraft V4.1 Vector — это векторный (SVG) вариант модели Recraft V4.1, оптимизированный для высокой эстетики. Он поддерживает текстовые запросы и изображения на входе и создаёт выходное изображение SVG с различными соотношениями сторон, при этом типичная генерация занимает около 10 секунд. Выходное изображение хорошо масштабируется, что делает его подходящим для иконок, логотипов и другой графики. V4.1 добавляет больше индивидуальности тексту и иллюстрациям, обеспечивает более плавные градиенты и лучшее следование коротким запросам по сравнению с V4. Подходит для повседневной иллюстрационной работы, где результат должен быть дизайном, а не фотографией. Поддерживает следующие параметры image_config: strength (управляет степенью отклонения результата от исходного изображения), rgb_colors (задаёт цветовую палитру) и background_rgb_color (задаёт цвет фона). Подробности см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.

автор recraft13 мая 2026 г.9,90 ₽ за изображение
Recraft: Recraft V4.1 Utility Pro

recraft/recraft-v4.1-utility-pro

Recraft V4.1 Utility Pro — универсальная модель генерации изображений от Recraft. Она поддерживает текстовые и графические входные данные с выводом изображения в разрешении примерно 2K при нескольких соотношениях сторон — вдвое выше разрешения V4.1 Utility — при типичном времени генерации около 10 секунд. Как и V4.1 Utility, она спроектирована с расчётом на сдержанность как эстетический выбор — плоское освещение, фронтальная композиция и простые, контролируемые сцены — с более высокой точностью для производственных сценариев использования. Улучшения V4.1 по сравнению с V4 Pro включают более естественное понимание объектов, более чёткие мокапы, более аккуратные стандартные иконки и более точное следование промпту при более коротких промптах. Подходит для изображений товаров, электронной коммерции и структурированных визуальных материалов, где важна качество изображения, а линия V4.1 Pro с высокой эстетикой была бы слишком выразительной. Поддерживает следующие параметры image_config: strength (управляет тем, насколько результат отклоняется от исходного изображения), rgb_colors (задаёт цветовую палитру) и background_rgb_color (задаёт цвет фона). Подробнее см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.

автор recraft13 мая 2026 г.25,99 ₽ за изображение
Recraft: Recraft V4.1 Utility

recraft/recraft-v4.1-utility

Recraft V4.1 Utility — это универсальная модель генерации изображений от Recraft. Она поддерживает текстовые и графические входные данные с выводом изображений разрешением около 1K при различных соотношениях сторон, при этом типичное время генерации составляет около 6 секунд. Линейка Utility ориентирована на сдержанность как эстетический выбор: ровное освещение, фронтальная композиция и простые контролируемые сцены — что делает её практичным решением для изображений товаров, макетов и структурированных визуалов, где слишком выразительная линейка V4.1 была бы излишней. Улучшения в V4.1 по сравнению с V4 включают более естественное понимание объектов, более чёткие макеты, более аккуратные иконки по умолчанию и более точное следование коротким промптам. Поддерживаются следующие параметры image_config: strength (управляет степенью отклонения выходного изображения от исходного), rgb_colors (задаёт цветовую палитру) и background_rgb_color (устанавливает цвет фона). Подробнее см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.

автор recraft13 мая 2026 г.4,33 ₽ за изображение
Recraft: Recraft V4.1 Pro

recraft/recraft-v4.1-pro

Recraft V4.1 Pro — это модель генерации изображений от Recraft, настроенная на высокую эстетику. Она поддерживает ввод текста и изображений с выводом изображения с разрешением около ~2K при различных соотношениях сторон — вдвое больше разрешения, чем у V4.1 — при типичной генерации за около 10 секунд. Она разделяет визуальную чувствительность V4.1 при более высокой точности и плотности деталей, с более естественным фотореализмом, более плавным 3D-рендерингом и градиентами, а также более сильным следованием коротким промптам, чем V4 Pro. Подходит для продакшн-работы, где качество изображения является приоритетом, и идея выигрывает от большего разрешения, чтобы дышать. Поддерживает следующие параметры image_config: strength (контролирует, насколько выходное изображение отклоняется от исходного), rgb_colors (задает цветовую палитру) и background_rgb_color (задает цвет фона). Подробнее см. документацию по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.

автор recraft13 мая 2026 г.25,99 ₽ за изображение
Recraft: Recraft V4.1

recraft/recraft-v4.1

Recraft V4.1 — это модель генерации изображений от Recraft, настроенная на высокую эстетику. Она поддерживает текстовые и графические входные данные с выводом изображений при разрешении примерно 1K в различных соотношениях сторон, с типичной генерацией около 6 секунд. По сравнению с V4, фотореализм ощущается более естественным с более спокойными фонами и целенаправленным освещением, 3D-рендеринг и мягкие градиенты становятся более плавными, а модель более надёжно следует более коротким подсказкам. Подходит для исследований, концептуальной работы и повседневной творческой работы, где важны скорость и стоимость. Поддерживает следующие параметры image_config: strength (контролирует, насколько выходное изображение отклоняется от исходного), rgb_colors (устанавливает цветовую палитру) и background_rgb_color (устанавливает цвет фона). Подробнее см. документацию по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.

автор recraft13 мая 2026 г.4,33 ₽ за изображение
Recraft: Recraft V4 Pro Vector

recraft/recraft-v4-pro-vector

Recraft V4 Pro Vector — это векторный (SVG) вариант VRecraft V4 Pro. Он поддерживает ввод текста и изображений и создает векторные изображения в различных соотношениях сторон на уровне более высокого качества Pro. Вывод предоставляется в формате SVG, подходящем для иконок, логотипов и другой графики, которую нужно масштабировать без потери качества. V4 Pro обеспечивает более высокое качество и плотность деталей, чем V4, с более сильным композиционным суждением, согласованностью цветов и читаемым встроенным текстом по сравнению с V3. Поддерживаются следующие параметры image_config: strength (контролирует степень отклонения вывода от исходного изображения), rgb_colors (задает цветовую палитру) и background_rgb_color (задает цвет фона). См. документацию по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.

автор recraft13 мая 2026 г.37,13 ₽ за изображение
Recraft: Recraft V4 Vector

recraft/recraft-v4-vector

Recraft V4 Vector — это векторный (SVG) вариант модели Recraft V4. Он поддерживает ввод текста и изображений и создает векторное изображение на выходе для различных соотношений сторон. По сравнению с растровой моделью V4, выходные данные предоставляются в виде SVG, подходящего для иконок, логотипов и другой графики, которую нужно масштабировать без потери качества. V4 обеспечивает более сильное чувство композиции, цветовую согласованность и читаемый встроенный текст по сравнению с V3. Поддерживаются следующие параметры image_config: strength (управляет степенью отклонения выходного изображения от исходного), rgb_colors (задает цветовую палитру) и background_rgb_color (задает цвет фона). Дополнительную информацию см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.

автор recraft13 мая 2026 г.9,90 ₽ за изображение
Perceptron: Perceptron Mk1

perceptron/perceptron-mk1

Perceptron Mk1 (Mark One) — это зрение-языковая модель высочайшего качества от Perceptron для видео и воплощённого рассуждения.** Она принимает изображения и видео вместе с запросами на естественном языке и выдаёт подробные ответы с пониманием визуальной информации — либо в структурированной форме, либо на естественном языке. Она превосходно справляется с задачами понимания видео, такими как видео QA, суммаризация и обнаружение событий. Для изображений она развивает точечную привязку по примерам из мультимодальных подсказок, OCR и разбор документов на «зашумлённых» реальных входных данных, обнаружение и подсчёт объектов с открытым словарём, а также оценку позы рук. Рассуждение может быть включено по запросу, чтобы обменять задержку на более глубокий анализ более сложных задач. Структурированные аннотации выводятся в тексте только в том случае, если это явно запрошено через параметр annotation_format (передайте "point", "box" или "polygon" для пространственной локализации на изображениях, или "clip" (временные метки начала/конца) для временных сегментов в видео). Без annotation_format модель возвращает только текст на естественном языке.

автор perceptron12 мая 2026 г.18,57 ₽ / 1 млн входных185,66 ₽ / 1 млн выходных
Recraft: Recraft V4 Pro

recraft/recraft-v4-pro

Recraft V4 Pro — это модель генерации изображений от Recraft. Она поддерживает ввод текста и изображений с выводом изображения с разрешением ~2K при нескольких соотношениях сторон, что вдвое превышает разрешение V4. Она обеспечивает более высокую достоверность и плотность деталей, чем V4, и подходит для производственных сценариев, где качество изображения является приоритетом. Поддерживаются следующие параметры image_config: strength (управляет степенью отклонения вывода от исходного изображения), rgb_colors (задает цветовую палитру) и background_rgb_color (задает цвет фона). Подробнее см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.

автор recraft7 мая 2026 г.30,94 ₽ за изображение
Recraft: Recraft V4

recraft/recraft-v4

Recraft V4 — это модель генерации изображений от Recraft. Она поддерживает ввод текста и изображений с выводом изображения с разрешением около 1K при нескольких соотношениях сторон. По сравнению с V3 она обеспечивает более сильное композиционное суждение, согласованность цветов и читаемый встроенный текст, что делает её подходящей для инфографики, вывесок и упаковки. Поддерживает следующие параметры image_config: strength (контролирует степень отклонения вывода от исходного изображения), rgb_colors (задаёт цветовую палитру) и background_rgb_color (задаёт цвет фона). Подробности см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.

автор recraft7 мая 2026 г.4,95 ₽ за изображение
Recraft: Recraft V3

recraft/recraft-v3

Recraft V3 — это модель генерации изображений от Recraft. Она поддерживает ввод текста и изображений с выводом изображения в разрешении ~1K при различных соотношениях сторон. Поддерживаются следующие параметры image_config: strength (управляет степенью отклонения выходного изображения от исходного), style (применяет художественный стиль), text_layout (размещает текст в определённых позициях), rgb_colors (задаёт цветовую палитру) и background_rgb_color (задаёт цвет фона). См. документацию по генерации изображений для подробностей: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: поддерживается только одно входное изображение.

автор recraft7 мая 2026 г.4,95 ₽ за изображение
Google: Gemini 3.1 Flash Lite

google/gemini-3.1-flash-lite

Gemini 3.1 Flash Lite — это GA высокоэффективная мультимодальная модель от Google, оптимизированная для низкой задержки и больших объёмов рабочих нагрузок. Она поддерживает ввод текста, изображений, видео, аудио и PDF и предназначена для лёгких агентных рабочих процессов, простого извлечения данных и приложений, где основными ограничениями являются отзывчивость и стоимость API. Поддерживает полные уровни мышления (минимальный, низкий, средний, высокий) для тонкой настройки компромиссов между стоимостью и производительностью. Цена составляет половину стоимости Gemini 3 Flash.

автор google7 мая 2026 г.30,94 ₽ / 1 млн входных185,66 ₽ / 1 млн выходных
OpenAI: GPT Chat Latest

openai/gpt-chat-latest

GPT Chat Latest указывает на стабильный псевдоним chat-latest модели API от OpenAI, который всегда разрешается в актуальную модель Instant-чата, используемую в ChatGPT. По мере того как OpenAI в будущем выпускает новые обновления модели Instant, они автоматически направляются через этот слаг. Дополнительная информация: https://developers.openai.com/api/docs/models/chat-latest

автор openai5 мая 2026 г.618,88 ₽ / 1 млн входных3 713,27 ₽ / 1 млн выходных
Google: Chirp 3

google/chirp-3

Chirp 3 — новейшая многоязычная модель распознавания речи от Google. Она обеспечивает повышенную точность транскрипции для 24 GA языков и 77+ языков в предварительном доступе, с поддержкой автоматического определения языка, автоматической пунктуации и встроенного шумоподавителя для более чистой обработки аудио.

автор google5 мая 2026 г.1,98 ₽ за минуту
OpenAI: GPT-4o Mini Transcribe

openai/gpt-4o-mini-transcribe

GPT-4o Mini Transcribe — это меньшая и экономичная модель распознавания речи от OpenAI, построенная на аудиовозможностях GPT-4o Mini. Она тарифицируется за токен (вход и выход), что делает её подходящей для высокообъёмных процессов транскрипции, которым выгодна прозрачность оплаты на уровне токенов при более низкой стоимости.

автор openai1 мая 2026 г.154,72 ₽ за 1 млн токенов
OpenAI: Whisper Large V3

openai/whisper-large-v3

Whisper Large V3 — это открытая модель автоматического распознавания речи от OpenAI, которая обеспечивает как транскрибацию аудио, так и перевод. Она поддерживает 99+ языков и принимает распространённые аудиоформаты, включая mp3, mp4, wav, webm, flac и ogg. С 1,550M параметрами модель достигает показателя ошибок в 10.3% слов и хорошо подходит для помехоустойчивой многоязычной транскрибации в сложных условиях. Поддерживается детализация временных меток на уровне слов и сегментов.

автор openai1 мая 2026 г.< 0,01 ₽ за секунду
OpenAI: Whisper Large V3 Turbo

openai/whisper-large-v3-turbo

Whisper Large V3 Turbo — это оптимизированная версия модели распознавания речи OpenAI's Whisper Large V3, разработанная для скорости и экономической эффективности. Она поддерживает транскрипцию на 99+ языках с коэффициентом ошибок в словах 12% и принимает распространённые аудиоформаты, включая mp3, mp4, wav, webm, flac и ogg. Достигает коэффициентов реального времени до 216x, что делает её хорошо подходящей для задач транскрипции, чувствительных к задержке и с высокой пропускной способностью.

автор openai1 мая 2026 г.< 0,01 ₽ за секунду
SpaceXAI: Grok 4.3

x-ai/grok-4.3

Grok 4.3 — это модель рассуждения от SpaceXAI. Она принимает текстовые и графические входные данные и выдает текст, подходит для агентских рабочих процессов, задач следования инструкциям и приложений, требующих высокой фактической точности. Уровень рассуждения можно настроить: отсутствует/низкий/средний/высокий (по умолчанию низкий). Поддерживается контекстное окно в 1 миллионов токенов без ограничения на выходные токены, что делает её хорошо подходящей для анализа длинных документов, глубоких исследований и многоэтапных агентских задач. Цены многоуровневые: запросы, превышающие 200k суммарных токенов, тарифицируются по более высокой ставке.

автор x-ai30 апр. 2026 г.от 154,72 ₽ / 1 млн входныхот 309,44 ₽ / 1 млн выходных
IBM: Granite 4.1 8B

ibm-granite/granite-4.1-8b

Granite 4.1 8B — это плотная языковая модель с архитектурой только декодер, содержащая 8 миллиардов параметров, от компании IBM, входящая в семейство Granite 4.1. Она поддерживает окно контекста в 131K токенов и предназначена для корпоративных задач, включая вызов инструментов, генерацию с дополнением на основе поиска (RAG), генерацию кода с поддержкой заполнения середины (fill-in-the-middle), суммаризацию текста, классификацию и извлечение информации. Модель работает с 12 языками (английский, немецкий, испанский, французский, японский, португальский, арабский, чешский, итальянский, корейский, нидерландский и китайский) и реализует совместимый с OpenAI вызов инструментов. Выпущена под лицензией Apache 2.0.

автор ibm-granite30 апр. 2026 г.6,19 ₽ / 1 млн входных12,38 ₽ / 1 млн выходных
Mistral: Mistral Medium 3.5

mistralai/mistral-medium-3-5

Mistral Medium 3.5 — это плотная модель 128B, следующая инструкциям, от Mistral AI. Она поддерживает текстовые и графические входные данные с текстовым выводом и предназначена для агентных сценариев, программирования и сложных многошаговых рассуждений. Модель особенно сильна в надёжных множественных вызовах инструментов и долгосрочных задачах, обладает контекстным окном на 256K, настраиваемой интенсивностью рассуждений для каждого запроса и собственным визуальным энкодером, который обрабатывает изображения переменного размера и с разным соотношением сторон. Разворачивается самостоятельно всего на четырёх GPUs и доступна с открытыми весами.

автор mistralai30 апр. 2026 г.185,66 ₽ / 1 млн входных928,32 ₽ / 1 млн выходных
Kling: Video v3.0 Pro

kwaivgi/kling-v3.0-pro

Kling v3.0 Pro — это премиальная модель генерации видео от Kuaishou, обеспечивающая более высокое визуальное качество по сравнению со стандартным уровнем. Она поддерживает рабочие процессы «текст в видео» и «изображение в видео», с контролем первого и последнего кадра для точной компоновки сцены. Длительность клипов варьируется от 3 до 15 секунд при соотношениях сторон 16:9, 9:16 или 1:1. Нативную генерацию аудио можно включить как опцию.

автор kwaivgi29 апр. 2026 г.25,99 ₽ за секунду
Kling: Video v3.0 Standard

kwaivgi/kling-v3.0-std

Kling v3.0 Standard — это модель генерации видео от Kuaishou. Она поддерживает рабочие процессы «текст в видео» и «изображение в видео», а также управление по первому и последнему кадру для направленной композиции сцен. Ролики могут длиться от 3 до 15 секунд при соотношениях сторон 16:9, 9:16 или 1:1. Опционально доступна генерация нативного аудио.

автор kwaivgi29 апр. 2026 г.19,49 ₽ за секунду
OpenAI: Whisper 1

openai/whisper-1

Whisper — это модель автоматического распознавания речи с открытым исходным кодом от OpenAI, доступная через API как whisper-1. Она поддерживает транскрипцию и перевод для 50+ языков из аудиофайлов размером до 25 MB. Принимает форматы, включая mp3, mp4, wav и webm. Цена рассчитывается за минуту аудиодлительности, с округлением до ближайшей секунды.

автор openai27 апр. 2026 г.0,74 ₽ за минуту
OpenAI: GPT-4o Transcribe

openai/gpt-4o-transcribe

GPT-4o Transcribe — это высококачественная модель распознавания речи от OpenAI, построенная на аудио-возможностях GPT-4o. Она тарифицируется за токен (вход и выход), что делает её подходящей для рабочих процессов, которые выигрывают от прозрачности биллинга на уровне токенов.

автор openai27 апр. 2026 г.309,44 ₽ за 1 млн токенов
Anthropic Claude Haiku Latest

~anthropic/claude-haiku-latest

Эта модель всегда перенаправляет на последнюю модель в семействе Anthropic Claude Haiku.

автор ~anthropic27 апр. 2026 г.123,78 ₽ / 1 млн входных618,88 ₽ / 1 млн выходных
OpenAI GPT Mini Latest

~openai/gpt-mini-latest

Эта модель всегда перенаправляет на последнюю модель в семействе OpenAI GPT Mini.

автор ~openai27 апр. 2026 г.92,83 ₽ / 1 млн входных556,99 ₽ / 1 млн выходных
Google Gemini Pro Latest

~google/gemini-pro-latest

Эта модель всегда перенаправляет на последнюю модель в семействе Google Gemini Pro.

автор ~google27 апр. 2026 г.от 123,78 ₽ / 1 млн входныхот 742,65 ₽ / 1 млн выходных
MoonshotAI Kimi Latest

~moonshotai/kimi-latest

Эта модель всегда перенаправляет на последнюю модель в семействе MoonshotAI Kimi.

автор ~moonshotai27 апр. 2026 г.371,33 ₽ / 1 млн входных1 856,63 ₽ / 1 млн выходных
Google Gemini Flash Latest

~google/gemini-flash-latest

Эта модель всегда перенаправляет на самую последнюю модель в семействе Google Gemini Flash.

автор ~google27 апр. 2026 г.92,83 ₽ / 1 млн входных464,16 ₽ / 1 млн выходных
Anthropic Claude Sonnet Latest

~anthropic/claude-sonnet-latest

Эта модель всегда перенаправляет на последнюю модель семейства Anthropic Claude Sonnet.

автор ~anthropic27 апр. 2026 г.247,55 ₽ / 1 млн входных1 237,76 ₽ / 1 млн выходных
OpenAI GPT Latest

~openai/gpt-latest

Эта модель всегда перенаправляет на последнюю модель в семействе OpenAI GPT.

автор ~openai27 апр. 2026 г.от 123,78 ₽ / 1 млн входныхот 618,88 ₽ / 1 млн выходных
Qwen: Qwen3.5 Plus 2026-04-20

qwen/qwen3.5-plus-20260420

Qwen3.5 Plus (апрель 2026) — это крупномасштабная мультимодальная языковая модель от Alibaba. Она принимает текст, изображения и видео на входе и генерирует текстовый вывод с контекстным окном в 1M токенов. Это обновлённая версия Qwen3.5 Plus с многоуровневым ценообразованием: стоимость зависит от количества токенов, превышающего 256K.

автор qwen27 апр. 2026 г.от 37,13 ₽ / 1 млн входныхот 222,80 ₽ / 1 млн выходных
Qwen: Qwen3.6 Flash

qwen/qwen3.6-flash

Qwen3.6 Flash — это быстрая и эффективная языковая модель из серии Alibaba Qwen 3.6. Она поддерживает ввод текста, изображений и видео с контекстным окном в 1M токенов. Начиная с 256K токенов действует многоуровневое ценообразование. Поддерживается кэширование подсказок, включая тарификацию как за явное чтение кэша, так и за его создание.

автор qwen27 апр. 2026 г.от 23,21 ₽ / 1 млн входныхот 139,25 ₽ / 1 млн выходных
Qwen: Qwen3.6 35B A3B

qwen/qwen3.6-35b-a3b

Qwen3.6-35B-A3B — это мультимодальная модель с открытыми весами от Alibaba Cloud с 35 миллиардами параметров суммарно и 3 миллиардами активных параметров на токен. Она использует гибридную разреженную архитектуру смеси экспертов, сочетающую гейтированное линейное внимание DeltaNet со стандартными гейтированными слоями внимания, что обеспечивает эффективный инференс за небольшую долю вычислительных затрат. Модель поддерживает нативное окно контекста на 262K токенов (расширяемое до 1M с помощью YaRN) и принимает текстовые, графические и видеовходные данные. В неё встроен режим размышления с сохранением следов рассуждений в многоходовых беседах, вызов функций и структурированный вывод. Модель выпущена под лицензией Apache 2.0.

автор qwen27 апр. 2026 г.12,38 ₽ / 1 млн входных111,40 ₽ / 1 млн выходных
Qwen: Qwen3.6 Max Preview

qwen/qwen3.6-max-preview

Qwen3.6-Max-Preview — это проприетарная передовая модель от Alibaba Cloud, построенная на разреженной архитектуре смеси экспертов с примерно 1 триллионами параметров. Она оптимизирована для агентного программирования, использования инструментов и рассуждений в длинном контексте, поддерживая окно контекста в 262K токенов. Модель включает встроенный режим мышления, который сохраняет цепочки рассуждений в многоходовых диалогах, и поддерживает структурированный вывод и вызов функций. Доступ предоставляется исключительно через Alibaba Cloud Model Studio и Qwen Studio APIs; открытые веса не предоставляются.

автор qwen27 апр. 2026 г.от 127,12 ₽ / 1 млн входныхот 762,70 ₽ / 1 млн выходных
Qwen: Qwen3.6 27B

qwen/qwen3.6-27b

Qwen3.6 27B — это плотная языковая модель с 27 миллиардами параметров от команды Qwen в Alibaba, выпущенная в апреле 2026. Она обладает гибридными мультимодальными возможностями — принимает текстовые, графические и видео входные данные — и поддерживает контекстное окно на 262,144 токенов. Модель предназначена для агентных задач кодирования и рассуждений, с особой силой в понимании кода на уровне репозитория, рабочих процессах фронтенд-разработки и многошаговом решении проблем. Она включает встроенный режим мышления для расширенного рассуждения и сохраняет контекст мышления в истории разговора. Qwen3.6 27B поддерживает 201 языков и диалектов и выпущена под лицензией Apache 2.0.

автор qwen27 апр. 2026 г.74,27 ₽ / 1 млн входных445,59 ₽ / 1 млн выходных
OpenAI: GPT-5.5 Pro

openai/gpt-5.5-pro

GPT-5.5 Pro — это высокопроизводительная модель OpenAI, оптимизированная для глубокого рассуждения и точности в решении сложных задач с высокой ответственностью. Она оснащена контекстным окном на 1M+ токенов (вход — 922K, выход — 128K) и поддерживает ввод текста и изображений. Модель предназначена для долгосрочного решения проблем, агентного программирования и точного выполнения многошаговых рабочих процессов.

автор openai24 апр. 2026 г.от 3 713,27 ₽ / 1 млн входныхот 22 279,60 ₽ / 1 млн выходных
OpenAI: GPT-5.5

openai/gpt-5.5

GPT-5.5 — это фронтирная модель от OpenAI, разработанная для сложных профессиональных задач, развивающаяся на основе GPT-5.4 с более сильными рассуждениями, повышенной надёжностью и улучшенной эффективностью токенов на сложных задачах. Она оснащена контекстным окном размером 1M+ токенов (922K на вход, 128K на выход) с поддержкой текстовых и графических входных данных, что обеспечивает масштабные рассуждения, программирование и мультимодальные рабочие процессы в одной системе.

автор openai24 апр. 2026 г.от 618,88 ₽ / 1 млн входныхот 3 713,27 ₽ / 1 млн выходных
DeepSeek: DeepSeek V4 Pro 0423

deepseek/deepseek-v4-pro

DeepSeek V4 Pro — это крупномасштабная модель смеси экспертов от DeepSeek с общим количеством параметров 1.6T и активными параметрами 49B, поддерживающая контекстное окно в 1M токенов. Модель предназначена для сложных задач рассуждения, программирования и длительных агентных сценариев, демонстрируя высокую производительность в области знаний, математики и программной инженерии. Основанная на той же архитектуре, что и DeepSeek V4 Flash, она использует гибридную систему внимания для эффективной обработки длинных контекстов. Поддерживаются уровни рассуждения high и xhigh; xhigh соответствует максимальному режиму рассуждения. Модель хорошо подходит для ресурсоёмких задач, таких как анализ всего кодового репозитория, многошаговая автоматизация и крупномасштабный синтез информации, где критически важны как производительность, так и эффективность.

автор deepseek24 апр. 2026 г.129,75 ₽ / 1 млн входных259,49 ₽ / 1 млн выходных
DeepSeek: DeepSeek V4 Flash 0423

deepseek/deepseek-v4-flash

DeepSeek V4 Flash — это оптимизированная по эффективности модель Mixture-of-Experts от DeepSeek с 284B общим количеством параметров и 13B активируемых параметров, поддерживающая контекстное окно в 1M токенов. Она предназначена для быстрого вывода и высокопроизводительных рабочих нагрузок, сохраняя при этом высокую производительность в рассуждениях и написании кода. Модель включает гибридное внимание для эффективной обработки длинного контекста. Поддерживаются режимы рассуждений high и xhigh; xhigh соответствует максимальному режиму рассуждений. Она хорошо подходит для таких приложений, как ассистенты программирования, чат-системы и агентные рабочие процессы, где важны отзывчивость и экономическая эффективность.

автор deepseek24 апр. 2026 г.10,40 ₽ / 1 млн входных20,79 ₽ / 1 млн выходных
Google: Gemini 3.1 Flash TTS Preview

google/gemini-3.1-flash-tts-preview

Gemini 3.1 Flash TTS Preview — это модель преобразования текста в речь от Google, и значительный шаг вперед по сравнению с Gemini 2.5 Flash TTS. Она принимает текстовый ввод и создает аудиовыход на 70+ языках — почти в 3× больше языков, чем у ее предшественницы. Главное дополнение — это система из 200+ встроенных аудиотегов (например, [whispers], [laughs], [excited]), которые позволяют разработчикам управлять подачей, эмоциями и темпом прямо в середине предложения, а также рабочий процесс «режиссерского кресла» в студии Google AI для определения аудиопрофилей для каждого персонажа и контекста сцены. Она поддерживает до двух говорящих с независимой настройкой голоса и стиля для каждого, выводит аудио PCM в формате 24 kHz / 16-бит моно и автоматически добавляет водяной знак SynthID ко всем выходам. Окно контекста — 32k токенов.

автор google24 апр. 2026 г.2 475,51 ₽ за 1 млн аудиотокенов
Google: Veo 3.1 Fast

google/veo-3.1-fast

Модель генерации видео среднего уровня от Google, сочетающая скорость и качество. Veo 3.1 Fast генерирует высококачественное видео по текстовым или графическим запросам с синхронизированным звуком, обеспечивая более быструю выдачу результата, чем Veo 3.1, при более низкой стоимости. Поддерживает управление по первому и последнему кадру, несколько разрешений и соотношений сторон, а также нанесение водяных знаков SynthID.

автор google24 апр. 2026 г.от 16,50 ₽ за секунду
Canopy Labs: Orpheus 3B

canopylabs/orpheus-3b-0.1-ft

Orpheus 3B — это англоязычная модель синтеза речи от Canopy Labs, тонко настроенная для естественной просодии и выразительного озвучивания. Она предлагает 7 предустановленных голосов и подходит для озвучивания повествований, голосовых ассистентов и интерактивных приложений, где приоритетом является естественность речи.

автор canopylabs23 апр. 2026 г.866,43 ₽ за 1 млн символов
Sesame: CSM 1B

sesame/csm-1b

CSM 1B — это разговорная речевая модель от Sesame. Она принимает текстовый ввод и генерирует англоязычную речь, с вариантами голоса, охватывающими разговорный и чтение-речевой стили. При 1B параметрах она подходит для приложений, ориентированных на диалог, таких как голосовые ассистенты и интерактивные агенты.

автор sesame23 апр. 2026 г.866,43 ₽ за 1 млн символов
hexgrad: Kokoro 82M

hexgrad/kokoro-82m

Kokoro 82M — это легковесная модель синтеза речи с открытыми весами от hexgrad. Она преобразует текст в речь на 8 языках (американский и британский английский, испанский, французский, хинди, итальянский, японский, португальский и китайский) с использованием 54 предустановленных голосов, сгруппированных по языку и полу. При 82M параметрах она хорошо подходит для многоязычных TTS развертываний, где важны компактность и эффективность затрат.

автор hexgrad23 апр. 2026 г.76,74 ₽ за 1 млн символов
Google: Veo 3.1 Lite

google/veo-3.1-lite

Наиболее экономически эффективная модель генерации видео от Google, предназначенная для высоконагруженных приложений и быстрой итерации. Veo 3.1 Lite генерирует видео разрешением 720p и 1080p по текстовым или графическим промптам со встроенным синхронизированным звуком менее чем за 50% стоимости Veo 3.1 Fast. Поддерживает клипы длительностью 4–8 секунд в альбомном (16:9) и портретном (9:16) форматах, с водяным знаком SynthID. Идеально подходит для контентных платформ, создания коротких видео и автоматизированной генерации медиа.

автор google23 апр. 2026 г.от 7,74 ₽ за секунду
Tencent: Hy3 preview

tencent/hy3-preview

Hy3 preview — это высокоэффективная модель смеси экспертов от Tencent, предназначенная для агентных рабочих процессов и производственного использования. Она поддерживает настраиваемые уровни рассуждения в режимах «отключено», «низкий» и «высокий», что позволяет балансировать между скоростью и глубиной в зависимости от задачи, обеспечивая при этом высокое качество генерации кода и надёжную работу в многошаговых реальных сценариях.

автор tencent22 апр. 2026 г.22,28 ₽ / 1 млн входных74,27 ₽ / 1 млн выходных
Xiaomi: MiMo-V2.5-Pro

xiaomi/mimo-v2.5-pro

MiMo-V2.5-Pro — флагманская модель Xiaomi, обеспечивающая высокую производительность в общих агентных возможностях, сложной программной инженерии и задачах с длинным горизонтом планирования, занимая верхние строчки в бенчмарках, таких как ClawEval, GDPVal и SWE-bench Pro. Модель способна независимо и автономно выполнять профессиональные задачи, на которые у экспертов-людей ушли бы дни или недели, задействуя более тысячи вызовов инструментов. Длина контекста до 1M делает её хорошо подходящей для интеграции с широким спектром агентных фреймворков.

автор xiaomi22 апр. 2026 г.138,06 ₽ / 1 млн входных276,11 ₽ / 1 млн выходных
Xiaomi: MiMo-V2.5

xiaomi/mimo-v2.5

MiMo-V2.5 — это нативная омнимодальная модель от Xiaomi. Она обеспечивает производительность агентного уровня Pro примерно при вдвое меньших затратах на инференс, превосходя MiMo-V2-Omni в мультимодальном восприятии при решении задач понимания изображений и видео. Её контекстное окно 1M поддерживает полные документы, протяжённые диалоги и сложные контексты задач за один проход, что делает её идеальной для интеграции с агентными фреймворками, где важны сильные рассуждения, богатое восприятие и экономическая эффективность.

автор xiaomi22 апр. 2026 г.17,33 ₽ / 1 млн входных34,66 ₽ / 1 млн выходных
OpenAI: GPT-5.4 Image 2

openai/gpt-5.4-image-2

GPT-5.4 Image 2 объединяет модель GPT-5.4 от OpenAI с передовыми возможностями генерации изображений от GPT Image 2. Это обеспечивает богатые мультимодальные рабочие процессы, позволяя пользователям беспрепятственно переключаться между рассуждением, программированием и генерацией изображений в рамках одного взаимодействия.

автор openai21 апр. 2026 г.3 713,27 ₽ за 1 млн токенов
Anthropic: Claude Opus Latest

~anthropic/claude-opus-latest

Эта модель всегда перенаправляет на последнюю модель семейства Claude Opus.

автор ~anthropic21 апр. 2026 г.618,88 ₽ / 1 млн входных3 094,39 ₽ / 1 млн выходных
Kling: Video O1

kwaivgi/kling-video-o1

Kling Video O1 — это модель генерации видео от Kuaishou. Она поддерживает ввод текста и изображений с выводом видео, что позволяет использовать сценарии «текст-в-видео» и «изображение-в-видео». Модель подходит для создания кинематографичного контента, обеспечивая контроль над первым и последним кадрами для точной композиции сцены. Она генерирует клипы длительностью 5 или 10 секунд с соотношениями сторон 16:9, 9:16 или 1:1.

автор kwaivgi20 апр. 2026 г.17,33 ₽ за секунду
MiniMax: Hailuo 2.3

minimax/hailuo-2.3

Hailuo 2.3 — это модель генерации видео от MiniMax. Она принимает текстовые подсказки и референсные изображения на вход и генерирует видео на выходе, поддерживая как сценарии «текст-в-видео», так и «изображение-в-видео». Она подходит для создания креативного контента, генерации кинематографичных сцен и анимации персонажей, с акцентом на реалистичное движение и выразительную отрисовку персонажей.

автор minimax20 апр. 2026 г.12,64 ₽ за секунду
MoonshotAI: Kimi K2.6

moonshotai/kimi-k2.6

Kimi K2.6 — это мультимодальная модель следующего поколения от Moonshot AI, предназначенная для долгосрочного программирования, генерации UI/UX на основе кода и мультиагентной оркестрации. Она справляется со сложными сквозными задачами программирования на Python, Rust и Go, а также может преобразовывать промпты и визуальные входные данные в готовые к эксплуатации интерфейсы. Её архитектура роя агентов масштабируется до сотен параллельных субагентов для автономной декомпозиции задач — создавая документы, веб-сайты и электронные таблицы за один запуск без участия человека.

автор moonshotai20 апр. 2026 г.117,59 ₽ / 1 млн входных495,10 ₽ / 1 млн выходных
Mistral: Voxtral Mini TTS

mistralai/voxtral-mini-tts-2603

Voxtral Mini TTS — это модель преобразования текста в речь от Mistral, поддерживающая клонирование голоса без обучения (zero-shot) и многоязычность. Она преобразует текстовый ввод в естественно звучащий аудиовыход.

автор mistralai19 апр. 2026 г.1 980,41 ₽ за 1 млн символов
Google: Gemini Embedding 2 Preview

google/gemini-embedding-2-preview

Gemini Embedding 2 Preview — первая мультимодальная модель встраивания от Google. В настоящее время мы поддерживаем сопоставление текста и изображений в едином векторном пространстве для семантического поиска и поисковой дополненной генерации (RAG). Она поддерживает входной контекст до 8,192 токенов и гибкие размеры выходных векторов от 128 до 3,072 (рекомендуется: 768, 1536 или 3,072). Разработана для кросс-модального сходства — вы можете встроить текстовый запрос и получить наиболее релевантные изображения или наоборот, — что делает её хорошо подходящей для мультимодального поиска, рекомендаций и конвейеров понимания документов.

автор google17 апр. 2026 г.24,76 ₽ за 1 млн токенов
Anthropic: Claude Opus 4.7

anthropic/claude-opus-4.7

Opus 4.7 — это следующее поколение семейства Anthropic's Opus, созданное для долгоиграющих асинхронных агентов. Опираясь на сильные стороны кодирования и агентности Opus 4.6, оно обеспечивает более высокую производительность в сложных многошаговых задачах и более надежное агентное выполнение в расширенных рабочих процессах. Особенно эффективно для асинхронных агентных конвейеров, где задачи разворачиваются во времени — большие кодовые базы, многоэтапная отладка и сквозная оркестрация проектов. Помимо кодирования, Opus 4.7 расширяет возможности интеллектуальной работы — от составления документов и создания презентаций до анализа данных. Он поддерживает согласованность в очень длинных выводах и длительных сессиях, что делает его надежным выбором по умолчанию для задач, требующих настойчивости, суждения и доведения до конца. Для пользователей, переходящих с более ранних версий Opus, см. официальное руководство по миграции здесь.

автор anthropic16 апр. 2026 г.618,88 ₽ / 1 млн входных3 094,39 ₽ / 1 млн выходных
Alibaba: Wan 2.7

alibaba/wan-2.7

Wan 2.7 — это модель генерации видео от Alibaba. Она поддерживает генерацию видео по тексту, по изображению с управлением первым и последним кадром, а также по референсам, где несколько референсных изображений задают стиль и содержание генерируемой сцены.

автор alibaba15 апр. 2026 г.15,47 ₽ за секунду
ByteDance: Seedance 2.0

bytedance/seedance-2.0

Seedance 2.0 — это модель генерации видео от ByteDance. Она поддерживает генерацию видео из текста, из изображения с контролем первого и последнего кадра, а также мультимодальную генерацию по референсу. Она особенно сильна в сохранении согласованности персонажа, визуального стиля и движения камеры из референсного материала. Количество токенов вычисляется по формуле (высота выходного видео ширина выходного видео длительность * 24) / 1024.

автор bytedance15 апр. 2026 г.от 10,41 ₽ за секунду
ByteDance: Seedance 2.0 Fast

bytedance/seedance-2.0-fast

Seedance 2.0 Fast — это модель генерации видео от ByteDance. Она поддерживает преобразование текста в видео, изображения в видео с управлением первым и последним кадром, а также мультимодальное преобразование референса в видео. Она ставит приоритет на скорость генерации и низкую стоимость, а не на максимальное качество вывода. Количество токенов определяется как (высота выходного видео ширина выходного видео длительность * 24) / 1024

автор bytedance15 апр. 2026 г.от 6,24 ₽ за секунду
Z.ai: GLM 5.1

z-ai/glm-5.1

GLM-5.1 обеспечивает значительный скачок в возможностях программирования, особенно заметный при работе с долгосрочными задачами. В отличие от предыдущих моделей, ориентированных на взаимодействие в масштабе минут, GLM-5.1 может работать независимо и непрерывно над одной задачей в течение более чем 8 часов, автономно планируя, выполняя и улучшая себя в процессе, в конечном итоге предоставляя полные результаты инженерного уровня.

автор z-ai7 апр. 2026 г.119,57 ₽ / 1 млн входных375,78 ₽ / 1 млн выходных
Cohere: Rerank 4 Pro

cohere/rerank-4-pro

Поисковая фундаментальная модель AI от Cohere для повышения релевантности информации, отображаемой в поисковых и RAG-системах. Отличается контекстным окном 32K, многоязычной поддержкой более чем 100+ языков, отсутствием необходимости предварительной обработки данных, а также передовой производительностью с низкой задержкой.

автор cohere6 апр. 2026 г.0,31 ₽ за поиск
Cohere: Rerank 4 Fast

cohere/rerank-4-fast

Поисковая фундаментальная модель AI от Cohere для повышения релевантности информации, отображаемой в поисковых и RAG-системах. Отличается контекстным окном 32K, многоязычной поддержкой на 100+ языках, отсутствием необходимости предварительной обработки данных и высокой производительностью с минимальной задержкой.

автор cohere6 апр. 2026 г.0,25 ₽ за поиск
Cohere: Rerank v3.5

cohere/rerank-v3.5

Rerank v3.5 предназначена для переупорядочивания результатов поиска с целью повышения релевантности. Поддерживает реранжирование мультиаспектных и полуструктурированных данных на 100+ языках. Идеально подходит для уточнения результатов пайплайнов семантического или ключевого поиска.

автор cohere5 апр. 2026 г.0,12 ₽ за поиск
Google: Gemma 4 26B A4B

google/gemma-4-26b-a4b-it

Gemma 4 26B A4B IT — это модель Mixture-of-Experts (MoE) с инструкционной настройкой от Google DeepMind. Несмотря на 25.2B общих параметров, во время инференса активируется только 3.8B на токен, что обеспечивает качество, близкое к -31B, при доле вычислительных затрат. Поддерживает мультимодальный ввод, включая текст, изображения и видео (до 60 секунд при 1fps). Имеет контекстное окно в 256K токенов, встроенный вызов функций, настраиваемый режим мышления/рассуждения и поддержку структурированного вывода. Выпущена под лицензией Apache 2.0.

автор google3 апр. 2026 г.8,66 ₽ / 1 млн входных42,08 ₽ / 1 млн выходных
Google: Gemma 4 31B

google/gemma-4-31b-it

Gemma 4 31B Instruct — это 30.7B плотная мультимодальная модель Google DeepMind, поддерживающая ввод текста и изображений с выводом текста. Она имеет контекстное окно размером 256K токенов, настраиваемый режим мышления/рассуждений, встроенный вызов функций и многоязычную поддержку для 140+ языков. Сильна в задачах программирования, рассуждений и понимания документов. Лицензия Apache 2.0.

автор google2 апр. 2026 г.11,14 ₽ / 1 млн входных42,08 ₽ / 1 млн выходных
Qwen: Qwen3.6 Plus

qwen/qwen3.6-plus

Qwen 3.6 Plus построена на гибридной архитектуре, сочетающей эффективное линейное внимание с маршрутизацией разреженных смесей экспертов, что обеспечивает высокую масштабируемость и высокопроизводительный вывод. По сравнению с серией 3.5 она обеспечивает значительные улучшения в агентном кодировании, фронтенд-разработке и общем рассуждении, а также значительно улучшенный опыт «вайб-кодинга». Модель превосходно справляется со сложными задачами, такими как 3D-сцены, игры и решение проблем на уровне репозитория, достигая оценки 78.8 на SWE-bench Verified. Она представляет собой значительный скачок как в чисто текстовых, так и в мультимодальных возможностях, работая на уровне ведущих современных моделей.

автор qwen2 апр. 2026 г.от 40,23 ₽ / 1 млн входныхот 241,36 ₽ / 1 млн выходных
Z.ai: GLM 5V Turbo

z-ai/glm-5v-turbo

GLM-5V-Turbo — первая нативная мультимодальная агентная фундаментальная модель Z.ai, созданная для задач визуального программирования и управления агентами. Она нативно обрабатывает изображения, видео и текстовые входные данные, превосходно справляется с долгосрочным планированием, сложным программированием и выполнением задач, а также бесшовно работает с агентами, замыкая полный цикл «восприятие → планирование → выполнение».

автор z-ai1 апр. 2026 г.148,53 ₽ / 1 млн входных495,10 ₽ / 1 млн выходных
Arcee AI: Trinity Large Thinking

arcee-ai/trinity-large-thinking

Trinity Large Thinking — это мощная открытая модель рассуждений от команды Arcee AI. Она показывает высокую производительность в PinchBench, агентных нагрузках и задачах на рассуждение. Видео запуска: https://youtu.be/Gc82AXLa0Rg?si=4RLn6WBz33qT--B7 Эта модель оптимизирована для агентных рабочих процессов и показывает наилучшие результаты при сохранении рассуждений (так называемое перемежающееся мышление). Узнайте, как сохранять рассуждения, в нашей документации: https://openrouter.ai/docs/guides/best-practices/reasoning-tokens#preserving-reasoning

автор arcee-ai1 апр. 2026 г.30,94 ₽ / 1 млн входных99,02 ₽ / 1 млн выходных
SpaceXAI: Grok 4.20 Multi-Agent

x-ai/grok-4.20-multi-agent

Grok 4.20 Multi-Agent — это вариант Grok 4.20 от SpaceXAI, предназначенный для совместных агентных рабочих процессов. Несколько агентов работают параллельно, чтобы проводить глубокое исследование, координировать использование инструментов и синтезировать информацию при решении сложных задач. Поведение уровня усилий рассуждения: low / medium: агенты 4 high / xhigh: агенты 16

автор x-ai31 мар. 2026 г.от 154,72 ₽ / 1 млн входныхот 309,44 ₽ / 1 млн выходных
SpaceXAI: Grok 4.20

x-ai/grok-4.20

Grok 4.20 — это модель рассуждения от SpaceXAI с ведущей в отрасли скоростью и возможностями агентного вызова инструментов. Она сочетает самый низкий на рынке уровень галлюцинаций со строгим следованием инструкциям, обеспечивая стабильно точные и правдивые ответы. Рассуждение можно включить/отключить с помощью параметра reasoning enabled в API. Подробнее в нашей документации

автор x-ai31 мар. 2026 г.от 154,72 ₽ / 1 млн входныхот 309,44 ₽ / 1 млн выходных
Google: Lyria 3 Pro Preview

google/lyria-3-pro-preview

Полные песни оцениваются в $0.08 за песню. Lyria 3 — это семейство моделей генерации музыки от Google, доступное через Gemini API. С помощью Lyria 3 вы можете создавать высококачественное стереоаудио с частотой 48кГц на основе текстовых подсказок или изображений. Эти модели обеспечивают структурную целостность, включая вокал, синхронизированные по времени тексты песен и полные инструментальные аранжировки. Lyria 3 Pro могут генерировать полноформатные песни с куплетами, припевами и бриджами.

автор google30 мар. 2026 г.9,90 ₽ за песню
Google: Lyria 3 Clip Preview

google/lyria-3-clip-preview

Клипы длительностью 30 секунд стоят $0.04 за клип. Lyria 3 — это семейство моделей генерации музыки от Google, доступное через Gemini API. С помощью Lyria 3 вы можете создавать высококачественное стереоаудио с частотой 48 кГц из текстовых подсказок или изображений. Эти модели обеспечивают структурную целостность, включая вокал, синхронизированные тексты песен и полные инструментальные аранжировки. Lyria 3 Clip могут генерировать короткие клипы, лупы, превью.

автор google30 мар. 2026 г.4,95 ₽ за песню
Alibaba: Wan 2.6

alibaba/wan-2.6

Alibaba's most advanced video generation model, supporting over 10 visual creation capabilities in a unified system. Wan 2.6 generates 1080p video at 24fps from text, images, reference videos, or audio, with native audio-visual synchronization and precise lip-sync. Key features include reference-to-video (insert a character's appearance and voice into new scenes), multi-shot storytelling from simple prompts, synchronized sound effects and music, and support for 16:9, 9:16, and 1:1 aspect ratios with clips up to 15 seconds.

автор alibaba28 мар. 2026 г.от 6,19 ₽ за секунду
Kwaipilot: KAT-Coder-Pro V2

kwaipilot/kat-coder-pro-v2

KAT-Coder-Pro V2 — это последняя высокопроизводительная модель в серии KwaiKAT KAT-Coder, предназначенная для сложной корпоративной разработки программного обеспечения и интеграции с SaaS. Она опирается на сильные стороны агентного кодирования предыдущих версий, с акцентом на крупномасштабные производственные среды, координацию множества систем и бесшовную интеграцию с современными программными стеками, а также поддерживает генерацию веб-эстетики для создания производственных лендингов и презентаций.

автор kwaipilot27 мар. 2026 г.37,13 ₽ / 1 млн входных148,53 ₽ / 1 млн выходных
ByteDance: Seedance 1.5 Pro

bytedance/seedance-1-5-pro

ByteDance — аудиовизуальная генеративная модель следующего поколения с архитектурой Dual-Branch Diffusion Transformer на 4.5B параметров. Seedance 1.5 Pro генерирует видео и аудио одновременно за один единый проход — это устраняет проблемы синхронизации при последовательном озвучивании. Поддерживает многоязычную синхронизацию губ (английский, мандаринский, японский, корейский, испанский и другие), кинематографическое управление камерой (панорамирование, наклон, масштабирование, орбитальное движение), диалоги нескольких персонажей и согласованность персонажей между кадрами. Pro создаёт клипы длительностью от 4 до 12 секунд с разрешением до 1080p. Количество токенов вычисляется по формуле: (высота выходного видео ширина выходного видео длительность * 24) / 1024

автор bytedance23 мар. 2026 г.от 3,57 ₽ за секунду
OpenAI: Sora 2 Pro

openai/sora-2-pro

OpenAI — флагманская модель генерации видео, создающая производственное видео с физически точным движением, синхронизированным аудио и сохранением состояния мира между кадрами. Sora 2 Pro следует сложным многосценным инструкциям, сохраняя согласованные пространственные соотношения — объекты не исчезают и не меняют форму между кадрами. Поддерживает преобразование текста в видео и изображения в видео, с синхронизированными фоновыми звуковыми ландшафтами, речью и звуковыми эффектами. Включает расширенную безопасность контента с метаданными происхождения C2PA и водяными знаками в стиле SynthID.

автор openai23 мар. 2026 г.от 37,13 ₽ за секунду
Google: Veo 3.1

google/veo-3.1

Google — это передовая модель генерации видео, созданная для максимальной визуальной точности в финальных производственных версиях. Veo 3.1 генерирует высококачественное видео разрешением 1080p из текстовых или графических подсказок с нативным синхронизированным звуком — включая диалоги, эффекты окружения и фоновые звуки. Поддерживает расширение сцен (до 20 связанных клипов для повествований длительностью 140+ секунд), переходы между двумя изображениями, вертикальное видео для Shorts и апскейлинг 4K.

автор google23 мар. 2026 г.от 49,51 ₽ за секунду
Reka Edge

rekaai/reka-edge

Reka Edge — это чрезвычайно эффективная мультимодальная модель 7B, которая принимает изображения, видео и текст на входе и генерирует текстовые ответы. Модель оптимизирована специально для достижения ведущих в отрасли результатов в области понимания изображений, анализа видео, обнаружения объектов и использования инструментов агентами.

автор rekaai20 мар. 2026 г.12,38 ₽ / 1 млн входных12,38 ₽ / 1 млн выходных
MiniMax: MiniMax M2.7

minimax/minimax-m2.7

MiniMax-M2.7 — это большая языковая модель нового поколения, предназначенная для автономной продуктивности в реальных условиях и постоянного совершенствования. Созданная для активного участия в собственной эволюции, M2.7 интегрирует передовые агентные возможности благодаря мультиагентному взаимодействию, что позволяет ей планировать, выполнять и уточнять сложные задачи в динамических средах. Обученная для работы на производственном уровне, M2.7 справляется с такими задачами, как живая отладка, анализ первопричин, финансовое моделирование и полная генерация документов в Word, Excel и PowerPoint. Она показывает высокие результаты на тестах, включая 56.2% на SWE-Pro и 57.0% на Terminal Bench 2, а также достигает 1495 ELO на GDPval-AA, устанавливая новый стандарт для мультиагентных систем, работающих в реальных цифровых процессах.

автор minimax18 мар. 2026 г.37,13 ₽ / 1 млн входных148,53 ₽ / 1 млн выходных
OpenAI: GPT-5.4 Nano

openai/gpt-5.4-nano

GPT-5.4 nano — самый легковесный и экономичный вариант семейства GPT-5.4, оптимизированный для задач, критичных к скорости и большим объёмам. Он поддерживает ввод текста и изображений и предназначен для сценариев с низкой задержкой, таких как классификация, извлечение данных, ранжирование и выполнение субагентов. Модель ставит приоритет на отзывчивость и эффективность, а не на глубокое рассуждение, что делает её идеальной для конвейеров, требующих быстрых и надёжных результатов в масштабе. GPT-5.4 nano хорошо подходит для фоновых задач, систем реального времени и распределённых агентных архитектур, где минимизация затрат и задержек критически важна.

автор openai17 мар. 2026 г.24,76 ₽ / 1 млн входных154,72 ₽ / 1 млн выходных
OpenAI: GPT-5.4 Mini

openai/gpt-5.4-mini

GPT-5.4 mini переносит основные возможности GPT-5.4 в более быструю и эффективную модель, оптимизированную для высоконагруженных рабочих нагрузок. Она поддерживает ввод текста и изображений, обеспечивая высокую производительность в рассуждениях, написании кода и использовании инструментов, при этом снижая задержку и стоимость для масштабных развертываний. Модель предназначена для производственных сред, требующих баланса между производительностью и эффективностью, что делает её подходящей для чат-приложений, помощников по программированию и агентских рабочих процессов, работающих в масштабе. GPT-5.4 mini обеспечивает надёжное следование инструкциям, уверенные многошаговые рассуждения и стабильные результаты в различных задачах при улучшенной экономической эффективности.

автор openai17 мар. 2026 г.92,83 ₽ / 1 млн входных556,99 ₽ / 1 млн выходных
Mistral: Mistral Small 4

mistralai/mistral-small-2603

Mistral Small 4 — это следующий крупный релиз в семействе Mistral Small, объединяющий возможности нескольких флагманских моделей Mistral в единую систему. Он сочетает в себе сильные рассуждения от Magistral, мультимодальное понимание от Pixtral и агентные возможности кодирования от Devstral, позволяя одной модели выполнять сложный анализ, разработку программного обеспечения и визуальные задачи в рамках одного рабочего процесса.

автор mistralai16 мар. 2026 г.18,57 ₽ / 1 млн входных74,27 ₽ / 1 млн выходных
Perplexity: Embed V1 4B

perplexity/pplx-embed-v1-4b

pplx-embed-v1 -4B — одна из современных моделей текстовых эмбеддингов Perplexity, созданных для реального веб-масштабного поиска. pplx-embed-v1 оптимизирована для стандартного плотного текстового поиска: модель с 4B параметрами максимизирует качество поиска.

автор perplexity16 мар. 2026 г.3,71 ₽ за 1 млн токенов
Perplexity: Embed V1 0.6B

perplexity/pplx-embed-v1-0.6b

pplx-embed-v1-0.6B — одна из передовых моделей встраивания текста от Perplexity, разработанная для реального поиска в веб-масштабе. pplx-embed-v1 оптимизирована для стандартного плотного текстового поиска с моделью с параметрами 0.6B, ориентированной на лёгкую и низколатентную генерацию встраиваний.

автор perplexity16 мар. 2026 г.0,50 ₽ за 1 млн токенов
Z.ai: GLM 5 Turbo

z-ai/glm-5-turbo

GLM-5 Turbo — это новая модель от Z.ai, предназначенная для быстрого вывода и высокой производительности в средах, управляемых агентами, таких как OpenClaw. Она глубоко оптимизирована для реальных рабочих процессов агентов, включая длинные цепочки выполнения, улучшенную обработку сложных инструкций, декомпозицию задач, использование инструментов, плановое и постоянное выполнение, а также общую стабильность при длительных задачах.

автор z-ai15 мар. 2026 г.148,53 ₽ / 1 млн входных495,10 ₽ / 1 млн выходных
NVIDIA: Nemotron 3 Super

nvidia/nemotron-3-super-120b-a12b

NVIDIA Nemotron 3 Super — это открытая гибридная модель MoE с параметрами 120B, активирующая всего 12B параметров для максимальной вычислительной эффективности и точности в сложных мультиагентных приложениях. Построенная на гибридной архитектуре Mamba-Transformer Mixture-of-Experts с многотокенным предсказанием (MTP), она обеспечивает более чем 50% более высокую генерацию токенов по сравнению с ведущими открытыми моделями. Модель имеет контекстное окно в 1M токенов для долгосрочной когерентности агента, междокументного рассуждения и многошагового планирования задач. Латентный MoE позволяет вызывать 4 экспертов по стоимости вывода только одного, улучшая интеллект и обобщение. Многосредовое обучение RL на 10+ средах обеспечивает ведущую точность на бенчмарках, включая AIME 2025, TerminalBench и SWE-Bench Verified. Полностью открытая с весами, наборами данных и рецептами под открытой лицензией NVIDIA, Nemotron 3 Super позволяет легко настраивать и безопасно развертывать где угодно — от рабочей станции до облака.

автор nvidia11 мар. 2026 г.10,52 ₽ / 1 млн входных49,51 ₽ / 1 млн выходных
ByteDance Seed: Seed-2.0-Lite

bytedance-seed/seed-2.0-lite

Seed-2.0-Lite — это универсальная и экономичная корпоративная рабочая лошадка, которая обеспечивает мощные мультимодальные и агентные возможности при заметно более низкой задержке, что делает её практичным выбором по умолчанию для большинства производственных нагрузок, связанных с текстом, зрением и инструментами. Разработанная для высокочастотного визуального понимания и агентных рабочих процессов, она идеально подходит для масштабного развёртывания с минимальной задержкой.

автор bytedance-seed10 мар. 2026 г.от 30,94 ₽ / 1 млн входныхот 247,55 ₽ / 1 млн выходных
Qwen: Qwen3.5-9B

qwen/qwen3.5-9b

Qwen3.5-9B — это мультимодальная фундаментальная модель из семейства Qwen3.5, разработанная для обеспечения сильных рассуждений, программирования и визуального понимания в эффективной архитектуре с 9B параметрами. Она использует унифицированный дизайн «зрение-язык» с ранним слиянием мультимодальных токенов, что позволяет модели обрабатывать и рассуждать над текстом и изображениями в одном контексте.

автор qwen10 мар. 2026 г.12,38 ₽ / 1 млн входных18,57 ₽ / 1 млн выходных
OpenAI: GPT-5.4 Pro

openai/gpt-5.4-pro

GPT-5.4 Pro — самая современная модель OpenAI, основанная на единой архитектуре GPT-5.4 с улучшенными возможностями рассуждения для сложных задач с высокими ставками. Она имеет контекстное окно на 1M+ токенов (922K на вход, 128K на выход) с поддержкой текстовых и графических входных данных. Оптимизированная для пошаговых рассуждений, следования инструкциям и точности, GPT-5.4 Pro превосходно справляется с агентным программированием, длинными контекстными рабочими процессами и многошаговым решением задач.

автор openai5 мар. 2026 г.от 1 856,63 ₽ / 1 млн входныхот 11 139,80 ₽ / 1 млн выходных
OpenAI: GPT-5.4

openai/gpt-5.4

GPT-5.4 — новейшая фронтирная модель OpenAI, объединяющая линейки Codex и GPT в единую систему. Она поддерживает контекстное окно размером 1M+ токенов (922K на входе, 128K на выходе) с поддержкой текстовых и графических входных данных, что позволяет выполнять рассуждения с большим контекстом, программирование и мультимодальный анализ в рамках одного рабочего процесса. Модель обеспечивает улучшенную производительность в программировании, понимании документов, использовании инструментов и следовании инструкциям. Она разработана как надёжное решение по умолчанию как для задач общего назначения, так и для программной инженерии, способна генерировать производственный код, синтезировать информацию из множества источников и выполнять сложные многошаговые рабочие процессы с меньшим количеством итераций и большей эффективностью использования токенов.

автор openai5 мар. 2026 г.от 154,72 ₽ / 1 млн входныхот 928,32 ₽ / 1 млн выходных
Inception: Mercury 2

inception/mercury-2

Mercury 2 — это чрезвычайно быстрая модель рассуждений LLM и первая диффузионная модель рассуждений LLM (dLLM). Вместо последовательной генерации токенов Mercury 2 создаёт и уточняет несколько токенов параллельно, достигая >1,000 токенов/сек на стандартном GPUs. Mercury 2 работает в 5x+ раз быстрее, чем ведущие оптимизированные по скорости LLMs, такие как Claude 4.5 Haiku и GPT 5 Mini, при значительно меньшей стоимости. Mercury 2 поддерживает настраиваемые уровни рассуждений, контекст 128K, нативное использование инструментов и вывод JSON, соответствующий схеме. Создан для рабочих процессов программирования, где задержки накапливаются, для голосовых/поисковых операций в реальном времени и агентных циклов. Совместим с OpenAI API. Подробнее читайте в блог-посте.

автор inception4 мар. 2026 г.30,94 ₽ / 1 млн входных92,83 ₽ / 1 млн выходных
Google: Gemini 3.1 Flash Lite Preview

google/gemini-3.1-flash-lite-preview

Gemini 3.1 Flash Lite Preview — это высокоэффективная модель Google, оптимизированная для сценариев с большими объёмами использования. Она превосходит Gemini 2.5 Flash Lite по общему качеству и приближается к производительности Gemini 2.5 Flash по ключевым возможностям. Улучшения охватывают аудиовход/ASR, ранжирование фрагментов RAG, перевод, извлечение данных и завершение кода. Поддерживаются все уровни мышления (минимальный, низкий, средний, высокий) для точной настройки соотношения затрат и производительности. Цена составляет половину стоимости Gemini 3 Flash.

автор google3 мар. 2026 г.30,94 ₽ / 1 млн входных185,66 ₽ / 1 млн выходных
ByteDance Seed: Seed-2.0-Mini

bytedance-seed/seed-2.0-mini

Seed-2.0-mini ориентирован на сценарии с высокой чувствительностью к задержке, высокой степенью параллелизма и высокой чувствительностью к стоимости, с акцентом на быстрый ответ и гибкое развертывание инференса. Он обеспечивает производительность, сопоставимую с ByteDance-Seed-1.6, поддерживает контекст 256k, четыре режима усилия рассуждения (минимальный/низкий/средний/высокий), мультимодальное понимание и оптимизирован для легких задач, где приоритет отдается стоимости и скорости.

автор bytedance-seed26 февр. 2026 г.от 12,38 ₽ / 1 млн входныхот 49,51 ₽ / 1 млн выходных
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)

google/gemini-3.1-flash-image-preview

Gemini 3.1 Flash Image Preview, также известная как «Nano Banana 2», — это последняя модель генерации и редактирования изображений уровня state of the art от Google, обеспечивающая визуальное качество уровня Pro при скорости Flash. Она сочетает расширенное контекстное понимание с быстрым и экономичным инференсом, делая сложную генерацию изображений и итеративное редактирование значительно более доступными. Соотношение сторон можно контролировать с помощью параметра image_config API

автор google26 февр. 2026 г.7 426,53 ₽ за 1 млн токенов
Qwen: Qwen3.5-35B-A3B

qwen/qwen3.5-35b-a3b

Серия Qwen3.5 35B-A3B представляет собой нативную визуально-языковую модель, разработанную с гибридной архитектурой, которая объединяет механизмы линейного внимания и разреженную модель смеси экспертов, обеспечивая более высокую эффективность вывода. Её общая производительность сопоставима с производительностью Qwen3.5-27B.

автор qwen25 февр. 2026 г.30,94 ₽ / 1 млн входных154,72 ₽ / 1 млн выходных
Qwen: Qwen3.5-27B

qwen/qwen3.5-27b

Модель Qwen3.5 27B, основанная на плотном vision-language подходе, использует механизм линейного внимания, обеспечивая быструю реакцию при сохранении баланса между скоростью вывода и производительностью. Её общие возможности сопоставимы с характеристиками Qwen3.5-122B-A10B.

автор qwen25 февр. 2026 г.24,14 ₽ / 1 млн входных193,09 ₽ / 1 млн выходных
Qwen: Qwen3.5-122B-A10B

qwen/qwen3.5-122b-a10b

Нативная визуально-языковая модель Qwen3.5 122B-A10B построена на гибридной архитектуре, которая объединяет механизм линейного внимания с разреженной моделью смеси экспертов, обеспечивая более высокую эффективность инференса. По общей производительности эта модель уступает только Qwen3.5-397B-A17B. Её текстовые возможности значительно превосходят возможности Qwen3-235B-2507, а визуальные возможности превосходят Qwen3-VL-235B.

автор qwen25 февр. 2026 г.35,89 ₽ / 1 млн входных297,06 ₽ / 1 млн выходных
Qwen: Qwen3.5-Flash

qwen/qwen3.5-flash-02-23

Нативные визуально-языковые Flash-модели Qwen3.5 построены на гибридной архитектуре, которая объединяет механизм линейного внимания с разреженной моделью смеси экспертов, обеспечивая более высокую эффективность инференса. По сравнению с серией 3 эти модели совершают скачок в производительности как для чисто текстовых, так и для мультимодальных задач, предлагая быстрое время отклика и одновременно балансируя скорость инференса и общую производительность.

автор qwen25 февр. 2026 г.8,05 ₽ / 1 млн входных32,18 ₽ / 1 млн выходных
Google: Gemini 3.1 Pro Preview Custom Tools

google/gemini-3.1-pro-preview-customtools

Gemini 3.1 Pro Preview Custom Tools — это вариант Gemini 3.1 Pro, который улучшает поведение при выборе инструментов, предотвращая чрезмерное использование общего bash-инструмента, когда доступны более эффективные сторонние или пользовательские функции. Эта специализированная предварительная конечная точка значительно повышает надёжность вызова функций и гарантирует, что модель выбирает наиболее подходящий инструмент в программных агентах и сложных многоинструментальных рабочих процессах. Она сохраняет ключевые сильные стороны Gemini 3.1 Pro, включая мультимодальные рассуждения по тексту, изображениям, видео, аудио и коду, контекстное окно на 1M токенов и высокую производительность в разработке программного обеспечения.

автор google25 февр. 2026 г.от 247,55 ₽ / 1 млн входныхот 1 485,31 ₽ / 1 млн выходных
OpenAI: GPT-5.3-Codex

openai/gpt-5.3-codex

GPT-5.3-Codex — это самая продвинутая агентная модель для написания кода от OpenAI, сочетающая передовую производительность в разработке программного обеспечения GPT-5.2-Codex с более широкими возможностями рассуждения и профессиональными знаниями GPT-5.2. Она достигает самых современных результатов на SWE-Bench Pro и высоких показателей в Terminal-Bench 2.0 и OSWorld-Verified, что отражает улучшенное многоязычное программирование, владение терминалом и навыки реального использования компьютера. Модель оптимизирована для длительных рабочих процессов с использованием инструментов и поддерживает интерактивное управление во время выполнения, что делает её подходящей для сложных задач разработки, отладки, развертывания и итеративной работы над продуктом. Помимо программирования, GPT-5.3-Codex показывает высокие результаты на бенчмарках структурированной работы со знаниями, таких как GDPval, поддерживая такие задачи, как составление документов, анализ электронных таблиц, создание слайдов и операционные исследования в различных областях. Она обучена с усиленным вниманием к кибербезопасности, включая возможности выявления уязвимостей, и развернута с дополнительными мерами защиты для случаев высокого риска. По сравнению с предыдущими моделями Codex, она более эффективно использует токены и примерно на 25% быстрее, ориентируясь на профессиональные сквозные рабочие процессы, охватывающие рассуждение, выполнение и взаимодействие с компьютером.

автор openai24 февр. 2026 г.216,61 ₽ / 1 млн входных1 732,86 ₽ / 1 млн выходных
AionLabs: Aion-2.0

aion-labs/aion-2.0

Aion-2.0 — это вариант модели DeepSeek V3.2, оптимизированный для захватывающей ролевой игры и повествования. Она особенно сильна в создании напряжения, кризисов и конфликтов в историях, делая повествование более увлекательным. Кроме того, она обрабатывает зрелые и более тёмные темы с большей нюансировкой и глубиной.

автор aion-labs23 февр. 2026 г.99,02 ₽ / 1 млн входных198,04 ₽ / 1 млн выходных
Google: Gemini 3.1 Pro Preview

google/gemini-3.1-pro-preview

Gemini 3.1 Pro Preview — это флагманская модель рассуждений от Google, обеспечивающая повышенную производительность в разработке ПО, улучшенную надежность агентов и более эффективное использование токенов в сложных рабочих процессах. Опираясь на мультимодальную основу серии Gemini 3, она сочетает высокоточные рассуждения по тексту, изображениям, видео, аудио и коду с контекстным окном на 1M токенов. Детали рассуждений сохраняются при использовании многошаговых вызовов инструментов, см. документацию: https://openrouter.ai/docs/use-cases/reasoning-tokens#preserving-reasoning. Обновление 3.1 обеспечивает измеримые улучшения в бенчмарках SWE и в реальных средах программирования, а также более сильное автономное выполнение задач в структурированных областях, таких как финансы и работа с электронными таблицами. Разработанная для продвинутых систем и агентных архитектур, Gemini 3.1 Pro Preview улучшает долгосрочную стабильность и оркестрацию инструментов, повышая при этом эффективность использования токенов. Она вводит новый средний уровень мышления для лучшего баланса между стоимостью, скоростью и производительностью. Модель отлично справляется с агентным программированием, структурированным планированием, мультимодальным анализом и автоматизацией рабочих процессов, что делает её идеальной для автономных агентов, финансового моделирования, работы с электронными таблицами и корпоративных задач с высоким контекстом.

автор google19 февр. 2026 г.от 123,78 ₽ / 1 млн входныхот 742,65 ₽ / 1 млн выходных
Anthropic: Claude Sonnet 4.6

anthropic/claude-sonnet-4.6

Sonnet 4.6 — это самая производительная модель Sonnet-класса от Anthropic, обеспечивающая передовую производительность в программировании, работе с агентами и профессиональных задачах. Она превосходно подходит для итеративной разработки, навигации по сложным кодовым базам, сквозного управления проектами с памятью, создания качественных документов и уверенного использования компьютера для веб-QA и автоматизации рабочих процессов.

автор anthropic17 февр. 2026 г.371,33 ₽ / 1 млн входных1 856,63 ₽ / 1 млн выходных
Qwen: Qwen3.5 Plus 2026-02-15

qwen/qwen3.5-plus-02-15

Модели Plus нативной серии Qwen3.5 для vision-language построены на гибридной архитектуре, которая объединяет механизмы линейного внимания с разреженными моделями смеси экспертов, достигая более высокой эффективности вывода. В ходе разнообразных оценок задач серия 3.5 стабильно демонстрирует результаты на уровне современных передовых моделей. По сравнению с серией 3, эти модели показывают значительный прогресс как в работе с чистым текстом, так и в мультимодальных возможностях.

автор qwen16 февр. 2026 г.от 32,18 ₽ / 1 млн входныхот 193,09 ₽ / 1 млн выходных
Qwen: Qwen3.5 397B A17B

qwen/qwen3.5-397b-a17b

Серия Qwen3.5 (397B–A17B) — это нативная модель «Vision-Language», построенная на гибридной архитектуре, которая объединяет механизм линейного внимания с разреженной моделью «смесь экспертов», что обеспечивает более высокую эффективность вывода. Она демонстрирует производительность, сопоставимую с ведущими современными моделями, в широком спектре задач: понимание языка, логические рассуждения, генерация кода, агентные сценарии, понимание изображений и видео, а также взаимодействие с графическими интерфейсами (GUI). Благодаря развитым возможностям генерации кода и агентному подходу модель показывает высокую обобщающую способность в разнообразных прикладных областях.

автор qwen16 февр. 2026 г.48,27 ₽ / 1 млн входных289,63 ₽ / 1 млн выходных
MiniMax: MiniMax M2.5

minimax/minimax-m2.5

MiniMax-M2.5 — это большая языковая модель SOTA, предназначенная для реальной продуктивности. Обученная на разнообразных сложных реальных цифровых рабочих средах, M2.5 опирается на экспертизу в программировании M2.1, чтобы расшириться на общую офисную работу, достигая свободного владения генерацией и работой с файлами Word, Excel и Powerpoint, переключением контекста между разнообразными программными средами и работой в разных командах агентов и людей. Набрав 80.2% на SWE-Bench Verified, 51.3% на Multi-SWE-Bench и 76.3% на BrowseComp, M2.5 также более эффективен по токенам, чем предыдущие поколения, будучи обученным оптимизировать свои действия и вывод через планирование.

автор minimax12 февр. 2026 г.33,42 ₽ / 1 млн входных133,68 ₽ / 1 млн выходных
Z.ai: GLM 5

z-ai/glm-5

GLM-5 — это флагманская open-source базовая модель Z.ai, разработанная для проектирования сложных систем и долгосрочных агентных рабочих процессов. Созданная для опытных разработчиков, она обеспечивает производительность производственного уровня при решении крупномасштабных задач программирования, конкурируя с ведущими закрытыми моделями. Благодаря продвинутому агентному планированию, глубоким внутренним рассуждениям и итеративной самокоррекции GLM-5 выходит за рамки генерации кода, обеспечивая построение целых систем и автономное выполнение.

автор z-ai11 февр. 2026 г.74,27 ₽ / 1 млн входных237,65 ₽ / 1 млн выходных
Qwen: Qwen3 Max Thinking

qwen/qwen3-max-thinking

Qwen3-Max-Thinking — это флагманская модель рассуждений в серии Qwen3, разработанная для ответственных когнитивных задач, требующих глубоких многошаговых рассуждений. Значительное масштабирование вычислительных мощностей модели и обучения с подкреплением обеспечивает существенный прирост фактической точности, сложности рассуждений, точности следования инструкциям, соответствия предпочтениям людей и агентного поведения.

автор qwen9 февр. 2026 г.от 96,54 ₽ / 1 млн входныхот 482,72 ₽ / 1 млн выходных
Anthropic: Claude Opus 4.6

anthropic/claude-opus-4.6

Opus 4.6 — это самая мощная модель Anthropic для программирования и длительных профессиональных задач. Она создана для агентов, работающих в рамках целых рабочих процессов, а не отдельных запросов, что делает её особенно эффективной для больших кодовых баз, сложных рефакторингов и многоэтапной отладки, разворачивающейся во времени. Модель демонстрирует более глубокое понимание контекста, более сильную декомпозицию задач и большую надёжность при решении сложных инженерных задач по сравнению с предыдущими поколениями. Помимо программирования, Opus 4.6 превосходно справляется с длительной интеллектуальной работой. Она создаёт документы, планы и аналитические материалы, готовые к использованию, за один проход, и сохраняет связность в очень длинных выходных данных и продолжительных сессиях. Это делает её надёжным выбором по умолчанию для задач, требующих настойчивости, суждения и доведения до конца, таких как техническое проектирование, планирование миграции и сквозное выполнение проектов. Для пользователей, переходящих с более ранних версий Opus, см. официальное руководство по миграции здесь

автор anthropic4 февр. 2026 г.618,88 ₽ / 1 млн входных3 094,39 ₽ / 1 млн выходных
Qwen: Qwen3 Coder Next

qwen/qwen3-coder-next

Qwen3-Coder-Next — это языковая модель с открытым весом и архитектурой причинно-следственного типа, оптимизированная для агентов кодинга и локальных рабочих процессов разработки. Она использует разреженную конструкцию MoE с 80B общими параметрами, из которых при обработке каждого токена активируется только 3B, что обеспечивает производительность, сопоставимую с моделями, имеющими в 10–20x более высокую активную вычислительную нагрузку. Это делает её хорошо подходящей для затратно-чувствительного и постоянно работающего развертывания агентов. Модель обучена с сильным акцентом на агентский сценарий и надёжно работает при выполнении длительных задач по кодингу, сложном использовании инструментов и восстановлении после сбоев выполнения. Благодаря собственному контекстному окну 256k она легко интегрируется в реальные среды CLI и IDE и хорошо адаптируется к распространённым агентским каркасам, используемым современными инструментами разработки. Модель работает исключительно в режиме без рассуждений и не генерирует блоки thinking, что упрощает интеграцию для производственных агентов кодинга.

автор qwen4 февр. 2026 г.14,85 ₽ / 1 млн входных99,02 ₽ / 1 млн выходных
Sourceful: Riverflow V2 Pro

sourceful/riverflow-v2-pro

Riverflow V2 Pro — это самая мощная версия линейки Sourceful Riverflow 2.0, обеспечивающая максимальный контроль и идеальное качество отрисовки текста. Серия Riverflow 2.0 представляет собой производительность уровня SOTA для задач генерации и редактирования изображений, используя интегрированную модель рассуждений для повышения надёжности и решения сложных задач. Цена составляет $0.15 за 1K/2K выходное изображение и $0.33 за 4K выходное изображение. Дополнительные возможности: Отрисовка пользовательских шрифтов через font_inputs ($0.03/шрифт, макс. 2) Улучшение изображений через super_resolution_references ($0.20/референс, макс. 4) Подробности см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: Sourceful накладывает ограничение на размер запроса в 4.5MB, поэтому настоятельно рекомендуется передавать URLs изображения вместо данных Base64.

автор sourceful2 февр. 2026 г.от 18,57 ₽ за изображение
Sourceful: Riverflow V2 Fast

sourceful/riverflow-v2-fast

Riverflow V2 Fast — самый быстрый вариант линейки Riverflow 2.0 от Sourceful, оптимален для продакшен-развёртываний и рабочих процессов, критичных к задержке. Серия Riverflow 2.0 представляет производительность SOTA в задачах генерации и редактирования изображений, используя интегрированную модель рассуждений для повышения надёжности и решения сложных задач. Цена составляет $0.02 за 1K выходное изображение и $0.04 за 2K выходное изображение. Не поддерживает вывод изображений 4K. Дополнительные возможности: Отрисовка пользовательских шрифтов через font_inputs ($0.03/шрифт, макс. 2) Улучшение изображений через super_resolution_references ($0.20/референс, макс. 4) Подробнее см. в документации по генерации изображений: https://openrouter.ai/docs/features/multimodal/image-generation Примечание: Sourceful устанавливает ограничение на размер запроса 4.5MB, поэтому настоятельно рекомендуется передавать изображение URLs вместо данных Base64.

автор sourceful2 февр. 2026 г.от 2,48 ₽ за изображение
StepFun: Step 3.5 Flash

stepfun/step-3.5-flash

Step 3.5 Flash — это наиболее производительная открытая фундаментальная модель StepFun. Построенная на архитектуре разреженной смеси экспертов (MoE), она выборочно активирует только 11B из своих 196B параметров на каждый токен. Это модель рассуждений, которая невероятно эффективна по скорости даже при длинных контекстах.

автор stepfun29 янв. 2026 г.12,38 ₽ / 1 млн входных37,13 ₽ / 1 млн выходных
MoonshotAI: Kimi K2.5

moonshotai/kimi-k2.5

Kimi K2.5 — это нативная мультимодальная модель Moonshot AI, обеспечивающая передовые возможности визуального кодирования и самодостаточную парадигму роя агентов. Построенная на базе Kimi K2 с продолженным предобучением на примерно 15T смешанных визуальных и текстовых токенах, она демонстрирует высокую производительность в общем рассуждении, визуальном кодировании и агентном вызове инструментов.

автор moonshotai27 янв. 2026 г.58,63 ₽ / 1 млн входных293,15 ₽ / 1 млн выходных
Upstage: Solar Pro 3

upstage/solar-pro-3

Solar Pro 3 — это мощная языковая модель со смесью экспертов (MoE) от Upstage. С 102B общими параметрами и 12B активными параметрами за один прямой проход она обеспечивает исключительную производительность, сохраняя вычислительную эффективность. Оптимизирована для корейского языка с поддержкой японского и английского.

автор upstage27 янв. 2026 г.18,57 ₽ / 1 млн входных74,27 ₽ / 1 млн выходных
MiniMax: MiniMax M2-her

minimax/minimax-m2-her

MiniMax M2-her — это большая языковая модель, ориентированная в первую очередь на диалог и созданная для захватывающей ролевой игры, общения с персонажами и выразительных многоходовых бесед. Разработанная для сохранения последовательности в тоне и личности, она поддерживает расширенные роли сообщений (user_system, группа, sample_message_user, sample_message_ai) и может учиться на примерах диалогов, чтобы лучше соответствовать стилю и темпу вашего сценария, что делает её отличным выбором для повествования, компаньонов и разговорных сценариев, где важны естественный поток и яркое взаимодействие.

автор minimax23 янв. 2026 г.37,13 ₽ / 1 млн входных148,53 ₽ / 1 млн выходных
Writer: Palmyra X5

writer/palmyra-x5

Palmyra X5 — самая передовая модель Writer, специально созданная для разработки и масштабирования AI-агентов на уровне предприятия. Она обеспечивает ведущую в отрасли скорость и эффективность при работе с контекстными окнами до 1 миллионов токенов благодаря новой архитектуре трансформера и гибридным механизмам внимания. Это обеспечивает более быстрый вывод и расширенную память для обработки больших объёмов корпоративных данных, что критически важно для масштабирования AI-агентов.

автор writer21 янв. 2026 г.74,27 ₽ / 1 млн входных742,65 ₽ / 1 млн выходных
OpenAI: GPT Audio

openai/gpt-audio

Модель gpt-audio — это OpenAI первая общедоступная аудиомодель. Новый снимок модели включает улучшенный декодер для более естественного звучания голоса и лучшей согласованности голоса. Стоимость Audio составляет $32 за миллион входных токенов и $64 за миллион выходных токенов.

автор openai19 янв. 2026 г.1 237,76 ₽ за 1 млн токенов
OpenAI: GPT Audio Mini

openai/gpt-audio-mini

Экономичная версия GPT Audio. Новая версия включает улучшенный декодер для более естественного звучания голоса и сохраняет лучшую согласованность голоса. Входные данные оцениваются в $0.60 за миллион токенов, а выходные — в $2.40 за миллион токенов.

автор openai19 янв. 2026 г.297,06 ₽ за 1 млн токенов
Z.ai: GLM 4.7 Flash

z-ai/glm-4.7-flash

Являясь моделью класса 30B-SOTA, GLM-4.7-Flash предлагает новый вариант, который балансирует производительность и эффективность. Она дополнительно оптимизирована для агентских сценариев использования в кодинге, усиливая возможности программирования, планирования долгосрочных задач и взаимодействия с инструментами, и достигла ведущих показателей среди open-source моделей того же размера в нескольких актуальных публичных рейтингах бенчмарков.

автор z-ai19 янв. 2026 г.7,43 ₽ / 1 млн входных49,51 ₽ / 1 млн выходных
Black Forest Labs: FLUX.2 Klein 4B

black-forest-labs/flux.2-klein-4b

FLUX.2 [klein] 4B — самая быстрая и экономически эффективная модель в семействе FLUX.2, оптимизированная для сценариев с высокой пропускной способностью при сохранении отличного качества изображений. Ценообразование основано на выходном изображении. Первый сгенерированный мегапиксель стоит $0.014. Каждый последующий мегапиксель стоит $0.001.

автор black-forest-labs14 янв. 2026 г.1,73 ₽ за мегапиксель
OpenAI: GPT-5.2-Codex

openai/gpt-5.2-codex

GPT-5.2-Codex — это обновлённая версия GPT-5.1-Codex, оптимизированная для разработки программного обеспечения и рабочих процессов написания кода. Она предназначена как для интерактивных сессий разработки, так и для длительного независимого выполнения сложных инженерных задач. Модель поддерживает создание проектов с нуля, разработку функций, отладку, масштабный рефакторинг и проверку кода. По сравнению с GPT-5.1-Codex, 5.2-Codex более управляема, точно следует инструкциям разработчика и выдаёт более чистый и качественный код. Уровень рассуждений можно настраивать с помощью параметра reasoning.effort. Читайте документацию здесь. Codex интегрируется в среды разработки, включая CLI, расширения IDE, GitHub и облачные задачи. Он динамически адаптирует уровень рассуждений — обеспечивает быстрые ответы для небольших задач и поддерживает длительные многочасовые сессии для крупных проектов. Модель обучена проводить структурированные проверки кода, выявляя критические ошибки за счёт анализа зависимостей и проверки поведения на тестах. Она также поддерживает мультимодальные входные данные, такие как изображения или скриншоты, для разработки UI, и интегрирует использование инструментов для поиска, установки зависимостей и настройки окружения. Codex предназначен специально для агентных задач написания кода.

автор openai14 янв. 2026 г.216,61 ₽ / 1 млн входных1 732,86 ₽ / 1 млн выходных
ByteDance Seed: Seedream 4.5

bytedance-seed/seedream-4.5

Seedream 4.5 — это новейшая внутренняя модель генерации изображений, разработанная ByteDance. По сравнению с Seedream 4.0 она обеспечивает комплексные улучшения, особенно в согласованности редактирования, включая лучшее сохранение деталей объекта, освещения и цветового тона. Также улучшает уточнение портретов и отрисовку мелкого текста. Возможности композиции с несколькими изображениями были значительно усилены, и как логические способности, так и визуальная эстетика продолжают развиваться, что позволяет создавать более точные и художественно выразительные изображения. Цена составляет $0.04 за выходное изображение, независимо от размера.

автор bytedance-seed23 дек. 2025 г.4,95 ₽ за изображение
ByteDance Seed: Seed 1.6 Flash

bytedance-seed/seed-1.6-flash

Seed 1.6 Flash — это сверхбыстрая мультимодальная модель глубокого мышления от ByteDance Seed, поддерживающая как текстовое, так и визуальное понимание. Она обладает контекстным окном 256k и может генерировать выходные данные объемом до 16k токенов.

автор bytedance-seed23 дек. 2025 г.от 9,28 ₽ / 1 млн входныхот 37,13 ₽ / 1 млн выходных
ByteDance Seed: Seed 1.6

bytedance-seed/seed-1.6

Seed 1.6 — это универсальная модель, выпущенная командой ByteDance Seed. Она включает мультимодальные возможности и адаптивное глубокое мышление с окном контекста 256K.

автор bytedance-seed23 дек. 2025 г.от 30,94 ₽ / 1 млн входныхот 247,55 ₽ / 1 млн выходных
MiniMax: MiniMax M2.1

minimax/minimax-m2.1

MiniMax-M2.1 — это легковесная большая языковая модель современного уровня, оптимизированная для программирования, агентных рабочих процессов и разработки современных приложений. Имея всего 10 миллиарда активных параметров, она обеспечивает значительный скачок в реальной производительности, сохраняя при этом исключительную задержку, масштабируемость и экономическую эффективность. По сравнению с предшественником, M2.1 выдаёт более чистые и лаконичные результаты и более быстрое воспринимаемое время ответа. Она демонстрирует ведущую многоязычную производительность в области кодирования в основных системах и языках приложений, достигая 49.4% в Multi-SWE-Bench и 72.5% в SWE-Bench Multilingual, и служит универсальным «мозгом» агента для IDEs, инструментов кодирования и общей помощи. Чтобы не допустить ухудшения производительности этой модели, MiniMax настоятельно рекомендует сохранять рассуждения между ходами. Узнайте больше об использовании reasoning_details для передачи рассуждений в нашей документации.

автор minimax23 дек. 2025 г.37,13 ₽ / 1 млн входных148,53 ₽ / 1 млн выходных
Z.ai: GLM 4.7

z-ai/glm-4.7

GLM-4.7 — это последняя флагманская модель Z.ai, с улучшениями в двух ключевых областях: расширенные возможности программирования и более стабильное многошаговое рассуждение/исполнение. Она демонстрирует значительные улучшения в выполнении сложных агентных задач, обеспечивая при этом более естественное общение и превосходную эстетику интерфейса.

автор z-ai22 дек. 2025 г.49,51 ₽ / 1 млн входных216,61 ₽ / 1 млн выходных
Google: Gemini 3 Flash Preview

google/gemini-3-flash-preview

Gemini 3 Flash Preview — это высокоскоростная и высокоценная модель мышления, разработанная для агентных рабочих процессов, многоходового чата и помощи в программировании. Она обеспечивает рассуждения и использование инструментов почти уровня Pro с существенно меньшей задержкой, чем более крупные варианты Gemini, что делает её хорошо подходящей для интерактивной разработки, длительных агентных циклов и задач совместного программирования. По сравнению с Gemini 2.5 Flash она обеспечивает широкие улучшения качества в рассуждениях, мультимодальном понимании и надёжности. Модель поддерживает окно контекста в 1M токенов и мультимодальные входные данные, включая текст, изображения, аудио, видео и PDFs, с выводом текста. Она включает настраиваемые рассуждения через уровни мышления (минимальный, низкий, средний, высокий), структурированный вывод, использование инструментов и автоматическое кэширование контекста. Gemini 3 Flash Preview оптимизирована для пользователей, которые хотят сильных рассуждений и агентного поведения без затрат или задержек полномасштабных передовых моделей.

автор google17 дек. 2025 г.61,89 ₽ / 1 млн входных371,33 ₽ / 1 млн выходных
Black Forest Labs: FLUX.2 Max

black-forest-labs/flux.2-max

FLUX.2 [max] — это новая топ-модель изображений от Black Forest Labs, поднимающая качество изображений, понимание промптов и согласованность редактирования на самый высокий уровень на сегодняшний день. Цены следующие, согласно документации: Вход: мы взимаем $0.03 за каждый мегапиксель на входе (т.е. референсные изображения для редактирования) Выход: первый сгенерированный мегапиксель стоит $0.07. Каждый последующий мегапиксель стоит $0.03.

автор black-forest-labs16 дек. 2025 г.8,66 ₽ за мегапиксель
NVIDIA: Nemotron 3 Nano 30B A3B

nvidia/nemotron-3-nano-30b-a3b

NVIDIA Nemotron 3 Nano 30B A3B — это небольшая языковая MoE модель с наивысшей вычислительной эффективностью и точностью для разработчиков, создающих специализированные агентные AI системы. Модель полностью открыта: открытые веса, наборы данных и рецепты позволяют разработчикам легко настраивать, оптимизировать и разворачивать модель на своей инфраструктуре для максимальной конфиденциальности и безопасности.

автор nvidia14 дек. 2025 г.6,19 ₽ / 1 млн входных24,76 ₽ / 1 млн выходных
OpenAI: GPT-5.2 Chat

openai/gpt-5.2-chat

GPT-5.2 Chat (AKA Instant) — это быстрый и легковесный представитель семейства 5.2, оптимизированный для чатов с низкой задержкой и при этом сохраняющий высокий общий интеллект. Он использует адаптивные рассуждения, чтобы выборочно «размышлять» над сложными запросами, повышая точность в математике, программировании и многошаговых задачах, не замедляя при этом типичные разговоры. По умолчанию модель более тёплая и разговорчивая, лучше следует инструкциям и демонстрирует более стабильные краткие рассуждения. GPT-5.2 Chat предназначен для высоконагруженных интерактивных сценариев, где скорость отклика и согласованность важнее глубоких размышлений.

автор openai10 дек. 2025 г.216,61 ₽ / 1 млн входных1 732,86 ₽ / 1 млн выходных
OpenAI: GPT-5.2 Pro

openai/gpt-5.2-pro

GPT-5.2 Pro — это самая продвинутая модель OpenAI, предлагающая значительные улучшения в агентном программировании и работе с длинным контекстом по сравнению с GPT-5 Pro. Она оптимизирована для сложных задач, требующих пошаговых рассуждений, следования инструкциям и точности в сценариях с высокими ставками. Модель поддерживает функции маршрутизации во время тестирования и расширенное понимание промптов, включая указанные пользователем намерения, например «хорошенько подумай об этом». Улучшения включают снижение галлюцинаций, подхалимства и более высокую производительность в задачах, связанных с программированием, письмом и здоровьем.

автор openai10 дек. 2025 г.2 599,29 ₽ / 1 млн входных20 794,29 ₽ / 1 млн выходных
OpenAI: GPT-5.2

openai/gpt-5.2

GPT-5.2 — это новейшая модель пограничного класса в серии GPT-5, обеспечивающая более высокую производительность в агентных сценариях и работе с длинным контекстом по сравнению с GPT-5.1. Она использует адаптивные рассуждения для динамического распределения вычислительных ресурсов, быстро отвечая на простые запросы и затрачивая больше глубины на сложные задачи. Созданная для широкого охвата задач, GPT-5.2 обеспечивает стабильный прирост в математике, программировании, научных и инструментальных рабочих нагрузках, предлагая более связные развёрнутые ответы и повышенную надёжность использования инструментов.

автор openai10 дек. 2025 г.216,61 ₽ / 1 млн входных1 732,86 ₽ / 1 млн выходных
Mistral: Devstral 2 2512

mistralai/devstral-2512

Devstral 2 — это современная открытая модель от Mistral AI, специализирующаяся на агентном написании кода. Это плотная трансформерная модель с 123B параметрами, поддерживающая контекстное окно 256K. Devstral 2 поддерживает исследование кодовых баз и координацию изменений в нескольких файлах, сохраняя контекст на уровне архитектуры. Она отслеживает зависимости фреймворков, обнаруживает сбои и повторяет попытки с исправлениями — решая такие задачи, как исправление ошибок и модернизация устаревших систем. Модель можно дообучать для приоритизации конкретных языков или оптимизации для крупных корпоративных кодовых баз. Она доступна под модифицированной лицензией MIT.

автор mistralai9 дек. 2025 г.49,51 ₽ / 1 млн входных247,55 ₽ / 1 млн выходных
Relace: Relace Search

relace/relace-search

Модель relace-search использует инструменты 4-12, view_file и grep параллельно для исследования кодовой базы и возврата релевантных файлов по запросу пользователя. В отличие от RAG, relace-search выполняет агентные многошаговые рассуждения, чтобы получить высокоточные результаты в 4 раз быстрее, чем любая передовая модель. Она предназначена для работы в качестве субагента, который передаёт свои результаты «оракулу» — агенту-кодеру, координирующему и выполняющему остальную часть задачи по написанию кода. Для использования relace-search необходимо создать подходящую среду агента и parse полученный ответ для извлечения релевантной информации, которую нужно передать «оракулу». Подробнее об этом можно прочитать в Relace документации.

автор relace8 дек. 2025 г.123,78 ₽ / 1 млн входных371,33 ₽ / 1 млн выходных
Z.ai: GLM 4.6V

z-ai/glm-4.6v

GLM-4.6V — это большая мультимодальная модель, предназначенная для высокоточного визуального понимания и рассуждений в длинном контексте по изображениям, документам и смешанным медиа. Модель поддерживает до 128K токенов, обрабатывает сложные макеты страниц и диаграммы непосредственно как визуальные входные данные, а также интегрирует нативную мультимодальную функцию вызова для связи восприятия с последующим выполнением инструментов. Модель также обеспечивает чередующуюся генерацию изображений и текста и рабочие процессы реконструкции UI, включая синтез из скриншота в HTML и итеративное визуальное редактирование.

автор z-ai8 дек. 2025 г.37,13 ₽ / 1 млн входных111,40 ₽ / 1 млн выходных
OpenAI: GPT-5.1-Codex-Max

openai/gpt-5.1-codex-max

GPT-5.1-Codex-Max — это последняя агентная модель для написания кода от OpenAI, разработанная для длительных задач разработки программного обеспечения с большим контекстом. Она основана на обновлённой версии стека рассуждений 5.1 и обучена на агентных рабочих процессах, охватывающих разработку программного обеспечения, математику и исследования. GPT-5.1-Codex-Max обеспечивает более высокую производительность, улучшенные рассуждения и более высокую эффективность использования токенов на всём жизненном цикле разработки.

автор openai4 дек. 2025 г.154,72 ₽ / 1 млн входных1 237,76 ₽ / 1 млн выходных
Amazon: Nova 2 Lite

amazon/nova-2-lite-v1

Nova 2 Lite — это быстрая, экономичная модель рассуждений для повседневных задач, которая может обрабатывать текст, изображения и видео для генерации текста. Nova 2 Lite демонстрирует выдающиеся возможности в обработке документов, извлечении информации из видео, генерации кода, предоставлении точных обоснованных ответов и автоматизации многошаговых агентных рабочих процессов.

автор amazon2 дек. 2025 г.37,13 ₽ / 1 млн входных309,44 ₽ / 1 млн выходных
Mistral: Ministral 3 14B 2512

mistralai/ministral-14b-2512

Самая крупная модель в семействе Ministral 3, Ministral 3 14B предлагает передовые возможности и производительность, сравнимые с её более крупным Mistral Small 3.2 24B аналогом. Мощная и эффективная языковая модель с возможностями зрения.

автор mistralai2 дек. 2025 г.24,76 ₽ / 1 млн входных24,76 ₽ / 1 млн выходных
Mistral: Ministral 3 8B 2512

mistralai/ministral-8b-2512

Сбалансированная модель в семействе Ministral 3, Ministral 3 8B — это мощная, эффективная крошечная языковая модель с возможностями зрения.

автор mistralai2 дек. 2025 г.18,57 ₽ / 1 млн входных18,57 ₽ / 1 млн выходных
Mistral: Ministral 3 3B 2512

mistralai/ministral-3b-2512

Самая маленькая модель в семействе Ministral 3, Ministral 3 3B — это мощная, эффективная крошечная языковая модель с возможностями зрения.

автор mistralai2 дек. 2025 г.12,38 ₽ / 1 млн входных12,38 ₽ / 1 млн выходных
Mistral: Mistral Large 3 2512

mistralai/mistral-large-2512

Mistral Large 3 2512 — это самая производительная модель Mistral на сегодняшний день, использующая разреженную архитектуру смеси экспертов с 41B активными параметрами (675B всего) и выпущенная под лицензией Apache 2.0.

автор mistralai1 дек. 2025 г.61,89 ₽ / 1 млн входных185,66 ₽ / 1 млн выходных
DeepSeek: DeepSeek V3.2

deepseek/deepseek-v3.2

DeepSeek-V3.2 — это большая языковая модель, предназначенная для гармоничного сочетания высокой вычислительной эффективности с сильными возможностями рассуждения и использования инструментов. Она внедряет DeepSeek Разреженное Внимание (DSA), механизм мелкозернистого разреженного внимания, который снижает затраты на обучение и вывод, сохраняя при этом качество в сценариях с длинным контекстом. Масштабируемая структура обучения с подкреплением дополнительно улучшает её, обеспечивая производительность в классе GPT-5 и демонстрируя результаты уровня золотой медали на 2025 IMO и IOI. V3.2 также использует крупномасштабный конвейер синтеза задач агентного типа, чтобы лучше интегрировать рассуждения в сценарии использования инструментов, повышая соответствие и обобщение в интерактивных средах. Пользователи могут управлять поведением рассуждения с помощью reasoning enabled логического параметра. Подробнее в нашей документации

автор deepseek1 дек. 2025 г.33,30 ₽ / 1 млн входных49,51 ₽ / 1 млн выходных
Black Forest Labs: FLUX.2 Flex

black-forest-labs/flux.2-flex

FLUX.2 [flex] отлично справляется с отображением сложного текста, типографики и мелких деталей, а также поддерживает редактирование по множественным референсам в рамках единой архитектуры. Ценообразование следующее, согласно документации: Мы взимаем $0.06 за каждый мегапиксель как на входе, так и на выходе.

автор black-forest-labs25 нояб. 2025 г.7,43 ₽ за мегапиксель
Black Forest Labs: FLUX.2 Pro

black-forest-labs/flux.2-pro

Высококлассная модель генерации и редактирования изображений, ориентированная на передовое качество визуала и надёжность. Она обеспечивает точное следование промпту, стабильное освещение, чёткие текстуры и согласованное воспроизведение персонажей/стиля при работе с несколькими референсными изображениями. Создана для продакшн-нагрузок, сбалансирована по скорости и качеству, поддерживает генерацию из текста и редактирование изображений с разрешением до 4 MP. Ценообразование следующее, согласно документации: Вход: мы взимаем $0.015 за каждый мегапиксель на входе (т.е. референсные изображения для редактирования) Выход: первый мегапиксель стоит $0.03, а каждый последующий MP будет стоить $0.015.

автор black-forest-labs25 нояб. 2025 г.3,71 ₽ за мегапиксель
Anthropic: Claude Opus 4.5

anthropic/claude-opus-4.5

Claude Opus 4.5 — это передовая модель рассуждений от Anthropic, оптимизированная для сложной разработки программного обеспечения, агентных рабочих процессов и длительного использования компьютера. Она обладает сильными мультимодальными возможностями, конкурентоспособной производительностью в реальных задачах кодирования и рассуждений, а также повышенной устойчивостью к инъекциям подсказок. Модель разработана для эффективной работы при различных уровнях усилий, позволяя разработчикам выбирать между скоростью, глубиной и использованием токенов в зависимости от требований задачи. Она поставляется с новым параметром для контроля эффективности токенов, который доступен через параметр OpenRouter Verbosity с уровнями low, medium или high. Opus 4.5 поддерживает расширенное использование инструментов, управление расширенным контекстом и скоординированные настройки мультиагентов, что делает её хорошо подходящей для автономных исследований, отладки, многошагового планирования и манипуляций с электронными таблицами/браузером. Она обеспечивает значительный прирост в структурированных рассуждениях, надежности выполнения и согласованности по сравнению с предыдущими поколениями Opus, при этом снижая накладные расходы на токены и улучшая производительность при длительных задачах.

автор anthropic24 нояб. 2025 г.618,88 ₽ / 1 млн входных3 094,39 ₽ / 1 млн выходных

Nano Banana Pro — это наиболее продвинутая модель генерации и редактирования изображений от Google, построенная на Gemini 3 Pro. Она расширяет возможности оригинальной модели Nano Banana за счет значительно улучшенного мультимодального рассуждения, привязки к реальному миру и высокоточной визуальной генерации. Модель создает контекстно-насыщенную графику — от инфографики и диаграмм до кинематографичных композиций — и может включать информацию в реальном времени через поисковую привязку. Она обеспечивает лидирующее в индустрии отображение текста в изображениях (включая длинные фрагменты и многоязычные макеты), согласованное смешивание нескольких изображений и точное сохранение идентичности до пяти объектов. Nano Banana Pro добавляет тонкие инструменты творческого контроля, такие как локальные правки, корректировка освещения и фокуса, трансформации камеры, а также поддержку выходных форматов 2K/4K и гибких соотношений сторон. Модель предназначена для профессионального дизайна, визуализации продуктов, раскадровки и сложных многоэлементных композиций, оставаясь при этом эффективной для стандартных рабочих процессов создания изображений.

автор google20 нояб. 2025 г.14 853,07 ₽ за 1 млн токенов
Thenlper: GTE-Base

thenlper/gte-base

Модель эмбеддингов gte-base кодирует английские предложения и абзацы в плотное векторное пространство размерности 768, обеспечивая эффективные и действенные семантические вложения, оптимизированные для задач семантического сходства, семантического поиска и кластеризации.

автор thenlper18 нояб. 2025 г.0,62 ₽ за 1 млн токенов
Thenlper: GTE-Large

thenlper/gte-large

Модель встраивания gte-large преобразует английские предложения, абзацы и документы средней длины в плотное векторное пространство размерности 1024, обеспечивая высококачественные семантические встраивания, оптимизированные для задач поиска информации, семантического текстового сходства, реранжирования и кластеризации. Обученная с помощью многоэтапного контрастивного обучения на крупном корпусе релевантности, разнообразном по доменам, она обеспечивает отличную производительность в различных случаях использования встраиваний общего назначения.

автор thenlper18 нояб. 2025 г.1,24 ₽ за 1 млн токенов
Intfloat: E5-Large-v2

intfloat/e5-large-v2

Модель эмбеддингов e5-large-v2 отображает английские предложения, абзацы и документы в плотное векторное пространство размерности 1024, обеспечивая высокоточные семантические векторы, оптимизированные для поиска, семантического поиска, реранжирования и задач оценки сходства.

автор intfloat18 нояб. 2025 г.1,24 ₽ за 1 млн токенов
Intfloat: E5-Base-v2

intfloat/e5-base-v2

Модель эмбеддингов e5-base-v2 кодирует английские предложения и абзацы в плотное векторное пространство размерности 768, создавая эффективные и высококачественные семантические эмбеддинги, оптимизированные для таких задач, как семантический поиск, оценка схожести, поиск информации и кластеризация.

автор intfloat18 нояб. 2025 г.0,62 ₽ за 1 млн токенов
Intfloat: Multilingual-E5-Large

intfloat/multilingual-e5-large

Модель вложений multilingual-e5-large кодирует предложения, абзацы и документы на более чем 90 языках в плотное векторное пространство размерности 1024, обеспечивая надежные семантические вложения, оптимизированные для многоязычного поиска, кросс-языкового сходства и поиска по крупномасштабным данным.

автор intfloat18 нояб. 2025 г.1,24 ₽ за 1 млн токенов
Sentence Transformers: paraphrase-MiniLM-L6-v2

sentence-transformers/paraphrase-minilm-l6-v2

Модель эмбеддингов paraphrase-MiniLM-L6-v2 преобразует предложения и короткие абзацы в плотное векторное пространство размерности 384, создавая высококачественные семантические эмбеддинги, оптимизированные для определения парафраз, оценки семантической схожести, кластеризации и облегченных задач поиска.

автор sentence-transformers18 нояб. 2025 г.0,62 ₽ за 1 млн токенов
Sentence Transformers: all-MiniLM-L12-v2

sentence-transformers/all-minilm-l12-v2

Модель эмбеддингов all-MiniLM-L12-v2 отображает предложения и короткие абзацы в плотное векторное пространство размерности 384, создавая эффективные и высококачественные семантические эмбеддинги, оптимизированные для таких задач, как семантический поиск, кластеризация и оценка сходства.

автор sentence-transformers18 нояб. 2025 г.0,62 ₽ за 1 млн токенов
BAAI: bge-base-en-v1.5

baai/bge-base-en-v1.5

Модель эмбеддингов bge-base-en-v1.5 преобразует английские предложения и абзацы в плотные векторы размерности 768, обеспечивая эффективные и качественные семантические эмбеддинги, оптимизированные для задач поиска, семантического поиска и сопоставления документов. Эта версия (v1.5) отличается улучшенным распределением оценки сходства и более высокой производительностью поиска из коробки.

автор baai18 нояб. 2025 г.0,62 ₽ за 1 млн токенов
Sentence Transformers: multi-qa-mpnet-base-dot-v1

sentence-transformers/multi-qa-mpnet-base-dot-v1

Модель эмбеддингов multi-qa-mpnet-base-dot-v1 преобразует предложения и короткие абзацы в плотное векторное пространство размерности 768, создавая высококачественные семантические эмбеддинги, оптимизированные для поиска по вопросам и ответам, семантического поиска и оценки сходства разнообразного контента.

автор sentence-transformers18 нояб. 2025 г.0,62 ₽ за 1 млн токенов
BAAI: bge-large-en-v1.5

baai/bge-large-en-v1.5

Модель вложений bge-large-en-v1.5 сопоставляет английские предложения, абзацы и документы с плотным векторным пространством размерности 1024, выдавая высокоточные семантические вложения, оптимизированные для семантического поиска, поиска документов и последующих задач NLP на английском языке.

автор baai18 нояб. 2025 г.1,24 ₽ за 1 млн токенов
BAAI: bge-m3

baai/bge-m3

Модель эмбеддингов bge-m3 кодирует предложения, абзацы и длинные документы в плотное векторное пространство размерностью 1024, обеспечивая высококачественные семантические эмбеддинги, оптимизированные для многоязычного поиска, семантического поиска и приложений с большим контекстом.

автор baai18 нояб. 2025 г.1,24 ₽ за 1 млн токенов
Sentence Transformers: all-mpnet-base-v2

sentence-transformers/all-mpnet-base-v2

Модель эмбеддингов all-mpnet-base-v2 кодирует предложения и короткие абзацы в плотное векторное пространство размерности 768, обеспечивая высококачественные семантические эмбеддинги, хорошо подходящие для таких задач, как информационный поиск, кластеризация, оценка схожести и ранжирование текстов.

автор sentence-transformers17 нояб. 2025 г.0,62 ₽ за 1 млн токенов
Sentence Transformers: all-MiniLM-L6-v2

sentence-transformers/all-minilm-l6-v2

Модель эмбеддингов all-MiniLM-L6-v2 преобразует предложения и короткие абзацы в плотное векторное пространство размерности 384, обеспечивая высококачественные семантические представления, идеально подходящие для таких задач, как поиск информации, кластеризация, оценка сходства и ранжирование текстов.

автор sentence-transformers17 нояб. 2025 г.0,62 ₽ за 1 млн токенов
OpenAI: GPT-5.1

openai/gpt-5.1

GPT-5.1 — это модель передового уровня в серии GPT-5, обладающая более сильными универсальными рассуждениями, улучшенным следованием инструкциям и более естественным стилем общения по сравнению с GPT-5. Она использует адаптивные рассуждения для динамического распределения вычислительных ресурсов, быстро отвечая на простые запросы и выделяя больше ресурсов GPU для сложных задач. Модель дает более четкие и понятные объяснения с меньшим количеством жаргона, что упрощает восприятие даже технических или многошаговых проблем. Благодаря широкой сфере применения, GPT-5.1 обеспечивает стабильные результаты в математике, программировании и задачах со структурированными данными, предлагая более связные развернутые ответы и повышенную надежность при использовании инструментов. Кроме того, она отличается более точным следованием указаниям, обеспечивая более естественное и комфортное взаимодействие без ущерба для точности. GPT-5.1 — это основная модель полного цикла, пришедшая на смену GPT-5.

автор openai13 нояб. 2025 г.154,72 ₽ / 1 млн входных1 237,76 ₽ / 1 млн выходных
OpenAI: GPT-5.1-Codex

openai/gpt-5.1-codex

GPT-5.1-Codex — это специализированная версия GPT-5.1, оптимизированная для разработки программного обеспечения и рабочих процессов написания кода. Она предназначена как для интерактивных сессий разработки, так и для длительного автономного выполнения сложных инженерных задач. Модель поддерживает создание проектов с нуля, разработку функций, отладку, масштабный рефакторинг и ревью кода. По сравнению с GPT-5.1, Codex более управляема, строго следует инструкциям разработчика и выдаёт более чистый и качественный код. Уровень усилий на рассуждение можно регулировать с помощью параметра reasoning.effort. Документация доступна здесь Codex интегрируется в среды разработки, включая CLI, расширения IDE, GitHub и облачные задачи. Она динамически адаптирует усилия на рассуждение: обеспечивает быстрые ответы для небольших задач и поддерживает длительные многочасовые сессии для крупных проектов. Модель обучена выполнять структурированные ревью кода, выявляя критические недостатки путём анализа зависимостей и проверки поведения на соответствие тестам. Она также поддерживает мультимодальные входные данные, такие как изображения или скриншоты, для разработки UI, и интегрирует использование инструментов для поиска, установки зависимостей и настройки окружения. Codex предназначена специально для агентных задач написания кода.

автор openai13 нояб. 2025 г.154,72 ₽ / 1 млн входных1 237,76 ₽ / 1 млн выходных
OpenAI: GPT-5.1-Codex-Mini

openai/gpt-5.1-codex-mini

GPT-5.1-Codex-Mini — это меньшая и более быстрая версия GPT-5. 1-Codex

автор openai13 нояб. 2025 г.30,94 ₽ / 1 млн входных247,55 ₽ / 1 млн выходных
MoonshotAI: Kimi K2 Thinking

moonshotai/kimi-k2-thinking

Kimi K2 Thinking — это самая продвинутая открытая модель для рассуждений от Moonshot AI, расширяющая серию K2 до агентных и долгосрочных рассуждений. Построенная на триллионной архитектуре смеси экспертов (MoE), представленной в Kimi K2, она активирует 32 миллиардов параметров за проход и поддерживает контекстные окна в 256 тысяч токенов. Модель оптимизирована для устойчивого пошагового мышления, динамического вызова инструментов и сложных рабочих процессов рассуждений, охватывающих сотни витков. Она чередует пошаговые рассуждения с использованием инструментов, что позволяет автономно выполнять исследования, написание кода и текстов, сохраняя устойчивость на протяжении сотен последовательных действий без сбоев. Она устанавливает новые открытые эталоны в HLE, BrowseComp, SWE-Multilingual и LiveCodeBench, сохраняя стабильное мультиагентное поведение благодаря 200–300 вызовам инструментов. Построенная на крупномасштабной архитектуре MoE с оптимизацией MuonClip, модель сочетает глубокую способность к рассуждениям с высокой эффективностью вывода для сложных агентных и аналитических задач.

автор moonshotai6 нояб. 2025 г.74,27 ₽ / 1 млн входных309,44 ₽ / 1 млн выходных
Amazon: Nova Premier 1.0

amazon/nova-premier-v1

Amazon Nova Premier — самая производительная мультимодальная модель Amazon для сложных задач рассуждения, а также лучший инструмент для дистилляции собственных моделей в роли учителя.

автор amazon31 окт. 2025 г.309,44 ₽ / 1 млн входных1 547,19 ₽ / 1 млн выходных
Mistral: Mistral Embed 2312

mistralai/mistral-embed-2312

Mistral Embed — это специализированная модель встраивания для текстовых данных, оптимизированная для семантического поиска и приложений RAG. Разработанная компанией Mistral AI в конце 2023 года, она создаёт векторы размерности 1024, которые эффективно улавливают семантические связи в тексте.

автор mistralai31 окт. 2025 г.12,38 ₽ за 1 млн токенов
Google: Gemini Embedding 001

google/gemini-embedding-001

gemini-embedding-001 обеспечивает унифицированный передовой опыт в различных областях, включая науку, право, финансы и программирование. Эта модель эмбеддингов стабильно занимает высокие позиции в многоязычном рейтинге Massive Text Embedding Benchmark (MTEB) с момента экспериментального запуска в марте.

автор google31 окт. 2025 г.18,57 ₽ за 1 млн токенов
OpenAI: Text Embedding Ada 002

openai/text-embedding-ada-002

text-embedding-ada-002 — это устаревшая модель текстовых эмбеддингов от OpenAI.

автор openai30 окт. 2025 г.12,38 ₽ за 1 млн токенов
Mistral: Codestral Embed 2505

mistralai/codestral-embed-2505

Mistral Codestral Embed специально разработана для кода, идеально подходит для эмбеддинга баз кода, репозиториев и обеспечения работы ассистентов по программированию с передовым поиском.

автор mistralai30 окт. 2025 г.18,57 ₽ за 1 млн токенов
OpenAI: Text Embedding 3 Large

openai/text-embedding-3-large

text-embedding-3-large — это самая производительная модель встраивания OpenAI как для англоязычных, так и для неанглоязычных задач. Embedding представляют собой числовое представление текста, которое можно использовать для измерения связанности между двумя фрагментами текста. Embedding полезны для поиска, кластеризации, рекомендаций, обнаружения аномалий и задач классификации.

автор openai30 окт. 2025 г.16,09 ₽ за 1 млн токенов
OpenAI: Text Embedding 3 Small

openai/text-embedding-3-small

text-embedding-3-small — это улучшенная, более производительная версия модели встраивания OpenAI. Embedding — это числовое представление текста, которое можно использовать для измерения схожести между двумя фрагментами текста. Embedding полезны для задач поиска, кластеризации, рекомендаций, обнаружения аномалий и классификации.

автор openai30 окт. 2025 г.2,48 ₽ за 1 млн токенов
Perplexity: Sonar Pro Search

perplexity/sonar-pro-search

Эксклюзивно доступен на OpenRouter API, новый режим Pro Search от Sonar Pro — это самая продвинутая агентная поисковая система Perplexity. Он предназначен для более глубокого анализа и рассуждений. Ценообразование основано на токенах плюс $18 за тысячу запросов. Эта модель обеспечивает работу режима Pro Search на платформе Perplexity. Sonar Pro Search добавляет автономное многошаговое рассуждение к Sonar Pro. Таким образом, вместо просто одного запроса + синтеза, он планирует и выполняет целые исследовательские рабочие процессы с использованием инструментов.

автор perplexity30 окт. 2025 г.371,33 ₽ / 1 млн входных1 856,63 ₽ / 1 млн выходных
Mistral: Voxtral Small 24B 2507

mistralai/voxtral-small-24b-2507

Voxtral Small является улучшением Mistral Small 3, включая современные возможности ввода аудио, сохраняя при этом лучшую в своем классе производительность для текста. Он отлично справляется с транскрипцией речи, переводом и пониманием аудио. Входное аудио оценивается в $100 за миллион секунд.

автор mistralai30 окт. 2025 г.12,38 ₽ / 1 млн входных37,13 ₽ / 1 млн выходных
OpenAI: gpt-oss-safeguard-20b

openai/gpt-oss-safeguard-20b

gpt-oss-safeguard-20b — это модель для рассуждений в области безопасности от OpenAI, созданная на основе gpt-oss-20b. Эта модель с открытыми весами и архитектурой Mixture-of-Experts (MoE) с 21B параметрами обеспечивает более низкую задержку для задач безопасности, таких как классификация контента, фильтрация LLM и маркировка доверия и безопасности. Узнайте больше об этой модели в руководстве пользователя по gpt-oss-safeguard от OpenAI.

автор openai29 окт. 2025 г.9,28 ₽ / 1 млн входных37,13 ₽ / 1 млн выходных
Qwen: Qwen3 Embedding 8B

qwen/qwen3-embedding-8b

Серия моделей Qwen3 Embedding — это новейшая проприетарная модель семейства Qwen, специально предназначенная для задач текстовых эмбеддингов и ранжирования. Эта серия наследует исключительные многоязычные способности, понимание длинных текстов и навыки рассуждения своей базовой модели. Серия Qwen3 Embedding представляет собой значительный прогресс в нескольких задачах текстовых эмбеддингов и ранжирования, включая поиск текста, поиск кода, классификацию текста, кластеризацию текста и извлечение двуязычных параллелей.

автор qwen28 окт. 2025 г.1,24 ₽ за 1 млн токенов
Qwen: Qwen3 Embedding 4B

qwen/qwen3-embedding-4b

Серия моделей Qwen3 Embedding является последней проприетарной моделью семейства Qwen, специально разработанной для задач эмбеддинга текста и ранжирования. Эта серия наследует исключительные многоязычные возможности, понимание длинных текстов и навыки рассуждения своей базовой модели. Серия Qwen3 Embedding представляет значительные достижения в различных задачах эмбеддинга текста и ранжирования, включая поиск текста, поиск кода, классификацию текста, кластеризацию текста и извлечение двуязычных данных.

автор qwen28 окт. 2025 г.2,48 ₽ за 1 млн токенов
MiniMax: MiniMax M2

minimax/minimax-m2

MiniMax-M2 — это компактная языковая модель с высокой производительностью, оптимизированная для кодирования и агентных задач. Благодаря архитектуре с 10 млрд активированных параметров (всего 230 млрд) модель обеспечивает производительность, близкую к передовым системам, в общем мышлении, работе с инструментами и многошаговых задачах, сохраняя при этом низкую задержку и эффективность развертывания. Модель отлично справляется с генерацией кода, редактированием нескольких файлов, циклами компиляции и исправления, а также проверкой тестами, показывая высокие результаты на SWE-Bench Verified, Multi-SWE-Bench и Terminal-Bench. Она также конкурентоспособна в агентных оценках, таких как BrowseComp и GAIA, эффективно обрабатывая долгосрочное планирование, поиск информации и восстановление после ошибок выполнения. По результатам тестов Artificial Analysis, MiniMax-M2 входит в число лучших открытых моделей по составному интеллекту, охватывающему математику, естественные науки и следование инструкциям. Небольшой объем активируемых параметров обеспечивает быстрый вывод, высокую конкурентность и улучшенную экономическую эффективность, что делает модель подходящей для крупномасштабных агентов, помощников разработчиков и приложений, требующих высокой скорости и эффективности затрат. Чтобы не снижать производительность модели, MiniMax настоятельно рекомендует сохранять рассуждения между шагами. Узнайте больше об использовании reasoning_details для передачи рассуждений в нашей документации.

автор minimax23 окт. 2025 г.31,56 ₽ / 1 млн входных126,25 ₽ / 1 млн выходных
Qwen: Qwen3 VL 32B Instruct

qwen/qwen3-vl-32b-instruct

Qwen3-VL-32B-Instruct — это крупномасштабная мультимодальная модель «зрение-язык», предназначенная для высокоточной интерпретации и рассуждений по тексту, изображениям и видео. С количеством параметров в 32 миллиарда она сочетает глубокое визуальное восприятие с продвинутым пониманием текста, обеспечивая детальное пространственное рассуждение, анализ документов и сцен, а также понимание длительных видео. Надёжная поддержка OCR в 32 языках и улучшенное мультимодальное слияние с помощью архитектур Interleaved-MRoPE и DeepStack. Оптимизированная для агентного взаимодействия и использования визуальных инструментов, Qwen3-VL-32B обеспечивает передовую производительность для сложных реальных мультимодальных задач.

автор qwen23 окт. 2025 г.12,87 ₽ / 1 млн входных51,49 ₽ / 1 млн выходных
IBM: Granite 4.0 Micro

ibm-granite/granite-4.0-h-micro

Granite-4.0-H-Micro — это модель с 3B параметрами из семейства моделей Granite 4. Эти модели являются новейшими в серии моделей, выпущенных IBM. Они дообучены для вызова инструментов в длинном контексте.

автор ibm-granite20 окт. 2025 г.2,10 ₽ / 1 млн входных13,86 ₽ / 1 млн выходных
OpenAI: GPT-5 Image Mini

openai/gpt-5-image-mini

GPT-5 Image Mini объединяет передовые языковые возможности OpenAI, основанные на GPT-5 Mini, с GPT Image 1 Mini для эффективной генерации изображений. Эта нативно мультимодальная модель отличается превосходным следованием инструкциям, отображением текста и детальным редактированием изображений при сниженной задержке и стоимости. Она превосходно справляется с созданием высококачественного визуального контента, сохраняя при этом сильное понимание текста, что делает её идеальной для приложений, требующих как эффективной генерации изображений, так и обработки текста в больших масштабах.

автор openai16 окт. 2025 г.990,20 ₽ за 1 млн токенов
Anthropic: Claude Haiku 4.5

anthropic/claude-haiku-4.5

Claude Haiku 4.5 — самая быстрая и эффективная модель Anthropic, обеспечивающая интеллект почти фронтирного уровня при доле стоимости и задержки по сравнению с более крупными моделями Claude. Сопоставимая с производительностью Claude Sonnet 4 в задачах рассуждения, написания кода и использования компьютера, Haiku 4.5 выводит возможности фронтирного уровня в реальное время и приложения с высокими объёмами нагрузки. Она представляет расширенное мышление для линейки Haiku, обеспечивая контроль глубины рассуждений, суммаризированный или чередующийся вывод мыслей и рабочие процессы с инструментальной поддержкой, включая полную поддержку программирования, bash, веб-поиска и инструментов использования компьютера. Набрав >73% баллов в SWE-bench Verified, Haiku 4.5 занимает место среди лучших мировых моделей кодирования, сохраняя исключительную отзывчивость для сабагентов, параллельного выполнения и масштабируемого развёртывания.

автор anthropic15 окт. 2025 г.123,78 ₽ / 1 млн входных618,88 ₽ / 1 млн выходных
Qwen: Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking

Qwen3-VL-8B-Thinking — это вариант мультимодальной модели Qwen3-VL-8B, оптимизированный для рассуждений, предназначенный для продвинутого визуального и текстового мышления при работе со сложными сценами, документами и временными последовательностями. Он объединяет улучшенное мультимодальное согласование и обработку длинного контекста (нативно 256K, расширяется до 1M токенов) для таких задач, как научный визуальный анализ, каузальный вывод и математические рассуждения по изображениям или видео. По сравнению с версией Instruct, версия Thinking вводит более глубокое слияние визуального и языкового и продуманные пути рассуждений, которые улучшают производительность в задачах длинных логических цепочек, решении задач STEM и многошаговом понимании видео. Она достигает более сильной временной привязки благодаря Interleaved-MRoPE и эмбеддингам с учётом временных меток, сохраняя при этом надёжное OCR, многоязычное понимание и генерацию текста на уровне крупных текстовых LLMs.

автор qwen14 окт. 2025 г.22,28 ₽ / 1 млн входных259,93 ₽ / 1 млн выходных
Qwen: Qwen3 VL 8B Instruct

qwen/qwen3-vl-8b-instruct

Qwen3-VL-8B-Instruct — это мультимодальная модель vision-language из серии Qwen3-VL, созданная для высокоточной интерпретации и рассуждений в области текста, изображений и видео. Она отличается улучшенной мультимодальной интеграцией с Interleaved-MRoPE для долгосрочных временных рассуждений, DeepStack для точного выравнивания визуальных и текстовых данных, а также выравниванием текста по временным меткам для точной локализации событий. Модель поддерживает нативное контекстное окно на 256K токенов, расширяемое до 1M токенов, и обрабатывает как статические, так и динамические медиаданные для таких задач, как разбор документов, ответы на визуальные вопросы, пространственные рассуждения и управление GUI. Она достигает понимания текста, сравнимого с ведущими LLMs, расширяя при этом охват OCR до 32 языков и повышая устойчивость к разнообразным визуальным условиям.

автор qwen14 окт. 2025 г.14,48 ₽ / 1 млн входных56,32 ₽ / 1 млн выходных
OpenAI: GPT-5 Image

openai/gpt-5-image

GPT-5 Image сочетает модель OpenAI's GPT-5 с современными возможностями генерации изображений. Это обеспечивает значительные улучшения в рассуждении, качестве кода и пользовательском опыте, а также включает превосходное следование инструкциям GPT Image 1, рендеринг текста и детализированное редактирование изображений.

автор openai14 окт. 2025 г.4 951,02 ₽ за 1 млн токенов

Gemini 2.5 Flash Image, также известная как "Nano Banana", теперь общедоступна. Это современная модель генерации изображений с контекстным пониманием. Она способна генерировать изображения, редактировать их и вести многоходовые диалоги. Соотношение сторон можно контролировать с помощью параметра image_config API.

автор google7 окт. 2025 г.3 713,27 ₽ за 1 млн токенов
Qwen: Qwen3 VL 30B A3B Thinking

qwen/qwen3-vl-30b-a3b-thinking

Qwen3-VL-30B-A3B-Thinking — это мультимодальная модель, объединяющая мощную генерацию текста с визуальным пониманием изображений и видео. Вариант Thinking улучшает рассуждения в STEM, математике и сложных задачах. Она превосходно справляется с восприятием реальных/синтетических категорий, пространственной привязкой 2D/3D и длинным визуальным пониманием, достигая конкурентоспособных результатов в мультимодальных бенчмарках. Для агентного использования она обрабатывает многообразные многоходовые инструкции, согласование временных линий видео, автоматизацию GUI и визуальное программирование от набросков до отлаженного UI. Текстовая производительность соответствует флагманским моделям Qwen3, подходя для обработки документов AI, OCR, помощи UI, пространственных задач и агентных исследований.

автор qwen6 окт. 2025 г.24,76 ₽ / 1 млн входных297,06 ₽ / 1 млн выходных
Qwen: Qwen3 VL 30B A3B Instruct

qwen/qwen3-vl-30b-a3b-instruct

Qwen3-VL-30B-A3B-Instruct — это мультимодальная модель, которая объединяет сильную генерацию текста с визуальным пониманием изображений и видео. Её вариант Instruct оптимизирует следование инструкциям для общих мультимодальных задач. Она превосходно справляется с восприятием реальных/синтетических категорий, пространственной привязкой в 2D/3D и длинным визуальным пониманием, достигая конкурентоспособных результатов в мультимодальных бенчмарках. Для агентного использования она обрабатывает многораундовые инструкции с несколькими изображениями, выравнивание временной шкалы видео, автоматизацию GUI и визуальное кодирование от эскизов до отлаженного UI. Текстовая производительность соответствует флагманским моделям Qwen3, что подходит для AI документов, OCR, UI-помощи, пространственных задач и агентных исследований.

автор qwen6 окт. 2025 г.18,57 ₽ / 1 млн входных74,27 ₽ / 1 млн выходных
OpenAI: GPT-5 Pro

openai/gpt-5-pro

GPT-5 Pro — самая продвинутая модель OpenAI, предлагающая значительные улучшения в рассуждении, качестве кода и пользовательском опыте. Она оптимизирована для сложных задач, требующих пошагового рассуждения, следования инструкциям и точности в сценариях с высокими ставками. Поддерживает функции маршрутизации во время тестирования и расширенное понимание подсказок, включая задаваемые пользователем намерения, такие как «хорошенько подумай над этим». Улучшения включают снижение галлюцинаций, подхалимства и более высокую производительность в задачах, связанных с программированием, письмом и здоровьем.

автор openai6 окт. 2025 г.1 856,63 ₽ / 1 млн входных14 853,07 ₽ / 1 млн выходных
Z.ai: GLM 4.6

z-ai/glm-4.6

По сравнению с GLM-4.5, это поколение включает несколько ключевых улучшений: Более длинное контекстное окно: размер контекстного окна был расширен с 128K до 200K токенов, что позволяет модели справляться с более сложными агентными задачами. Превосходная производительность в кодировании: модель достигает более высоких результатов в бенчмарках для кода и демонстрирует лучшую реальную производительность в таких приложениях, как Claude Code, Cline, Roo Code и Kilo Code, включая улучшения в генерации визуально отполированных фронтенд-страниц. Продвинутые рассуждения: GLM-4.6 демонстрирует явное улучшение в способности к рассуждениям и поддерживает использование инструментов во время вывода, что приводит к более сильной общей функциональности. Более способные агенты: GLM-4.6 показывает более высокую производительность в агентах, использующих инструменты и поиск, и более эффективно интегрируется в агентные фреймворки. Улучшенный стиль письма: лучше соответствует человеческим предпочтениям в стиле и читабельности, а также ведёт себя более естественно в сценариях ролевых игр.

автор z-ai30 сент. 2025 г.53,22 ₽ / 1 млн входных216,61 ₽ / 1 млн выходных
Anthropic: Claude Sonnet 4.5

anthropic/claude-sonnet-4.5

Claude Sonnet 4.5 — это самая продвинутая модель Sonnet от Anthropic на сегодняшний день, оптимизированная для реальных агентов и рабочих процессов программирования. Она обеспечивает передовую производительность на бенчмарках кодинга, таких как SWE-bench Verified, с улучшениями в проектировании систем, безопасности кода и соблюдении спецификаций. Модель предназначена для длительной автономной работы, поддерживая непрерывность задач между сессиями и предоставляя отслеживание прогресса на основе фактов. Sonnet 4.5 также представляет более сильные агентные возможности, включая улучшенную оркестрацию инструментов, спекулятивное параллельное выполнение и более эффективное управление контекстом и памятью. Благодаря улучшенному отслеживанию контекста и контролю использования токенов при вызовах инструментов, она особенно хорошо подходит для многоконтекстных и длительных рабочих процессов. Варианты использования охватывают программную инженерию, кибербезопасность, финансовый анализ, исследовательских агентов и другие области, требующие устойчивого рассуждения и использования инструментов.

автор anthropic29 сент. 2025 г.от 371,33 ₽ / 1 млн входныхот 1 856,63 ₽ / 1 млн выходных
DeepSeek: DeepSeek V3.2 Exp

deepseek/deepseek-v3.2-exp

DeepSeek-V3.2-Exp — это экспериментальная большая языковая модель, выпущенная компанией DeepSeek в качестве промежуточного шага между V3.1 и будущими архитектурами. Она представляет DeepSeek Sparse Attention (DSA) — механизм мелкозернистого разреженного внимания, предназначенный для повышения эффективности обучения и инференса в сценариях с длинным контекстом при сохранении качества выходных данных. Пользователи могут управлять поведением рассуждения с помощью логического значения reasoning enabled. Узнайте больше в нашей документации Модель обучалась в условиях, согласованных с V3.1-Terminus, чтобы обеспечить прямое сравнение. Тестирование показывает, что производительность примерно находится на уровне V3.1 в задачах рассуждения, написания кода и агентного использования инструментов, с небольшими компромиссами и выигрышами в зависимости от области применения. Этот выпуск сосредоточен на проверке оптимизаций архитектуры для расшirенных длин контекста, а не на повышении точности задач как таковой, что делает модель в первую очередь исследовательской, предназначенной для изучения эффективных конструкций трансформеров.

автор deepseek29 сент. 2025 г.33,42 ₽ / 1 млн входных50,75 ₽ / 1 млн выходных
TheDrummer: Cydonia 24B V4.1

thedrummer/cydonia-24b-v4.1

Модель без цензуры для творческого письма на основе Mistral Small 3.2 24B с хорошей памятью, соблюдением промпта и интеллектом.

автор thedrummer27 сент. 2025 г.37,13 ₽ / 1 млн входных61,89 ₽ / 1 млн выходных
Relace: Relace Apply 3

relace/relace-apply-3

Relace Apply 3 — это специализированная LLM для исправления кода, которая объединяет правки AI-suggested прямо в ваши исходные файлы. Она может применять обновления из GPT-4o, Claude и других источников в ваши файлы со средней скоростью 10,000 токенов/сек. Модель требует, чтобы запрос имел следующий формат: {инструкция} {initial_code} {edit_snippet} Для Relace включено нулевое хранение данных. Подробнее об этой модели читайте в их документации

автор relace26 сент. 2025 г.105,21 ₽ / 1 млн входных154,72 ₽ / 1 млн выходных
Qwen: Qwen3 VL 235B A22B Thinking

qwen/qwen3-vl-235b-a22b-thinking

Qwen3-VL-235B-A22B Thinking — это мультимодальная модель, объединяющая сильную генерацию текста с визуальным пониманием изображений и видео. Модель Thinking оптимизирована для мультимодальных рассуждений в STEM и математике. Серия подчеркивает надежное восприятие (распознавание разнообразных реальных и синтетических категорий), пространственное понимание (2D/3D привязка) и длительное визуальное восприятие, с конкурентоспособными результатами на публичных мультимодальных бенчмарках как для восприятия, так и для рассуждений. Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: он может следовать сложным инструкциям в многоизображных и многооборотных диалогах; согласовывать текст с видео-таймлайнами для точных временных запросов; и управлять элементами GUI для задач автоматизации. Модели также обеспечивают визуальные рабочие процессы кодирования, превращая наброски или макеты в код и помогая с отладкой UI, сохраняя при этом высокую производительность только для текста, сравнимую с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL подходящими для производственных сценариев, охватывающих AI документов, многоязычный OCR, помощь в разработке ПО/UI, пространственные/воплощенные задачи и исследования агентов зрения и языка.

автор qwen23 сент. 2025 г.49,51 ₽ / 1 млн входных495,10 ₽ / 1 млн выходных
Qwen: Qwen3 VL 235B A22B Instruct

qwen/qwen3-vl-235b-a22b-instruct

Qwen3-VL-235B-A22B Instruct — это мультимодальная модель с открытыми весами, объединяющая сильную генерацию текста с визуальным пониманием изображений и видео. Модель Instruct ориентирована на универсальные сценарии применения в области зрения и языка (VQA, разбор документов, извлечение данных из диаграмм и таблиц, многоязычный OCR). Серия подчеркивает надежное восприятие (распознавание разнообразных реальных и синтетических категорий), пространственное понимание (2D/3D-grounding) и длительное визуальное понимание, демонстрируя конкурентоспособные результаты на публичных мультимодальных бенчмарках как по восприятию, так и по рассуждению. Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: модель может следовать сложным инструкциям в многоизображных и многоходовых диалогах; согласовывать текст с видеошкалой времени для точных временных запросов; а также управлять элементами GUI для задач автоматизации. Модели также обеспечивают рабочие процессы визуального кодирования — превращая эскизы или макеты в код и помогая с отладкой UI — сохраняя при этом высокую производительность при работе только с текстом, сопоставимую с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL пригодными для производственных сценариев, охватывающих AI документов, многоязычный OCR, помощь в разработке ПО/UI, пространственные/воплощенные задачи и исследования агентов на основе зрения и языка.

автор qwen23 сент. 2025 г.25,99 ₽ / 1 млн входных235,17 ₽ / 1 млн выходных
Qwen: Qwen3 Max

qwen/qwen3-max

Qwen3-Max — это обновлённая версия, построенная на серии Qwen3, предлагающая значительные улучшения в рассуждениях, следовании инструкциям, многоязычной поддержке и покрытии редких знаний по сравнению с январской версией 2025. Она обеспечивает более высокую точность в задачах по математике, программированию, логике и науке, более надёжно следует сложным инструкциям на китайском и английском языках, снижает галлюцинации и выдаёт более качественные ответы для открытых вопросов, написания текстов и разговоров. Модель поддерживает более 100 языков с более сильным переводом и здравым смыслом, а также оптимизирована для генерации с дополнением извлечением (RAG) и вызова инструментов, хотя она не включает специальный режим «размышления».

автор qwen23 сент. 2025 г.от 96,54 ₽ / 1 млн входныхот 482,72 ₽ / 1 млн выходных
Qwen: Qwen3 Coder Plus

qwen/qwen3-coder-plus

Qwen3 Coder Plus — это проприетарная версия Alibaba на основе открытого исходного кода Qwen3 Coder 480B A35B. Это мощная модель-агент для программирования, специализирующаяся на автономном написании кода с помощью вызова инструментов и взаимодействия со средой, сочетающая навыки программирования с универсальными возможностями общего назначения.

автор qwen23 сент. 2025 г.от 80,45 ₽ / 1 млн входныхот 402,27 ₽ / 1 млн выходных
DeepSeek: DeepSeek V3.1 Terminus

deepseek/deepseek-v3.1-terminus

DeepSeek-V3.1 Terminus — это обновление модели DeepSeek V3.1, которое сохраняет исходные возможности модели, одновременно устраняя проблемы, о которых сообщают пользователи, включая согласованность языка и возможности агентов, а также дополнительно оптимизируя производительность модели в задачах написания кода и поисковых агентов. Это большая гибридная модель рассуждений (671B параметров, 37B активны), которая поддерживает как режим мышления, так и режим без мышления. Она расширяет базу DeepSeek-V3 двухэтапным процессом обучения на длинном контексте, достигая до 128K токенов, и использует FP8 микроскейлинг для эффективного вывода. Пользователи могут управлять поведением рассуждений с помощью логического значения reasoning enabled. Подробнее в нашей документации Модель улучшает использование инструментов, генерацию кода и эффективность рассуждений, достигая производительности, сравнимой с DeepSeek-R1 на сложных бенчмарках, при этом отвечая быстрее. Она поддерживает структурированные вызовы инструментов, агентов для работы с кодом и поисковых агентов, что делает её подходящей для исследовательских, кодовых и агентных рабочих процессов.

автор deepseek22 сент. 2025 г.33,42 ₽ / 1 млн входных123,78 ₽ / 1 млн выходных
Qwen: Qwen3 Coder Flash

qwen/qwen3-coder-flash

Qwen3 Coder Flash — это быстрая и экономически эффективная версия проприетарной модели Qwen3 Coder Plus от Alibaba. Это мощная модель-агент для написания кода, специализирующаяся на автономном программировании с помощью вызова инструментов и взаимодействия с окружением, сочетающая владение программированием с разносторонними возможностями общего назначения.

автор qwen17 сент. 2025 г.от 24,14 ₽ / 1 млн входныхот 120,68 ₽ / 1 млн выходных
Qwen: Qwen3 Next 80B A3B Thinking

qwen/qwen3-next-80b-a3b-thinking

Qwen3-Next-80B-A3B-Thinking — это чат-модель с приоритетом рассуждений в линейке Qwen3-Next, которая по умолчанию выводит структурированные «трассы мышления». Она предназначена для сложных многошаговых задач: математических доказательств, синтеза и отладки кода, логики и агентного планирования — и показывает сильные результаты в оценках знаний, рассуждений, программирования, согласованности и многоязычности. По сравнению с предыдущими вариантами Qwen3 она делает акцент на стабильности при длинных цепочках рассуждений и эффективном масштабировании во время инференса, а также настроена на следование сложным инструкциям при снижении повторяющегося или нецелевого поведения. Модель подходит для агентных фреймворков и использования инструментов (вызов функций), рабочих процессов с интенсивным поиском информации и стандартизированного бенчмаркинга, где требуются пошаговые решения. Она поддерживает длинные детализированные ответы и использует ориентированные на пропускную способность техники (например, предсказание нескольких токенов) для более быстрой генерации. Обратите внимание, что она работает только в режиме мышления.

автор qwen11 сент. 2025 г.18,57 ₽ / 1 млн входных148,53 ₽ / 1 млн выходных
Qwen: Qwen3 Next 80B A3B Instruct

qwen/qwen3-next-80b-a3b-instruct

Qwen3-Next-80B-A3B-Instruct — это инструктивно-настроенная чат-модель из серии Qwen3-Next, оптимизированная для быстрых и стабильных ответов без следов «размышлений». Она нацелена на сложные задачи, включая рассуждение, генерацию кода, знания QA и многоязычное использование, оставаясь при этом устойчивой к согласованию и форматированию. По сравнению с предыдущими инструктивными вариантами Qwen3, она фокусируется на более высокой пропускной способности и стабильности на сверхдлинных входах и многоходовых диалогах, что делает её хорошо подходящей для RAG, использования инструментов и агентных рабочих процессов, требующих последовательных финальных ответов, а не видимой цепочки рассуждений. Модель использует эффективное с точки зрения масштабирования обучение и декодирование для улучшения эффективности параметров и скорости инференса, и была проверена на широком наборе публичных бенчмарков, где она достигает или приближается к более крупным системам Qwen3 в нескольких категориях, превосходя при этом более ранние модели среднего размера. Её лучше всего использовать как универсального ассистента, помощника по коду и решателя задач с длинным контекстом в производственных средах, где предпочтительны детерминированные выводы, следующие инструкциям.

автор qwen11 сент. 2025 г.12,38 ₽ / 1 млн входных136,15 ₽ / 1 млн выходных
Qwen: Qwen Plus 0728

qwen/qwen-plus-2025-07-28

Qwen Plus 0728, созданная на основе фундаментальной модели Qwen3, представляет собой гибридную модель рассуждений с контекстом в 1 миллионов токенов, отличающуюся сбалансированным сочетанием производительности, скорости и стоимости.

автор qwen8 сент. 2025 г.от 32,18 ₽ / 1 млн входныхот 96,54 ₽ / 1 млн выходных
MoonshotAI: Kimi K2 0905

moonshotai/kimi-k2-0905

Kimi K2 0905 — это сентябрьское обновление модели Kimi K2 0711. Это крупномасштабная языковая модель на основе смеси экспертов (MoE), разработанная компанией Moonshot AI, с 1 триллионами параметров суммарно и 32 миллиардами активных параметров на каждом прямом проходе. Она поддерживает вывод с длинным контекстом до 256k токенов, что расширено с предыдущих 128k. Это обновление улучшает агентное программирование с более высокой точностью и лучшей обобщаемостью на различных каркасах, а также улучшает фронтенд-разработку, обеспечивая более эстетичные и функциональные результаты для веб-задач, задач 3D и смежных областей. Kimi K2 оптимизирована для агентных возможностей, включая продвинутое использование инструментов, рассуждение и синтез кода. Модель превосходно показывает себя в тестах на программирование (LiveCodeBench, SWE-bench), рассуждение (ZebraLogic, GPQA) и использование инструментов (Tau2, AceBench). Модель обучена с использованием нового стека, включающего оптимизатор MuonClip для стабильного крупномасштабного обучения MoE.

автор moonshotai4 сент. 2025 г.74,27 ₽ / 1 млн входных309,44 ₽ / 1 млн выходных
Qwen: Qwen3 30B A3B Thinking 2507

qwen/qwen3-30b-a3b-thinking-2507

Qwen3-30B-A3B-Thinking-2507 — это 30B-параметрическая модель смеси экспертов, оптимизированная для сложных задач, требующих многошаговых рассуждений. Модель специально разработана для «режима мышления», где внутренние цепочки рассуждений отделены от итоговых ответов. По сравнению с предыдущими версиями Qwen3-30B, данная версия показывает улучшенные результаты в логических рассуждениях, математике, естественных науках, программировании и многоязычных тестах. Также она демонстрирует более сильные навыки следования инструкциям, использования инструментов и согласования с человеческими предпочтениями. Благодаря повышенной эффективности рассуждений и расширенным бюджетам вывода, модель лучше всего подходит для передовых исследований, решения сложных задач и агентных приложений, требующих структурированных длинных контекстов.

автор qwen28 авг. 2025 г.24,76 ₽ / 1 млн входных297,06 ₽ / 1 млн выходных
Nous: Hermes 4 70B

nousresearch/hermes-4-70b

Hermes 4 70B — это гибридная модель рассуждений от Nous Research, построенная на основе Meta-Llama-3.1-70B. Она использует тот же гибридный режим, что и более крупная версия 405B, позволяя модели либо отвечать напрямую, либо генерировать явные цепочки рассуждений перед ответом. Пользователи могут управлять поведением рассуждений с помощью логического параметра reasoning enabled. Подробнее в нашей документации Этот вариант 70B обучен на расширенном корпусе пост-обучения (~60B токенов) с акцентом на проверенные данные рассуждений, что привело к улучшениям в математике, программировании, STEM, логике и структурированных выводах, сохраняя при этом производительность общего ассистента. Он поддерживает режим JSON, соблюдение схем, вызов функций и использование инструментов, а также обеспечивает большую управляемость и сниженную частоту отказов.

автор nousresearch26 авг. 2025 г.16,09 ₽ / 1 млн входных49,51 ₽ / 1 млн выходных
Nous: Hermes 4 405B

nousresearch/hermes-4-405b

Hermes 4 — это крупномасштабная модель рассуждений, построенная на Meta-Llama-3.1-405B и выпущенная исследовательской группой Nous Research. Она вводит гибридный режим рассуждений, в котором модель может выбирать между внутренним обдумыванием с трассировками thinking... response и прямым ответом, обеспечивая гибкость между скоростью и глубиной. Пользователи могут управлять поведением рассуждений с помощью логического параметра reasoning enabled. Подробнее в нашей документации Модель дообучена по инструкциям с расширенным пост-тренировочным корпусом (~60B токенов), с акцентом на трассировки рассуждений, что улучшает производительность в математике, программировании, STEM и логических рассуждениях, сохраняя при этом широкую ассистентскую функциональность. Она также поддерживает структурированные выходные данные, включая режим JSON, соблюдение схем, вызов функций и использование инструментов. Hermes 4 обучена на управляемость, более низкий уровень отказов и согласование с нейтральным, ориентированным на пользователя поведением.

автор nousresearch26 авг. 2025 г.123,78 ₽ / 1 млн входных371,33 ₽ / 1 млн выходных
DeepSeek: DeepSeek V3.1

deepseek/deepseek-chat-v3.1

DeepSeek-V3.1 — это крупная гибридная модель рассуждений (671B параметров, 37B активных), поддерживающая как режим размышлений, так и режим без размышлений с помощью шаблонов подсказок. Она расширяет базовую модель DeepSeek-V3 двухэтапным процессом обучения на длинных контекстах, достигая до 128K токенов, и использует масштабирование FP8 для эффективного вывода. Пользователи могут управлять поведением рассуждений с помощью логического значения reasoning enabled. Подробнее в нашей документации Модель улучшает использование инструментов, генерацию кода и эффективность рассуждений, достигая производительности, сравнимой с DeepSeek-R1 на сложных бенчмарках, при этом отвечая быстрее. Она поддерживает структурированные вызовы инструментов, кодовых агентов и поисковых агентов, что делает её подходящей для исследовательских, кодовых и агентных сценариев. Она является преемником модели DeepSeek V3-0324 и хорошо справляется с разнообразными задачами.

автор deepseek21 авг. 2025 г.30,94 ₽ / 1 млн входных117,59 ₽ / 1 млн выходных
Mistral: Mistral Medium 3.1

mistralai/mistral-medium-3.1

Mistral Medium 3.1 — обновленная версия Mistral Medium 3, которая представляет собой высокопроизводительную языковую модель корпоративного класса, предназначенную для обеспечения возможностей передового уровня при значительно сниженных эксплуатационных затратах. Она сочетает современные возможности рассуждения и мультимодальную производительность со стоимостью в 8× ниже по сравнению с традиционными большими моделями, что делает ее пригодной для масштабируемого развертывания в профессиональных и промышленных сценариях использования. Модель превосходно проявляет себя в таких областях, как написание кода, STEM-рассуждения и корпоративная адаптация. Она поддерживает гибридные, локальные (on-prem) и внутри-VPC-развертывания и оптимизирована для интеграции в пользовательские рабочие процессы. Mistral Medium 3.1 обеспечивает конкурентоспособную точность по сравнению с более крупными моделями, такими как Claude Sonnet 3.5/3.7, Llama 4 Maverick и Command R+, сохраняя при этом широкую совместимость с облачными средами.

автор mistralai13 авг. 2025 г.49,51 ₽ / 1 млн входных247,55 ₽ / 1 млн выходных
Z.ai: GLM 4.5V

z-ai/glm-4.5v

GLM-4.5V — это фундаментальная модель зрения и языка для мультимодальных агентных приложений. Построенная на архитектуре Mixture-of-Experts (MoE) с 106B параметрами и 12B активируемыми параметрами, она достигает передовых результатов в понимании видео, ответах на вопросы по изображениям, OCR и разборе документов, со значительными улучшениями во фронтенд-веб-кодинге, grounding и пространственном мышлении. Она предлагает гибридный режим инференса: «режим мышления» для глубокого рассуждения и «режим без мышления» для быстрых ответов. Поведение рассуждения можно переключать через логическое значение reasoning enabled. Узнайте больше в нашей документации

автор z-ai11 авг. 2025 г.74,27 ₽ / 1 млн входных222,80 ₽ / 1 млн выходных
OpenAI: GPT-5

openai/gpt-5

GPT-5 — это самая продвинутая модель от OpenAI, предлагающая значительные улучшения в рассуждении, качестве кода и пользовательском опыте. Она оптимизирована для сложных задач, требующих пошагового мышления, следования инструкциям и точности в ответственных сценариях. Модель поддерживает функции маршрутизации на этапе тестирования и расширенное понимание намерений пользователя, включая такие запросы, как «обдумай это тщательно». Среди улучшений — снижение количества галлюцинаций и сикофантии, а также повышение производительности в задачах, связанных с программированием, письмом и медициной.

автор openai7 авг. 2025 г.154,72 ₽ / 1 млн входных1 237,76 ₽ / 1 млн выходных
OpenAI: GPT-5 Mini

openai/gpt-5-mini

GPT-5 Mini — это компактная версия GPT-5, предназначенная для решения менее ресурсоёмких задач рассуждения. Она обеспечивает те же преимущества следования инструкциям и безопасности тонкой настройки, что и GPT-5, но с меньшей задержкой и стоимостью. GPT-5 Mini — это преемник модели o4-mini от OpenAI.

автор openai7 авг. 2025 г.30,94 ₽ / 1 млн входных247,55 ₽ / 1 млн выходных
OpenAI: GPT-5 Nano

openai/gpt-5-nano

GPT-5-Nano — это самая компактная и быстрая вариация в системе GPT-5, оптимизированная для инструментов разработчика, быстрых взаимодействий и сред со сверхнизкой задержкой. Несмотря на ограниченную глубину рассуждений по сравнению с более крупными аналогами, она сохраняет ключевые функции следования инструкциям и безопасности. Она является преемницей GPT-4.1-nano и предлагает облегченный вариант для приложений с ограниченным бюджетом или работающих в реальном времени.

автор openai7 авг. 2025 г.6,19 ₽ / 1 млн входных49,51 ₽ / 1 млн выходных
OpenAI: gpt-oss-120b

openai/gpt-oss-120b

gpt-oss-120b — это модель языка с открытым весом, на 117B параметров, архитектуры Mixture-of-Experts (MoE) от OpenAI, предназначенная для производственных сценариев с высокими требованиями к рассуждению, агентных и универсальных задач. Она активирует 5.1B параметров за прямой проход и оптимизирована для работы на одном H100 GPU с нативной квантизацией MXFP4. Модель поддерживает настраиваемую глубину рассуждений, полный доступ к цепочке рассуждений и нативное использование инструментов, включая вызов функций, просмотр веб-страниц и генерацию структурированных выходных данных.

автор openai5 авг. 2025 г.4,58 ₽ / 1 млн входных21,04 ₽ / 1 млн выходных
OpenAI: gpt-oss-20b

openai/gpt-oss-20b

gpt-oss-20b — это модель с открытыми весами, выпущенная OpenAI с 21B параметрами под лицензией Apache 2.0. В ней используется архитектура смеси экспертов (MoE) с 3.6B активными параметрами на прямой проход, что обеспечивает более низкую задержку вывода и возможность развертывания на потребительском или однопроцессорном оборудовании GPU. Модель обучается в формате ответов Harmony от OpenAI и поддерживает настройку уровня рассуждений, дообучение, а также агентные возможности, включая вызов функций, использование инструментов и структурированные выходные данные.

автор openai5 авг. 2025 г.3,71 ₽ / 1 млн входных16,09 ₽ / 1 млн выходных
Anthropic: Claude Opus 4.1

anthropic/claude-opus-4.1

Claude Opus 4.1 является обновленной версией флагманской модели Anthropic, предлагающей улучшенную производительность в задачах кодирования, рассуждения и агентных задач. Она достигает 74.5% на SWE-bench Verified и демонстрирует заметные улучшения в рефакторинге многофайлового кода, точности отладки и детальном рассуждении. Модель поддерживает расширенное мышление до 64K токенов и оптимизирована для задач, связанных с исследованиями, анализом данных и рассуждениями с использованием инструментов.

автор anthropic5 авг. 2025 г.1 856,63 ₽ / 1 млн входных9 283,17 ₽ / 1 млн выходных
Mistral: Codestral 2508

mistralai/codestral-2508

Mistral — передовая языковая модель для программирования, выпущенная в конце июля 2025. Codestral специализируется на задачах с низкой задержкой и высокой частотой, таких как fill-in-the-middle (FIM), исправление кода и генерация тестов. Blog Post

автор mistralai1 авг. 2025 г.37,13 ₽ / 1 млн входных111,40 ₽ / 1 млн выходных
Qwen: Qwen3 Coder 30B A3B Instruct

qwen/qwen3-coder-30b-a3b-instruct

Qwen3-Coder-30B-A3B-Instruct — это модель смеси экспертов (MoE) с параметрами 30.5B, содержащая 128 экспертов (8 активны на каждом прямом проходе), предназначенная для продвинутой генерации кода, понимания на уровне репозитория и агентного использования инструментов. Построенная на архитектуре Qwen3, она поддерживает нативную длину контекста в 256K токенов (расширяемую до 1M с помощью Yarn) и показывает высокие результаты в задачах, включающих вызовы функций, использование браузера и структурированное завершение кода. Эта модель оптимизирована для следования инструкциям без «режима размышлений» и хорошо интегрируется с форматами использования инструментов, совместимыми с OpenAI.

автор qwen31 июл. 2025 г.8,66 ₽ / 1 млн входных34,66 ₽ / 1 млн выходных
Qwen: Qwen3 30B A3B Instruct 2507

qwen/qwen3-30b-a3b-instruct-2507

Qwen3-30B-A3B-Instruct-2507 — это языковая модель смеси экспертов с 30.5B параметрами от Qwen, с 3.3B активными параметрами на каждый вывод. Она работает в режиме без мышления и предназначена для качественного следования инструкциям, многоязычного понимания и использования агентных инструментов. Дообученная на инструкциях, она демонстрирует конкурентоспособные результаты в бенчмарках рассуждений (AIME, ZebraLogic), кодирования (MultiPL-E, LiveCodeBench) и согласованности (IFEval, WritingBench). Она превосходит свою версию без инструкций в субъективных и открытых задачах, сохраняя при этом высокую фактическую точность и производительность в кодировании.

автор qwen29 июл. 2025 г.5,96 ₽ / 1 млн входных23,89 ₽ / 1 млн выходных
Z.ai: GLM 4.5

z-ai/glm-4.5

GLM-4.5 — это наша новейшая флагманская базовая модель, специально разработанная для агентных приложений. Она использует архитектуру смеси экспертов (MoE) и поддерживает длину контекста до 128k токенов. GLM-4.5 обеспечивает значительно расширенные возможности в рассуждении, генерации кода и выравнивании агентов. Она поддерживает гибридный режим логического вывода с двумя опциями: «режим мышления», предназначенный для сложных рассуждений и использования инструментов, и «режим без мышления», оптимизированный для мгновенных ответов. Пользователи могут управлять поведением рассуждения с помощью булева параметра reasoning enabled. Подробнее в нашей документации

автор z-ai25 июл. 2025 г.74,27 ₽ / 1 млн входных272,31 ₽ / 1 млн выходных
Z.ai: GLM 4.5 Air

z-ai/glm-4.5-air

GLM-4.5-Air — это облегченная версия нашей последней серии флагманских моделей, специально созданная для агентных приложений. Как и GLM-4.5, она использует архитектуру «смесь экспертов» (MoE), но с более компактным размером параметров. GLM-4.5-Air также поддерживает гибридные режимы вывода, предлагая «режим мышления» для сложных рассуждений и использования инструментов, а также «режим без мышления» для взаимодействия в реальном времени. Пользователи могут управлять поведением рассуждений с помощью логического параметра reasoning enabled. Подробнее в нашей документации

автор z-ai25 июл. 2025 г.16,09 ₽ / 1 млн входных105,21 ₽ / 1 млн выходных
Qwen: Qwen3 235B A22B Thinking 2507

qwen/qwen3-235b-a22b-thinking-2507

Qwen3-235B-A22B-Thinking-2507 — это высокопроизводительная открытая языковая модель архитектуры Mixture-of-Experts (MoE), оптимизированная для сложных задач рассуждения. Она активирует 22B из своих 235B параметров за один прямой проход и изначально поддерживает до 262,144 токенов контекста. Этот вариант «только для размышлений» улучшает структурированные логические рассуждения, математику, естественные науки и длительную генерацию текста, демонстрируя сильные результаты в бенчмарках AIME, SuperGPQA, LiveCodeBench и MMLU-Redux. Модель принудительно использует специальный режим рассуждения (response) и предназначена для генерации большого количества токенов (до 81,920 токенов) в сложных областях. Модель дообучена на инструкциях и превосходно справляется с пошаговыми рассуждениями, использованием инструментов, агентными сценариями работы и многоязычными задачами. Этот релиз представляет собой самую производительную открытую версию в серии Qwen3-235B, превосходящую многие закрытые модели в сценариях структурированных рассуждений.

автор qwen25 июл. 2025 г.28,47 ₽ / 1 млн входных284,68 ₽ / 1 млн выходных

Qwen3-Coder-480B-A35B-Instruct — это модель генерации кода, основанная на архитектуре смеси экспертов (MoE), разработанная командой Qwen. Она оптимизирована для агентных задач кодирования, таких как вызов функций, использование инструментов и длинноконтекстное рассуждение по репозиториям. Модель имеет 480 миллиардов параметров, из которых 35 миллиардов активны во время каждого прямого прохода (8 из 160 экспертов). Цены на конечные точки Alibaba варьируются в зависимости от длины контекста. Если длина запроса превышает 128k входных токенов, применяется более высокая цена.

автор qwen23 июл. 2025 г.37,13 ₽ / 1 млн входных123,78 ₽ / 1 млн выходных
ByteDance: UI-TARS 7B

bytedance/ui-tars-1.5-7b

UI-TARS-1.5 — это мультимодальный визуально-языковой агент, оптимизированный для сред GUI-based, включая интерфейсы рабочего стола, веб-браузеры, мобильные системы и игры. Созданный компанией ByteDance, он основан на фреймворке UI-TARS с рассуждением на основе обучения с подкреплением, что обеспечивает надежное планирование действий и их выполнение в виртуальных интерфейсах. Эта модель достигает самых современных результатов на ряде интерактивных и grounding-бенчмарков, включая OSworld, WebVoyager, AndroidWorld и ScreenSpot. Она также демонстрирует полное выполнение задач в разнообразных играх Poki и превосходит предыдущие модели в задачах агента Minecraft. UI-TARS-1.5 поддерживает декомпозицию мышления во время инференса и демонстрирует сильное масштабирование по вариантам, причем версия 1.5 заметно превосходит по производительности более ранние чекпоинты 72B и 7B.

автор bytedance22 июл. 2025 г.12,38 ₽ / 1 млн входных24,76 ₽ / 1 млн выходных
Google: Gemini 2.5 Flash Lite

google/gemini-2.5-flash-lite

Gemini 2.5 Flash-Lite — это легковесная модель рассуждений в семействе Gemini 2.5, оптимизированная для сверхнизкой задержки и экономической эффективности. Она обеспечивает улучшенную пропускную способность, более быструю генерацию токенов и лучшую производительность в общих бенчмарках по сравнению с более ранними моделями Flash. По умолчанию «мышление» (т.е. многопроходные рассуждения) отключено для приоритета скорости, но разработчики могут включить его через параметр Reasoning API, чтобы избирательно обменивать стоимость на интеллект.

автор google22 июл. 2025 г.12,38 ₽ / 1 млн входных49,51 ₽ / 1 млн выходных
Qwen: Qwen3 235B A22B Instruct 2507

qwen/qwen3-235b-a22b-2507

Qwen3-235B-A22B-Instruct-2507 — это многоязычная языковая модель, настроенная на инструкции и основанная на архитектуре смеси экспертов Qwen3-235B, с 22B активными параметрами за один прямой проход. Она оптимизирована для генерации текста общего назначения, включая следование инструкциям, логические рассуждения, математику, код и использование инструментов. Модель поддерживает нативную длину контекста 262K и не реализует «режим мышления» (блоки thinking). По сравнению с базовой версией, эта версия обеспечивает значительные улучшения в охвате знаний, рассуждениях на длинном контексте, бенчмарках программирования и согласованности с открытыми задачами. Она особенно сильна в многоязычном понимании, математических рассуждениях (например, AIME, HMMT) и оценках согласованности, таких как Arena-Hard и WritingBench.

автор qwen21 июл. 2025 г.10,83 ₽ / 1 млн входных43,32 ₽ / 1 млн выходных
MoonshotAI: Kimi K2 0711

moonshotai/kimi-k2

Kimi K2 Instruct — это большая масштабируемая языковая модель на основе смеси экспертов (MoE), разработанная компанией Moonshot AI, с общим количеством параметров в 1 триллиона, из которых 32 миллиардов активны при каждом прямом проходе. Она оптимизирована для агентных возможностей, включая продвинутое использование инструментов, рассуждение и генерацию кода. Kimi K2 превосходит широкий круг бенчмарков, особенно в задачах программирования (LiveCodeBench, SWE-bench), рассуждения (ZebraLogic, GPQA) и использования инструментов (Tau2, AceBench). Она поддерживает инференс с длинным контекстом до 128K токенов и спроектирована с новым тренировочным стеком, включающим оптимизатор MuonClip для стабильного крупномасштабного обучения MoE.

автор moonshotai11 июл. 2025 г.70,55 ₽ / 1 млн входных284,68 ₽ / 1 млн выходных
Venice: Uncensored

cognitivecomputations/dolphin-mistral-24b-venice-edition

Venice Uncensored Dolphin Mistral 24B Venice Edition — это тонко настроенный вариант модели Mistral-Small-24B-Instruct-2501, разработанный компанией dphn.ai совместно с Venice.ai. Данная модель создана как «нецензурированная» LLM с инструктивной настройкой, сохраняющая контроль пользователя над выравниванием, системными подсказками и поведением. Предназначенная для продвинутых и неограниченных сценариев использования, Venice Uncensored делает акцент на управляемости и прозрачном поведении, убирая стандартные слои безопасности и выравнивания, обычно присутствующие в массовых ассистентских моделях.

автор cognitivecomputations9 июл. 2025 г.24,76 ₽ / 1 млн входных111,40 ₽ / 1 млн выходных
Tencent: Hunyuan A13B Instruct

tencent/hunyuan-a13b-instruct

Hunyuan-A13B — это языковая модель Mixture-of-Experts (MoE) с 13B активными параметрами, разработанная Tencent, с общим количеством параметров 80B и поддержкой рассуждений через цепочку мыслей. Она демонстрирует конкурентоспособные результаты в бенчмарках по математике, естественным наукам, программированию и многошаговым задачам рассуждений, сохраняя высокую эффективность инференса благодаря Grouped Query Attention (GQA) и поддержке квантования (FP8, GPTQ и т. д.).

автор tencent8 июл. 2025 г.17,33 ₽ / 1 млн входных70,55 ₽ / 1 млн выходных
Morph: Morph V3 Large

morph/morph-v3-large

Модель высокоточной обработки Morph для сложных правок кода. ~4,500 токенов/сек с точностью 98% для точных преобразований кода. Модель требует, чтобы запрос был в следующем формате: {instruction} {initial_code} {edit_snippet} Для Morph включено нулевое хранение данных. Узнайте больше об этой модели в их документации.

автор morph7 июл. 2025 г.111,40 ₽ / 1 млн входных235,17 ₽ / 1 млн выходных
Morph: Morph V3 Fast

morph/morph-v3-fast

Morph — самая быстрая модель для правок кода. ~10,500 токенов/сек с точностью 96% для быстрых преобразований кода. Модель требует, чтобы prompt был в следующем формате: {instruction} {initial_code} {edit_snippet} Нулевое хранение данных включено для Morph. Подробнее об этой модели в документации

автор morph7 июл. 2025 г.99,02 ₽ / 1 млн входных148,53 ₽ / 1 млн выходных
Baidu: ERNIE 4.5 VL 424B A47B

baidu/ernie-4.5-vl-424b-a47b

ERNIE-4.5-VL-424B-A47B — это мультимодальная модель с архитектурой «смесь экспертов» (MoE) из серии ERNIE 4.5 от Baidu, имеющая 424B всего параметров и 47B активных на каждый токен. Модель обучается совместно на текстовых и графических данных с использованием гетерогенной архитектуры MoE и изолированной маршрутизации по модальностям, что обеспечивает высокоточные межмодальные рассуждения, понимание изображений и генерацию длинного контекста (до 131k токенов). Благодаря тонкой настройке с такими методами, как SFT, DPO, UPO и RLVR, модель поддерживает как режимы «размышления», так и режимы без размышлений. Предназначенная для задач зрения и языка на английском и китайском, модель оптимизирована для эффективного масштабирования и может работать с квантованием в 4-бит и 8-бит.

автор baidu30 июн. 2025 г.51,99 ₽ / 1 млн входных154,72 ₽ / 1 млн выходных
Mistral: Mistral Small 3.2 24B

mistralai/mistral-small-3.2-24b-instruct

Mistral-Small-3.2-24B-Instruct-2506 — это обновленная модель с 24B параметрами от Mistral, оптимизированная для следования инструкциям, снижения повторений и улучшенного вызова функций. По сравнению с релизом 3.1, версия 3.2 значительно улучшает точность на WildBench и Arena Hard, сокращает бесконечные генерации и обеспечивает прирост в использовании инструментов и задачах со структурированным выводом. Он поддерживает ввод изображений и текста со структурированными выводами, вызов функций/инструментов, а также высокую производительность в области программирования (HumanEval+, MBPP), STEM (MMLU, MATH, GPQA) и бенчмарках компьютерного зрения (ChartQA, DocVQA).

автор mistralai20 июн. 2025 г.9,28 ₽ / 1 млн входных24,76 ₽ / 1 млн выходных
MiniMax: MiniMax M1

minimax/minimax-m1

MiniMax-M1 — это крупномасштабная модель с открытым весом, предназначенная для рассуждений, оптимизированная для длинного контекста и эффективного вывода. Она использует гибридную архитектуру смеси экспертов (MoE) в сочетании с пользовательским механизмом «молниеносного внимания», позволяющим обрабатывать длинные последовательности — до 1 миллионов токенов — при сохранении конкурентоспособной эффективности FLOP. При общем количестве 456 миллиардов параметров и 45.9B активных параметров на токен этот вариант оптимизирован для сложных многошаговых задач рассуждения. Обученная с помощью пользовательского конвейера обучения с подкреплением (CISPO), модель M1 превосходно справляется с пониманием длинного контекста, разработкой программного обеспечения, автономным использованием инструментов и математическими рассуждениями. Бенчмарки демонстрируют высокую производительность в задачах FullStackBench, SWE-bench, MATH, GPQA и TAU-Bench, часто превосходя другие открытые модели, такие как DeepSeek R1 и Qwen3-235B.

автор minimax17 июн. 2025 г.68,08 ₽ / 1 млн входных272,31 ₽ / 1 млн выходных
Google: Gemini 2.5 Flash

google/gemini-2.5-flash

Gemini 2.5 Flash — это передовая основная модель Google, специально разработанная для сложных задач рассуждения, программирования, математики и науки. Она включает встроенные возможности «мышления», позволяющие давать ответы с большей точностью и тонкой обработкой контекста. Кроме того, Gemini 2.5 Flash настраивается через параметр "max tokens for reasoning", как описано в документации (https://openrouter.ai/docs/use-cases/reasoning-tokens#max-tokens-for-reasoning).

автор google17 июн. 2025 г.37,13 ₽ / 1 млн входных309,44 ₽ / 1 млн выходных
Google: Gemini 2.5 Pro

google/gemini-2.5-pro

Gemini 2.5 Pro — это передовая модель Google AI, предназначенная для решения сложных задач в области логики, программирования, математики и науки. Модель использует возможности «мышления», что позволяет ей рассуждать при формировании ответов с повышенной точностью и тонким пониманием контекста. Gemini 2.5 Pro достигает результатов высшего уровня на множестве бенчмарков, включая первое место в рейтинге LMArena, что отражает превосходное соответствие человеческим предпочтениям и способность решать сложные проблемы.

автор google17 июн. 2025 г.от 154,72 ₽ / 1 млн входныхот 1 237,76 ₽ / 1 млн выходных
OpenAI: o3 Pro

openai/o3-pro

Модели серии o обучаются с помощью обучения с подкреплением, чтобы обдумывать ответ перед тем, как ответить, и выполнять сложные рассуждения. Модель o3-pro использует больше вычислений, чтобы думать усерднее и давать стабильно лучшие ответы. Обратите внимание, что для этой модели требуется BYOK. Настройка здесь: https://openrouter.ai/settings/integrations

автор openai10 июн. 2025 г.2 475,51 ₽ / 1 млн входных9 902,04 ₽ / 1 млн выходных
Google: Gemini 2.5 Pro Preview 06-05

google/gemini-2.5-pro-preview

Gemini 2.5 Pro — это передовая модель AI от Google, предназначенная для решения сложных задач рассуждения, программирования, математики и научных задач. Она использует возможности «мышления», позволяющие ей обдумывать ответы с повышенной точностью и тонким пониманием контекста. Gemini 2.5 Pro достигает результатов высшего уровня на многих бенчмарках, включая первое место в рейтинге LMArena, что отражает превосходное соответствие человеческим предпочтениям и способность решать сложные задачи.

автор google5 июн. 2025 г.от 154,72 ₽ / 1 млн входныхот 1 237,76 ₽ / 1 млн выходных
DeepSeek: R1 0528

deepseek/deepseek-r1-0528

28-е обновление к оригиналу DeepSeek R1 — производительность на уровне OpenAI o1, но с открытым исходным кодом и полностью открытыми токенами рассуждения. Размер модели — 671B параметров, при этом в ходе инференса активно задействовано 37B. Полностью открытая модель.

автор deepseek28 мая 2025 г.61,89 ₽ / 1 млн входных266,12 ₽ / 1 млн выходных
Anthropic: Claude Opus 4

anthropic/claude-opus-4

Claude Opus 4 признана по результатам бенчмарков лучшей моделью для написания кода в мире на момент выпуска, обеспечивая стабильную производительность в сложных длительных задачах и агентных рабочих процессах. Она устанавливает новые рекорды в разработке программного обеспечения, достигая ведущих результатов на SWE-bench (72.5%) и Terminal-bench (43.2%). Opus 4 поддерживает расширенные агентные сценарии, обрабатывая тысячи шагов задач непрерывно в течение часов без деградации. Подробнее в публикации в блоге

автор anthropic22 мая 2025 г.1 856,63 ₽ / 1 млн входных9 283,17 ₽ / 1 млн выходных
Anthropic: Claude Sonnet 4

anthropic/claude-sonnet-4

Claude Sonnet 4 значительно расширяет возможности своего предшественника, Sonnet 3.7, превосходя его как в задачах программирования, так и в рассуждениях, обеспечивая повышенную точность и управляемость. Достигая передовых результатов на SWE-bench (72.7%), Sonnet 4 сочетает производительность и вычислительную эффективность, что делает его подходящим для широкого спектра применений — от рутинных задач кодирования до сложных проектов разработки программного обеспечения. Ключевые улучшения включают улучшенную автономную навигацию по кодовой базе, снижение частоты ошибок в агентных рабочих процессах и повышенную надёжность при выполнении сложных инструкций. Sonnet 4 оптимизирован для практического повседневного использования, обеспечивая расширенные возможности рассуждений при сохранении эффективности и отзывчивости в различных внутренних и внешних сценариях. Подробнее в публикации в блоге

автор anthropic22 мая 2025 г.от 371,33 ₽ / 1 млн входныхот 1 856,63 ₽ / 1 млн выходных
Mistral: Mistral Medium 3

mistralai/mistral-medium-3

Mistral Medium 3 — это высокопроизводительная языковая модель корпоративного уровня, предназначенная для предоставления возможностей передового уровня при значительно сниженных эксплуатационных расходах. Она сочетает современные рассуждения и мультимодальную производительность с 8× более низкой стоимостью по сравнению с традиционными большими моделями, что делает её подходящей для масштабируемых развёртываний в профессиональных и промышленных сценариях использования. Модель превосходно работает в таких областях, как программирование, STEM-рассуждения и корпоративная адаптация. Она поддерживает гибридные, локальные (on-prem) и внутри-VPC развёртывания и оптимизирована для интеграции в пользовательские рабочие процессы. Mistral Medium 3 обеспечивает конкурентоспособную точность по сравнению с более крупными моделями, такими как Claude Sonnet 3.5/3.7, Llama 4 Maverick и Command R+, сохраняя широкую совместимость с облачными средами.

автор mistralai7 мая 2025 г.49,51 ₽ / 1 млн входных247,55 ₽ / 1 млн выходных
Google: Gemini 2.5 Pro Preview 05-06

google/gemini-2.5-pro-preview-05-06

Gemini 2.5 Pro — это самая современная модель AI от Google, предназначенная для решения сложных задач в области рассуждений, программирования, математики и научных исследований. Она использует возможности «мышления», позволяющие ей логически выстраивать ответы с повышенной точностью и тонким пониманием контекста. Gemini 2.5 Pro показывает высочайшую производительность в многочисленных тестах, включая первое место в таблице лидеров LMArena, что отражает превосходное соответствие человеческим предпочтениям и способность решать сложные задачи.

автор google7 мая 2025 г.от 154,72 ₽ / 1 млн входныхот 1 237,76 ₽ / 1 млн выходных
Meta: Llama Guard 4 12B

meta-llama/llama-guard-4-12b

Llama Guard 4 — это мультимодальная предобученная модель, полученная на основе Llama 4 Scout, доработанная для классификации безопасности контента. Как и предыдущие версии, она может использоваться для классификации контента как во входных данных LLM (классификация промптов), так и в ответах LLM (классификация ответов). Она действует как LLM, генерируя в выходных данных текст, указывающий, является ли данный промпт или ответ безопасным или небезопасным, а если небезопасным, то также перечисляет категории контента, которые были нарушены. Llama Guard 4 была согласована для защиты от стандартизированной таксономии опасностей MLCommons и разработана для поддержки мультимодальных возможностей Llama 4. В частности, она объединяет функции предыдущих моделей Llama Guard, обеспечивая модерацию контента на английском и нескольких поддерживаемых языках, а также расширенные возможности для обработки смешанных текстово-изображенческих промптов, включая несколько изображений. Кроме того, Llama Guard 4 интегрирована в API модерации Llama API, расширяя надежную классификацию безопасности на текст и изображения.

автор meta-llama30 апр. 2025 г.22,28 ₽ / 1 млн входных22,28 ₽ / 1 млн выходных
Qwen: Qwen3 30B A3B

qwen/qwen3-30b-a3b

Qwen3, новейшее поколение в серии больших языковых моделей Qwen, отличается как плотной, так и смешанной архитектурой экспертов (MoE), что позволяет достигать выдающихся результатов в рассуждениях, многоязычной поддержке и продвинутых агентных задачах. Его уникальная способность плавно переключаться между режимом мышления для сложных рассуждений и режимом без мышления для эффективного диалога обеспечивает универсальную высококачественную производительность. Значительно превосходя предыдущие модели, такие как QwQ и Qwen2.5, Qwen3 обеспечивает превосходные возможности в математике, программировании, здравом смысле, творческом письме и интерактивном диалоге. Вариант Qwen3-30B-A3B включает 30.5 миллиардов параметров (3.3 миллиардов активируется), 48 слоёв, 128 экспертов (8 активируется для каждой задачи) и поддерживает контексты до 131K токенов с YaRN, устанавливая новый стандарт среди моделей с открытым исходным кодом.

автор qwen28 апр. 2025 г.14,85 ₽ / 1 млн входных61,89 ₽ / 1 млн выходных
Qwen: Qwen3 8B

qwen/qwen3-8b

Qwen3-8B — это плотная причинная языковая модель с 8.2B параметрами из серии Qwen3, предназначенная как для задач, требующих интенсивных рассуждений, так и для эффективного диалога. Она поддерживает плавное переключение между режимом «размышления» для математики, программирования и логических выводов, и режимом «без размышлений» для обычного общения. Модель доработана для следования инструкциям, интеграции с агентами, творческого письма и многоязычного использования на 100+ языках и диалектах. Она изначально поддерживает контекстное окно в 32K токенов и может быть расширена до 131K токенов с помощью масштабирования YaRN.

автор qwen28 апр. 2025 г.14,48 ₽ / 1 млн входных56,32 ₽ / 1 млн выходных
Qwen: Qwen3 14B

qwen/qwen3-14b

Qwen3-14B — это плотная языковая модель с 14.8B параметрами из серии Qwen3, предназначенная как для сложных рассуждений, так и для эффективного диалога. Она поддерживает плавное переключение между режимом «размышления» для задач, требующих математики, программирования и логических выводов, и режимом «без размышлений» для обычного общения. Модель доработана для следования инструкциям, использования инструментов агентами, творческого письма и многоязычных задач на 100+ языках и диалектах. Она изначально поддерживает контекст до 32K токенов и может быть расширена до 131K токенов с помощью масштабирования на основе YaRN.

автор qwen28 апр. 2025 г.14,85 ₽ / 1 млн входных29,71 ₽ / 1 млн выходных
Qwen: Qwen3 32B

qwen/qwen3-32b

Qwen3-32B — это плотная 32.8B-параметрическая каузальная языковая модель из серии Qwen3, оптимизированная как для сложных рассуждений, так и для эффективного диалога. Она поддерживает плавное переключение между режимом «размышления» для задач математики, программирования и логического вывода, а также режимом «без размышлений» для более быстрых общих бесед. Модель демонстрирует высокую производительность в следовании инструкциям, использовании агентских инструментов, творческом написании и многоязычных задачах на более чем 100 языках и диалектах. Она изначально работает с контекстами до 32K токенов и может быть расширена до 131K токенов с помощью масштабирования на основе YaRN.

автор qwen28 апр. 2025 г.9,90 ₽ / 1 млн входных34,66 ₽ / 1 млн выходных
Qwen: Qwen3 235B A22B

qwen/qwen3-235b-a22b

Qwen3-235B-A22B — это модель смеси экспертов (MoE) с 235B параметрами, разработанная компанией Qwen и активирующая 22B параметров за один прямой проход. Она поддерживает бесшовное переключение между режимом «мышления» для сложных рассуждений, математики и задач программирования и режимом «без мышления» для общей эффективности диалога. Модель демонстрирует высокую способность к рассуждению, многоязычную поддержку (100+ языков и диалектов), продвинутое следование инструкциям и возможности вызова агентских инструментов. Она нативно обрабатывает контекстное окно в 32K токенов и расширяется до 131K токенов с помощью масштабирования на основе YaRN.

автор qwen28 апр. 2025 г.56,32 ₽ / 1 млн входных225,27 ₽ / 1 млн выходных
OpenAI: o4 Mini High

openai/o4-mini-high

OpenAI o4-mini-high — это та же модель, что и o4-mini, но с reasoning_effort, установленным на high. OpenAI o4-mini — это компактная модель рассуждений в серии o, оптимизированная для быстрой и экономичной работы при сохранении сильных мультимодальных и агентных возможностей. Она поддерживает использование инструментов и демонстрирует конкурентоспособную производительность в рассуждениях и написании кода на таких бенчмарках, как AIME (99.5% с Python) и SWE-bench, превосходя своего предшественника o3-mini и даже приближаясь к o3 в некоторых областях. Несмотря на меньший размер, o4-mini показывает высокую точность в задачах STEM, решении визуальных задач (например, MathVista, MMMU) и редактировании кода. Он особенно хорошо подходит для сценариев с высокой пропускной способностью, где критически важны задержка или стоимость. Благодаря эффективной архитектуре и усовершенствованному обучению с подкреплением o4-mini может объединять инструменты в цепочки, генерировать структурированные выходные данные и решать многошаговые задачи с минимальной задержкой — часто менее чем за минуту.

автор openai16 апр. 2025 г.136,15 ₽ / 1 млн входных544,61 ₽ / 1 млн выходных
OpenAI: o3

openai/o3

o3 — это разносторонняя и мощная модель, работающая во многих областях. Она задаёт новый стандарт для задач по математике, естественным наукам, программированию и визуальному мышлению. Также она отлично справляется с техническим письмом и выполнением инструкций. Используйте её для обдумывания многошаговых задач, требующих анализа текста, кода и изображений.

автор openai16 апр. 2025 г.247,55 ₽ / 1 млн входных990,20 ₽ / 1 млн выходных
OpenAI: o4 Mini

openai/o4-mini

OpenAI o4-mini — это компактная модель рассуждения из серии o, оптимизированная для быстрой и экономичной работы при сохранении сильных мультимодальных и агентных возможностей. Она поддерживает использование инструментов и демонстрирует конкурентоспособную производительность в рассуждениях и кодировании на таких бенчмарках, как AIME (99.5% с Python) и SWE-bench, превосходя своего предшественника o3-mini и даже приближаясь к o3 в некоторых областях. Несмотря на меньший размер, o4-mini показывает высокую точность в задачах STEM, решении визуальных задач (например, MathVista, MMMU) и редактировании кода. Он особенно хорошо подходит для сценариев с высокой пропускной способностью, где критически важны задержка или стоимость. Благодаря эффективной архитектуре и усовершенствованному обучению с подкреплением, o4-mini может связывать инструменты, генерировать структурированные выходные данные и решать многошаговые задачи с минимальной задержкой — часто менее чем за минуту.

автор openai16 апр. 2025 г.136,15 ₽ / 1 млн входных544,61 ₽ / 1 млн выходных
OpenAI: GPT-4.1

openai/gpt-4.1

GPT-4.1 — это большая языковая модель, оптимизированная для продвинутого следования инструкциям, реальной разработки ПО и рассуждений с длинным контекстом. Она поддерживает контекстное окно в 1 миллионов токенов и превосходит GPT-4o и GPT-4.5 в бенчмарках по кодингу (54.6% SWE-bench Verified), соблюдению инструкций (87.4% IFEval) и мультимодальному пониманию. Она настроена для точных диффов кода, надежности агентов и высокой точности извлечения в больших документах, что делает ее идеальной для агентов, инструментов IDE и корпоративного поиска знаний.

автор openai14 апр. 2025 г.247,55 ₽ / 1 млн входных990,20 ₽ / 1 млн выходных
OpenAI: GPT-4.1 Mini

openai/gpt-4.1-mini

GPT-4.1 Mini представляет собой модель среднего размера, обеспечивающую производительность, сопоставимую с GPT-4o, при значительно меньшей задержке и стоимости. Она сохраняет контекстное окно в 1 миллионов токенов и набирает 45.1% на сложных инструкционных тестах, 35.8% на MultiChallenge и 84.1% на IFEval. Mini также демонстрирует высокие способности к программированию (например, 31.6% в бенчмарке Aider polyglot diff) и понимание изображений, что делает её подходящей для интерактивных приложений с жёсткими ограничениями по производительности.

автор openai14 апр. 2025 г.49,51 ₽ / 1 млн входных198,04 ₽ / 1 млн выходных
OpenAI: GPT-4.1 Nano

openai/gpt-4.1-nano

Для задач, требующих низкой задержки, GPT‑4.1 nano — самая быстрая и дешёвая модель в серии GPT-4.1. Она обеспечивает исключительную производительность при небольшом размере благодаря контекстному окну в 1 миллионов токенов и набирает 80.1% на MMLU, 50.3% на GPQA и 9.8% на Aider polyglot coding — даже выше, чем GPT‑4o mini. Она идеально подходит для таких задач, как классификация или автодополнение.

автор openai14 апр. 2025 г.12,38 ₽ / 1 млн входных49,51 ₽ / 1 млн выходных
Meta: Llama 4 Maverick

meta-llama/llama-4-maverick

Llama 4 Maverick 17B Instruct (128E) — это высокопроизводительная мультимодальная языковая модель от Meta, построенная на архитектуре смеси экспертов (MoE) с 128 экспертами и 17 миллиардами активных параметров на один прямой проход (всего 400B). Она поддерживает многоязычный текстовый и графический ввод и создаёт многоязычный текст и код на 12 поддерживаемых языках. Оптимизированная для задач зрения и языка, Maverick доработана с помощью инструкций для поведения, подобного ассистенту, логических рассуждений над изображениями и универсального мультимодального взаимодействия. Maverick отличается ранним слиянием для нативной мультимодальности и контекстным окном на 1 миллионов токенов. Модель обучалась на тщательно подобранной смеси публичных, лицензированных и данных платформы Meta, охватывающей примерно 22 триллионов токенов, с датой отсечения знаний — август 2024. Выпущенная в апреле 5, 2025 под лицензией сообщества Llama 4, Maverick подходит для исследовательских и коммерческих приложений, требующих продвинутого мультимодального понимания и высокой пропускной способности модели.

автор meta-llama5 апр. 2025 г.24,76 ₽ / 1 млн входных86,15 ₽ / 1 млн выходных
Meta: Llama 4 Scout

meta-llama/llama-4-scout

Llama 4 Scout 17B Instruct (16E) — это языковая модель со смешанной экспертной архитектурой (MoE), разработанная компанией Meta, которая активирует 17 миллиарда параметров из общего числа 109B. Модель поддерживает нативный мультимодальный ввод (текст и изображения) и многоязычный вывод (текст и код) на 12 поддерживаемых языках. Созданная для ассистентского взаимодействия и визуального рассуждения, Scout использует 16 экспертов за один прямой проход и имеет длину контекста в 10 миллиона токенов, с обучающим корпусом объёмом около 40 триллионов токенов. Разработанная для высокой эффективности и локального или коммерческого развёртывания, Llama 4 Scout включает раннее слияние для бесшовной интеграции модальностей. Модель дообучена на инструкциях для использования в многоязычных чатах, генерации подписей и задачах понимания изображений. Выпущена под лицензией Llama 4 Community License, модель последний раз обучалась на данных, актуальных по август 2024, и была публично запущена в апреле 5, 2025.

автор meta-llama5 апр. 2025 г.12,38 ₽ / 1 млн входных37,13 ₽ / 1 млн выходных
DeepSeek: DeepSeek V3 0324

deepseek/deepseek-chat-v3-0324

DeepSeek V3, модель со смешанными экспертами с 685B параметрами, является новейшей итерацией флагманского семейства чат-моделей команды DeepSeek. Она приходит на смену модели DeepSeek V3 и отлично справляется с самыми разными задачами.

автор deepseek24 мар. 2025 г.30,94 ₽ / 1 млн входных123,78 ₽ / 1 млн выходных
OpenAI: o1-pro

openai/o1-pro

Модели серии o1 обучаются с помощью обучения с подкреплением, чтобы обдумывать ответ перед его выдачей и выполнять сложные рассуждения. Модель o1-pro использует больше вычислительных ресурсов, чтобы думать глубже и давать стабильно более качественные ответы.

автор openai19 мар. 2025 г.18 566,33 ₽ / 1 млн входных74 265,33 ₽ / 1 млн выходных
Mistral: Mistral Small 3.1 24B

mistralai/mistral-small-3.1-24b-instruct

Mistral Small 3.1 24B — это улучшенная версия Mistral Small 3 (2501), обладающая 24 миллиардами параметров и расширенными мультимодальными возможностями. Она обеспечивает передовую производительность в текстовых задачах и визуальном анализе, включая обработку изображений, программирование, многоязычные рассуждения и поддержку десятков языков. Оснащённая обширным контекстным окном 128k и оптимизированная для эффективного локального вывода, модель поддерживает такие сценарии, как диалоговые агенты, вызов функций, понимание длинных документов и развёртывание в условиях ограниченной конфиденциальности. Обновлённая версия доступна как Mistral Small 3.2.

автор mistralai17 мар. 2025 г.43,45 ₽ / 1 млн входных68,70 ₽ / 1 млн выходных
Google: Gemma 3 4B

google/gemma-3-4b-it

Gemma 3 вводит мультимодальность, поддерживая ввод вида «изображение-текст» и вывод текста. Он обрабатывает контекстные окна до 128k токенов, понимает более 140 языков и предлагает улучшенные возможности для математики, логических рассуждений и чата, включая структурированные выходные данные и вызов функций.

автор google13 мар. 2025 г.6,19 ₽ / 1 млн входных12,38 ₽ / 1 млн выходных
Google: Gemma 3 12B

google/gemma-3-12b-it

Gemma 3 вводит мультимодальность, поддерживая ввод на основе зрения и языка и текстовый вывод. Он обрабатывает контекстные окна до 128k токенов, понимает более 140 языков и предлагает улучшенные возможности для математики, рассуждений и чата, включая структурированные выходные данные и вызовы функций. Gemma 3 12B является второй по величине моделью в семействе Gemma 3 после Gemma 3 27B

автор google13 мар. 2025 г.6,19 ₽ / 1 млн входных18,57 ₽ / 1 млн выходных
Cohere: Command A

cohere/command-a

Command A — это модель с открытыми весами, имеющая 111B параметров и контекстное окно 256k, ориентированная на обеспечение высокой производительности в агентных, многоязычных и программных сценариях использования. По сравнению с другими ведущими проприетарными моделями и моделями с открытыми весами Command A обеспечивает максимальную производительность при минимальных аппаратных затратах, превосходно справляясь с критически важными для бизнеса агентными и многоязычными задачами.

автор cohere13 мар. 2025 г.309,44 ₽ / 1 млн входных1 237,76 ₽ / 1 млн выходных
Reka Flash 3

rekaai/reka-flash-3

Reka Flash 3 — это универсальная языковая модель большого размера, настроенная на выполнение инструкций, с 21 миллиардами параметров, разработанная компанией Reka. Она отлично справляется с общими диалогами, задачами программирования, следованием инструкциям и вызовом функций. Благодаря контекстной длине 32K и оптимизации с помощью обучения с подкреплением (RLOO) модель обеспечивает производительность, сопоставимую с проприетарными моделями, при меньшем количестве параметров. Reka Flash 3 идеально подходит для развертывания с низкой задержкой, локального или на устройстве: она компактна, поддерживает эффективное квантование (вплоть до 11GB с точностью 4 бит) и использует явные теги рассуждений ("") для обозначения внутреннего мыслительного процесса. Reka Flash 3 — это в первую очередь англоязычная модель с ограниченными возможностями многоязычного понимания. Веса модели выпущены под лицензией Apache 2.0.

автор rekaai12 мар. 2025 г.12,38 ₽ / 1 млн входных24,76 ₽ / 1 млн выходных
Google: Gemma 3 27B

google/gemma-3-27b-it

Gemma 3 вводит мультимодальность, поддерживая визуально-языковой ввод и текстовые выводы. Он обрабатывает контекстные окна до 128k токенов, понимает более 140 языков и предлагает улучшенные возможности в области математики, рассуждений и чата, включая структурированные выводы и вызовы функций. Gemma 3 27B — это последняя модель с открытым исходным кодом от Google, преемница Gemma 2

автор google12 мар. 2025 г.9,90 ₽ / 1 млн входных55,70 ₽ / 1 млн выходных
TheDrummer: Skyfall 36B V2

thedrummer/skyfall-36b-v2

Skyfall 36B v2 — это улучшенная итерация Mistral Small 2501, специально доработанная для повышения креативности, нюансированного письма, ролевой игры и связного повествования.

автор thedrummer10 мар. 2025 г.68,08 ₽ / 1 млн входных99,02 ₽ / 1 млн выходных
Perplexity: Sonar Reasoning Pro

perplexity/sonar-reasoning-pro

Примечание: цена Sonar Pro включает стоимость поиска Perplexity. См. подробнее здесь Sonar Reasoning Pro — это ведущая модель рассуждений на базе DeepSeek R1 с цепочкой рассуждений (CoT). Разработана для сложных сценариев использования, поддерживает углублённые многошаговые запросы, увеличенный контекст и может выводить больше ссылок на поиск, обеспечивая более полные и расширяемые ответы.

автор perplexity7 мар. 2025 г.247,55 ₽ / 1 млн входных990,20 ₽ / 1 млн выходных
Perplexity: Sonar Pro

perplexity/sonar-pro

Примечание: Sonar Pro ценообразование включает Perplexity поиск. Подробнее здесь Для предприятий, которым требуются более продвинутые возможности, Sonar Pro API могут обрабатывать многоэтапные запросы с расширенной функциональностью, например, вдвое больше цитируемых источников на поиск по сравнению с Sonar в среднем. Кроме того, увеличенное контекстное окно позволяет обрабатывать более длинные и сложные запросы, а также уточняющие вопросы.

автор perplexity7 мар. 2025 г.371,33 ₽ / 1 млн входных1 856,63 ₽ / 1 млн выходных
Perplexity: Sonar Deep Research

perplexity/sonar-deep-research

Sonar Deep Research — это модель, ориентированная на исследования, предназначенная для многоэтапного поиска, синтеза и рассуждений по сложным темам. Она автономно ищет, читает и оценивает источники, уточняя свой подход по мере сбора информации. Это позволяет создавать комплексные отчёты в таких областях, как финансы, технологии, здравоохранение и текущие события. Примечания по ценообразованию (Источник) Входные токены включают токены подсказки (пользовательский запрос) + токены цитирования (это обработанные токены из выполненных поисковых запросов) Deep Research выполняет несколько поисковых запросов для проведения исчерпывающего исследования. Поисковые запросы оцениваются в $5 за 1000 поисковых запросов. Запрос, выполняющий 30 поисковых запросов, будет стоить $0.15 на этом этапе. Рассуждение — это отдельный этап в Deep Research, поскольку он выполняет обширные автоматизированные рассуждения по всему материалу, собранному на этапе исследования. Токены рассуждения здесь немного отличаются от CoTs в ответе — это токены, которые мы используем для рассуждения о исследовательском материале перед генерацией результатов через CoTs. Токены рассуждения оцениваются в $3 за 1M токенов

автор perplexity7 мар. 2025 г.247,55 ₽ / 1 млн входных990,20 ₽ / 1 млн выходных
Mistral: Saba

mistralai/mistral-saba

Mistral Saba — это языковая модель с 24B параметрами, специально разработанная для Ближнего Востока и Южной Азии, обеспечивающая точные и контекстуально релевантные ответы при сохранении эффективной производительности. Обученная на курируемых региональных наборах данных, она поддерживает несколько языков индийского происхождения, включая тамильский и малаялам, наряду с арабским. Это делает её универсальным вариантом для широкого круга региональных и многоязычных приложений. Подробнее в блоге здесь.

автор mistralai17 февр. 2025 г.24,76 ₽ / 1 млн входных74,27 ₽ / 1 млн выходных
OpenAI: o3 Mini High

openai/o3-mini-high

OpenAI o3-mini-high — это та же модель, что и o3-mini, но с параметром reasoning_effort, установленным в значение high. o3-mini — это экономичная языковая модель, оптимизированная для задач STEM-рассуждений, особенно сильная в науке, математике и программировании. Модель предлагает три настраиваемых уровня усилий рассуждения и поддерживает ключевые возможности для разработчиков, включая вызов функций, структурированные выходные данные и потоковую передачу, однако не включает возможности обработки изображений. Модель демонстрирует значительные улучшения по сравнению с предыдущей версией: экспертные тестировщики предпочитают её ответы в 56% случаев и отмечают снижение 39% серьёзных ошибок при решении сложных вопросов. При среднем уровне усилий рассуждения o3-mini соответствует производительности более крупной модели o1 на сложных оценочных тестах рассуждений, таких как AIME и GPQA, сохраняя при этом более низкую задержку и стоимость.

автор openai12 февр. 2025 г.136,15 ₽ / 1 млн входных544,61 ₽ / 1 млн выходных
AionLabs: Aion-RP 1.0 (8B)

aion-labs/aion-rp-llama-3.1-8b

Aion-RP-Llama-3.1-8B — это бенчмарк, в котором оценивается качество ответов. Он относится к категории ролевых сценариев и является вариантом теста RPBench-Auto, где LLMs оценивают ответы друг друга. Это тонко настроенная базовая модель, а не инструктивная, предназначенная для создания более естественных и разнообразных текстов.

автор aion-labs4 февр. 2025 г.99,02 ₽ / 1 млн входных198,04 ₽ / 1 млн выходных
Qwen: Qwen2.5 VL 72B Instruct

qwen/qwen2.5-vl-72b-instruct

Qwen2.5-VL умеет распознавать распространённые объекты, такие как цветы, птицы, рыбы и насекомые. Кроме того, она отлично справляется с анализом текстов, диаграмм, иконок, графики и макетов в изображениях.

автор qwen1 февр. 2025 г.30,94 ₽ / 1 млн входных92,83 ₽ / 1 млн выходных
Qwen: Qwen-Plus

qwen/qwen-plus

Qwen-Plus, основанная на базовой модели Qwen2.5, представляет собой модель с контекстом 131K, обладающую сбалансированным сочетанием производительности, скорости и стоимости.

автор qwen1 февр. 2025 г.от 32,18 ₽ / 1 млн входныхот 96,54 ₽ / 1 млн выходных
OpenAI: o3 Mini

openai/o3-mini

OpenAI o3-mini — это экономичная языковая модель, оптимизированная для задач STEM-рассуждений, особенно эффективная в естественных науках, математике и программировании. Модель поддерживает параметр reasoning_effort, который можно задать как «high», «medium» или «low» для управления временем размышлений модели. По умолчанию используется значение «medium». OpenRouter также предлагает слаг модели openai/o3-mini-high, чтобы по умолчанию установить параметр в «high». Модель имеет три регулируемых уровня усилий при рассуждении и поддерживает ключевые возможности разработчиков, включая вызов функций, структурированные выходные данные и потоковую передачу, однако не включает возможности обработки изображений. Модель демонстрирует значительные улучшения по сравнению со своим предшественником: экспертные тестировщики предпочитают её ответы 56% случаев и отмечают снижение 39% серьёзных ошибок на сложных вопросах. При среднем уровне усилий рассуждения o3-mini соответствует производительности более крупной модели o1 на сложных оценочных тестах, таких как AIME и GPQA, сохраняя при этом меньшую задержку и стоимость.

автор openai31 янв. 2025 г.136,15 ₽ / 1 млн входных544,61 ₽ / 1 млн выходных
Mistral: Mistral Small 3

mistralai/mistral-small-24b-instruct-2501

Mistral Small 3 — это языковая модель с 24B параметрами, оптимизированная для низкой задержки при выполнении типовых задач AI. Выпущенная под лицензией Apache 2.0, она включает как предобученную, так и инструктивную версии, предназначенные для эффективного локального развертывания. Модель достигает точности 81% на бенчмарке MMLU и показывает конкурентоспособные результаты по сравнению с более крупными моделями, такими как Llama 3.3 70B и Qwen 32B, работая при этом в три раза быстрее на эквивалентном оборудовании. Прочитайте статью в блоге об этой модели здесь.

автор mistralai30 янв. 2025 г.6,19 ₽ / 1 млн входных9,90 ₽ / 1 млн выходных
Perplexity: Sonar

perplexity/sonar

Sonar легкий, доступный, быстрый и простой в использовании — теперь с цитатами и возможностью настройки источников. Он предназначен для компаний, стремящихся интегрировать легкие функции вопросов и ответов, оптимизированные для скорости.

автор perplexity27 янв. 2025 г.123,78 ₽ / 1 млн входных123,78 ₽ / 1 млн выходных
DeepSeek: R1 Distill Llama 70B

deepseek/deepseek-r1-distill-llama-70b

DeepSeek R1 Distill Llama 70B — это дистиллированная большая языковая модель, основанная на Llama-3.3-70B-Instruct и использующая выходные данные DeepSeek R1. Модель объединяет передовые методы дистилляции для достижения высокой производительности по множеству бенчмарков, включая: AIME 2024 pass@1: 70.0 MATH-500 pass@1: 94.5 CodeForces Rating: 1633 Модель использует точную настройку на выходных данных DeepSeek R1, что обеспечивает конкурентоспособную производительность, сравнимую с более крупными передовыми моделями.

автор deepseek23 янв. 2025 г.99,02 ₽ / 1 млн входных99,02 ₽ / 1 млн выходных
DeepSeek: R1

deepseek/deepseek-r1

DeepSeek R1 на месте: производительность на уровне OpenAI o1, но с открытым исходным кодом и полностью открытыми токенами рассуждений. Размер — 671B параметров, из которых 37B активны во время прохода вывода. Полностью открытая модель и технический отчет. Лицензия MIT: свободно дистиллируйте и коммерциализируйте!

автор deepseek20 янв. 2025 г.86,64 ₽ / 1 млн входных309,44 ₽ / 1 млн выходных
MiniMax: MiniMax-01

minimax/minimax-01

MiniMax-01 — это комбинированная модель, объединяющая MiniMax-Text-01 для генерации текста и MiniMax-VL-01 для понимания изображений. Она имеет 456 миллиардов параметров, при этом 45.9 миллиардов параметров активируется за один вывод, и может обрабатывать контекст до 4 миллионов токенов. Текстовая модель использует гибридную архитектуру, сочетающую Lightning Attention, Softmax Attention и Mixture-of-Experts (MoE). Модель изображений использует фреймворк «ViT-MLP-LLM» и обучается поверх текстовой модели. Чтобы узнать больше о релизе, см.: https://www.minimaxi.com/en/news/minimax-01-series-2

автор minimax15 янв. 2025 г.24,76 ₽ / 1 млн входных136,15 ₽ / 1 млн выходных
Microsoft: Phi 4

microsoft/phi-4

Microsoft Research Phi-4 разработана для достижения высоких результатов в сложных задачах рассуждения и может эффективно работать в условиях ограниченной памяти или когда требуются быстрые ответы. Модель с 14 миллиардами параметров была обучена на смеси высококачественных синтетических наборов данных, данных с курируемых веб-сайтов и академических материалов. Она прошла тщательную доработку, чтобы точно следовать инструкциям и поддерживать высокие стандарты безопасности. Она лучше всего работает с входными данными на английском языке. Для получения дополнительной информации см. Phi-4 Technical Report

автор microsoft10 янв. 2025 г.8,66 ₽ / 1 млн входных17,33 ₽ / 1 млн выходных
DeepSeek: DeepSeek V3

deepseek/deepseek-chat

DeepSeek-V3 — новейшая модель команды DeepSeek, развивающая способности предыдущих версий к следованию инструкциям и написанию кода. Предобученная на почти 15 триллионах токенов, модель, согласно опубликованным оценкам, превосходит другие открытые модели и конкурирует с ведущими закрытыми моделями. Подробности о модели см. в репозитории DeepSeek-V3 или в анонсе запуска.

автор deepseek26 дек. 2024 г.35,40 ₽ / 1 млн входных141,48 ₽ / 1 млн выходных
Sao10K: Llama 3.3 Euryale 70B

sao10k/l3.3-euryale-70b

Euryale L3.3 70B — модель, ориентированная на творческую ролевую игру, от Sao10k. Она является преемницей Euryale L3 70B v2.2.

автор sao10k18 дек. 2024 г.80,45 ₽ / 1 млн входных92,83 ₽ / 1 млн выходных
OpenAI: o1

openai/o1

Последнее и самое мощное семейство моделей от OpenAI, o1 разработано для того, чтобы тратить больше времени на размышления перед ответом. Серия моделей o1 обучается с помощью масштабного обучения с подкреплением, чтобы рассуждать, используя цепочку мыслей. Модели o1 оптимизированы для математики, науки, программирования и других задач STEM-related. Они стабильно демонстрируют точность уровня PhD на бенчмарках по физике, химии и биологии. Подробнее в анонсе о запуске.

автор openai17 дек. 2024 г.1 856,63 ₽ / 1 млн входных7 426,53 ₽ / 1 млн выходных
Cohere: Command R7B (12-2024)

cohere/command-r7b-12-2024

Command R7B (12-2024) — это небольшое и быстрое обновление модели Command R+, выпущенное в декабре 2024. Она отлично справляется с задачами, требующими сложных рассуждений и многошаговых действий, такими как RAG, использование инструментов, работа с агентами и аналогичными сценариями. Использование данной модели регулируется Политикой использования и Соглашением SaaS компании Cohere.

автор cohere14 дек. 2024 г.4,64 ₽ / 1 млн входных18,57 ₽ / 1 млн выходных
Meta: Llama 3.3 70B Instruct

meta-llama/llama-3.3-70b-instruct

Многоязычная большая языковая модель Meta Llama 3.3 (LLM) — это предобученная и инструкционно настроенная генеративная модель в 70B (текст на входе/текст на выходе). Модель Llama 3.3, инструкционно настроенная и работающая только с текстом, оптимизирована для многоязычных диалоговых сценариев и превосходит многие доступные открытые и закрытые чат-модели на распространённых отраслевых бенчмарках. Поддерживаемые языки: английский, немецкий, французский, итальянский, португальский, хинди, испанский и тайский. Model Card

автор meta-llama6 дек. 2024 г.117,17 ₽ / 1 млн входных117,17 ₽ / 1 млн выходных
Amazon: Nova Lite 1.0

amazon/nova-lite-v1

Amazon Nova Lite 1.0 — это очень недорогая мультимодальная модель от Amazon, которая ориентирована на быструю обработку изображений, видео и текстовых входных данных для генерации текстового вывода. Amazon Nova Lite может обрабатывать взаимодействия с клиентами в реальном времени, анализ документов и задачи визуальных вопросов-ответов с высокой точностью. При входном контексте в 300K токенов она может анализировать несколько изображений или до 30 минут видео за один вход.

автор amazon5 дек. 2024 г.7,43 ₽ / 1 млн входных29,71 ₽ / 1 млн выходных
Amazon: Nova Micro 1.0

amazon/nova-micro-v1

Amazon Nova Micro 1.0 — это текстовая модель, обеспечивающая минимальную задержку ответов среди моделей семейства Amazon Nova при очень низкой стоимости. С длиной контекста в 128K токенов и оптимизацией под скорость и цену, Amazon Nova Micro превосходно справляется с такими задачами, как суммаризация текста, перевод, классификация контента, интерактивный чат и генерация идей. Она обладает простыми математическими рассуждениями и способностями к программированию.

автор amazon5 дек. 2024 г.4,33 ₽ / 1 млн входных17,33 ₽ / 1 млн выходных
Amazon: Nova Pro 1.0

amazon/nova-pro-v1

Amazon Nova Pro 1.0 — это мощная мультимодальная модель от Amazon, ориентированная на предоставление сочетания точности, скорости и стоимости для широкого круга задач. По состоянию на декабрь 2024 она достигает передовых результатов на ключевых бенчмарках, включая ответы на визуальные вопросы (TextVQA) и понимание видео (VATEX). Amazon Nova Pro демонстрирует сильные возможности в обработке как визуальной, так и текстовой информации, а также в анализе финансовых документов. NOTE: Видеовход в настоящее время не поддерживается.

автор amazon5 дек. 2024 г.99,02 ₽ / 1 млн входных396,08 ₽ / 1 млн выходных
OpenAI: GPT-4o (2024-11-20)

openai/gpt-4o-2024-11-20

Версия 2024-11-20 модели GPT-4o предлагает улучшенные способности к творческому письму с более естественным, увлекательным и адаптированным текстом для повышения релевантности и удобочитаемости. Она также лучше работает с загруженными файлами, предоставляя более глубокие аналитические выводы и более тщательные ответы. GPT-4o ("o" — от "omni") — это последняя модель AI от OpenAI, поддерживающая как текстовые, так и графические входные данные с текстовыми выходными данными. Она сохраняет уровень интеллекта GPT-4 Turbo, будучи при этом вдвое быстрее и на 50% экономичнее. GPT-4o также обеспечивает улучшенную обработку неанглийских языков и расширенные визуальные возможности.

автор openai20 нояб. 2024 г.309,44 ₽ / 1 млн входных1 237,76 ₽ / 1 млн выходных
Mistral Large 2407

mistralai/mistral-large-2407

Это флагманская модель Mistral AI, Mistral Large 2 (версия mistral-large-2407). Это проприетарная модель с открытыми весами, которая превосходно справляется с рассуждениями, кодом, JSON, чатом и многим другим. Прочитайте анонс запуска здесь. Она поддерживает десятки языков, включая французский, немецкий, испанский, итальянский, португальский, арабский, хинди, русский, китайский, японский и корейский, а также более 80 языков программирования, включая Python, Java, C, C++, JavaScript и Bash. Её длинное контекстное окно позволяет точно извлекать информацию из больших документов.

автор mistralai19 нояб. 2024 г.247,55 ₽ / 1 млн входных742,65 ₽ / 1 млн выходных
Qwen2.5 Coder 32B Instruct

qwen/qwen-2.5-coder-32b-instruct

Qwen2.5-Coder — это последняя серия больших языковых моделей Qwen, специализированных на коде (ранее известных как CodeQwen). Qwen2.5-Coder представляет следующие улучшения по сравнению с CodeQwen1.5: Значительные улучшения в генерации кода, рассуждении о коде и исправлении кода. Более комплексная основа для реальных приложений, таких как кодовые агенты. Не только улучшение возможностей кодирования, но и сохранение сильных сторон в математике и общих компетенциях. Чтобы узнать больше о результатах оценки, посмотрите блог Qwen 2.5 Coder.

автор qwen11 нояб. 2024 г.81,69 ₽ / 1 млн входных123,78 ₽ / 1 млн выходных
TheDrummer: UnslopNemo 12B

thedrummer/unslopnemo-12b

UnslopNemo v4.1 является новейшим дополнением от создателя Rocinante, предназначенным для написания приключений и сценариев ролевых игр.

автор thedrummer8 нояб. 2024 г.49,51 ₽ / 1 млн входных49,51 ₽ / 1 млн выходных
Magnum v4 72B

anthracite-org/magnum-v4-72b

Это серия моделей, предназначенных для воспроизведения качества прозы моделей Claude 3, в частности Sonnet(https://openrouter.ai/anthropic/claude-3.5-sonnet) и Opus(https://openrouter.ai/anthropic/claude-3-opus). Модель дообучена на основе Qwen2.5 72B.

автор anthracite-org22 окт. 2024 г.309,44 ₽ / 1 млн входных618,88 ₽ / 1 млн выходных
Qwen: Qwen2.5 7B Instruct

qwen/qwen-2.5-7b-instruct

Qwen2.5 7B — новейшая серия больших языковых моделей Qwen. Qwen2.5 вносит следующие улучшения по сравнению с Qwen2: Значительно больше знаний и значительно улучшенные возможности в программировании и математике благодаря нашим специализированным экспертным моделям в этих областях. Значительные улучшения в следовании инструкциям, генерации длинных текстов (более 8K токенов), понимании структурированных данных (например, таблиц) и генерации структурированных выходных данных, особенно JSON. Повышенная устойчивость к разнообразию системных промптов, улучшающая реализацию ролевых игр и установку условий для чат-ботов. Поддержка длинного контекста до 128K токенов и возможность генерации до 8K токенов. Многоязычная поддержка более 29 языков, включая китайский, английский, французский, испанский, португальский, немецкий, итальянский, русский, японский, корейский, вьетнамский, тайский, арабский и другие. Использование этой модели регулируется условиями Tongyi Qianwen LICENSE AGREEMENT.

автор qwen16 окт. 2024 г.12,38 ₽ / 1 млн входных24,76 ₽ / 1 млн выходных
Meta: Llama 3.2 1B Instruct

meta-llama/llama-3.2-1b-instruct

Llama 3.2 1B — это языковая модель с 1 миллиардами параметров, ориентированная на эффективное выполнение задач обработки естественного языка, таких как суммаризация, диалоги и многоязычный анализ текста. Меньший размер позволяет ей эффективно работать в средах с ограниченными ресурсами, сохраняя при этом высокую производительность. Поддерживая восемь основных языков и допуская дообучение для дополнительных языков, Llama 1.3B идеально подходит для бизнеса или разработчиков, которые ищут лёгкие, но мощные решения типа AI, способные работать в различных многоязычных средах без высоких вычислительных затрат, характерных для более крупных моделей. Нажмите здесь: оригинальная карточка модели. Использование данной модели регулируется Политикой допустимого использования Meta.

автор meta-llama25 сент. 2024 г.3,34 ₽ / 1 млн входных24,88 ₽ / 1 млн выходных
Meta: Llama 3.2 3B Instruct

meta-llama/llama-3.2-3b-instruct

Llama 3.2 3B — это многоязычная большая языковая модель с 3 миллиардами параметров, оптимизированная для продвинутых задач обработки естественного языка, таких как генерация диалогов, рассуждение и суммаризация. Разработанная с использованием новейшей архитектуры трансформера, она поддерживает восемь языков, включая английский, испанский и хинди, и может быть адаптирована для дополнительных языков. Обученная на 9 триллионах токенов, модель Llama 3.2 3B превосходно справляется с выполнением инструкций, сложными рассуждениями и использованием инструментов. Её сбалансированная производительность делает её идеальной для приложений, требующих точности и эффективности в генерации текста в многоязычных средах. Нажмите здесь для оригинальной карточки модели. Использование этой модели регулируется Политикой допустимого использования Meta.

автор meta-llama25 сент. 2024 г.6,19 ₽ / 1 млн входных40,85 ₽ / 1 млн выходных
Qwen2.5 72B Instruct

qwen/qwen-2.5-72b-instruct

Qwen2.5 72B — последняя серия больших языковых моделей Qwen. Qwen2.5 обеспечивает следующие улучшения по сравнению с Qwen2: Значительно больше знаний и улучшенные возможности в программировании и математике благодаря нашим специализированным моделям в этих областях. Значительные улучшения в следовании инструкциям, генерации длинных текстов (более 8K токенов), понимании структурированных данных (например, таблиц) и создании структурированных результатов, особенно JSON. Повышенная устойчивость к разнообразию системных промптов, улучшение реализации ролевых сценариев и условий для чат-ботов. Поддержка длинного контекста до 128K токенов и возможность генерации до 8K токенов. Многоязычная поддержка более 29 языков, включая китайский, английский, французский, испанский, португальский, немецкий, итальянский, русский, японский, корейский, вьетнамский, тайский, арабский и другие. Использование этой модели регулируется условиями Tongyi Qianwen LICENSE AGREEMENT.

автор qwen19 сент. 2024 г.44,56 ₽ / 1 млн входных49,51 ₽ / 1 млн выходных
Cohere: Command R (08-2024)

cohere/command-r-08-2024

command-r-08-2024 — это обновление Command R с улучшенной производительностью для многоязычной поисково-дополненной генерации (RAG) и использования инструментов. В более широком смысле, она лучше в математике, коде и рассуждениях и конкурентоспособна с предыдущей версией более крупной модели Command R+. Читайте анонс здесь. Использование этой модели регулируется Политикой использования компании Cohere и Соглашением SaaS.

автор cohere30 авг. 2024 г.18,57 ₽ / 1 млн входных74,27 ₽ / 1 млн выходных
Cohere: Command R+ (08-2024)

cohere/command-r-plus-08-2024

command-r-plus-08-2024 — это обновление Command R+ с примерно 50% более высокой пропускной способностью и 25% более низкими задержками по сравнению с предыдущей версией Command R+, при сохранении тех же аппаратных требований. Читайте пост о запуске здесь. Использование этой модели регулируется Политикой использования компании Cohere и SaaS Соглашением.

автор cohere30 авг. 2024 г.309,44 ₽ / 1 млн входных1 237,76 ₽ / 1 млн выходных
Sao10K: Llama 3.1 Euryale 70B v2.2

sao10k/l3.1-euryale-70b

Euryale L3.1 70B v2.2 — это модель, ориентированная на творческую ролевую игру от Sao10k. Она является преемником Euryale L3 70B v2.1.

автор sao10k28 авг. 2024 г.107,36 ₽ / 1 млн входных107,36 ₽ / 1 млн выходных
Nous: Hermes 3 70B Instruct

nousresearch/hermes-3-llama-3.1-70b

Hermes 3 — это универсальная языковая модель со множеством улучшений по сравнению с Hermes 2, включая продвинутые агентные возможности, гораздо лучшее ролевое моделирование, рассуждение, многоходовые диалоги, связность длинного контекста и улучшения во всех областях. Hermes 3 70B — это конкурентоспособная, если не превосходящая тонкая настройка базовой модели Llama-3.1 70B, ориентированная на приведение LLMs в соответствие с пользователем, с мощными возможностями управления и контролем, предоставленным конечному пользователю. Серия Hermes 3 развивает и расширяет набор возможностей Hermes 2, включая более мощные и надёжные вызовы функций и возможности структурированного вывода, универсальные ассистентские возможности и улучшенные навыки генерации кода.

автор nousresearch18 авг. 2024 г.86,64 ₽ / 1 млн входных86,64 ₽ / 1 млн выходных
Nous: Hermes 3 405B Instruct

nousresearch/hermes-3-llama-3.1-405b

Hermes 3 представляет собой универсальную языковую модель со множеством улучшений по сравнению с Hermes 2, включая расширенные агентные возможности, значительно лучшее взаимодействие в ролевых сценариях, рассуждение, многоходовые диалоги, связность при длинном контексте и улучшения по всем направлениям. Hermes 3 405B — это модель передового уровня, полная тонкая настройка всех параметров на основе базовой модели Llama-3.1 405B, направленная на приведение LLMs в соответствие с пользователем, с мощными возможностями управления и контролем, предоставляемым конечному пользователю. Серия Hermes 3 развивает и расширяет набор возможностей Hermes 2, включая более мощный и надежный вызов функций и структурированный вывод, универсальные ассистентские возможности и улучшенные навыки генерации кода. Hermes 3 конкурентоспособна, если не превосходит, модели Llama-3.1 Instruct по общим возможностям, с различающимися сильными и слабыми сторонами, присущими обеим.

автор nousresearch16 авг. 2024 г.123,78 ₽ / 1 млн входных123,78 ₽ / 1 млн выходных
Sao10K: Llama 3 8B Lunaris

sao10k/l3-lunaris-8b

Lunaris 8B — это универсальная модель для ролевых игр, основанная на Llama 3. Она представляет собой стратегическое объединение нескольких моделей, созданное для баланса между креативностью и улучшенной логикой. Созданная Sao10k, эта модель нацелена на улучшение опыта по сравнению со Stheno v3.2, с повышенной креативностью и логическим мышлением. Для наилучших результатов используйте шаблон контекста инструкций Llama 3, температуру 1.4 и min_p 0.1.

автор sao10k13 авг. 2024 г.4,95 ₽ / 1 млн входных6,19 ₽ / 1 млн выходных
OpenAI: GPT-4o (2024-08-06)

openai/gpt-4o-2024-08-06

Версия 2024-08-06 модели GPT-4o обеспечивает improved производительность в структурированных выходных данных, позволяя передавать схему JSON в respone_format. Подробнее здесь. GPT-4o ("o" от "omni") — последняя модель OpenAI линейки AI, поддерживающая как текстовые, так и графические входные данные с текстовыми выходными данными. Она сохраняет уровень интеллекта модели GPT-4 Turbo, будучи при этом вдвое быстрее и на 50% экономичнее. GPT-4o также обеспечивает improved производительность при обработке неанглийских языков и enhanced визуальные возможности. Для сравнения с другими моделями она на короткое время была названа "im-also-a-good-gpt2-chatbot"

автор openai6 авг. 2024 г.309,44 ₽ / 1 млн входных1 237,76 ₽ / 1 млн выходных
Meta: Llama 3.1 70B Instruct

meta-llama/llama-3.1-70b-instruct

Последняя модель класса Meta (Llama 3.1), выпущенная в нескольких размерах и вариантах. Эта версия, оптимизированная для инструкций 70B, предназначена для высококачественных диалоговых сценариев. Она показала высокую производительность по сравнению с ведущими закрытыми моделями в оценках с участием людей. Чтобы узнать больше о выпуске модели, нажмите здесь. Использование этой модели регулируется Политикой допустимого использования Meta.

автор meta-llama23 июл. 2024 г.49,51 ₽ / 1 млн входных49,51 ₽ / 1 млн выходных
Meta: Llama 3.1 8B Instruct

meta-llama/llama-3.1-8b-instruct

Последний класс моделей Meta (Llama 3.1) был выпущен в различных размерах и вариантах. Эта версия 8B, настроенная по инструкциям, быстрая и эффективная. Она продемонстрировала высокую производительность по сравнению с ведущими закрытыми моделями в оценках людьми. Чтобы узнать больше о выпуске модели, нажмите здесь. Использование этой модели регулируется Политикой допустимого использования Meta.

автор meta-llama23 июл. 2024 г.6,19 ₽ / 1 млн входных9,90 ₽ / 1 млн выходных
Mistral: Mistral Nemo

mistralai/mistral-nemo

Модель с параметрами 12B и длиной контекста 128k токенов, созданная Mistral в сотрудничестве с NVIDIA. Модель является многоязычной и поддерживает английский, французский, немецкий, испанский, итальянский, португальский, китайский, японский, корейский, арабский и хинди. Она поддерживает вызов функций и выпущена под лицензией Apache 2.0.

автор mistralai19 июл. 2024 г.2,35 ₽ / 1 млн входных3,71 ₽ / 1 млн выходных
OpenAI: GPT-4o-mini

openai/gpt-4o-mini

GPT-4o mini — это новейшая модель OpenAI после GPT-4 Omni, поддерживающая как ввод изображений, так и текста с выводом текста. Будучи их самой продвинутой малой моделью, она во много раз доступнее других недавних моделей前沿 и более чем на 60% дешевле, чем GPT-3.5 Turbo. Она сохраняет интеллект SOTA, будучи при этом значительно более экономичной. GPT-4o mini достигает результата 82% по MMLU и в настоящее время занимает более высокое место, чем GPT-4, в чат-предпочтениях на общих рейтингах. Ознакомьтесь с анонсом запуска, чтобы узнать больше. мультимодальность

автор openai18 июл. 2024 г.18,57 ₽ / 1 млн входных74,27 ₽ / 1 млн выходных
OpenAI: GPT-4o-mini (2024-07-18)

openai/gpt-4o-mini-2024-07-18

GPT-4o mini — это новейшая модель OpenAI после GPT-4 Omni, поддерживающая ввод как текста, так и изображений с выводом текста. Будучи их самой продвинутой малой моделью, она в несколько раз доступнее других последних передовых моделей и более чем на 60% дешевле, чем GPT-3.5 Turbo. Она сохраняет интеллект SOTA, оставаясь при этом значительно более экономичной. GPT-4o mini достигает результата 82% в MMLU и в настоящее время занимает более высокое место, чем GPT-4, в рейтингах предпочтений пользователей общие таблицы лидеров. Ознакомьтесь с анонсом запуска, чтобы узнать больше. multimodal

автор openai18 июл. 2024 г.18,57 ₽ / 1 млн входных74,27 ₽ / 1 млн выходных
Google: Gemma 2 27B

google/gemma-2-27b-it

Gemma 2 27B от Google — это открытая модель, созданная на основе тех же исследований и технологий, что и модели Gemini. Модели Gemma хорошо подходят для множества задач генерации текста, включая ответы на вопросы, суммаризацию и рассуждение. Подробнее см. в объявлении о запуске. Использование Gemma регулируется условиями использования Gemma от Google.

автор google13 июл. 2024 г.80,45 ₽ / 1 млн входных80,45 ₽ / 1 млн выходных
OpenAI: GPT-4o

openai/gpt-4o

GPT-4o ("o" — от "omni") — последняя модель AI от OpenAI, принимающая на вход текст и изображения и выдающая текст. Она сохраняет уровень интеллекта GPT-4 Turbo, при этом работая вдвое быстрее и будучи на 50% экономичнее. GPT-4o также обеспечивает улучшенную производительность при обработке неанглийских языков и расширенные визуальные возможности. Для сравнения с другими моделями она кратко называлась "im-also-a-good-gpt2-chatbot" multimodal

автор openai13 мая 2024 г.309,44 ₽ / 1 млн входных1 237,76 ₽ / 1 млн выходных
OpenAI: GPT-4o (2024-05-13)

openai/gpt-4o-2024-05-13

GPT-4o (буква «o» означает «omni») — последняя модель OpenAI AI, поддерживающая ввод текста и изображений с выводом текста. Она сохраняет уровень интеллекта GPT-4 Turbo, будучи при этом вдвое быстрее и на 50% экономичнее. Кроме того, GPT-4o демонстрирует улучшенную производительность при обработке неанглийских языков и расширенные визуальные возможности. Для сравнения с другими моделями она кратко называлась "im-also-a-good-gpt2-chatbot" мультимодальность

автор openai13 мая 2024 г.618,88 ₽ / 1 млн входных1 856,63 ₽ / 1 млн выходных
Mistral: Mixtral 8x22B Instruct

mistralai/mixtral-8x22b-instruct

Официальная инструктивная тонконастроенная версия Mixtral 8x22B от Mistral. Она использует 39B активных параметров из 141B, обеспечивая непревзойденную экономическую эффективность для своего размера. Ее сильные стороны включают: сильная математика, программирование и рассуждение большой контекст (64k) свободное владение английским, французским, итальянским, немецким и испанским См. бенчмарки в анонсе здесь. moe

автор mistralai17 апр. 2024 г.247,55 ₽ / 1 млн входных742,65 ₽ / 1 млн выходных
WizardLM-2 8x22B

microsoft/wizardlm-2-8x22b

WizardLM-2 8x22B — самая продвинутая модель Microsoft AI. Она демонстрирует высокую конкурентоспособность по сравнению с ведущими проприетарными моделями и стабильно превосходит все существующие открытые модели. Это инструктивная тонкая настройка Mixtral 8x22B. Подробнее о выпуске модели читайте здесь. moe

автор microsoft16 апр. 2024 г.76,74 ₽ / 1 млн входных76,74 ₽ / 1 млн выходных
OpenAI: GPT-4 Turbo

openai/gpt-4-turbo

Новейшая модель GPT-4 Turbo с поддержкой возможностей зрения. Запросы с изображениями теперь могут использовать режим JSON и вызов функций. Обучающие данные: до декабря 2023.

автор openai9 апр. 2024 г.1 237,76 ₽ / 1 млн входных3 713,27 ₽ / 1 млн выходных
Anthropic: Claude 3 Haiku

anthropic/claude-3-haiku

Claude 3 Haiku — самая быстрая и компактная модель Anthropic для почти мгновенного отклика. Быстрая и точная целевая производительность. Смотрите анонс запуска и результаты тестов здесь multimodal

автор anthropic13 мар. 2024 г.30,94 ₽ / 1 млн входных154,72 ₽ / 1 млн выходных
Mistral Large

mistralai/mistral-large

Это флагманская модель Mistral AI — Mistral Large 2 (версия mistral-large-2407). Это проприетарная модель с доступными весами, которая отлично справляется с рассуждениями, кодом, JSON, чатом и многим другим. Прочитайте анонс запуска здесь. Она поддерживает десятки языков, включая французский, немецкий, испанский, итальянский, португальский, арабский, хинди, русский, китайский, японский и корейский, а также 80+ языков программирования, включая Python, Java, C, C++, JavaScript и Bash. Длинное окно контекста позволяет точно извлекать информацию из больших документов.

автор mistralai26 февр. 2024 г.247,55 ₽ / 1 млн входных742,65 ₽ / 1 млн выходных
OpenAI: GPT-3.5 Turbo (older v0613)

openai/gpt-3.5-turbo-0613

GPT-3.5 Turbo — самая быстрая модель OpenAI. Она может понимать и генерировать естественный язык или код, и оптимизирована для чата и традиционных задач завершения. Данные для обучения до сентября 2021.

автор openai25 янв. 2024 г.123,78 ₽ / 1 млн входных247,55 ₽ / 1 млн выходных
OpenAI: GPT-4 Turbo Preview

openai/gpt-4-turbo-preview

Предварительная версия модели GPT-4 с улучшенным следованием инструкциям, режимом JSON, воспроизводимыми выходами, параллельным вызовом функций и многим другим. Данные обучения: до декабря 2023. Примечание: в предварительной версии действует строгое ограничение частоты запросов OpenAI.

автор openai25 янв. 2024 г.1 237,76 ₽ / 1 млн входных3 713,27 ₽ / 1 млн выходных
OpenAI: GPT-3.5 Turbo Instruct

openai/gpt-3.5-turbo-instruct

Эта модель — вариант GPT-3.5 Turbo, настроенный на инструкционные запросы и исключающий оптимизации, связанные с чатом. Обучающие данные: по сентябрь 2021.

автор openai28 сент. 2023 г.185,66 ₽ / 1 млн входных247,55 ₽ / 1 млн выходных
OpenAI: GPT-3.5 Turbo 16k

openai/gpt-3.5-turbo-16k

Эта модель предлагает четырехкратную длину контекста по сравнению с gpt-3.5-turbo, позволяя обрабатывать примерно 20 страниц текста в одном запросе при более высокой стоимости. Данные для обучения: до сентября 2021.

автор openai28 авг. 2023 г.371,33 ₽ / 1 млн входных495,10 ₽ / 1 млн выходных

Попытка воссоздать стиль многословия Claude, но не ожидайте того же уровня связности или памяти. Предназначено для использования в ролевых/повествовательных ситуациях.

автор mancer2 авг. 2023 г.49,51 ₽ / 1 млн входных92,83 ₽ / 1 млн выходных
ReMM SLERP 13B

undi95/remm-slerp-l2-13b

Попытка воссоздания оригинальной MythoMax-L2-B13, но с обновлёнными моделями. #merge

автор undi9522 июл. 2023 г.55,70 ₽ / 1 млн входных80,45 ₽ / 1 млн выходных
MythoMax 13B

gryphe/mythomax-l2-13b

Одна из самых производительных и популярных тонких настроек Llama 2 13B с богатыми описаниями и ролевой игрой. #merge

автор gryphe2 июл. 2023 г.7,43 ₽ / 1 млн входных7,43 ₽ / 1 млн выходных
OpenAI: GPT-3.5 Turbo

openai/gpt-3.5-turbo

GPT-3.5 Turbo — самая быстрая модель OpenAI. Она может понимать и генерировать естественный язык или код и оптимизирована для чата и традиционных задач завершения. Обучающие данные до сентября 2021.

автор openai28 мая 2023 г.61,89 ₽ / 1 млн входных185,66 ₽ / 1 млн выходных
OpenAI: GPT-4

openai/gpt-4

Флагманская модель OpenAI, GPT-4, — это крупномасштабная мультимодальная языковая модель, способная решать сложные задачи с большей точностью, чем предыдущие модели, благодаря более широким общим знаниям и расширенным возможностям рассуждения. Обучающие данные: до сентября 2021.

автор openai28 мая 2023 г.3 713,27 ₽ / 1 млн входных7 426,53 ₽ / 1 млн выходных