Хостинг-провайдер

NextBit

NextBit обслуживает эти модели как инфраструктурный провайдер. Авторы моделей указаны отдельно в списке.

12

моделей в каталоге

Модели на хостинге NextBit

В списке показаны только включённые модели из публичного каталога GoRouter.

Z.ai: GLM 5.3 Flash

z-ai/glm-5.3-flash

GLM-5.3-Flash — это нативная мультимодальная модель от Z.ai. Она подходит для эффективного программирования и долгосрочных агентных задач. Её гибридная архитектура разрежённого и линейного внимания сохраняет точное поведение при работе с длинным контекстом, одновременно снижая вычислительные накладные расходы.

автор z-ai26 авг. 2026 г.9,28 ₽ / 1 млн входных30,94 ₽ / 1 млн выходных
DeepSeek: DeepSeek V4 Pro 0813

deepseek/deepseek-v4-pro-0813

DeepSeek V4 Pro 0813 — это крупномасштабная модель смеси экспертов от DeepSeek. Это GA-й выпуск DeepSeek V4 Pro.

автор deepseek12 авг. 2026 г.163,38 ₽ / 1 млн входных490,15 ₽ / 1 млн выходных
DeepSeek: DeepSeek V4 Flash 0731

deepseek/deepseek-v4-flash-0731

DeepSeek V4 Flash 0731 — это разреженная модель смеси экспертов от DeepSeek, с 13B активными параметрами из 284B общих. Эта переобученная версия подходит для задач кодирования, рассуждений и агентных рабочих процессов. Это GA-релиз DeepSeek V4 Flash.

автор deepseek31 июл. 2026 г.13,41 ₽ / 1 млн входных37,13 ₽ / 1 млн выходных
DeepSeek: DeepSeek V4 Pro 0423

deepseek/deepseek-v4-pro

DeepSeek V4 Pro — это крупномасштабная модель смеси экспертов от DeepSeek с общим количеством параметров 1.6T и активными параметрами 49B, поддерживающая контекстное окно в 1M токенов. Модель предназначена для сложных задач рассуждения, программирования и длительных агентных сценариев, демонстрируя высокую производительность в области знаний, математики и программной инженерии. Основанная на той же архитектуре, что и DeepSeek V4 Flash, она использует гибридную систему внимания для эффективной обработки длинных контекстов. Поддерживаются уровни рассуждения high и xhigh; xhigh соответствует максимальному режиму рассуждения. Модель хорошо подходит для ресурсоёмких задач, таких как анализ всего кодового репозитория, многошаговая автоматизация и крупномасштабный синтез информации, где критически важны как производительность, так и эффективность.

автор deepseek24 апр. 2026 г.129,75 ₽ / 1 млн входных259,49 ₽ / 1 млн выходных
DeepSeek: DeepSeek V4 Flash 0423

deepseek/deepseek-v4-flash

DeepSeek V4 Flash — это оптимизированная по эффективности модель Mixture-of-Experts от DeepSeek с 284B общим количеством параметров и 13B активируемых параметров, поддерживающая контекстное окно в 1M токенов. Она предназначена для быстрого вывода и высокопроизводительных рабочих нагрузок, сохраняя при этом высокую производительность в рассуждениях и написании кода. Модель включает гибридное внимание для эффективной обработки длинного контекста. Поддерживаются режимы рассуждений high и xhigh; xhigh соответствует максимальному режиму рассуждений. Она хорошо подходит для таких приложений, как ассистенты программирования, чат-системы и агентные рабочие процессы, где важны отзывчивость и экономическая эффективность.

автор deepseek24 апр. 2026 г.10,59 ₽ / 1 млн входных21,18 ₽ / 1 млн выходных
Google: Gemma 4 26B A4B

google/gemma-4-26b-a4b-it

Gemma 4 26B A4B IT — это модель Mixture-of-Experts (MoE) с инструкционной настройкой от Google DeepMind. Несмотря на 25.2B общих параметров, во время инференса активируется только 3.8B на токен, что обеспечивает качество, близкое к -31B, при доле вычислительных затрат. Поддерживает мультимодальный ввод, включая текст, изображения и видео (до 60 секунд при 1fps). Имеет контекстное окно в 256K токенов, встроенный вызов функций, настраиваемый режим мышления/рассуждения и поддержку структурированного вывода. Выпущена под лицензией Apache 2.0.

автор google3 апр. 2026 г.8,66 ₽ / 1 млн входных42,08 ₽ / 1 млн выходных
Qwen: Qwen3 14B

qwen/qwen3-14b

Qwen3-14B — это плотная языковая модель с 14.8B параметрами из серии Qwen3, предназначенная как для сложных рассуждений, так и для эффективного диалога. Она поддерживает плавное переключение между режимом «размышления» для задач, требующих математики, программирования и логических выводов, и режимом «без размышлений» для обычного общения. Модель доработана для следования инструкциям, использования инструментов агентами, творческого письма и многоязычных задач на 100+ языках и диалектах. Она изначально поддерживает контекст до 32K токенов и может быть расширена до 131K токенов с помощью масштабирования на основе YaRN.

автор qwen28 апр. 2025 г.14,85 ₽ / 1 млн входных29,71 ₽ / 1 млн выходных
Sao10K: Llama 3.3 Euryale 70B

sao10k/l3.3-euryale-70b

Euryale L3.3 70B — модель, ориентированная на творческую ролевую игру, от Sao10k. Она является преемницей Euryale L3 70B v2.2.

автор sao10k18 дек. 2024 г.80,45 ₽ / 1 млн входных92,83 ₽ / 1 млн выходных
TheDrummer: UnslopNemo 12B

thedrummer/unslopnemo-12b

UnslopNemo v4.1 является новейшим дополнением от создателя Rocinante, предназначенным для написания приключений и сценариев ролевых игр.

автор thedrummer8 нояб. 2024 г.49,51 ₽ / 1 млн входных49,51 ₽ / 1 млн выходных
Google: Gemma 2 27B

google/gemma-2-27b-it

Gemma 2 27B от Google — это открытая модель, созданная на основе тех же исследований и технологий, что и модели Gemini. Модели Gemma хорошо подходят для множества задач генерации текста, включая ответы на вопросы, суммаризацию и рассуждение. Подробнее см. в объявлении о запуске. Использование Gemma регулируется условиями использования Gemma от Google.

автор google13 июл. 2024 г.80,45 ₽ / 1 млн входных80,45 ₽ / 1 млн выходных
ReMM SLERP 13B

undi95/remm-slerp-l2-13b

Попытка воссоздания оригинальной MythoMax-L2-B13, но с обновлёнными моделями. #merge

автор undi9522 июл. 2023 г.55,70 ₽ / 1 млн входных80,45 ₽ / 1 млн выходных
MythoMax 13B

gryphe/mythomax-l2-13b

Одна из самых производительных и популярных тонких настроек Llama 2 13B с богатыми описаниями и ролевой игрой. #merge

автор gryphe2 июл. 2023 г.7,43 ₽ / 1 млн входных7,43 ₽ / 1 млн выходных