NVIDIA: Nemotron 3 Ultra

nvidia/nemotron-3-ultra-550b-a55b
Документация

NVIDIA Nemotron 3 Ultra — открытая модель фронтьерного рассуждения и оркестрации от NVIDIA, с 55B активными параметрами из 550B общих (MoE). Построенная на гибридной архитектуре Transformer-Mamba смеси экспертов, она поддерживает ввод и вывод текста с окном контекста до 1M токенов. Она подходит для длительных агентных рабочих процессов, включая оркестрацию агентов, агентов программирования, глубокие исследования и сложные корпоративные задачи. Модель особенно сильна в многошаговом рассуждении и планировании, с высокопроизводительным инференсом, разработанным для высокообъёмных агентных конвейеров. Она является частью семейства открытых моделей NVIDIA Nemotron для агентных AI.

Модальности
Вход / выход за 1 млн
77,36 ₽ / 386,80 ₽
Контекст
262 144
Добавлена
4 июн. 2026 г.

Поставщики, endpoint’ы и маршрутизация

Один поставщик может предлагать несколько endpoint-вариантов: стандартный, flex, priority или региональный. Без дополнительных настроек выбирается самый дешёвый доступный endpoint.

Сначала самый дешёвый доступный endpoint
"provider": { "sort": "price" }

3 поставщика · 4 endpoint-вариантов

Поставщик / endpointДанныеВход / 1 млнВыход / 1 млнКэш / 1 млнЗадержкаСкоростьДоступность
DeepInfraДешевле
deepinfra/fp4·FP4
61,89 ₽272,31 ₽12,38 ₽99,96%
baseten/fp4·FP4
74,27 ₽297,06 ₽14,85 ₽655 мс84 ток/с100,00%
baseten/fp4·FP4
74,27 ₽297,06 ₽14,85 ₽643 мс77 ток/с100,00%
venice/fp8·FP8
77,36 ₽386,80 ₽23,21 ₽16,2 с8 ток/с51,86%

Красный и жёлтый щиты отмечают предупреждения о данных. Наведите на значок для подробностей. Условия конкретного endpoint могут отличаться от общей политики провайдера.

Цены

Стоимость показана в рублях по текущему курсу пополнения. Итоговая сумма зависит от фактического usage ответа.

ОперацияСтоимость
Входные токены77,36 ₽за 1 млн токенов
Выходные токены386,80 ₽за 1 млн токенов
Чтение кэша23,21 ₽за 1 млн токенов

Бенчмарки

Результаты стандартизированных оценок. Для индексов, ELO и точности большее значение означает лучший результат.

Artificial Analysis

Сводные индексы способностей модели.

Источник
Интеллекттоп 42%
38,3индекс

место 49 из 117

Кодтоп 40%
49,3индекс

место 56 из 143

Агентные задачитоп 40%
27,5индекс

место 47 из 118

Design Arena

ELO и доля побед по категориям визуальных задач.

Источник
3Dтоп 48%
1 173ELO
41,1%побед119,1 ссреднее62/130место
UI-компонентытоп 61%
1 161ELO
37,7%побед113,3 ссреднее82/136место
Визуализация данныхтоп 62%
1 160ELO
38,4%побед116,4 ссреднее84/137место
Разработка игртоп 60%
1 160ELO
37%побед142,2 ссреднее83/139место
Категории кодатоп 64%
1 157ELO
36,3%побед145,6 ссреднее90/141место
Веб-сайтытоп 67%
1 145ELO
34,3%побед161,4 ссреднее100/151место
SVGтоп 70%
1 116ELO
36,5%побед45 ссреднее69/99место
ASCII-арттоп 90%
1 102ELO
36,5%побед101,4 ссреднее65/73место

Публичные eval-задачи

Точность опубликованных прогонов.

Источник
GPQA Diamond
82,2%точность

579 задач

τ-bench Verified — Airline
76,9%точность

150 задач

Данные API на 02.09.2026, 12:01:44.

Параметры и модальности

Поддержка параметров синхронизирована с текущей версией модели.

Входные модальности

text

Выходные модальности

text
frequency_penaltyinclude_reasoninglogit_biasmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_p

Пример запроса

curl https://gorouter.ru/api/v1/chat/completions \
  -H "Authorization: Bearer $GOROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-3-ultra-550b-a55b",
    "messages": [{"role": "user", "content": "Привет!"}]
  }'