DeepSeek: DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
Документация

DeepSeek V4.1 Flash — это разреженная модель смеси экспертов от DeepSeek и первая модель, построенная на архитектуре Causal Encoder-Decoder (CED) компании. Она активирует 8B параметров на входе и 16B на выходе из базовой модели с 552B параметрами; такое асимметричное разделение обеспечивает низкий объём вычислений на токен по сравнению с общим размером модели. Понимание изображений изначально присуще архитектуре: визуальные и текстовые эмбеддинги обучаются совместно с самого начала предварительного обучения, а не добавляются впоследствии, как в более ранней экспериментальной модели V4 Flash Vision Exp. Она подходит для агентов, работающих с кодом, терминалом и компьютером, а также для задач с длинным горизонтом, которые должны выполняться до конца на протяжении многих шагов, и для анализа длинного контекста. Сжатое KV кэширование сокращает объём кэш-памяти примерно до четверти по сравнению с предыдущим поколением Flash, значительно снижая затраты на агентных нагрузках. DeepSeek позиционирует её как экономичный уровень семейства V4.1 и сообщает, что она превосходит V4 Pro по производительности, скорости и времени выполнения задач.

Модальности
Вход / выход за 1 млн
36,17 ₽ / 144,66 ₽
Контекст
1 048 576
Добавлена
10 сент. 2026 г.

Поставщики, endpoint’ы и маршрутизация

Один поставщик может предлагать несколько endpoint-вариантов: стандартный, flex, priority или региональный. Автоматическая маршрутизация учитывает цену и доступность провайдеров. Стратегию можно выбрать вручную.

Выбор с учётом цены и доступности
"provider": {}

9 поставщика · 9 endpoint-вариантов

Поставщик / endpointДанныеВход / 1 млнВыход / 1 млнКэш / 1 млнЗадержкаСкоростьДоступность
DeepSeekДешевле
deepseek·Стандарт
18,08 ₽72,33 ₽0,36 ₽1,3 с134 ток/с99,98%
fireworks·Стандарт
26,52 ₽79,56 ₽0,84 ₽1,11 с121 ток/с98,15%
siliconflow/fp8·FP8
36,17 ₽144,66 ₽0,72 ₽1,14 с134 ток/с100,00%
modal·Стандарт
36,17 ₽144,66 ₽3,62 ₽2,11 с51 ток/с96,75%
gmicloud/fp8·FP8
36,17 ₽144,66 ₽0,72 ₽3,32 с86 ток/с99,97%
novita/fp8·FP8
36,17 ₽144,66 ₽0,72 ₽1,93 с129 ток/с100,00%
deepinfra/fp8·FP8
24,11 ₽72,33 ₽0,72 ₽4,48 с16 ток/с94,17%
morph/fp8·FP8
36,17 ₽144,66 ₽3,62 ₽17,24 с5 ток/с87,00%
io-net/fp8·FP8
36,17 ₽144,66 ₽0,36 ₽4,9 с4 ток/с90,70%

Красный и жёлтый щиты отмечают предупреждения о данных. Наведите на значок для подробностей. Условия конкретного endpoint могут отличаться от общей политики провайдера.

Цены

Стоимость показана в рублях по текущему курсу пополнения. Итоговая сумма зависит от фактического usage ответа.

ОперацияСтоимость
Входные токены36,17 ₽за 1 млн токенов
Выходные токены144,66 ₽за 1 млн токенов
Чтение кэша0,72 ₽за 1 млн токенов

Бенчмарки

Результаты стандартизированных оценок. Для индексов, ELO и точности большее значение означает лучший результат.

Artificial Analysis

Сводные индексы способностей модели.

Источник
Интеллекттоп 18%
39,5индекс

место 17 из 96

Публичные eval-задачи

Точность опубликованных прогонов.

Источник
GPQA Diamond
91,1%точность

197 задач

τ-bench Verified — Airline
73,3%точность

50 задач

Данные API на 11.09.2026, 00:03:27.

Параметры и модальности

Поддержка параметров синхронизирована с текущей версией модели.

Входные модальности

textimage

Выходные модальности

text
frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p

Пример запроса

curl https://gorouter.ru/api/v1/chat/completions \
  -H "Authorization: Bearer $GOROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek/deepseek-v4.1-flash",
    "messages": [{"role": "user", "content": "Привет!"}]
  }'