Блог

Claude Fable 5.1

Редакция GoRouterОпубликовано
Fable 5.1

Новая флагманская модель Anthropic возглавила рейтинг Artificial Analysis. Но за последний пункт в тесте приходится платить почти сорок процентов сверху — и это хорошо описывает весь релиз.

1 сентября Anthropic выпустила Claude Fable 5.1. По названию это промежуточное обновление, но позиционируют модель без скромности: как самый сильный общедоступный Claude для программирования, исследований и длинных задач, которые могут часами работать без присмотра.

Важное слово здесь — «длинных». Fable 5.1 вряд ли стоит выбирать ради ответа на письмо или краткого пересказа документа. Это модель для ситуаций, где дешевле потратить больше вычислений, чем получить почти правильный результат.

Что именно выпустила Anthropic

Fable 5.1 и закрытая Claude Mythos 5.1 — одна и та же базовая модель. Отличаются они ограничениями: Fable доступна всем, но часть запросов по кибербезопасности и биологии перенаправляется на модели Opus. Mythos с более свободным доступом к таким возможностям получают только проверенные организации.

У Fable 5.1 контекст на 1 миллион токенов, максимальный ответ на 128 тысяч токенов и постоянно включённое адаптивное мышление. Глубиной рассуждений управляет параметр effort: low, medium, high, xhigh или max. В Claude Code по умолчанию используется high, а в Claude.ai и Cowork — medium. Официальная документация Anthropic отдельно рекомендует начинать большинство обычных задач с Opus 5, оставляя Fable для случаев, когда Opus уже не справляется.

Основные цены не изменились:

  • входные токены — $10 за миллион;

  • выходные — $50 за миллион;

  • чтение кэша — $0,25 за миллион вместо прежнего $1.

Именно скидка на кэш позволяет Anthropic говорить, что типичный запуск Fable 5.1 будет примерно на 25% дешевле предшественника, а некоторые агентные сценарии — до 45% дешевле. Но это только половина картины.

Что намерила Artificial Analysis

На максимальном effort Fable 5.1 получила 66 баллов в Artificial Analysis Intelligence Index — это первое место. Для сравнения: Opus 5 набрала 63, Fable 5 — 62, GPT-5.6 Sol — 61.

Результаты разных режимов выглядят показательнее одного рекорда:

Effort

Intelligence Index

Стоимость одной задачи AA

Low

58

$0,77

Medium

60

$1,00

High

62

$1,43

Xhigh

65

$2,65

Max

66

$3,69

Стоимость здесь — не цена произвольного запроса пользователя, а средневзвешенная стоимость одной задачи из набора тестов Artificial Analysis. Таблица использует актуальные значения на странице релиза AA; в первоначальной статье в день запуска были указаны $2,72 для xhigh и $3,76 для max — сервис уже успел немного пересчитать данные. Текущая таблица Artificial Analysis.

Главный вывод хорошо виден без сложной статистики: переход с xhigh на max приносит один дополнительный балл, но увеличивает стоимость задачи примерно на 39%. Max выглядит полезным для бенчмарков и действительно дорогих ошибок. Для повседневной работы xhigh, а иногда и high, рациональнее.

На отдельных тестах модель тоже выступила сильно. Она получила 59,1% на Humanity’s Last Exam, 91,4% на Terminal-Bench v2.1 и 62% на SciCode. В тесте профессиональной работы GDPval-AA v2 результат составил 1853 Elo против 1824 у Opus 5, хотя доверительные интервалы пересекаются. На AA-Briefcase модели практически сравнялись: Fable лучше справлялась с анализом и соблюдением критериев, Opus — с подачей результата. Подробный разбор Artificial Analysis.

Так она действительно прожорливая?

Да, особенно на максимальном effort.

Во время полного прогона Intelligence Index модель израсходовала 13,1 миллиона выходных токенов в режиме low и 143,7 миллиона в max. Расход вырос почти в 11 раз, а итоговый индекс — с 58 до 66.

Это не означает, что один запрос внезапно съест 143 миллиона токенов: цифра относится ко всему набору тестов. Но характер модели она передаёт точно. Fable 5.1 умеет превращать дополнительное время и токены в качество — просто после xhigh отдача начинает быстро уменьшаться.

По данным AA, максимальный режим использовал примерно в 1,7 раза больше выходных токенов, чем Fable 5, и обходился примерно на 20% дороже за задачу. Снижение цены кэша не спасает, когда дорожает другая часть счёта: выходные токены по-прежнему стоят $50 за миллион.

Поэтому заявления Anthropic об экономии и результаты Artificial Analysis не противоречат друг другу. Anthropic считает реальные сценарии с повторным использованием большого контекста и стандартным effort. Artificial Analysis нагружает максимальный режим, где модель много рассуждает и генерирует больше текста. В первом случае выигрывает дешёвый кэш, во втором счёт определяет объём вывода.

Ещё один мелкий шрифт

Artificial Analysis тестировала Fable 5.1 с серверным fallback от Anthropic. Около 4% выходных токенов в индексе сгенерировали Opus 4.8 или Opus 5 после срабатывания защитных фильтров. Поэтому 66 баллов — результат реальной продуктовой конфигурации, а не полностью изолированной модели.

Есть и другая любопытная деталь. В AA-Omniscience Fable 5.1 чаще пыталась отвечать и показала рекордную точность 67,2%. Но среди вопросов, где правильного ответа не получилось, модель всё равно давала содержательный ответ в 72,6% случаев — против 63,6% у Fable 5. В итоге общий показатель на этом тесте не вырос.

Проще говоря, модель стала смелее. Это полезно в исследовании и поиске решений, но не отменяет проверку фактов.

Кому имеет смысл использовать Fable 5.1

Модель выглядит оправданно для больших кодовых баз, многоэтапных исследований, анализа массивов документов и задач, которые агент выполняет часами. Здесь один найденный дефект или правильно выбранное направление может окупить большой счёт за токены.

Для обычного чата, коротких текстов и типовых вызовов Fable 5.1 избыточна. Даже Anthropic предлагает сначала попробовать Opus 5, который стоит вдвое дешевле по входным и выходным токенам.

Практичная стратегия выглядит так: начинать с high, поднимать effort до xhigh только для сложных этапов и включать max там, где лишний процент качества действительно имеет денежную ценность. А при работе с большим постоянным контекстом обязательно использовать кэш — без него экономическая часть этого релиза почти теряется.

Fable 5.1 не стала «тем же самым, только умнее и дешевле». Она предлагает более интересный обмен: можно покупать дополнительную уверенность дополнительными вычислениями. На low и medium это эффективная модель нового поколения. На max — уже исследовательский инструмент с соответствующим аппетитом.

Официальный анонс: Anthropic — Claude Fable 5.1 and Mythos 5.1.

Anthropic: Claude Fable 5.1anthropic/claude-fable-5.1Claude Fable 5.1 превосходит Claude Fable 5 по всем направлениям, при этом наибольший прогресс наблюдается в агентном программировании, длительных агентных рабочих процессах и интеллектуальной работе: особенно в длительном рефакторинге кода, генерации front-end и визуального кода, а также в финансовых и аналитических задачах. Он также, как правило, более лаконичен, чем Fable 5, в своих планах и сводках. Мы рекомендуем протестировать его как прямое обновление везде, где вы сегодня используете Fable 5, а также вместе с Opus 5 для задач, требующих сложных рассуждений.Вход / выходвход1 237,76 ₽выход6 188,78 ₽за 1 млн токеновКонтекст 1 млнТекст, Изображение, Файл ТекстПодробнее о модели