Блог

GPT‑6 Astra: модель, которая не просто отвечает, а работает

Редакция GoRouterОпубликовано
gpt-6-astra

3 сентября OpenAI представила GPT‑6 Astra — новую флагманскую модель и, по формулировке самой компании, свою самую интеллектуальную и согласованную с намерениями пользователя систему.

Громкая часть анонса — почти идеальные результаты в математике, абстрактном мышлении и кибербезопасности. Но куда интереснее другое: Astra заметно прибавила именно там, где модель должна не выдать красивый ответ, а пережить длинную последовательность действий и всё-таки довести работу до конца.

Она открывает сайты, ориентируется в интерфейсах, редактирует документы, запускает код, проверяет результат и меняет план по ходу задачи. То есть центр тяжести окончательно смещается от чат-бота к рабочему агенту. Анонс GPT‑6 Astra на сайте OpenAI.

Что изменилось на практике

Предыдущие поколения уже умели пользоваться браузером и компьютером, но сложные сценарии оставались хрупкими. Модель могла потерять исходную цель после уточнения, забыть раннее ограничение или остановиться посреди работы из-за несущественного пробела в инструкции.

Astra лучше удерживает общий замысел. Если недостающую деталь можно безопасно вывести из контекста, модель продолжает сама. Если решение действительно влияет на результат — задаёт конкретный вопрос, не бросая независимую часть работы.

В Codex появилась и новая механика работы с длинной историей. Вместо очередного сжатого пересказа модель может вести заметки и искать детали в предыдущих контекстных окнах: например, найти старый результат теста или вспомнить, почему уже испробованное исправление не сработало. Пока функция экспериментальная.

Компьютерные задачи Astra выполняет не только точнее, но и быстрее. В симуляции OSWorld 2.0 модель набрала 72,6% примерно за 40 минут на задачу. GPT‑5.6 Sol получила 65,7% и тратила около 75 минут. Это примерно на 47% меньше времени при более высоком результате.

Основные характеристики

Характеристика

GPT‑6 Astra

ID модели

gpt-6-astra

Контекстное окно

1 050 000 токенов

Максимальный ответ

128 000 токенов

Срез знаний

30 апреля 2026 года

Уровни рассуждения

low, medium, high, xhigh, max

Вход

Текст и изображения

Выход

Текст

Аудио и видео

Не поддерживаются напрямую

Structured Outputs

Поддерживаются

Function calling

Поддерживается

Инструменты

Web Search, File Search, Code Interpreter, Hosted Shell, Computer Use, MCP, Skills

Fine-tuning

Не поддерживается

Рекомендуемый API

Responses API

Полные технические характеристики опубликованы в карточке GPT‑6 Astra.

Метрики GPT‑6 Astra

Ниже — наиболее показательные результаты в сравнении с GPT‑5.6 Sol. Разница указана в процентных пунктах.

Тест

GPT‑6 Astra

GPT‑5.6 Sol

Разница

OSWorld 2.0

72,6%

65,7%

+6,9

ScreenSpot-Pro

92,7%

76,9%

+15,8

AutomationBench

41,4%

18,1%

+23,3

BenchCAD

95,9%

83,3%

+12,6

Terminal-Bench 4.0

57,9%

37,3%

+20,6

Database Migration Tasks

63,9%

42,7%

+21,2

Terminal-Bench Science

64,6%

22,4%

+42,2

FrontierMath Tier 4

97,6%

83,0%

+14,6

ARC-AGI-3

99,9%

7,8%

+92,1

MRCR, контекст 512K–1M

96,3%

73,8%

+22,5

ExploitBench

100%

78,5%

+21,5

SRE-Bench, одна попытка

88,0%

55,9%

+32,1

У таблицы есть важная оговорка. OpenAI приводит максимальный результат модели при доступных уровнях reasoning effort, а часть испытаний проводилась в исследовательском окружении. Продакшен-версия ChatGPT может вести себя иначе из-за другого системного промпта и набора инструментов.

Особенно осторожно стоит читать 99,9% на ARC-AGI-3: Astra запускалась через модифицированный Responses API harness. Результат всё равно впечатляет, но превращать его в универсальное «модель решила интеллект» было бы преждевременно.

Код, браузер и настоящие рабочие процессы

В кодинге самый заметный скачок произошёл не на привычных коротких задачах, а в терминальных и многошаговых сценариях. Terminal-Bench вырос с 37,3% до 57,9%, внутренний тест миграции баз данных — с 42,7% до 63,9%.

На DeepSWE разница скромнее: 74,1% против 72,7%. Это хороший холодный душ для маркетингового восторга. Astra не уничтожает предыдущее поколение в каждой строке таблицы. Её преимущество раскрывается, когда программирование связано с терминалом, браузером, тестированием и проверкой результата.

Похожая картина в профессиональной работе. Модель обучали соблюдать существующие шаблоны, собирать презентации с внятной структурой, приводить в порядок таблицы и не тащить в документ весь найденный контекст. Результат должен быть ближе к готовому артефакту, а не к черновику, который ещё час приходится чистить вручную.

Новые возможности API

Для разработчиков Astra приносит несколько вещей, которые важнее очередного прироста контекстного окна:

  • Асинхронные вызовы инструментов. Пока приложение выполняет долгий tool call, модель может рассуждать дальше или заниматься независимой частью задачи.

  • Управление во время генерации. Через WebSocket можно отправить уточнение, пока задача уже выполняется, не начиная весь запрос заново.

  • Изменение reasoning effort внутри диалога. Уровень рассуждения можно повысить для сложного этапа и снова уменьшить для рутинных шагов, сохранив кэшированный префикс.

  • Более устойчивое выполнение длинных агентных сценариев, включая computer use, MCP и программные вызовы инструментов.

Минимальный запрос выглядит так:

Код
const response = await client.responses.create({
  model: "gpt-6-astra",
  reasoning: { effort: "high" },
  input: "Проанализируй проект, запусти тесты и подготовь отчёт о найденных проблемах."
});

Для инструментов OpenAI рекомендует Responses API. Уровни none и minimal модель не поддерживает; минимальный вариант — low. Параметры temperature, top_p и top_logprobs при миграции нужно убрать. Подробности собраны в официальном руководстве по GPT‑6 Astra.

Сколько стоит GPT‑6 Astra

Высокие результаты достались не бесплатно. По стандартному тарифу Astra в 2,5 раза дороже GPT‑5.6 Sol и на входе, и на выходе.

Операция

Цена за 1 млн токенов

Входные токены

$10

Чтение из кэша

$1

Запись в кэш

$12,50

Выходные токены

$50

Batch и Flex

50% от Standard

Fast mode

200% от соответствующего тарифа

Запрос со 100 тысячами входных и 10 тысячами выходных токенов обойдётся примерно в $1,50. При повторном использовании уже записанного кэша — около $0,60 без учёта первоначальной записи.

Есть неприятная деталь для очень длинного контекста: если вход превышает 272 тысячи токенов, для всего запроса вход и операции с кэшем тарифицируются с коэффициентом ×2, а выход — ×1,5.

Поэтому миллионное окно лучше воспринимать как доступный инструмент, а не приглашение отправлять в каждый запрос всю базу документов. При этом более высокая цена токена не всегда означает более дорогую задачу: OpenAI отмечает, что Astra в некоторых агентных тестах достигает результата с меньшим количеством выходных токенов.

Доступность

На момент публикации развёртывание ещё продолжается. Первой доступ получила ограниченная группа организаций; API и доступ для остальных планов OpenAI обещает расширять в течение нескольких дней.

Ситуация зависит от конкретного продукта. В обычном ChatGPT модель появляется как GPT‑6 Pro на тарифах Pro, Business и Enterprise. Для Plus доступ заявлен через ChatGPT Work и Codex по мере развёртывания. В Enterprise модель по умолчанию выключена — её должен разрешить администратор рабочего пространства. Актуальное разделение по продуктам приведено в справке OpenAI.

Для разработчиков заявлены OpenAI API, Microsoft Azure и AWS Bedrock. API-идентификатор — gpt-6-astra.

Почему вокруг безопасности столько внимания

Astra стала первой моделью OpenAI, достигшей уровня Critical по кибербезопасности в Preparedness Framework. Без продакшен-ограничений она получила 100% на ExploitBench, нашла две ранее неизвестные уязвимости и показала способность работать с защищёнными браузерами и операционными системами.

Полезная сторона очевидна: поиск уязвимостей, аудит кода и подготовка исправлений становятся быстрее. Обратная сторона столь же очевидна, поэтому продакшен-версия отказывается от части продвинутых запросов на создание эксплойтов, а потенциально опасная работа может быть приостановлена для дополнительной проверки.

В тесте на нежелательные последствия при управлении компьютером Astra показала 2,4% против 22% у GPT‑5.6 Sol — меньше здесь лучше. Внутренний показатель ложных заявлений о собственных возможностях снизился с 12,2% до 4,2%.

При этом OpenAI признаёт слабое место: письменные рассуждения Astra оказалось сложнее контролировать, чем рассуждения GPT‑5.6 Sol. Компания связывает это с тем, что новая модель лучше управляет объёмом объяснений и решает простые задачи с меньшим числом явно записанных шагов. Детали опубликованы в обзоре безопасности GPT‑6 Astra.

Кому действительно нужна Astra

Astra имеет смысл выбирать, когда ошибка или незавершённая задача обходятся дороже токенов:

  • для агентов, работающих с браузером, терминалом и десктопными приложениями;

  • для больших кодовых баз, миграций и циклов «изменить — запустить — проверить»;

  • для длинных исследований с множеством источников;

  • для подготовки документов, таблиц и презентаций по корпоративным шаблонам;

  • для сложных научных и защитных киберсценариев.

Для классификации, коротких ответов, простого извлечения данных и массовой генерации текста Astra будет избыточной. Там разумнее оставить GPT‑5.6 Terra, Luna или другую дешёвую модель, а Astra подключать как старшего исполнителя на дорогом участке процесса.

Итог

GPT‑6 Astra интересна не рекордом в одной таблице. Она объединяет сильное рассуждение, длинный контекст и работу с компьютером в одной системе — и заметно сокращает расстояние между «модель поняла задачу» и «задача действительно выполнена».

Но универсальной заменой всем моделям Astra пока не выглядит. Она дорогая, местами ограниченная усиленными проверками и всё ещё разворачивается постепенно. Это инструмент для работы, где важны самостоятельность, проверка результата и способность не потерять цель после двадцатого шага.

Именно на таких задачах новое поколение заметнее всего.