GPT‑6 Astra: модель, которая не просто отвечает, а работает
3 сентября OpenAI представила GPT‑6 Astra — новую флагманскую модель и, по формулировке самой компании, свою самую интеллектуальную и согласованную с намерениями пользователя систему.
Громкая часть анонса — почти идеальные результаты в математике, абстрактном мышлении и кибербезопасности. Но куда интереснее другое: Astra заметно прибавила именно там, где модель должна не выдать красивый ответ, а пережить длинную последовательность действий и всё-таки довести работу до конца.
Она открывает сайты, ориентируется в интерфейсах, редактирует документы, запускает код, проверяет результат и меняет план по ходу задачи. То есть центр тяжести окончательно смещается от чат-бота к рабочему агенту. Анонс GPT‑6 Astra на сайте OpenAI.
Что изменилось на практике
Предыдущие поколения уже умели пользоваться браузером и компьютером, но сложные сценарии оставались хрупкими. Модель могла потерять исходную цель после уточнения, забыть раннее ограничение или остановиться посреди работы из-за несущественного пробела в инструкции.
Astra лучше удерживает общий замысел. Если недостающую деталь можно безопасно вывести из контекста, модель продолжает сама. Если решение действительно влияет на результат — задаёт конкретный вопрос, не бросая независимую часть работы.
В Codex появилась и новая механика работы с длинной историей. Вместо очередного сжатого пересказа модель может вести заметки и искать детали в предыдущих контекстных окнах: например, найти старый результат теста или вспомнить, почему уже испробованное исправление не сработало. Пока функция экспериментальная.
Компьютерные задачи Astra выполняет не только точнее, но и быстрее. В симуляции OSWorld 2.0 модель набрала 72,6% примерно за 40 минут на задачу. GPT‑5.6 Sol получила 65,7% и тратила около 75 минут. Это примерно на 47% меньше времени при более высоком результате.
Основные характеристики
Характеристика | GPT‑6 Astra |
|---|---|
ID модели |
|
Контекстное окно | 1 050 000 токенов |
Максимальный ответ | 128 000 токенов |
Срез знаний | 30 апреля 2026 года |
Уровни рассуждения |
|
Вход | Текст и изображения |
Выход | Текст |
Аудио и видео | Не поддерживаются напрямую |
Structured Outputs | Поддерживаются |
Function calling | Поддерживается |
Инструменты | Web Search, File Search, Code Interpreter, Hosted Shell, Computer Use, MCP, Skills |
Fine-tuning | Не поддерживается |
Рекомендуемый API | Responses API |
Полные технические характеристики опубликованы в карточке GPT‑6 Astra.
Метрики GPT‑6 Astra
Ниже — наиболее показательные результаты в сравнении с GPT‑5.6 Sol. Разница указана в процентных пунктах.
Тест | GPT‑6 Astra | GPT‑5.6 Sol | Разница |
|---|---|---|---|
OSWorld 2.0 | 72,6% | 65,7% | +6,9 |
ScreenSpot-Pro | 92,7% | 76,9% | +15,8 |
AutomationBench | 41,4% | 18,1% | +23,3 |
BenchCAD | 95,9% | 83,3% | +12,6 |
Terminal-Bench 4.0 | 57,9% | 37,3% | +20,6 |
Database Migration Tasks | 63,9% | 42,7% | +21,2 |
Terminal-Bench Science | 64,6% | 22,4% | +42,2 |
FrontierMath Tier 4 | 97,6% | 83,0% | +14,6 |
ARC-AGI-3 | 99,9% | 7,8% | +92,1 |
MRCR, контекст 512K–1M | 96,3% | 73,8% | +22,5 |
ExploitBench | 100% | 78,5% | +21,5 |
SRE-Bench, одна попытка | 88,0% | 55,9% | +32,1 |
У таблицы есть важная оговорка. OpenAI приводит максимальный результат модели при доступных уровнях reasoning effort, а часть испытаний проводилась в исследовательском окружении. Продакшен-версия ChatGPT может вести себя иначе из-за другого системного промпта и набора инструментов.
Особенно осторожно стоит читать 99,9% на ARC-AGI-3: Astra запускалась через модифицированный Responses API harness. Результат всё равно впечатляет, но превращать его в универсальное «модель решила интеллект» было бы преждевременно.
Код, браузер и настоящие рабочие процессы
В кодинге самый заметный скачок произошёл не на привычных коротких задачах, а в терминальных и многошаговых сценариях. Terminal-Bench вырос с 37,3% до 57,9%, внутренний тест миграции баз данных — с 42,7% до 63,9%.
На DeepSWE разница скромнее: 74,1% против 72,7%. Это хороший холодный душ для маркетингового восторга. Astra не уничтожает предыдущее поколение в каждой строке таблицы. Её преимущество раскрывается, когда программирование связано с терминалом, браузером, тестированием и проверкой результата.
Похожая картина в профессиональной работе. Модель обучали соблюдать существующие шаблоны, собирать презентации с внятной структурой, приводить в порядок таблицы и не тащить в документ весь найденный контекст. Результат должен быть ближе к готовому артефакту, а не к черновику, который ещё час приходится чистить вручную.
Новые возможности API
Для разработчиков Astra приносит несколько вещей, которые важнее очередного прироста контекстного окна:
Асинхронные вызовы инструментов. Пока приложение выполняет долгий tool call, модель может рассуждать дальше или заниматься независимой частью задачи.
Управление во время генерации. Через WebSocket можно отправить уточнение, пока задача уже выполняется, не начиная весь запрос заново.
Изменение reasoning effort внутри диалога. Уровень рассуждения можно повысить для сложного этапа и снова уменьшить для рутинных шагов, сохранив кэшированный префикс.
Более устойчивое выполнение длинных агентных сценариев, включая computer use, MCP и программные вызовы инструментов.
Минимальный запрос выглядит так:
const response = await client.responses.create({
model: "gpt-6-astra",
reasoning: { effort: "high" },
input: "Проанализируй проект, запусти тесты и подготовь отчёт о найденных проблемах."
});Для инструментов OpenAI рекомендует Responses API. Уровни none и minimal модель не поддерживает; минимальный вариант — low. Параметры temperature, top_p и top_logprobs при миграции нужно убрать. Подробности собраны в официальном руководстве по GPT‑6 Astra.
Сколько стоит GPT‑6 Astra
Высокие результаты достались не бесплатно. По стандартному тарифу Astra в 2,5 раза дороже GPT‑5.6 Sol и на входе, и на выходе.
Операция | Цена за 1 млн токенов |
|---|---|
Входные токены | $10 |
Чтение из кэша | $1 |
Запись в кэш | $12,50 |
Выходные токены | $50 |
Batch и Flex | 50% от Standard |
Fast mode | 200% от соответствующего тарифа |
Запрос со 100 тысячами входных и 10 тысячами выходных токенов обойдётся примерно в $1,50. При повторном использовании уже записанного кэша — около $0,60 без учёта первоначальной записи.
Есть неприятная деталь для очень длинного контекста: если вход превышает 272 тысячи токенов, для всего запроса вход и операции с кэшем тарифицируются с коэффициентом ×2, а выход — ×1,5.
Поэтому миллионное окно лучше воспринимать как доступный инструмент, а не приглашение отправлять в каждый запрос всю базу документов. При этом более высокая цена токена не всегда означает более дорогую задачу: OpenAI отмечает, что Astra в некоторых агентных тестах достигает результата с меньшим количеством выходных токенов.
Доступность
На момент публикации развёртывание ещё продолжается. Первой доступ получила ограниченная группа организаций; API и доступ для остальных планов OpenAI обещает расширять в течение нескольких дней.
Ситуация зависит от конкретного продукта. В обычном ChatGPT модель появляется как GPT‑6 Pro на тарифах Pro, Business и Enterprise. Для Plus доступ заявлен через ChatGPT Work и Codex по мере развёртывания. В Enterprise модель по умолчанию выключена — её должен разрешить администратор рабочего пространства. Актуальное разделение по продуктам приведено в справке OpenAI.
Для разработчиков заявлены OpenAI API, Microsoft Azure и AWS Bedrock. API-идентификатор — gpt-6-astra.
Почему вокруг безопасности столько внимания
Astra стала первой моделью OpenAI, достигшей уровня Critical по кибербезопасности в Preparedness Framework. Без продакшен-ограничений она получила 100% на ExploitBench, нашла две ранее неизвестные уязвимости и показала способность работать с защищёнными браузерами и операционными системами.
Полезная сторона очевидна: поиск уязвимостей, аудит кода и подготовка исправлений становятся быстрее. Обратная сторона столь же очевидна, поэтому продакшен-версия отказывается от части продвинутых запросов на создание эксплойтов, а потенциально опасная работа может быть приостановлена для дополнительной проверки.
В тесте на нежелательные последствия при управлении компьютером Astra показала 2,4% против 22% у GPT‑5.6 Sol — меньше здесь лучше. Внутренний показатель ложных заявлений о собственных возможностях снизился с 12,2% до 4,2%.
При этом OpenAI признаёт слабое место: письменные рассуждения Astra оказалось сложнее контролировать, чем рассуждения GPT‑5.6 Sol. Компания связывает это с тем, что новая модель лучше управляет объёмом объяснений и решает простые задачи с меньшим числом явно записанных шагов. Детали опубликованы в обзоре безопасности GPT‑6 Astra.
Кому действительно нужна Astra
Astra имеет смысл выбирать, когда ошибка или незавершённая задача обходятся дороже токенов:
для агентов, работающих с браузером, терминалом и десктопными приложениями;
для больших кодовых баз, миграций и циклов «изменить — запустить — проверить»;
для длинных исследований с множеством источников;
для подготовки документов, таблиц и презентаций по корпоративным шаблонам;
для сложных научных и защитных киберсценариев.
Для классификации, коротких ответов, простого извлечения данных и массовой генерации текста Astra будет избыточной. Там разумнее оставить GPT‑5.6 Terra, Luna или другую дешёвую модель, а Astra подключать как старшего исполнителя на дорогом участке процесса.
Итог
GPT‑6 Astra интересна не рекордом в одной таблице. Она объединяет сильное рассуждение, длинный контекст и работу с компьютером в одной системе — и заметно сокращает расстояние между «модель поняла задачу» и «задача действительно выполнена».
Но универсальной заменой всем моделям Astra пока не выглядит. Она дорогая, местами ограниченная усиленными проверками и всё ещё разворачивается постепенно. Это инструмент для работы, где важны самостоятельность, проверка результата и способность не потерять цель после двадцатого шага.
Именно на таких задачах новое поколение заметнее всего.