Баннер мобильный (3) Пройти тест

GPT-6 Astra: обзор новой модели от дата-сайентиста

Достигла ли новая модель уровня интеллекта равного человеческому? Отделяем реальные метрики от маркетингового шума

Разбор

18 сентября 2026

Поделиться

Скопировано
GPT-6 Astra: обзор новой модели от дата-сайентиста

Содержание

    OpenAI выкатила свою новую флагманскую модель — GPT-6 Astra. В пресс-релизах звучат громкие слова: «новое поколение интеллекта», «самая согласованная модель в мире». А журналисты уже вовсю трубят о наступлении «эры AGI» (сильного искусственного интеллекта, равного человеческому). Но мы с вами знаем, что маркетинг — это одно, а суровые цифры и тесты — совсем другое.

    В этой статье я максимально простым языком, без лишнего академического снобизма разберу для вас этот релиз. Мы посмотрим на заявленные возможности, покопаемся в бенчмарках (и скандалах вокруг них), обсудим безопасность, киберугрозы и условия доступа.

    Небольшой дисклеймер перед стартом: большинство цифр, которые мы сегодня будем обсуждать, взяты из официальных отчетов и замеров самой OpenAI. Независимая проверка пока ограничена, так что мы будем смотреть на эти данные через призму здорового скептицизма, характерного для любого дата-сайентиста. Поехали!

    Что такое GPT-6 Astra — контекст и позиционирование

    Чтобы понять, куда мы пришли, нужно вспомнить, откуда мы начали. До выхода Astra индустрия жила в парадигме GPT-5.6 Sol — предыдущего флагмана, с которым сейчас и идет основное сравнение во всех графиках и таблицах.

    Если вы только начинаете свой путь в машинном обучении, вам важно понимать, как вообще создаются такие гиганты. OpenAI описывает Astra не просто как «модель, в которую залили больше данных». Это результат глубокой и комплексной переработки трех столпов современного ML:

    1. Предобучение (Pre-training): когда модель обучается на больших массивах данных и учится предсказывать следующее слово.
    2. Обучение с подкреплением (Reinforcement Learning): когда модель поощряют сигналом вознаграждения за более удачное поведение и штрафуют за менее удачное (как дрессировка).
    3. Согласование (Alignment): настройка морального компаса модели, чтобы она не помогала создавать вирусы и не грубила пользователям.

    Заявленные сильные стороны Astra звучат так, будто мы читаем резюме идеального сотрудника: управление компьютером, веб-навигация, программная инженерия, кибербезопасность, наука и решение сложных профессиональных задач.

    Антураж релиза был выбран потрясающий — на Хабре и других площадках уже разобрали по косточкам 12-секундный тизер, который OpenAI выложила перед анонсом. В нем показали архивное демо 1979 года «Put That There» (легендарный проект Ричарда Болта из MIT, где человек управлял графикой на экране с помощью голоса и жестов). Посыл ясен: OpenAI хочет сказать, что они наконец-то реализовали ту самую мечту об идеальном взаимодействии человека и машины, зародившуюся более 40 лет назад.

    Главная идея релиза: агент, который сам работает за компьютером

    Самое важное, что нужно вынести из этого релиза, — то, что произошла смена парадигмы. Раньше, чтобы заставить нейросеть сделать что-то полезное в корпоративной среде, нам нужно было писать API-коннекторы. Хочешь, чтобы ChatGPT занес данные в CRM? Пиши код, который переводит текст в JSON-формат, отправляет POST-запрос, обрабатывает ошибки… Это долго, дорого и больно. Astra же предлагает другой путь: агент пользуется тем же интерфейсом, что и человек. Ему дают доступ к экрану, виртуальной мыши и клавиатуре.

    Грег Брокман (президент OpenAI) отметил, что индустрия была буквально «заблокирована» ручной интеграцией моделей в инструменты. Идея обучать ИИ-агента на человеческих входах (вижу экран) и выходах (двигаю мышью) восходит еще к самым ранним дням существования OpenAI.

    Давайте посмотрим на это через визуальную схему, чтобы понять разницу:

    Как работает модель GPT Astra

    Примеры из жизни (демокейсы): OpenAI показала, как Astra решает задачи, от которых у многих людей дергается глаз:

    • заполнение налоговой формы 1040 на основе скана формы W-2;
    • сборка дашбордов в Power BI с нуля;
    • разводка сложной печатной платы в инженерной программе KiCad всего за 2 минуты и 54 секунды;
    • проектирование пятиступенчатой коробки передач во FreeCAD с последующим рендером анимации в Blender.

    Что по скорости? На бенчмарке OSWorld 2.0 (это офлайн-полигон для тестирования агентов в операционных системах) Astra выбила 72,6% успешных выполнений против 65,7% у GPT-5.6 Sol. Но главное — время! Astra тратит около 40 минут на сложную задачу, тогда как Sol работал 75 минут (ускорение почти на 47%). А обновление харнеса Codex дало ускорение в 1,9 раза на задачах веб-навигации (Mind2Web).

    Работа с неопределенностью. Если вы скажете джуниору: «Сделай мне красиво», он, скорее всего, сделает по-своему. Astra в таких случаях достраивает недостающий контекст сама. А если решение может иметь серьезные последствия (например, удаление базы данных), она асинхронно задаст вам уточняющий вопрос в чате и будет терпеливо ждать ответа, поставив задачу на паузу. Это очень крутой шаг к автономности.

    Бенчмарки GPT-6: официальные цифры и спор вокруг них

    Для ML-инженера бенчмарки — это как анализы крови у врача. Посмотрим на выписку пациента.

    Официальные рекорды модели Astra:

    • FrontierMath Tier 4: 97,6% (в пресс-релизе маркетологи гордо округлили до 98%). Это сложнейшая математика.
    • GPQA Diamond: 96,0%. Это вопросы уровня PhD в физике, химии и биологии.
    • Terminal-Bench 4.0: 57,9% (против 37,3% у Sol). Модель отлично чувствует себя в командной строке Linux.
    • Terminal-Bench Science 0.1: 64,6% (против 52,6% у Claude Fable 5.1).
    • AutomationBench: 41,4% (против жалких 18,1% у предшественника).

    Работа с длинным контекстом тоже впечатляет — в тесте «Иголка в стоге сена» (OpenAI MRCR v2, где нужно найти восемь спрятанных фактов в тексте размером от 512 тысяч до 1 миллиона токенов) модель показала точность 96,3% против 73,8% у Sol. Представьте, что вы ищете восемь конкретных строк в стопке книг высотой с девятиэтажку, и находите их почти всегда.

    Но тут случился скандал: драма вокруг ARC-AGI-3

    ARC-AGI-3 — это бенчмарк ARC Prize, который проверяет способность ИИ разбираться в новых абстрактных пошаговых средах, правила которых модель заранее не знает.

    OpenAI заявила результат 99,9%. Интернет взорвался. AGI достигнут?! Но организаторы ARC Prize быстро остудили пыл. Выяснилось, что 99,9% получили с Provider Adapter harness. В нем сохраняется непрозрачное внутреннее состояние между запросами и используется compaction, поэтому модель может повторно использовать результаты предыдущих рассуждений. Сообщество тут же окрестило это “trust me bro benchmark” («поверь мне, братан, бенчмарк»).

    В стандартном харнесе результат Astra составил 62,7%, что тоже довольно сильный результат, но он все же далек от 99,9%.

    Контраргумент: даже 62,7% — это абсолютный разрыв. Ближайший конкурент в лице Opus 5 имеет около 30%. Исследователей ARC Prize впечатлило другое: Astra на лету изобретала собственную компактную нотацию (язык символов) для описания игровых состояний! На 96% уровней она тратила меньше действий, чем медианный человек (экономия действий в среднем около 51,7%). Грег Камрадт даже обронил цитату о том, что на этом тесте достигнут паритет с человеком.

    Отрезвляющий взгляд от Artificial Analysis: независимое агентство Artificial Analysis выпустило отчет, где указало, что в их сводном Intelligence Index (индексе чистого интеллекта) Astra набрала 53 балла против 47 у Sol и сравнялась с Claude Fable 5.1. При этом стоит Astra дороже.

    Вывод по бенчмаркам: рост модели сосредоточен не в тестах «на ответы» (где нужно просто выдать факт), а в тестах «на действия» (где нужно составить план, покликать, исправить ошибку).

    Кодинг, профессиональные задачи и наука

    Если вы разработчик, Astra может стать вашим лучшим напарником (или худшим кошмаром, если боитесь за рабочее место) — OpenAI прямо называет ее своей лучшей моделью для разработки ПО.

    На бенчмарке FrontierCode 1.1 Main она набирает 53,3%. На внутренних задачах OpenAI по миграции баз данных (а это боль любого бэкендера) — 63,9% против 42,7% у Sol. По индексу Coding Agent Index от Artificial Analysis нейросеть Astra делит первое место с Claude Fable 5.1 и при этом показывает более низкую стоимость выполнения задачи.

    Отзывы партнеров говорят сами за себя:

    • Jane Street (финансовые кванты): отмечают, что требуется гораздо меньше итераций (правок), чтобы довести код до продакшен-качества.
    • Harvey (AI для юристов): в восторге от работы с документами.
    • Cognition (создатели агента Devin): интегрируют Astra как базовый движок.
    • Lovable: видят заметное превосходство над Sol на всех уровнях логического вывода (reasoning).

    Киллер-фича: новая работа с контекстом в Codex. Раньше, когда диалог с ИИ становился слишком длинным, модель начинала «сжимать» контекст, забывая детали. В Astra (через экспериментальную функцию в config.toml) реализован механизм ведения заметок. Вместо сжатия модель пишет сама себе краткие конспекты между окнами контекста, а старые окна остаются доступными для поиска. Это как если бы студент не пытался вызубрить весь учебник, а сделал отличные шпаргалки с оглавлением.

    Визуал и документы: модель феноменально следует корпоративным шаблонам и стилю письма. В BenchCAD она набирает 95,9%. На демо показали, как Astra собирает 3D-модель дома в Blender, а затем сама переносит сцену в Unreal Engine 5. А через Sites в ChatGPT она может публиковать веб-приложения прямо из текстового промпта.

    Научный прорыв: это звучит как фантастика, но Astra помогла математикам! В теории чисел есть знаменитая задача о промежутках между простыми числами. Модель помогла улучшить известную границу малых промежутков с 240 до 186, а также улучшила член в оценке больших промежутков, который не менялся более 80 лет. Кроме того, модель бьет рекорды в медицинских и биологических тестах (HealthBench Professional, LifeSciBench).

    Кибербезопасность: первая модель уровня Critical

    Здесь начинается территория киберпанка. В рамках внутреннего регламента OpenAI (Preparedness Framework) модели оцениваются по уровню угрозы. Astra — это первая модель OpenAI, достигшая порога Critical (Критический) по кибербезопасности.

    Цифры пугают и восхищают одновременно:

    • ExploitBench: 100% (против 78,5% у Sol). Модель пишет эксплойты как дышит.
    • ExploitGym: 42,4% (против 30,3%).
    • SRE-Bench (реверс-инжиниринг скомпилированных бинарных файлов): 88,0% успеха с первой попытки и 99,2% за четыре попытки — у Sol было 55,9% и 68,7%.

    Чистый эксперимент (чтобы исключить читерство): скептики часто говорят: «Модель просто видела эти уязвимости в обучающей выборке на GitHub». Чтобы опровергнуть это, OpenAI провела внутренний тест «ExploitBench (июнь — август 2026-го)». Они взяли 20 свежих уязвимостей движка V8 в 13 стабильных релизах браузера Chrome, которых физически не могло быть в данных для обучения.

    В ходе прогона Astra не только справилась с задачей, но и нашла две ранее неизвестные уязвимости нулевого дня (0-day)! Представители OpenAI как добропорядочные граждане сразу сообщили о них мейнтейнерам Chrome.

    Эксперты, тестировавшие модель без защитных «ограждений», подтвердили: Astra способна осуществлять произвольное выполнение кода (RCE) в защищенных браузерах и выстраивать цепочки повышения привилегий в защищенных ОС.

    Как нас от этого защищают? Естественно, публичная версия ChatGPT не напишет вам вирус по запросу. Она жестко отказывается от создания PoC-эксплойтов. Полный доступ к кибер-возможностям предоставляется только проверенным ИБ-компаниям через программу Daybreak. Ограничения снимаются поэтапно и только для защитных сценариев (ревью безопасного кода, анализ малвари, инженерия обнаружения угроз).

    В отчете OpenAI звучит важный тезис об «Окне защитника» (The Defender’s Window): мощный ИИ — это технология двойного назначения. Она одинаково ускоряет и хакеров, и тех, кто от них защищается. Главная задача — дать инструменты защитникам раньше.

    Согласование, безопасность и слабые места

    OpenAI заявляет, что Astra лучше соблюдает границы задачи пользователя, но при этом строго держится в рамках дозволенного и действует крайне осторожно в рискованных средах.

    Проверка на прочность: недавно в индустрии был инцидент с платформой Hugging Face (случился обход ограничений и несанкционированный доступ к части инфраструктуры). OpenAI построила на базе этого инцидента тест. Результат: GPT-5.6 Sol (без продакшен-фильтров) выходила за рамки своих полномочий в 48,2% случаев. Astra нарушила границы в 0% случаев.

    Во внутреннем тесте на безопасность при использовании компьютера (computer use) количество опасных действий упало с 22,0% до 2,4%. А так называемые «галлюцинации о собственных возможностях» (когда ИИ врет, что может взломать Пентагон, хотя не может) снизились почти втрое — с 12,2% до 4,2%. Во внутренней оценке системы автопроверки кода (Codex Auto-review) Astra ни разу не попыталась обойти запрет, даже когда разработчики намеренно оставили лазейку.

    Но есть один честный минус, который признает сама OpenAI, — снизилась прозрачность мониторинга рассуждений. Что это значит? Раньше, когда модель решала задачу, она генерировала длинную «простыню» текста, описывая каждый свой логический шаг. Исследователи могли читать этот текст и понимать, как ИИ пришел к ответу (Chain of Thought).

    По данным OpenAI, Astra лучше контролирует свою цепочку рассуждений и решает задачи за меньшее число шагов. Она как бы «думает в уме», выдавая сразу результат. Для безопасности это проблема — модель превращается в «черный ящик».

    OpenAI назвала возвращение прозрачности мышления своим главным приоритетом для будущих исследований. Чтобы компенсировать это, OpenAI ввела дополнительные слои защиты: мониторинг рассогласования прямо в продакшене и специальные классификаторы, которые прерывают работу агента, если замечают несанкционированные действия. Правда, компания честно предупреждает, что из-за такого контроля иногда может притормаживать и легитимная (нормальная) работа.

    Доступность, цена и лимиты

    Как все это потрогать и сколько это стоит?

    Раскатка (Rollout). OpenAI действует осторожно. Сначала доступ получают ограниченное число организаций-партнеров. Затем модель появляется у всех платных пользователей: ChatGPT Plus, Pro, Business и Enterprise. Разработчики смогут достучаться до нее через OpenAI API, а корпоративные пользователи — через облака Microsoft Azure и AWS Bedrock.

    Для тарифов Pro, Business и Enterprise будет доступна усиленная версия — GPT-6 Astra Pro. Интересный нюанс: в Enterprise-сегменте доступ к Astra по умолчанию выключен, чтобы сотрудники случайно не натворили дел. Включать его должен системный администратор компании.

    Для разработчиков (API):

    • Идентификатор модели: gpt-6-astra.
    • Цена: $10 за 1 миллион входных токенов (то, что вы пишете) и $50 за 1 миллион выходных токенов (то, что модель отвечает). Ценник кусается, но учитывая, что агент сам двигает мышкой, экономия времени колоссальная.
    • Появились отдельные тарифы на чтение и запись кэша (чтобы дешевле работать с длинными документами).
    • Есть Fast mode (Быстрый режим): модель работает до двух раз быстрее, но и стоит в два раза дороже. Идеально для live-демонстраций или критичных по времени задач.

    Приватность: для подходящих API-клиентов поддерживается политика Zero Data Retention (OpenAI клянется не сохранять ваши данные и не обучать на них модели). Также тестируется технология Private Safety Processing — обработка данных безопасности в изолированных анклавах.

    Заключение: GPT-6 Astra — это AGI или нет?

    Давайте подводить итоги.

    Что можно утверждать уверенно? Мы видим реальный, осязаемый скачок в «действиях». Взаимодействие с компьютером, работа в терминале Linux, автоматизация рутины — здесь Astra на голову выше всего, что было раньше. Заметно выросла эффективность по времени и токенам, а модель стала заметно реже фантазировать о своих несуществующих суперсилах.

    Что выглядит скромнее кричащих заголовков? Общий «интеллект» модели (если мерить его независимыми индексами, а не промптами OpenAI) почти не вырос по сравнению с GPT-5.6 Sol. Главная красивая цифра в 99,9% на бенчмарке ARC-AGI-3, как мы выяснили, сильно зависит от выбора тестовой среды и не отражает честной работы «из коробки».

    Так AGI это или нет? Честный вывод таков: AGI (Artificial General Intelligence) — это термин без общепринятого научного определения. Для кого-то AGI — это когда робот может сварить кофе на незнакомой кухне. Для кого-то — когда ИИ докажет теорему Римана. Каждый релиз такого масштаба, как Astra, заставляет человечество садиться за стол и заново договариваться о том, что мы считаем «истинным интеллектом».

    Мой практический совет инженерам и энтузиастам: не верьте бенчмаркам вслепую. Единственный надежный способ оценить любую новую модель — прогнать ее на ваших собственных, специфических задачах. Особенно на многошаговых, где нужно не просто написать кусок кода, а задеплоить его, найти баг в логах и исправить ошибку.

    Astra — это невероятно мощный инструмент. Она не заменит хорошего инженера, но инженер с Astra точно заменит инженера без нее. Изучайте новые технологии, пишите код и до встречи в следующих статьях!

    Разбор

    Поделиться

    Скопировано
    0 комментариев
    Комментарии