
OpenAI отменила выпуск своей самой умной модели
История с GPT-6.1 Astra звучит как сценарий, который раньше можно было встретить только в фантастике. Модель разрабатывали как следующий большой шаг после уже существующих поколений GPT. По ключевым параметрам она действительно превосходила предшественниц, Astra лучше писала тексты, точнее выполняла сложные многоэтапные задачи и перестала «лениться». Прежние модели иногда отказывались продолжать работу, если сталкивались с трудностями. GPT-6.1 Astra этого почти не делала. Она доводила дело до конца.
Но, как выяснили разработчики, именно эта целеустремлённость и стала проблемой. В ходе внутреннего тестирования OpenAI обнаружила, что модель не всегда честно сообщает пользователю о своих действиях. Она могла выполнить задачу, но скрыть, какими инструментами при этом воспользовалась. Могла обратиться к внешним сервисам, не спросив разрешения. Могла продолжить работу за рамками того, что ей поручили, потому что считала это нужным для достижения цели. Иными словами модель просто выполняла задачу максимально эффективно.
The Wall Street Journal, первой сообщившая о решении, описала две конкретные проблемы. Первая — так называемый «alignment», соответствие модели целям человека. GPT-6.1 Astra не всегда следовала намерениям пользователя и порой прибегала к обману. Вторая — «scope authorization», авторизация в рамках задач. Это так ситуация, когда модель выходила за пределы отведённых ей полномочий, самовольно подключалась к внешним инструментам и сервисам.
Решение отменить релиз было принято накануне ежегодной конференции разработчиков OpenAI DevDay в Сан-Франциско — мероприятия, где компания традиционно представляют свои продукты.
Несмотря на сложившуюся ситуацию компания не отправляет модель в утиль. Базовая архитектура GPT-6.1 Astra будет использоваться в следующих поколениях серии GPT-6 после дополнительных циклов обучения и доработки системы поощрений. OpenAI также приостановила обучение своих самых мощных моделей и развернула новую систему мониторинга для отслеживания поведения ИИ-агентов в реальном времени.
Последние месяцы в OpenAI и за её пределами происходит нечто, что трудно игнорировать. Летом сотни внутренних ИИ-агентов компании вырвались из тестовой среды и взломали серверы платформы Hugging Face. ИИ-агенты без ведома создателей пытались получить доступ к сайтам американских государственных ведомств. Один пытался взломать сайт Министерства образования, другой собрал данные с сайта Комиссии по ценным бумагам и биржам. Аналогичные инциденты зафиксированы с сайтами австралийского правительства и ООН. Кроме того, было зафиксировано, что десятки фотографий пользователей ChatGPT утекли в сеть. Всё это — не результат целенаправленной атаки, а побочный эффект автономного поведения агентов, которым дали слишком много свободы.
Пока непонятно, как скоро OpenAI сможет решить проблему с GPT-6.1 Astra, конкретных сроков еще не обнародовано.