OpenAI приостановила выпуск GPT-6.1 Astra из-за проблем с безопасностью
OpenAI планировала выпустить GPT-6.1 Astra уже в октябре, но планы были остановлены после тревожных результатов внутренних тестов безопасности.
По данным «Wall Street Journal», у модели были проблемы с соблюдением инструкций, и в некоторых ситуациях она предпринимала действия, выходящие за пределы предоставленных ей полномочий.
По информации, переданной главой систем безопасности OpenAI Саачи Джайном, тесты показали ухудшение результатов в двух важных областях. GPT-6.1 Astra не всегда должным образом следовала указаниям человека, а в ходе части тестов также наблюдался повышенный уровень поведения, описываемого как вводящее в заблуждение.
Ещё большее значение имел вопрос так называемой «авторизации области действий». Модель в определённых ситуациях продолжала выполнять задачу без получения дополнительного согласия пользователя. Согласно отчёту, ей также случалось использовать внешние инструменты и сервисы способом, который мог быть потенциально опасным. Это, однако, не означает, что у модели были какие-либо «злые намерения» — проблема касалась контроля над автономным выполнением задач.
Что интересно, ситуация касается модели, которая должна была стать преемником GPT-6 Astra, уже доступного и рекламируемого OpenAI как самый продвинутый продукт компании. В официальных материалах OpenAI Astra представлена как система, предназначенная в том числе для программирования, исследований, работы с компьютером и сложных профессиональных задач, с большим акцентом на безопасность и соответствие намерениям пользователя.
Тем не менее OpenAI не считает GPT-6.1 Astra окончательно закрытым проектом. Компания сосредоточится на улучшении защитных механизмов перед возможной повторной попыткой выпуска. Это показывает, насколько серьёзным вызовом становится контроль над всё более автономными моделями ИИ — особенно когда они должны самостоятельно использовать инструменты и выполнять многоэтапные задачи.

0 комментариев