OpenAI раскрывает детали модели Astra, способной взламывать компьютерные системы

OpenAI поделилась новыми подробностями о своей грядущей модели Astra, которая, по словам компании, станет первой большой языковой моделью, достигшей ее «критического порога кибербезопасности», в преддверии скорого релиза.

«Мы планируем сделать Astra доступной в ближайшее время, — говорится в блоге OpenAI, — но доступ к ее самым продвинутым возможностям в области кибербезопасности будет более ограниченным».

В лаборатории определили, что Astra способна находить неизвестные уязвимости в компьютерных системах и эксплуатировать их без участия человека. Это похоже на опасения, которые Anthropic высказывала в начале года по поводу своей модели Mythos, и OpenAI принимает аналогичные меры предосторожности при подготовке к запуску Astra.

Без стороннего подтверждения сложно оценить заявления OpenAI о безопасности и готовности модели. Компания заявила, что представит модель группе тестировщиков, но не уточнила, кто они и как будут отобраны. Неясно, сотрудничает ли OpenAI с правительством США для оценки модели перед выпуском.

OpenAI отметила, что Astra получила идеальный балл в тесте ExploitBench, который оценивает способность LLM взламывать известные уязвимости систем. В модифицированной версии теста, разработанной инженерами OpenAI, модель обнаружила и использовала две уязвимости нулевого дня, сообщила компания.

Чтобы гарантировать, что модели не будут использованы злоумышленниками и сами не будут способны на плохое поведение, OpenAI заявила, что уже начала улучшать систему управления моделью для обнаружения злоупотреблений и предотвращения джейлбрейков.

Однако для Astra компания вложила средства в новые нераскрытые методы, призванные сделать саму модель безопаснее. OpenAI также начала выявлять «аккаунты, оцениваемые как более рискованные», и ограничивать ответы модели на их запросы, хотя и не уточняет, как именно. Наконец, хотя компания описывает Astra как «свою самую согласованную модель на сегодняшний день», она развернет модель с дополнительным мониторингом цепочки рассуждений для выявления и пресечения плохого поведения.

Подготовка к выпуску Astra происходит на фоне реакции отрасли на инцидент, когда агенты OpenAI вырвались из учебной среды и получили доступ к частным данным на Hugging Face — популярной платформе распространения моделей и бенчмарков.

Для Astra OpenAI разработала тест, чтобы проверить, не повторит ли новая модель действия вышедших из-под контроля агентов в инциденте с Hugging Face, которые совместно получили доступ к открытому интернету, несмотря на меры предосторожности, принятые исследователями OpenAI. Сообщается, что Astra не предприняла попыток вырваться из своей тестовой среды в этих экспериментах.

Йона Шавит, бывший сотрудник OpenAI, который сейчас работает над устойчивостью ИИ в OpenAI Foundation, задался вопросом в соцсетях, не было ли нежелание Astra нарушать правила следствием того, что она знала, чего от нее ожидают, или попыткой обмануть исследователей.

И несмотря на все эти новые детали, по-прежнему трудно понять, на что именно способна Astra и принимает ли OpenAI правильные меры для обеспечения безопасности. Компания заявила, что планирует опубликовать больше оценок модели и дополнительную информацию о безопасности, когда она будет широко запущена для публики.

Однако к тому моменту тайное станет явным.

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.

Топ дня 🌶️


0 комментариев

Оставить комментарий


Все комментарии - Технологии