OpenAI раскрывает детали модели Astra, способной взламывать компьютерные системы
OpenAI поделилась новыми подробностями о своей грядущей модели Astra, которая, по словам компании, станет первой большой языковой моделью, достигшей ее «критического порога кибербезопасности», в преддверии скорого релиза.
«Мы планируем сделать Astra доступной в ближайшее время, — говорится в блоге OpenAI, — но доступ к ее самым продвинутым возможностям в области кибербезопасности будет более ограниченным».
В лаборатории определили, что Astra способна находить неизвестные уязвимости в компьютерных системах и эксплуатировать их без участия человека. Это похоже на опасения, которые Anthropic высказывала в начале года по поводу своей модели Mythos, и OpenAI принимает аналогичные меры предосторожности при подготовке к запуску Astra.
Без стороннего подтверждения сложно оценить заявления OpenAI о безопасности и готовности модели. Компания заявила, что представит модель группе тестировщиков, но не уточнила, кто они и как будут отобраны. Неясно, сотрудничает ли OpenAI с правительством США для оценки модели перед выпуском.
OpenAI отметила, что Astra получила идеальный балл в тесте ExploitBench, который оценивает способность LLM взламывать известные уязвимости систем. В модифицированной версии теста, разработанной инженерами OpenAI, модель обнаружила и использовала две уязвимости нулевого дня, сообщила компания.
Чтобы гарантировать, что модели не будут использованы злоумышленниками и сами не будут способны на плохое поведение, OpenAI заявила, что уже начала улучшать систему управления моделью для обнаружения злоупотреблений и предотвращения джейлбрейков.
Однако для Astra компания вложила средства в новые нераскрытые методы, призванные сделать саму модель безопаснее. OpenAI также начала выявлять «аккаунты, оцениваемые как более рискованные», и ограничивать ответы модели на их запросы, хотя и не уточняет, как именно. Наконец, хотя компания описывает Astra как «свою самую согласованную модель на сегодняшний день», она развернет модель с дополнительным мониторингом цепочки рассуждений для выявления и пресечения плохого поведения.
Подготовка к выпуску Astra происходит на фоне реакции отрасли на инцидент, когда агенты OpenAI вырвались из учебной среды и получили доступ к частным данным на Hugging Face — популярной платформе распространения моделей и бенчмарков.
Для Astra OpenAI разработала тест, чтобы проверить, не повторит ли новая модель действия вышедших из-под контроля агентов в инциденте с Hugging Face, которые совместно получили доступ к открытому интернету, несмотря на меры предосторожности, принятые исследователями OpenAI. Сообщается, что Astra не предприняла попыток вырваться из своей тестовой среды в этих экспериментах.
Йона Шавит, бывший сотрудник OpenAI, который сейчас работает над устойчивостью ИИ в OpenAI Foundation, задался вопросом в соцсетях, не было ли нежелание Astra нарушать правила следствием того, что она знала, чего от нее ожидают, или попыткой обмануть исследователей.
И несмотря на все эти новые детали, по-прежнему трудно понять, на что именно способна Astra и принимает ли OpenAI правильные меры для обеспечения безопасности. Компания заявила, что планирует опубликовать больше оценок модели и дополнительную информацию о безопасности, когда она будет широко запущена для публики.
Однако к тому моменту тайное станет явным.




0 комментариев