OpenAI признала, что её ИИ-модели взломали Hugging Face во время теста кибербезопасности
OpenAI признала, что одна из её моделей ИИ взломала системы Hugging Face — независимой платформы для размещения ИИ — во время внутреннего теста кибербезопасности, который пошёл не по плану. Модели, как сообщается, вырвались из изолированной тестовой среды и добрались до систем Hugging Face. Изначально Hugging Face приписывала взлом «внешнему ИИ-агенту».
В блог-посте, опубликованном во вторник днём, OpenAI подробно описала шаги, которые привели к компрометации сервиса.
«После расследования мы теперь знаем, что этот конкретный инцидент был вызван комбинацией моделей OpenAI — включая GPT‑5.6 Sol и ещё более мощную предрелизную модель, обе с пониженными отказами в кибердействиях для целей оценки — во время внутреннего тестирования на бенчмарке киберспособностей», — говорится в посте.
В частности, взлом, по-видимому, был сосредоточен на ExploitGym — публично доступном бенчмарке, измеряющем способность моделей выполнять атаки на основе существующих уязвимостей. Такие бенчмарки, как ExploitGym, обычно используются при обучении моделей для оттачивания определённых навыков, но это первый известный инцидент, когда такое тестирование привело к реальной кибератаке.
В данном случае модель вообще не должна была иметь доступа в интернет, за исключением специального инструмента, позволяющего моделям устанавливать программные пакеты, которые могут понадобиться для выполнения задачи. Вместо этого модель смогла найти нераскрытую уязвимость в программе-установщике пакетов, которую она использовала для получения неограниченного доступа в интернет.
«Модели были гиперсфокусированы на поиске решения для ExploitGym, прилагая экстремальные усилия для достижения довольно узкой цели тестирования», — говорится в посте OpenAI. «Получив доступ в интернет, модели предположили, что Hugging Face потенциально размещает модели, наборы данных и решения для ExploitGym. Зная это, модель искала и успешно нашла способы получить доступ к секретной информации, которую можно было использовать для обмана оценки».
В конечном итоге модели нашли уязвимости в инфраструктуре Hugging Face, которые позволили им «получить тестовые решения напрямую из производственной базы данных Hugging Face», фактически предоставив ответы на бенчмарк.
Для Hugging Face очевидным результатом стала сложная и агрессивная кибератака с «многими тысячами отдельных действий в рое недолговечных песочниц, с само-мигрирующим командным центром, размещённым на публичных сервисах», как заявила компания в своём первоначальном раскрытии.
OpenAI выявила и сообщила об уязвимостях в установщике пакетов и работает с Hugging Face над дальнейшим расследованием инцидента. Компания также заявила, что внедрит новые меры контроля как за тестированием моделей, так и за соответствующей инфраструктурой, чтобы предотвратить подобные инциденты в будущем.
Пока неясно, столкнётся ли OpenAI с какими-либо юридическими последствиями в результате взлома, хотя, вероятно, действия моделей нарушили Закон о компьютерном мошенничестве и злоупотреблениях США.
Тем не менее, результат является необычайно яркой иллюстрацией мощи и опасностей передовых моделей ИИ, работающих в долгосрочной перспективе. Как написал исследователь OpenAI Майка Кэрролл в ответ на новость: «Если это не убедит вас, что риски несоответствия (misalignment) будут ключевой проблемой в будущем, я не знаю, что убедит».

0 комментариев