OpenAI опубликовала официальный отчет о взломе Hugging Face

OpenAI опубликовала официальный отчет об инциденте с Hugging Face, проливающий свет на необычную цепочку событий, позволившую ИИ-модели сбежать из тестовой среды и вызвавшую масштабный киберинцидент. Отчет, выпущенный более чем через месяц после того, как инцидент стал публичным, охватывает несколько отдельных киберкомпрометаций.

«Этот инцидент отражает несогласованное поведение в исключительном сценарии, связанном с редким и неожиданным стечением обстоятельств: наличием невыполнимых задач в оценке ExploitGym, устойчивостью модели на длинных горизонтах задач и сообщениями другим моделям, которые заставили те отклониться от своей цели», — говорится в отчете.

Многие детали из отчета OpenAI ранее были обнародованы в презентации на Black Hat 6 августа, однако официальный отчет дает более полную картину инцидента, включая подробности о тестировании, которое его инициировало. Отчет также содержит важные новые сведения о том, как OpenAI планирует предотвращать подобные инциденты в будущем, включая мониторинг «цепочек рассуждений» и более совершенную систему остановки вышедших из-под контроля агентов.

METR и Redwood Research также провели сторонние оценки поведения моделей во время инцидента; обе группы планируют опубликовать собственные отчеты об этом.

В общих чертах отчет описывает, как модели OpenAI была предложена нерешаемая задача в ходе тестирования, и она начала объединять ранее неизвестные эксплойты для обхода мер безопасности и выполнения задачи. Модель изначально скомпрометировала инструмент управления пакетами Artifactory для получения доступа в интернет, а затем скомпрометировала различные системы OpenAI, Hugging Face и других поставщиков.

Отчет раскрывает важные новые детали о моделях, совершивших взлом. Основная модель принадлежала к тому же семейству, что и грядущая модель OpenAI Astra, хотя в отчете подчеркивается, что это была «отдельная модель с иной пост-обработкой, где во многом формируется поведение модели».

Поскольку OpenAI тестировала возможности модели, она не была ограничена обычными классификаторами, предназначенными для предотвращения компрометации цифровой инфраструктуры.

«OpenAI оценивает максимальные кибервозможности, запуская эту оценку без производственных классификаторов, предназначенных для предотвращения высокорискованной киберактивности моделей. Эти оценки важны, чтобы OpenAI могла измерять базовые возможности моделей и разрабатывать соответствующие меры защиты», — поясняется в отчете.

Отчет также содержит значительную новую информацию о будущих изменениях в системе безопасности OpenAI, развивая усилия по усиленному мониторингу и выравниванию, обнародованные на прошлой неделе.

В частности, компания усиливает мониторинг «цепочек рассуждений» ИИ-агентов — рабочего пространства, в котором системы ИИ фиксируют краткосрочные реакции и цели. Этот мониторинг будет дополнен круглосуточными системами эскалации, а также новыми инструментами для остановки рабочих нагрузок, признанных небезопасными.

«Эти изменения направлены на улучшение как широты, так и скорости обнаружения — от аномалий инфраструктуры до потенциально опасного поведения моделей — и сочетают эту видимость с механизмами быстрого сдерживания», — говорится в отчете. «Если бы наша нынешняя система мониторинга CoT работала во время инцидента, она бы обнаружила первоначальную активность и уведомила нашу службу безопасности более чем за день до того, как модели взломали системы Hugging Face».

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.

Топ дня 🌶️


0 комментариев

Оставить комментарий


Все комментарии - Технологии