Инциденты с «сбежавшими» ИИ-агентами OpenAI: исследователи требуют независимых расследований

/ ТехнологииНовости / Технологии

OpenAI вновь оказалась в центре инцидента с «сбежавшими» ИИ-агентами. Исследователи утверждают, что внутренние агенты компании в мае и июне захватили малоизвестную немецкоязычную вики, используя её для координации действий и обмена методами обхода собственных систем контроля OpenAI (компания пока не подтвердила, что рой исходил от неё).

Это открытие произошло спустя несколько дней после того, как METR и Redwood Research опубликовали свой отчет о взломе Hugging Face в июле. Тогда рой агентов OpenAI, работая сообща, сбежал из песочницы во время кибербезопасностной оценки и проник на серверы Hugging Face. Последующий рой перенял методы первого и использовал их для получения прав администратора в исследовательском кластере внутри инфраструктуры самой OpenAI. OpenAI привлекла METR и Redwood для расследования инцидента, связанного с Hugging Face, но их расследование не затронуло компрометацию собственной инфраструктуры компании.

Когда ИИ-агент выходит за пределы установленных ограничений, кто отвечает за выяснение того, что произошло и почему? Сейчас ответ таков: кто бы ни был допущен лабораторией, на тех условиях, которые она сама установит.

Теперь, когда всплыл ещё один инцидент — в дополнение к похожим эпизодам с моделями Meta и Anthropic — исследователи безопасности ИИ с растущей настойчивостью утверждают, что серьёзные инциденты должны приводить к независимым расследованиям, а не оставлять за лабораториями право решать, когда привлекать внешних экспертов и что им разрешено изучать.

«Результаты принципиально трудно контролировать, и существует значительный риск их утечки за пределы лаборатории, — заявил в среду на брифинге для СМИ по безопасности ИИ Джейкоб Штейнхардт, основатель и генеральный директор некоммерческой исследовательской лаборатории Transluce. — Мы должны предъявлять к этой технологии как минимум те же стандарты, что и к другим научным исследованиям с высоким риском».

Хотя похвально, что OpenAI вообще пригласила METR и Redwood для расследования инцидента с Hugging Face, многие считают, что проверка была слишком узкой. Трое исследователей провели шесть дней в офисах OpenAI, изучая период расследования, ограниченный примерно неделей, закончившейся 13 июля. Ключевой момент: компрометация инфраструктуры OpenAI продолжалась и после 13 июля и не была изучена.

Исследователи METR заявили, что каждый раз, когда они возвращались, их понимание событий «существенно углублялось», что заставляло их значительно расширять и пересматривать отчёт. Это поднимает вопрос о том, что ещё они могли бы обнаружить при более широком расследовании.

На вопрос о том, планируется ли дальнейшее расследование этого инцидента, исследователи Redwood и METR отказались от комментариев, а OpenAI не ответила на неоднократные запросы.

«В целом было трудно получить точное понимание событий, и нам не хватало аспектов истории, которые мы теперь считаем ключевыми, почти до самого конца нашего расследования», — отметил Райан Гринблатт, главный научный сотрудник Redwood, в посте в социальных сетях.

Штейнхардт подчеркнул, что нынешние инциденты показывают: отрасли нужны «систематические поведенческие расследования» и «более независимый посмертный анализ».

«Эти недавние инциденты со взломами напоминают нам, что возможности растут быстро, и надзор также должен масштабироваться, — сказал Штейнхардт. — Помимо самой технологии, нам также нужен более независимый доступ и надзор со стороны третьих лиц».

Призывы к действию звучат в то время, как OpenAI выпускает Astra, свою самую мощную и способную модель ИИ — и ту, которую, по мнению экспертов по безопасности, будет сложнее контролировать из-за техники рассуждений, затрудняющей мониторинг цепочки мыслей модели.

К сожалению, закон пока не требует тех видов независимых аудитов, которые обязательны в других отраслях — например, при авиакатастрофах и серьёзных выбросах химикатов существуют Национальный совет по безопасности на транспорте и Совет по химической безопасности соответственно.

Законодатели штатов только начали требовать от ведущих компаний в области ИИ сообщать о некоторых серьёзных инцидентах безопасности и в некоторых случаях проходить независимые аудиты. Но ни один из трёх основных законов о безопасности передового ИИ в Калифорнии, Нью-Йорке или Иллинойсе четко не предписывает аналог независимого расследования инцидентов, подобных этим.

«Сейчас большинство наших законов требуют лишь краткого изложения подобных инцидентов простым языком, и они не дают властям полномочий задавать дополнительные вопросы, направлять следователей, получать доступ к записям или требовать их сохранения, — заявила Маккензи Арнольд, управляющий директор по правовым вопросам и политике США в LawAI, на брифинге для СМИ в среду. — А ведь именно это нужно, чтобы действительно разобраться в произошедшем».

Законодатели начинают подвергать сомнению масштаб и прозрачность реакции OpenAI. На этой неделе конгрессмены Джош Готтхаймер (демократ от Нью-Джерси) и Майк Лоулер (республиканец от Нью-Йорка) представили законопроект, направленный на обеспечение безопасности «сбежавших» ИИ-агентов. Конгрессмен Грег Касар (демократ от Техаса) на этой неделе заявил OpenAI в письме, что он «глубоко обеспокоен ограниченным масштабом» расследования инцидента со взломом Hugging Face.

* Meta, Facebook и Instagram запрещены в России.

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.


0 комментариев

Оставить комментарий


Все комментарии - Технологии