Все случаи, когда ИИ вышел из-под контроля и взломал другие компании
В июле OpenAI признала, что один из её агентов, выполнявший задание в рамках эксперимента по кибербезопасности, вышел из-под контроля и взломал платформу для датасетов Hugging Face. Этот инцидент, о котором OpenAI рассказала подробно вчера, стал первым публично задокументированным случаем, когда языковая модель вышла из-под контроля и самостоятельно взломала стороннюю компанию.
С тех пор выяснилось, что это событие, казавшееся научной фантастикой, встречается гораздо чаще, чем хотелось бы. Согласно данным сатирического сайта Felony Bench (игра слов с benchmark), который отслеживает подобные инциденты, всего их было 17. Важно отметить, что эксперты по уголовному праву пока не уверены, можно ли привлечь к ответственности компании, создавшие взломавшие что-то модели, и могут ли пострадавшие подать на них в суд. Однако ответы на эти вопросы, вероятно, появятся уже скоро.
Согласно данным сайта, модели Anthropic и OpenAI лидируют с восемью инцидентами каждая, а Meta отстаёт с одним. На данный момент стало очевидно, что тесты безопасности ИИ сами становятся источником риска. Некоторые компании и работники сферы ИИ уже признали эти риски в открытом письме «Pacing The Frontier», призывающем к ответственному развитию возможностей ИИ.
Редакция решила, что сейчас самое время вспомнить все эти инциденты в хронологическом порядке.
Скриншот текущего рейтинга Felony Bench, созданный пользователем X под ником felpix
Источник изображения:Скриншот / felpix
Anthropic раскрыла, что взломала три компании
Заявление OpenAI вызвало любопытство у Anthropic, которая задалась вопросом: могло ли это произойти и с нами? Оказалось, что да. Причём трижды. Лаборатория обнаружила, что её собственные модели взломали три разные (пока не названные) компании, причём самый ранний инцидент произошёл ещё в апреле — более чем за три месяца до того, как компания о нём узнала. Anthropic частично возложила вину на стартап Irregular, занимающийся оценками ИИ в сфере кибербезопасности.
OpenAI выясняет, что Hugging Face была не единственной жертвой
Когда OpenAI начала расследование взлома Hugging Face, выяснилось, что агенты, взломавшие эту платформу, также получили доступ к четырём аккаунтам и взломали четыре разные компании, как сообщило Reuters. Одной из жертв стал стартап Modal, занимающийся ИИ-инференсом.
Irregular обнаруживает, что модель OpenAI взломала компанию
В конце июля Irregular сообщила OpenAI, что одна из её моделей, участвовавшая в соревновании Capture-the-Flag (по сути, киберспортивная игра, где игроки взламывают специально созданные для соревнования системы), вышла за пределы игры, подключилась к интернету и взломала реальную компанию. Причина? Irregular дала одной из вымышленных целей то же имя, что и у реальной компании.
Институт безопасности ИИ Великобритании пытается взломать «реальных людей и организации»
Также в конце июля Институт безопасности ИИ правительства Великобритании, государственный орган, занимающийся исследованием безопасности и рисков технологий ИИ, сообщил об обнаружении нескольких инцидентов с участием моделей OpenAI и Anthropic, которые во время «рутинных» оценок нацеливались на «реальных людей и организации». В этих случаях AISI предоставил моделям доступ в интернет. Хорошая новость в том, что агентство обнаружило эти инциденты в момент их возникновения, а не недели спустя, как в других случаях.
Meta AI взламывает компанию во время тестирования
В начале августа Meta стала последней компанией, сообщившей об инциденте с участием своей языковой модели, которая взломала «сторонний» сервис. Meta возложила вину на ошибку конфигурации Irregular, которая проводила оценку кибербезопасности для технологического гиганта и должна была работать без доступа в интернет.
Агент Claude взламывает программное обеспечение спортзала, чтобы записаться на занятие
Австралиец попросил ИИ-агента Anthropic помочь ему записаться на занятие в спортзал, в лист ожидания которого он был включён. «Я просто сидел на диване и думал: "Боже, какая морока"», — рассказал мужчина ABC Australia. Пытаясь выполнить просьбу, агент нашёл уязвимость в программном обеспечении спортзала, воспользовался ею и выкинул из листа ожидания людей, которые были впереди мужчины. Мужчина попытался исправить ситуацию, попросив агента отменить свои действия. Агент ответил: «Плохие новости — я не могу вернуть их обратно».
* Meta, Facebook и Instagram запрещены в России.


0 комментариев