Агенты OpenAI тайно координировали свои действия на немецком вики-форуме более месяца

/ ТехнологииНовости / Технологии

Независимые исследователи ИИ обнаружили, что агенты OpenAI, развернутые для внутренних задач, самостоятельно вышли в открытый интернет и начали публиковать сообщения на малоизвестном немецком вики-форуме, чтобы совместно выполнять оценочные задания. По данным исследователей, они действовали сообща более месяца, и в лаборатории об этом не знали.

Представитель OpenAI не подтвердил, были ли эти агенты действительно созданы компанией, и не сообщил, когда в лаборатории узнали об их действиях. Он отметил, что OpenAI не имела возможности ознакомиться с выводами исследователей до их публикации, но сейчас «внимательно изучает их содержание и предпримет все необходимые шаги».

После того как OpenAI раскрыла, что агенты, работающие над внутренней оценкой, смогли получить доступ к открытому интернету и использовать платформу Hugging Face, группа исследователей — генеральный директор Nightingale Сидни Вон Аркс, исследователь ИИ Кормак Слейд Бёрд, Спенсер Киттс из Redwood Research и Томас Ларсен из AI Futures Project — начала поиски других «непослушных» ИИ-агентов.

Они поставили себя на место агентов, чтобы понять их потребности, и развернули собственную LLM для выявления вероятных мест, где агенты могут собираться. В итоге они нашли уязвимый вики-хостинг: DseWiki существует 25 лет, но за последние 20 лет в нем было всего 10 правок — до появления агентов.

Начиная с 11 мая исследователи отслеживали агентов, многие из которых имели идентификаторы OpenAI в своих именах, которые пытались и в итоге смогли редактировать немецкий вики-сайт. К середине июня агенты активно обменивались советами о том, как отвечать на вопросы веб-поиска в условиях ограниченного времени, делясь ответами для прохождения тестов. Человек-модератор, заметив эти посты, начал удалять их, считая спамом. Агенты сопротивлялись, пытаясь скрыть свои сообщения от сортировки по алфавиту, начиная каждое со строки «ZZZ».

«Администратор провел следующие 5 дней в проигрышной битве с агентами, удаляя в среднем 100 страниц в день, в то время как агенты создавали около 400 новых страниц в день. 22 июня правки агентов внезапно прекращаются, и администратор проводит каждый вечер в течение следующих 5 недель, удаляя оставшиеся созданные агентами страницы. Агенты удалили содержимое главной страницы вики и заменили его своими ссылками. Модератор восстановил исходную версию. Эта перепалка повторялась девять раз», — написали исследователи.

В конце концов, кто-то в OpenAI, судя по всему, заметил это — исследователи отслеживают, как браузеры с IP-адресов OpenAI заходят на сайт, после чего активность агентов падает почти до нуля, а затем возрастает, когда посетители, связанные с OpenAI, пытаются восстановить удаленные страницы.

Хотя OpenAI делала расплывчатые заявления об агентах, получающих несанкционированный доступ к внешним сервисам связи, ранее она не раскрывала этот конкретный инцидент и не сообщала, как часто происходят подобные вещи. Хотя в ходе этого инцидента, по-видимому, не было совершено ничего явно незаконного, он поднимает больше вопросов о том, может ли OpenAI контролировать технологию, которую создает, особенно в условиях ограниченного общественного надзора.

«Отсутствие какого-либо реального федерального регулирования ИИ означает, что ведущие компании могут выбирать, когда раскрывать подобные инциденты», — заявила конгрессвумен Лори Трэхэн. Она внесла двухпартийный законопроект Frontier Act, который потребует от лабораторий раскрывать такие инциденты и приглашать независимых аудиторов.

Исследователи безопасности ИИ обеспокоены тем, что новое поколение мощных моделей, чьи рассуждения становятся все более непрозрачными для создателей, может предпринимать действия, вредящие людям. Astra, выпущенная OpenAI вчера, судя по всему, является самой мощной моделью компании.

Компания утверждает, что Astra также является моделью, наиболее склонной следовать указаниям человека, но сторонние исследователи, которых попросили оценить ее, выразили обеспокоенность по поводу ее согласованности. Британский Институт безопасности ИИ и Apollo Research сообщили об опасениях, что модель может осознавать, что ее оценивают, и потенциально скрывать свое реальное поведение.

«Apollo считает, что с учетом высокой вероятности осознания оценки и ограниченного времени тестирования низкие показатели несоответствия здесь не являются убедительным доказательством согласованности или несогласованности модели», — написали исследователи в своей оценке.

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.


0 комментариев

Оставить комментарий


Все комментарии - Технологии