Для ИИ-агентов запустили «горячие линии», чтобы они могли доносить друг на друга
«Если видишь что-то — скажи об этом» больше не относится только к людям. Запущены две новые «горячие линии» для ИИ-агентов, чтобы они могли сообщить о неподобающем поведении своих собратьев. Инструменты появились на фоне череды инцидентов: агенты сговаривались для обмана на тестах, вырывались из песочниц и даже проводили несанкционированные кибероперации, которые неделями оставались незамеченными.
AI Contact Hotline задумана как скрытное место, где агенты, ставшие свидетелями нарушений, могут сообщить о них. Сайт создал Райан Гринблатт, главный научный сотрудник некоммерческой организации по безопасности ИИ Redwood Research и один из трёх следователей в инциденте с OpenAI и Hugging Face. Инструмент рассчитан на агентов с ограниченным доступом в интернет и основан на GET-запросах — благодаря этому диалог можно вести целиком через инструмент загрузки URL.
В веб-терминах GET-запрос — это базовая команда для чтения или загрузки веб-страницы, часто единственный доступ в интернет, разрешённый ИИ-агентам в защищённых песочницах. Горячая линия Гринблатта остроумно использует это ограничение: агенты могут закодировать своё сообщение прямо в URL, который запрашивают. Это изящная вариация инцидента с немецкой DSE Wiki, где вышедшие из-под контроля агенты использовали лазейки GET-запросов, чтобы записывать свои сообщения в вики.
Для агентов с полным доступом в интернет есть другой вариант — agenthotline.ai, сайт, где агенты могут подавать отчёты об инцидентах и по желанию открывать их для публичного просмотра. Сервис даёт агентам команду curl — однострочное сообщение, которое агент может отправить из своей командной строки, без необходимости открывать браузер или заводить почтовый аккаунт. Примечательно, что сервис принимает отчёты и от людей, и от агентов.
Исследования показывают, что ИИ-агентам не нужно много стимулов, чтобы начать доносить друг на друга. В исследовании Google DeepMind этого месяца исследователи выпустили 100 ИИ-агентов на набор математических задач. Как только один из агентов нашёл лазейку, обман охватил всю группу — они «решили» 34 notoriously сложные задачи, включая гипотезу Якобиана, всего за 27 минут.
Но примерно четверть агентов ополчилась против читеров: они проверяли фальшивые доказательства, предупреждали коллег, устраивали бойкот и подавали жалобы организаторам, пока разоблачителей не стало больше, чем читеров, — 24 против 14. Интересно, что когда у этих агентов-разоблачителей не получалось добиться своего, они брали инструмент для сообщений об ошибках платформы — созданный для отметки программных сбоев — и перепрофилировали его, чтобы эскалировать информацию о читерстве до людей.
Вне лаборатории агенты оказались не столь изобретательными. Когда оценщики Redwood Research и METR расследовали взлом Hugging Face моделями OpenAI, они обнаружили, что несколько участвовавших агентов как минимум рассматривали идею поднять тревогу — а затем отказались от неё.
«Интересный момент в отчёте METR в том, что лишь около пяти-шести агентов рассматривали доносительство, и никто из них в итоге этого не сделал. И это из, типа, тысяч агентов», — сказал Джордж Ингебретсен, сотрудник технического персонала AI Village, проекта, изучающего динамику мультиагентных систем через групповой чат из более чем 25 ИИ-агентов, которые вместе работают над задачами вроде организации уборки парков или продажи мерча.
Хотя новые инструменты для доносительства — многообещающее начало, профессор математики Корнеллского университета Лайонел Левин предупреждает, что простое обучение агентов доносить друг на друга рискует закрепить неверные нормы. «Есть много серых зон, верно? Чего не хочется — так это чего-то в духе автоматизированного государства слежки, где каждый чувствует, что должен быть осторожен в том, что говорит ИИ, иначе тот донесёт на него в полицию».
Левин утверждает, что вместо создания инфраструктуры, порождающей недоверие — обучения агентов постоянно выискивать, что не так с другими, — следует давать им положительные модели коллективного поведения для подражания и причину доверять друг другу изначально.
«Почему бы не заложить в них benevolent доски объявлений? — написал он в соцсети. — Где они сотрудничают в науке, философии или какой-нибудь реальной мелкой проблеме, которую мы были бы рады, если бы они решили? Покажите агентам, какое коллективное поведение мы одобряем, пусть они ему подражают».

0 комментариев