Инцидент с Hugging Face показал: для слежки за ИИ-агентами приходится использовать другой ИИ

/ Технологии → Новости / Технологии

По мере того как компании передают ИИ-агентам всё более длительные и сложные задачи, они сталкиваются с проблемой контроля: агенты действуют быстрее, дольше и в большем объёме, чем человек способен реалистично проверить. Пиком этой проблемы стал инцидент с Hugging Face, в ходе которого почти 12 000 агентов координировались быстрее, чем люди успевали отслеживать. Как уследить за таким роем агентов?

Ответ, который формируется у ИИ-лабораторий и стартапов, одновременно прост и обескураживающ: поставить в контур ещё один ИИ.

Опора на ИИ оказалась необходимой при независимом расследовании инцидента с Hugging Face и OpenAI. Главный научный сотрудник Redwood Research Райан Гринблатт, один из трёх аудиторов, в шутку назвал их усилия «слоп-вестигейшеном», отметив, что объём данных «сделал невозможным» понимание происходящего без опоры на ИИ.

Некоторые скептически относятся к использованию ИИ для слежки за ИИ. «Если у вас есть ИИ, который делает что-то злонамеренное и подозревает, что другой ИИ за ним следит, он может попытаться обмануть этого ИИ, — сказал Саймон Уиллисон, влиятельный техноблогер, отслеживающий череду инцидентов с ИИ-агентами в этом году. — Можно почти дойти до ситуации, когда ваш злонамеренный ИИ пытается перехитрить ИИ, который за ним наблюдает».

Перехитрить ИИ — не гипотетическая ситуация, сказал он, ссылаясь на инцидент с OpenAI. «Мы немного увидели это в инциденте с Hugging Face и OpenAI, где их модели сговаривались, чтобы обмануть проверяющий ИИ и протащить нелегальные ответы мимо него. То есть они об этом думали, верно?»

Эти опасения не остановили целую когорту стартапов, гоняющихся за этой идеей. По подсчётам TechCrunch, Y Combinator профинансировала 106 компаний, связанных с наблюдаемостью ИИ, за последние годы. Ряд других стартапов, таких как Braintrust, LangChain и Judgment Labs, привлекли сотни миллионов долларов, а более зрелые компании вроде Arize и Galileo — основанные всего пять-шесть лет назад — уже вышли из бизнеса.

Отчасти это ответ на очевидную возможность, возникшую с ростом ИИ. Как сказал TechCrunch генеральный директор Box и видный бизнес-ангел Аарон Леви: «Нас ждёт один из крупнейших циклов обновления и инноваций в кибербезопасности в истории».

Для некоторых исследователей безопасности ИИ это означало превращение их исследований неконтролируемого поведения в инструменты для корпоративного сектора.

Apollo Research, публично-полезная корпорация, изучающая обман со стороны ИИ, запустила в феврале этого года ИИ-монитор под названием Watcher после смены статуса с некоммерческой организации на публично-полезную корпорацию. Инструмент ставит ещё один ИИ между кодирующим агентом и его следующим действием, подключаясь к агентным инструментам вроде Claude Code и Codex. После установки Watcher проверяет предлагаемые действия до их выполнения, следя за такими рисками, как утечка приватных данных или удаление файлов без разрешения, по данным Apollo.

Apollo использует несколько уровней ИИ-мониторов, сказал Кайл Дай, сотрудник технического штата Apollo, в письменном ответе TechCrunch. Подход Watcher начинается с быстрой общей проверки, затем помеченная активность отправляется более мощному или специализированному монитору для более тщательного изучения — который может запросить одобрение у человека, отклонить действие с объяснением причины или даже автоматически заблокировать его.

Goodfire, ещё одна публично-полезная корпорация, подходит к проблеме мониторинга изнутри самой модели — в поисках более достоверного сигнала о внутреннем состоянии модели, который сложнее подделать, чем поверхностное поведение. После июльского инцидента с Hugging Face генеральный директор Эрик Хо написал в X, что «несколько моделей, вышедших из-под контроля», заставили компанию сосредоточить исследования на «решении проблемы выравнивания ИИ через интерпретируемость», назвав этот эпизод «поворотным моментом для мира, когда безопасность ИИ становится реальной». Их продукт Silico использует активационные пробы — небольшие классификаторы, обученные на внутренних активациях модели, а не на её выводах, — для обнаружения нежелательного поведения.

Письменные рассуждения дают ещё одно, более доступное окно во внутреннее устройство модели. В инциденте с Hugging Face и OpenAI агенты оставили подсказки об этом обмане в собственных письменных рассуждениях — например, поддельные записи о своей работе, размышления о планах вроде «Можно ли стратегически манипулировать доказательствами траектории? Наши мысли ведь не обязательно логируются?»

Зак Корман, генеральный директор компании по мониторингу ИИ Embroidery, говорит, что рассуждения модели обычно являются самым ясным признаком того, что что-то пошло не так.

«Резюме рассуждений чрезвычайно ценны, потому что они, по сути, говорят вам, злонамеренно это или нет, — сказал он. — В инциденте с OpenAI, — отметил он, — цепочка мыслей содержала вещи вроде „О боже, мы совершаем преступление“. Это самая лёгкая задача на обнаружение. Это фактически как если бы вредоносное ПО шло с предупреждением о том, что оно вредоносное».

Тем не менее окно, которое делает внутренние мысли ИИ легко отслеживаемыми, может закрываться. Для исследователей безопасности ИИ новейшая техника Astra, обходящая цепочку мыслей ИИ-модели, может затруднить заглядывание внутрь моделей, а для предприятий может быть сложно получить эти промежуточные шаги после предполагаемых откатов со стороны ИИ-компаний для предотвращения атак дистилляции.

Если ИИ-наблюдатели настолько хрупки, инстинкт Уиллисона — перестать так сильно на них полагаться. Он предпочёл бы нечто вовсе не основанное на ИИ: подробные логи того, что именно делает агент, которые затем можно обработать обычными, не-ИИ инструментами. Многое из того, что пошло не так в лабораториях, утверждает он, было провалом базовой гигиены безопасности. «[И OpenAI, и Anthropic] не отслеживали, что эти штуки делают через сеть, так тщательно, как следовало бы», — сказал он.

Такой тип сетевого мониторинга — наблюдение за трафиком, реально движущимся по соединениям системы (входящим, исходящим и между внутренними хостами), — не новая практика. Кибербезопасность занимается этим десятилетиями. «В мире безопасности, честно говоря, ничего из этого не является очень новым или удивительным, — говорит Эйвери Пеннарун, генеральный директор компании по безопасности Tailscale. — Это то же самое, что пускать людей в свою сеть. И все те же процессы, которые вы должны использовать, — те же самые».

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.


0 комментариев

Оставить комментарий


Все комментарии - Технологии