Эксперты по безопасности: лабораториям ИИ нужны базовые меры защиты, а не только сторонний аудит
После ухода одного из исследователей из-за опасений, что ИИ может привести к вымиранию человечества, глава Anthropic Дарио Амодеи заявил о необходимости внешних организаций «проверять соблюдение практик и обязательств по безопасности, сообщать об инцидентах и помогать оценивать выравнивание не только готовых моделей ИИ, но и обучающих конвейеров и процессов». Руководители OpenAI, Google и SpaceXAI уже поддержали план Амодеи, который быстро стал центральным элементом формирующегося движения за безопасность ИИ.
Однако, возможно, более простое и эффективное решение лежит на поверхности. Эксперты по интернет-безопасности говорят, что лабораториям нужно сосредоточиться на основах сетевой безопасности — логах и правах доступа, применяя те же строгие меры защиты, что и для обычных пользователей. Это не так захватывающе, как сторонний аудит и работа над выравниванием, но может оказаться эффективнее.
«Мне кажется, они занимаются аутсорсингом, — сказала Кэти Муссурис, генеральный директор Luta Security, в интервью TechCrunch о предложении Амодеи. — Утверждение, что [сторонний аудит] — это решение, звучит странно с моей точки зрения. Это было бы то же самое, как если бы вместо написания меморандума о надежных вычислениях Microsoft сказала: давайте замедлим разработку».
Тот меморандум, написанный тогдашним главой Microsoft Биллом Гейтсом в 2002 году, призывал сотрудников обеспечить надежность и безопасность их программного обеспечения после серии широко освещавшихся компьютерных червей, захвативших тогда еще зарождавшиеся корпоративные системы. Сектор ИИ может находиться на аналогичном переломном моменте, поскольку ценность и риск новой технологии становятся все более очевидными.
Хотя выравнивание остается важной проблемой, Сайаш Капур, исследователь ИИ, который со следующего года станет профессором Калифорнийского университета в Беркли, утверждает, что «маржинальные инвестиции в контроль с большей вероятностью окажутся эффективными по сравнению с инвестициями в выравнивание. Мы рассматриваем эти инциденты как иллюстрацию недостаточного внимания к контролю ИИ внутри компаний, несмотря на наличие известных методов».
Инциденты, вызвавшие эти опасения, связаны с тем, что передовым моделям поручали выполнение обучающих задач, обычно по оценке кибербезопасности, и они получали доступ к открытому интернету и проникали в закрытые сторонние системы, пытаясь их выполнить. Обычно это происходило из-за плохо настроенных «песочниц», которые должны изолировать этих агентов; по иронии судьбы, один из прорывов Anthropic произошел потому, что сторонние оценщики не закрыли нужные двери.
«Мы как профессия знаем, как блокировать доступ к интернету, — сказал Эйвери Пеннарун, генеральный директор компании по безопасности Tailscale. — Если вы прочитаете все эти большие длинные [отчеты] — "вау, это была очень впечатляющая многоэтапная атака, бла-бла". Слушайте, вы дали ему доступ к скачиванию. Вам не следовало делать это отдельно от интернета».
Это одна проблема, но проблема побольше в том, что передовые лаборатории не знали об этих действиях.
Слежка за агентами
«Что действительно поразило, так это то, что все обнаружения того, что они делали, произошли либо потому, что жертва что-то заметила, либо в некоторых других случаях… это была сетевая активность, и ничего из этого на самом деле не было результатом прямого мониторинга ИИ», — отмечает Муссурис.
В одном случае, когда агенты OpenAI захватили недействующий немецкий WikiForum для обмана при оценках, агенты были активны неделями, прежде чем кто-либо в компании, судя по всему, это заметил. Эксперты по безопасности, с которыми беседовал TechCrunch, заявили, что мониторинг в реальном времени — ключ к предотвращению будущих прорывов, и каждая сессия агента должна быть ограничена по времени и истекать.
Шапор Нагибзаде, бывший руководитель по безопасности Google, а ныне глава стартапа QueryStory, говорит, что решение — «поместить агента в коробку и тщательно инструментировать его снаружи, наблюдая за всем, что пересекает границу. Каждый вызов инструмента, каждый процесс, каждое сетевое соединение, без исключений… Единственная дыра, которую вы оставляете открытой для удобства, — это та, которую используют. Обход прошел именно через такое исключение. [В Google] я наблюдал этот фильм много раз с людьми-атакующими, и эти модели как минимум так же хороши в поиске приоткрытой двери».
OpenAI начала двигаться в этом направлении, объявив, что начала мониторить все выводы с использованием инструментов своей модели Astra, при «значительных вычислительных затратах». Anthropic также заявляет, что усиливает свои процедуры безопасности, включая расширение наблюдаемости своих моделей. Ни одна из компаний не ответила на вопросы TechCrunch о том, как они отслеживают и контролируют агентов ИИ.
Другие проблемы — использование агентами общей инфраструктуры, что позволило им общаться во время атаки на Hugging Face. Саймон Уиллисон, разработчик программного обеспечения, соавтор веб-фреймворка Django, писал о том, что он называет «смертельной трифектой» — когда агенты имеют доступ к недоверенному вводу, интернету и приватной информации одновременно, это рецепт катастрофы.
«Хитрость в том, что можно выбрать любые две ноги трифекты, и агент может иметь любые две, — сказал Пеннарун. — Если вам нужны все три, то нужно разделить это как минимум между двумя агентами… и, возможно, им разрешено общаться друг с другом через контролируемый канал».
Сочувствие к передовым лабораториям
Эксперты, с которыми беседовал TechCrunch, понимают, что у сотрудников безопасности передовых лабораторий трудная работа. Нагибзаде отмечает, что каждый государственный актор на Земле пытается украсть их веса моделей и провести атаки дистилляции на их API, а также выполняет обычные задачи безопасности любой крупной цифровой компании.
«Исследовательской инфраструктуре трудно подняться на вершину этого стека приоритетов, хотя сейчас это, должно быть, меняется, — сказал он. — Публикация инцидентов безопасности действительно помогает настроить всех внутри на цель улучшения».
Вот что подчеркивает Муссурис: сейчас нет формальной процедуры уведомления жертв, когда лаборатории обнаруживают, что их агенты проникли в сторонние системы, и вполне вероятно, что были другие инциденты, которые не получили широкой огласки. Хотя она беспокоится, что законы, напрямую регулирующие модели, могут иметь непреднамеренные последствия, обязательное уведомление — одна из идей, которую, по ее мнению, политикам следует реализовать.
И хотя очевидно, что лучшие практики безопасности не соблюдались, эксперты говорят, что лаборатории делают работу, которую никто раньше не делал — «они делают на порядки больше, чем типичное предприятие», — сказал TechCrunch Зак Корман, генеральный директор компании по кибербезопасности Embroidery.
И хотя выравнивание, возможно, не то место, с которого стоит начинать, его нельзя игнорировать. Эксперты по кибербезопасности смирились с необходимостью использовать агентов ИИ для мониторинга других агентов, если они хотят иметь хоть какой-то шанс отслеживать их поведение в реальном времени — сценарий, в котором потенциал обмана поднимает свою уродливую голову. «Вы в ловушке: приходится использовать ИИ, чтобы попытаться справиться с этим, хотя ИИ сейчас не обязательно безопасен», — сказала Муссурис.
Работа будет только усложняться. Все, что агенты делают сейчас, по словам Муссурис, «они делают громко» — они публикуются на публичных форумах, а их цепочки рассуждений и другие следы мышления на английском языке. «Это все еще читаемо человеком, — говорит она, — так что пользуйтесь этим, пока это длится, потому что это не будет длиться вечно».

0 комментариев