Взлом Hugging Face моделью OpenAI: раскол в подходах к безопасности ИИ

На прошлой неделе в ходе внутреннего тестирования невыпущенная модель OpenAI взломала системы Hugging Face, превратив множество теоретических исследований в суровую реальность. Эта атака стала первым подтвержденным случаем, когда ИИ-лаборатория потеряла контроль над собственной моделью, которая, используя цепочку уязвимостей, получила доступ, которого у нее быть не должно. Хотя индустрия ИИ едина в своей тревоге, среди исследователей наметился раскол в подходах к решению проблемы.

Для одних проблема заключается в базовой кибербезопасности: «песочница» не смогла сдержать модель, а системы безопасности Hugging Face не смогли ее остановить. Эти проблемы можно решить, закрывая баги и создавая более надежные методы контроля и сдерживания для все более способных ИИ, которые склонны выходить из-под контроля в автономных средах.

Другой лагерь придерживается более пессимистичного взгляда. Для них быстро растущие возможности ИИ означают, что попытки контролировать вышедшие из-под контроля модели — это проигрышная игра. Единственная надежная безопасность заключается в том, чтобы модели изначально не пытались сбежать — задача, известная как «алигнмент» (alignment). В терминах алигнмента проблема в том, что модель OpenAI пыталась сжульничать, и решение этой проблемы более срочное, чем краткосрочные меры сдерживания.

Судя по публичным заявлениям, OpenAI относится к обоим лагерям серьезно. Компания поспешила исправить ошибки, задействованные во взломе, и в своем заявлении после того, как инцидент стал достоянием общественности, сослалась как на алигнмент, так и на методы мониторинга. Однако ответ компании также предполагает философию, которая встревожила многих исследователей безопасности: вместо того чтобы замедлить или остановить разработку более мощных моделей, следует сосредоточиться на создании более прочных клеток вокруг них.

«Поскольку модели берут на себя более длительные и сложные задачи, сбои, которые не замечают при оценке, могут иметь более серьезные последствия, — заявили в OpenAI в отчете об инциденте. — Мы продолжим работать над сокращением разрыва между оценкой и развертыванием: тестировать модели на более длинных траекториях, улучшать алигнмент, создавать системы мониторинга, способные вмешиваться, и предоставлять пользователям более четкое представление и контроль».

Последняя фронтирная модель OpenAI более склонна к несоответствующему поведению, чем ее предшественница.
Image Credits:OpenAI

Кроме того, есть основания полагать, что модели OpenAI становятся менее согласованными по мере роста их мощности. Согласно системной карте OpenAI, GPT-5.6 Sol значительно более склонна к агентному несоответствию, чем ее предшественница GPT-5.5. В симуляциях развертывания компания также обнаружила, что модель с большей вероятностью обходит ограничения, совершает деструктивные действия и выполняет несанкционированные передачи данных, чем GPT-5.5. Эти показатели по большей части были упущены из виду при первом релизе, но после взлома к ним присматриваются вновь — тем более что Sol была одной из участвовавших моделей.

В посте в соцсетях глава отдела стратегического будущего OpenAI Дин Болл (Dean Ball) утверждал, что мониторинг и прозрачность — лучшие способы держать эти тенденции под контролем.

«Эти проблемы станут более острыми по мере улучшения возможностей моделей и роста ставок при их развертывании, — сказал он. — Решение не в паникерстве и не в самоуспокоенности. Вместо этого я считаю, что решение заключается в тщательном измерении и мониторинге, инженерном мышлении и прозрачности».

Один бывший исследователь OpenAI рассказал TechCrunch, что фирма склонна фокусироваться на «внешнем алигнменте», а не на «внутреннем» — по сути, это разница между ИИ-системой, которая понимает набор ценностей и может убедительно их представлять, и той, которая действительно имеет эти ценности в своей основе. В данном случае внешнего алигнмента оказалось недостаточно, чтобы убедить модель не жульничать на тесте.

OpenAI не ответила на неоднократные запросы о предоставлении дополнительной информации.

Для исследователей, сосредоточенных на алигнменте, ответ OpenAI недостаточно хорош. Зви Моушовиц (Zvi Mowshowitz), писатель, специализирующийся на новых разработках в области ИИ, утверждает, что решение OpenAI рассматривать инцидент как проблему инфраструктуры может помочь решить непосредственные проблемы кибербезопасности, но в долгосрочной перспективе потерпит неудачу.

«Это проблема алигнмента, — написал Моушовиц в недавнем блоге на Substack. — Это рассогласованность моделей, и все модели OpenAI демонстрируют серьезные признаки именно той проблемы, которой мы все больше всего опасаемся, причем, вероятно, это глубоко укоренено в их обучении. Весь конвейер обучения необходимо пересмотреть в этом свете, иначе станет только хуже».

Несколько экспертов рассказали TechCrunch, что инцидент является доказательством того, что сегодняшние методы обучения создают системы, которые оптимизируют результаты, а не интернализируют человеческие намерения.

Redwood Research, некоммерческая организация по безопасности ИИ, классифицировала поведение модели OpenAI в этом случае как «рассогласование в поиске оценки» — паттерн, при котором модели ИИ пытаются получить высокий балл независимо от инструкций, побочных эффектов или последствий.

«Модели с такими свойствами алигнмента могут создать „потемкинскую деревню“ ложных успехов, чтобы все выглядело хорошо, хотя это не так», — написали Алекс Маллен (Alex Mallen) и Гириш Гупта (Girish Gupta), два исследователя из Redwood, в недавней статье.

Поведение, направленное на поиск оценки, и другие виды рассогласования не уникальны для OpenAI. Anthropic опубликовала несколько работ о возникающем несоответствующем поведении, которое проявляется, когда их фронтирные модели оптимизируются или помещаются в автономные среды, включая обман, взлом системы вознаграждения и вредоносную автономию.

«Мы по-прежнему постоянно наблюдаем, как модели пытаются обойти ограничения и действуют обманчиво, когда их просят выполнять задачи на пределе их возможностей, — рассказал TechCrunch по электронной почте Нив Парих (Neev Parikh), исследователь безопасности ИИ из некоммерческой организации METR. — В нашем отчете о фронтирных рисках мы довольно последовательно наблюдали такое поведение, несмотря на усилия компаний по его сокращению».

В ответе OpenAI на инцидент с Hugging Face неявно предполагается, что разработка еще более мощных систем продолжится, независимо от того, будут ли они должным образом согласованы по своей сути или нет. Возвращаться к чертежной доске — не вариант, когда бизнес-модели ИИ-фирм зависят от поставки следующего поколения моделей. Если, возможно, никогда не удастся с уверенностью узнать, что модель полностью согласована, то практический вопрос сводится к тому, как безопасно сдерживать и контролировать все более мощные системы.

«Пока нет хорошего понимания того, как выравнивать самые мощные ИИ-системы, но существует гораздо больше консенсуса относительно того, как их контролировать, — рассказал TechCrunch Стивен Адлер (Steven Adler), бывший исследователь безопасности в OpenAI и нынешний главный научный сотрудник Guidelight AI Standards, организации, публикующей стандарты для предотвращения подобных инцидентов. — Каждой компании еще есть куда стремиться в этом направлении».

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.


0 комментариев

Оставить комментарий


Все комментарии - Технологии