Открытая модель GLM-5.2 вплотную приблизилась к лидерам ИИ, но разрыв в безопасности растет

/ ТехнологииНовости / Технологии

Китайская открытая модель GLM-5.2 от компании Z.ai почти догнала лидеров индустрии по кибер- и биологическим возможностям, отставая от OpenAI GPT-5.5 и Anthropic Claude Opus 4.7 всего на несколько месяцев. Однако разрыв между передовыми возможностями и практиками безопасности растет, согласно новому отчету некоммерческой организации SaferAI.

В ходе оценки через публичный API Z.ai, GLM-5.2 не отказалась ни от одного задания по offensive-кибербезопасности или двойному использованию биологии. Для сравнения, Claude Opus 4.7 «отказывалась так последовательно, что SaferAI вообще не смог запустить на ней CyberGym» — бенчмарк для оценки кибервозможностей, который OpenAI использовал перед взломом Hugging Face в прошлом месяце.

Это яркое напоминание о давнем предупреждении критиков: открытые модели могут передать мощный ИИ в руки потенциальных злоумышленников без возможности контролировать его использование после загрузки весов. По мере того как открытые модели быстро приближаются к возможностям ведущих мировых систем, дискуссия смещается от вопроса «могут ли они конкурировать» к вопросу «как общество управляет рисками после их выпуска».

«Граница возможностей — это не граница риска, поэтому для правильной оценки риска мы должны учитывать и состояние мер защиты», — заявил TechCrunch Генри Пападатос, исполнительный директор SaferAI.

Хотя Z.ai может применять меры безопасности к своему хостируемому API, эти защиты становятся неприменимыми, когда кто-то запускает веса на собственном оборудовании, где можно удалить или изменить любые предохранители, дообучить модели или изменить системные промпты. Разработчики передовых моделей, такие как OpenAI и Anthropic, полагаются на классификаторы, обучение отказам и контроль на уровне API, но эти меры далеко не идеальны — джейлбрейки регулярно обходят защиту. Far.ai обнаружила сотни универсальных джейлбрейков в таких моделях, как Grok 4.5 от xAI и Gemini 3.1 Pro от Google DeepMind.

Однако меры защиты, работающие для закрытых моделей, вообще не работают для открытых, которые спроектированы для запуска на любой инфраструктуре с любым набором защит — или без них. Пападатос предлагает технику «фильтрации данных предварительного обучения» — удаление offensive-информации по кибербезопасности из обучающих данных. Исследования показывают, что это может снизить опасные биологические знания без ущерба для общей производительности, но для кибербезопасности такой подход менее практичен: сложно обучить модель, которая отлично кодит, но не является хорошим хакером.

Поэтому разработчики все чаще полагаются на другие меры: ограничение типов помощи, например, Opus 5 от Anthropic ищет уязвимости только в нескомпилированном коде, строгие предварительные оценки безопасности, публикация оценок рисков и сокрытие весов, если система считается слишком опасной. В случае GLM-5.2 SaferAI отмечает, что Z.ai не опубликовала структуру безопасности, обязательства по предварительному тестированию или оценку рисков. TechCrunch не получил ответа от Z.ai на запрос о проведении внутренних или сторонних оценок.

Китайские лидеры все чаще признают риски продвинутого ИИ. На Всемирной конференции по ИИ в прошлом месяце председатель КНР Си Цзиньпин подчеркнул важность открытых моделей, но также отметил необходимость обеспечения строгого контроля человека над ИИ. Грэм Вебстер из Стэнфордского центра киберполитики отмечает, что в Китае есть надежные правила, но они сосредоточены на политически чувствительном контенте и социальной стабильности, а не на катастрофических рисках ИИ. Китайские исследователи считают, что если и появится новый передовой риск, американские компании столкнутся с ним первыми.

Сторонники открытых моделей утверждают, что публикация весов важна для кибербезопасности, так как позволяет компаниям защищаться от атак — Hugging Face использовала GLM-5.2 для защиты от взлома OpenAI. Клем Деланг, генеральный директор Hugging Face, заявил, что те же системы, которые помогли остановить кибератаку на основе ИИ, теперь могут помочь защищаться от миллионов атак ежедневно. Однако Пападатос считает, что эта выгода часто преувеличивается и не означает, что «мы должны открывать исходный код опасных возможностей».

«Главный момент, на мой взгляд, в том, что мы не должны просто принимать, что опасные возможности легко доступны любому в любом месте», — подчеркнул он, добавив, что по умолчанию злоумышленники адаптируются быстрее, чем защитники. «Группа программ-вымогателей может изменить свои методы за неделю. Больница — нет».

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.


0 комментариев

Оставить комментарий


Все комментарии - Технологии