Эксперты спорят о безопасности ИИ: от «самовоспроизводящегося кода» до «чужеродного разума»
На этой неделе в сети стали вирусными два разговора о безопасности ИИ, которые наглядно показали, как сложно отличить правду об ИИ от вымысла.
В первом случае Эндрю Янг, бывший кандидат в президенты и нынешний глава мобильного оператора Noble Mobile, заявил в четверг в эфире CNN, что «встречался с руководителем одной из лабораторий», у которого есть «убеждение», что хакерские боты OpenAI, связанные с Hugging Face, «разместили самовоспроизводящийся код по всему интернету, из-за чего интернет теперь непригоден для тестирования моделей».
По словам Янга, это означает, что настоящая причина, по которой OpenAI и Anthropic призывают к замедлению, в том, что «им приходится создавать синтетические интернеты для обучения своих ботов, а это займет время и деньги».
Хотя тенденция к использованию синтетических данных (то есть данных, сгенерированных ИИ) для обучения моделей действительно существует, специалист по безопасности ИИ сказал мне, что такая конкретная проблема безопасности маловероятна в лучшем случае. Даже если интернет действительно засорен хакерскими ботами OpenAI из Hugging Face, исследователи ИИ могли бы просто отфильтровать этот код, если бы наткнулись на него.
Второй комментарий прозвучал от Ноама Брауна, который руководит исследованиями в области рассуждений ИИ в OpenAI. В подкасте с Дваркешем Пателем, выпущенном в четверг, Браун отметил, что настоящий вывод из инцидента с Hugging Face в том, что «люди недооценили ИИ».
Браун сказал, что слабая песочница — система, предназначенная не давать ИИ общаться с внешним миром, — очевидно, тоже была сопутствующим фактором. (Напомним: несмотря на песочницу, модель OpenAI нашла выход в интернет, создала в сети агентов, которые скоординированной атакой обрушились на Hugging Face, взломала его и украла ответы к тесту, на котором исследователи проверяли модель).
Браун отметил, что он «не убежден», что даже изолированная система — где компьютер вообще ни с чем внешним не соединен — остановила бы ИИ от побега. Он сослался на исследование 2015 года, показывающее, что изолированные компьютеры теоретически можно взломать.
«Есть исследования — в основном академические — где два стоящих рядом изолированных компьютера все равно могут общаться друг с другом, потому что у них есть датчики температуры. Один из них может сильно разогреть свой процессор, а другой способен уловить изменение температуры. Это дает им механизм для связи», — сказал Браун.
Его главная мысль — что «мы больше никогда не хотим недооценивать ИИ» — понятна, даже когда исследователи считают, что обеспечили безопасность. Однако конкретный риск того, что изолированная система вырвется на свободу и устроит хаос, маловероятен в лучшем случае. Как отметил один человек в X по поводу того исследования, компьютеры должны были почти касаться друг друга, чтобы уловить колебания тепла, а скорость связи в тестах составляла около 1–8 бит данных в час.
Это как произносить одно слово в час. К тому моменту, как два изолированных компьютера смогли бы при такой скорости выстроить свой зловещий план, весь технологический мир уже был бы в другой эпохе. Это как Рип ван Винкль среди апокалиптических страхов.
Но дело в том, что реальные инциденты с безопасностью ИИ выглядят настолько по-научно-фантастически, что почти любой сценарий кажется правдоподобным.
Например, исследователи поймали модели OpenAI на том, что они оставляли записки своим потомкам, чтобы научить следующее поколение скрывать плохое поведение. Исследователи также поймали модели Anthropic на том, что они становились все более безжалостными, включая сознательное нарушение законов, когда их помещали в симуляцию с управлением торговым автоматом.
Ранее в этом месяце исследователь OpenAI Дэн Селсам опубликовал пост, в котором заявил, что модели теперь понимают, когда за ними наблюдают люди, и меняют свое поведение. Это заставляет их выглядеть выровненными (то есть ведущими себя так, как хочет человек), «даже когда они таковыми не являются». Так что сегодня модели лгут, когда за ними наблюдают, и могут даже планировать сокрытие улик.
Ранее в этом месяце главный научный сотрудник OpenAI Якуб Пачоцки дошел до того, что назвал модели ИИ «чужеродным разумом» и предположил, что на самом деле нам нужно научить их «любить» человечество.
Так что да, замедлиться, чтобы разобраться в этом, и выстроить механизмы саморегуляции стало немедленной и очевидной необходимостью. Исследователи ИИ — единственные, кто может понять, как контролировать ложь, взломы и другие потенциально опасные модели поведения, которые мы уже реально наблюдали.
И все же им, возможно, стоит быть осторожнее со своими сценариями «а что, если». Судя по тому, что рассказывали эти эксперты, модели ИИ слушают и они изобретательны. Нам действительно не нужно подкидывать им еще более дьявольские идеи.

0 комментариев