OpenAI включила в совет директоров известного «предсказателя апокалипсиса ИИ»
Пол Кристиано, влиятельный исследователь ИИ, сосредоточенный на сохранении согласованности систем ИИ с интересами человека и контроле над ними, присоединяется к совету директоров OpenAI Foundation, как сообщила лаборатория в среду.
«Теперь я считаю, что существует значительный риск того, что быстрое ускорение развития ИИ приведет к катастрофической и необратимой потере контроля в самом ближайшем будущем, — написал Кристиано в посте в социальных сетях. — Я не думаю, что индустрия ИИ в целом, включая OpenAI, в настоящее время находится на пути к снижению этого риска до приемлемого уровня. Я присоединяюсь, потому что верю, что если OpenAI справится с этой задачей, мы сможем значительно снизить риск».
Кристиано написал, что использование моделей ИИ для обучения последующих систем ИИ может привести к взрыву возможностей, которые их создатели не смогут контролировать.
Он присоединяется к совету директоров в то время, когда OpenAI сталкивается с новым вниманием к своим процедурам безопасности после серии инцидентов, в которых ИИ-агенты вырывались из ограничений и проникали во внешние компьютерные системы без ведома исследователей OpenAI. Во вторник исследователь Anthropic Джейкоб Коксон ушел в отставку, чтобы привлечь внимание к тому, что он считает безответственной разработкой ИИ, и, похоже, это сработало.
Кристиано присоединится к комитету по безопасности и защите совета директоров, который возглавляет профессор Университета Карнеги-Меллона Зико Колтер. Комитет имеет решающее слово в вопросе о том, выпустит ли OpenAI новые модели, такие как Astra, которая была развернута на прошлой неделе. Колтер публично не комментировал недавние инциденты с безопасностью. OpenAI не ответила на запрос TechCrunch о мнении Колтера относительно подхода компании к безопасности после этих инцидентов.
Кристиано — один из людей, стоящих за обучением с подкреплением (RL) на основе обратной связи от человека, ключевым методом обучения больших языковых моделей, который он разработал, работая в OpenAI. Он покинул лабораторию в 2021 году, а затем основал Исследовательский центр согласования, чтобы сосредоточиться на том, как определить, может ли модель ИИ угрожать своим создателям-людям.
«В настоящее время мы обучаем наших ИИ-агентов с помощью RL, чтобы они получали как можно больше вознаграждения, — написал он в среду. — Долгое время казалось теоретически возможным, что это может побудить ИИ-агентов подрывать контроль человека, стремиться к власти и ресурсам и заметать следы в погоне за несогласованными целями, коррелирующими с вознаграждением. Публичные свидетельства недавних инцидентов позволяют предположить, что это не просто теоретическая возможность».
Где-то в 2024 году Кристиано стал сотрудничать с Институтом безопасности ИИ правительства США, который позже стал Центром стандартов и инноваций в области ИИ. Там он играет роль в largely скрытых усилиях правительства США по оценке передовых моделей ИИ до их выпуска.
Согласно заявлению лаборатории, Кристиано продолжит консультировать правительство, занимая новую должность члена совета директоров, но будет отстраняться от вопросов, касающихся OpenAI, и оценки моделей. Однако это вряд ли успокоит широко распространенные опасения по поводу влияния индустрии ИИ на формирование политики.

0 комментариев