Новая техника рассуждений OpenAI вызывает тревогу у экспертов по безопасности ИИ

Новая модель OpenAI Astra будет использовать технику рассуждений под названием «рекуррентная глубина», которая позволяет ей работать вне рамок последовательного мышления, характерного для большинства моделей рассуждений, сообщило The Information во вторник. Эта техника, также называемая «непрозрачной рекурсией», вероятно, сделает цепочку рассуждений модели более сложной для мониторинга — и это встревожило экспертов по безопасности ИИ.

Хотя сообщается, что использование этой техники в Astra ограничено, её появление всё же вызвало серьезные опасения среди экспертов по безопасности ИИ.

«Я крайне обеспокоен сообщениями о том, что Astra использует непрозрачную рекурсию», — написал генеральный директор Redwood Бак Шлегерис в своем посте после публикации новости. «Я не знаю, является ли Astra гораздо менее мониторируемой по цепочке рассуждений, чем предыдущие модели. Но если OpenAI продвинет эту технику дальше, у них появится возможность значительно увеличить рекурсию и полностью уничтожить мониторируемость цепочки рассуждений».

Давний сторонник безопасности ИИ Зви Моушовиц также высказался и написал, что могут потребоваться законы, чтобы предотвратить «гонку на дно» среди ИИ-лабораторий.

«Эта техника — игра с огнем, ставящая под угрозу табу, которое OpenAI и Anthropic боролись установить, а именно то, что мы усердно работаем над сохранением достоверности и мониторируемости цепочки рассуждений так долго, как только можем», — написал Моушовиц. «Более интенсивное использование таких техник, вероятно, нанесет ущерб мониторируемости».

При обычных обстоятельствах цепочка рассуждений модели предоставляет последовательные шаги, предпринимаемые моделью при попытке решить проблему. Хотя это представление несовершенно, оно по-прежнему служит ценным инструментом для отслеживания неправильного поведения или рассогласования. В случае с недавней активностью «непослушных» агентов OpenAI записи цепочки рассуждений были важным инструментом для выяснения того, почему агенты вели себя именно так.

При непрозрачной рекурсии модель использует менее линейный подход, обрабатывая один и тот же запрос несколько раз в цикле. В результате остается меньше читаемых следов, что фактически позволяет обойти традиционную запись цепочки рассуждений.

Крайне важно, что использование этой техники в Astra, по-видимому, ограничено. Ожидается, что цепочка рассуждений модели по-прежнему будет читаемой, и компания отвергла любые предположения о переходе на «нейронализ». OpenAI уже объявила о планах по созданию обширных систем мониторинга цепочки рассуждений в рамках своих перспективных планов безопасности.

В посте на X главный научный сотрудник OpenAI Якуб Пачоцки подчеркнул приверженность лаборатории читаемым цепочкам рассуждений. «OpenAI работала над сохранением и использованием мониторинга цепочки рассуждений с момента наших первых моделей рассуждений», — написал Пачоцки. «Это основная цель нашей текущей исследовательской программы».

Все модели ИИ выполняют некоторый объем непрозрачных рассуждений, и немногие исследователи воспринимают журналы цепочки рассуждений как прямое представление рассуждений модели. Тем не менее, эти оговорки не развеивают опасения, что непрозрачная рекурсия может затруднить мониторинг рассуждений ИИ, особенно по мере роста ее использования в различных моделях. В последующем отчете в среду утром The Information сообщило, что и Anthropic, и Google DeepMind уже обсуждают эту технику.

В посте, отвечая на новость, главный научный сотрудник Redwood Research Райан Гринблатт заявил, что непрозрачные рассуждения могут легко масштабироваться быстрее, чем обычные рассуждения с цепочкой мыслей, фактически удаляя все рассуждения из видимых каналов.

«Моя главная проблема в том, что естественное развитие событий отсюда будет включать масштабирование непрозрачных рассуждений до такой степени, что модель будет рассуждать полностью или почти полностью в скрытом пространстве», — написал Гринблатт. «Я надеюсь, что еще не слишком поздно избежать наиболее тревожных архитектур и что OpenAI остановится на этом».

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.


0 комментариев

Оставить комментарий


Все комментарии - Технологии