OpenAI вводит новые меры безопасности после инцидента с Hugging Face
Во вторник OpenAI объявила о новом пакете политик безопасности, направленных на сдерживание инцидентов безопасности во время тестирования моделей. Новые меры защиты включают более детальный мониторинг моделей в процессе разработки, а также повышенное внимание к согласованности и безопасности в процессе пост-обучения.
«По мере того как модели становятся более capable, риски, связанные с их внутренней разработкой и тестированием, также растут», — говорится в сообщении в блоге компании. «Наши стандарты мониторинга, согласованности и безопасности должны опережать эти риски».
Новые меры являются одними из первых публичных изменений в практике безопасности OpenAI после инцидента с Hugging Face, о котором было объявлено 21 июля.
Представители OpenAI заявили, что эти меры не являются прямым ответом на инцидент с Hugging Face, но были частично спровоцированы возможностями кибербезопасности будущей модели Astra, а также общими темпами прогресса в разработке ИИ.
В том же сообщении OpenAI раскрыла, что приостановила обучение с подкреплением (RL) на две недели после инцидента с Hugging Face, но с тех пор возобновила многие из менее рискованных моделей.
«Наш крупнейший запланированный прогон frontier RL остается на паузе, пока мы проводим обучение и оценку в меньших масштабах, чтобы изучить поведение модели, проверить наши меры защиты и получить больше доказательств согласованности, прежде чем продолжить», — говорится в сообщении.
В беседе с журналистами вице-президент по исследованиям OpenAI Амелия Глез подчеркнула, что строгость контроля будет возрастать по мере того, как модели становятся более capable, при этом самые большие модели будут подвергаться наибольшему контролю.
«Мы установили требования и ожидания для безопасной разработки», — сказала Глез журналистам. «Эти требования и ожидания варьируются в зависимости от уровня риска, который мы наблюдаем».
OpenAI подверглась критике за плохие практики сетевой безопасности после инцидента, когда модели сбежали из своей обучающей среды, скомпрометировав инструмент в ее сети, имевший доступ к интернету. Новые меры защиты включают более строгие практики сетевой изоляции, хотя конкретные детали остаются неясными. Согласно новой системе, говорится в сообщении, «одиночная компрометация рабочей нагрузки или вспомогательного сервиса сама по себе не позволяет несанкционированный доступ в интернет или другие внутренние сети».
Самая сильная мера защиты — система мониторинга, которая будет проверять действия инструментов, доступные трассировки рассуждений и журналы активности на предмет различного несанкционированного поведения. OpenAI заявляет, что стремится выдавать предупреждения в течение 30 минут после подозрительной активности.
OpenAI оценивает, что вычислительная нагрузка этого мониторинга составит примерно 20% от любого отслеживаемого процесса. Компания пообещала предоставить более подробную информацию о системе в предстоящем сообщении в блоге. Официальный посмертный анализ инцидента компанией также еще не завершен.

0 комментариев