Исследователь Anthropic показал, как ИИ может улучшать сам себя
Исследователь из программы стипендиатов Anthropic представил ранний взгляд на то, как может выглядеть практическое применение самоулучшающегося искусственного интеллекта.
В пятницу Anthropic опубликовала новую научную работу под названием «Автоматизированные исследователи могут надежно снижать риски рассинхронизации», в которой подробно описывается, как системы ИИ могли бы надежно повышать производительность модели на наборе бенчмарков выравнивания. Получив 10 бенчмарков для конкретных видов нежелательного поведения, автоматизированные системы смогли улучшить показатели по каждому из них без ухудшения общей производительности.
Под руководством стипендиата Anthropic Чэнь Юэ-Ханя система воспроизводит большую часть традиционного подхода к исследованиям. Каждая автоматизированная система ищет в доступной литературе, предлагает метод и обучает модель с его помощью в течение 30 минут, постепенно повышая бенчмарк в течение нескольких итераций. Эффективные методы сохраняются, а неэффективные отбрасываются, что позволяет системе работать быстро и в больших масштабах.
«В целом эти результаты дают ранние доказательства того, что автоматизированное пост-обучение выравниванию может стать практичным в ближайшей перспективе», — говорится в статье.
Эта работа является шагом к рекурсивному самосовершенствованию, которое многие считают следующим значительным этапом в развитии ИИ. Если модели смогут улучшать собственное обучение выравниванию, вполне вероятно, что они смогут улучшать и более широкие практики обучения — и в этот момент исследователи-люди в области ИИ могут вскоре стать не нужны.
Статья не стесняется обсуждать эту идею, прямо сравнивая Автоматизированного исследователя выравнивания (AAR) с его человеческим аналогом. «Лучший метод AAR превосходит то, что предлагают опытные люди, в среднем в течение шести часов», — говорится в статье. «Направления исследований, предложенные людьми, не приводят к более высокой производительности».
В статье также приводится сравнение затрат, на случай если кто-то не был убежден. «AAR стоит примерно 4 доллара в час за API-инференс против 150 долларов в час, которые мы платим нашим исследователям-людям» (примерно 320 и 12000 рублей соответственно).
Справедливости ради, в статье также отмечаются некоторые ограничения этого подхода. Автоматизированная система работает лишь постольку, поскольку бенчмарки отражают реальные цели выравнивания, и даже в этом случае предстоит значительная работа по созданию и поддержанию этих бенчмарков — не говоря уже о поддержании и расширении литературы, из которой черпают автоматизированные исследователи.

0 комментариев