Рассекреченные документы: руководитель Microsoft назвал сбор данных для ИИ «крупнейшей кражей труда в истории человечества»
Новые неотредактированные материалы судебного иска, поданного The New York Times против OpenAI и Microsoft три года назад, раскрывают признание того, что массовый сбор данных для обучения ИИ был равносилен краже, а продукты на базе ИИ представляют серьёзную угрозу для изданий.
Согласно иску, высокопоставленный руководитель Microsoft в частном порядке описывал практику обучения ИИ компаний как «кражу», а руководство OpenAI признавало, что их модели ИИ представляют «экзистенциальную угрозу» для издателей и журналистов, чьи работы использовались для обучения.
Рассекреченные материалы также подробно описывают, как компании предположительно получали и использовали этот контент, обходя платные подписки незамеченными, создавая обучающие наборы данных путём массового сбора и намеренно удаляя уведомления об авторских правах из обучающих данных.
Стоит отметить, что большая часть новой информации исходит из собственного заключения The Times, а не из лежащих в основе доказательств, которые остаются засекреченными. Приведённые цитаты представлены без оригинального контекста.
Рассекреченный документ — это последняя эскалация в трёхлетнем судебном процессе, в котором The New York Times изначально утверждала, что компании нарушили закон об авторском праве, обучая генеративные модели ИИ на её контенте.
Вопрос о том, могут ли компании, занимающиеся ИИ, законно использовать защищённый авторским правом материал для обучения ИИ, не имеет однозначного ответа, но судьи в основном благосклонно относились к аргументам ИИ-компаний о том, что обучение представляет собой «добросовестное использование». Это правовое правило позволяет людям использовать защищённую авторским правом работу без разрешения в определённых случаях, например, для пародии, новостных репортажей или критики. Ранее в этом месяце администрация Трампа представила заключение в защиту нелицензированного использования OpenAI защищённого авторским правом материала для обучения своих больших языковых моделей.
Однако несколько новых признаний противоречат защите OpenAI по принципу добросовестного использования, особенно требованию этого правила о том, что использование не заменяет и не наносит вреда рынку оригинальной работы.
Например, собственные данные Microsoft показывают, что её «движок ответов» Copilot привёл к падению показателя переходов по домену The New York Times на целых 93% по сравнению с традиционным поиском Bing. Внутренняя презентация Microsoft, написанная директором по прикладной науке Microsoft Брентом Хехтом в январе 2024 года, описывает это снижение как «петлю гибели», которая «навредит производительности наших моделей и всей сети одновременно».
«Крайне необычно, что конечный продукт угрожает экономическим основам своих ключевых поставщиков, но именно такую ситуацию мы создали для нашего бизнеса больших языковых моделей в отношении его "цепочки поставок контента"», — говорится в документе Microsoft, цитируемом в заключении.
Генеральный директор Microsoft Сатья Наделла также заявил в ходе дачи показаний ранее в этом году, что «всё, что находится за платной подпиской, должно лицензироваться любым, кто хочет это использовать… для обоснования или обучения», и дал понять, что если бы он «был осведомлён о том, что OpenAI собирала и обучалась на информации, находящейся за платной подпиской», он бы «воспользовался [правом Microsoft] потребовать от OpenAI переобучить свои модели».
Другие признания противоречат иным столпам теста на добросовестное использование: руководитель ChatGPT в OpenAI Ник Тёрли написал во внутренней переписке, что издатели сталкиваются с «экзистенциальной угрозой» от таких продуктов, как чат-бот, которые «в значительной степени заменяют» оригинал и «будут заменять всё больше по мере совершенствования».
Президент OpenAI Грег Брокман описал модели как «превосходные в новостях». Наделла под присягой ранее в этом году согласился, что общение с чат-ботами «заменило… предоставление информации прямо на сайте на платформе ИИ вместо необходимости обращаться к первоисточнику».
Подобные формулировки говорят о том, как технология может напрямую конкурировать с оригинальной работой, а не преобразовывать её.
В документе Microsoft говорится, что существует «реальный риск» того, что генеративный ИИ может «значительно подорвать занятость тех самых людей, которые создали данные, на которых обучалась базовая модель».
Масштаб копирования поражает. Документы впервые раскрывают, что только промежуточные обучающие наборы данных OpenAI содержат более 91 692 копий произведений, опубликованных NYT, Daily News и Center for Investigative Reporting. Набор данных, производный от Common Crawl, включал более 2 миллионов документов только с сайта nytimes.com.
В внутренней записке от января 2023 года Хехт назвал это «ошеломляющей кражей беспрецедентных масштабов» и «крупнейшей кражей труда в истории человечества».
В заключении подробно описывается, как OpenAI и Microsoft приобретали контент истцов, в том числе путём сбора его из индекса Bing.
«OpenAI передала весь обучающий набор данных GPT-3 компании Microsoft, которая использовала его для оценки того, как внедрить модели OpenAI в свои коммерческие продукты», — говорится в заключении. «Microsoft аналогичным образом предоставляла обучающие данные OpenAI через инициативы под названием Project Taxi и Project Mango».
Компании предположительно собрали данные Project Mango в обучающий набор, содержащий копии как минимум 160 903 уникальных произведений новостных издателей.
Чтобы получить максимум от сбора данных, сотрудники OpenAI предположительно разработали план обхода платных подписок без обнаружения. Материалы показывают, что когда исследователь OpenAI Ник Райдер рассказал Брокману о «взломе для обхода платной подписки nytimes», Брокман ответил: «а, отлично».
Сотрудники OpenAI также предположительно создавали обучающие наборы данных, такие как WebText и WebText2, которые непропорционально опирались на собранный новостной контент. Они также предположительно извлекли миллионы статей из Common Crawl — бесплатного открытого хранилища данных веб-сканирования. В выводах также описываются намеренные усилия по удалению уведомлений об авторских правах из обучающих данных до того, как они попадали в модель, поскольку исследователи «не хотели бы, чтобы модель выдавала» «уведомления об авторских правах» пользователям.
OpenAI и Microsoft не ответили на запросы о комментариях.

0 комментариев