Законно ли обучать ИИ на книгах, защищенных авторским правом? Это сложный вопрос
Вы наверняка знаете, что языковые модели, лежащие в основе ChatGPT, Gemini, Claude и других чат-ботов, обучаются на огромных базах опубликованных произведений, содержащих сотни миллионов книг, онлайн-статей, научных работ и практически всего, что можно найти в интернете. Большинство авторов, без их ведома и согласия, внесли вклад в разработку тех самых ИИ-инструментов, которые угрожают их средствам к существованию. Это кажется незаконным, не так ли?
Реальность не так проста.
«Я думаю, одна из проблем всей этой области права и технологии в том, что здесь происходит очень много всего, — рассказала TechCrunch Кэти Геллис, адвокат, специализирующийся на интеллектуальной собственности, авторском праве и технологиях. — Это очень сложно, и вокруг происходящего много эмоций, как за, так и против».
В прошлом году в одном из первых подобных решений судья Уильям Алсуп обязал Anthropic выплатить огромное урегулирование в размере 1,5 миллиарда долларов (около 120 миллиардов рублей) группе писателей, чьи произведения использовались для обучения моделей компании. На первый взгляд это казалось моральной победой авторов, но на самом деле судья Алсуп постановил, что обучение ИИ в Anthropic было законным. Штраф был наложен за пиратство книг из нелегальных онлайн-библиотек.
«Как и любой начинающий писатель, языковые модели Anthropic обучались на произведениях не для того, чтобы обогнать и заменить их, а для того, чтобы создать что-то новое», — написал судья, сравнивая поглощение триллионов слов языковой моделью с изучением литературы писателем.
Геллис считает, что это решение более выгодно для ИИ-компаний. Что такое штраф в 1,5 миллиарда долларов для компании, прогнозирующей доход около 200 миллиардов долларов (примерно 16 триллионов рублей) в год к 2028 году?
«Я думаю, это в целом хорошая новость для обучения ИИ, что он посмотрел на происходящее и действительно счел это аналогичным чтению охраняемого авторским правом произведения, а не копированию его, — сказала Геллис. — Закон об авторском праве основан на копировании, но он не основан на использовании, ознакомлении, потреблении или чтении произведения».
Закон об авторском праве не обновлялся с 1976 года, что означает, что судьям приходится выяснять, как интерпретировать руководящие принципы 50-летней давности при рассмотрении юридических вопросов, которые могут определить будущее индустрии ИИ.
«Сейчас все очень обеспокоены, потому что закон непоследователен, и именно из-за этого вопроса, — рассказал TechCrunch Джейсон Хендерсон, старший юрисконсульт и основатель практики интеллектуальной собственности и СМИ в JWL International. — Они знают, что модель ИИ была обучена на огромном количестве данных, а закон еще не успел ответить на этот вопрос».
Эти вопросы часто касаются доктрины добросовестного использования, а именно того, является ли использование охраняемого авторским правом произведения достаточно «преобразующим», чтобы считаться юридически допустимым.
Добросовестное использование — это исключение из закона об авторском праве, которое допускает использование материалов без явного разрешения, защищая возможность комментировать и развивать охраняемые произведения через критику, пародию, образование и другими способами. Судьи учитывают конкретные факторы при принятии решения, включая цель и характер произведения, объем использования и его влияние на рынок.
«Авторское право всегда направлено на защиту и рост рынка, — отметил Хендерсон. — Суды довольно непоследовательны в своих рассуждениях [в делах об ИИ]. Как правило, выигрывает то, что если вы обучаетесь на чужой собственности с целью прямой конкуренции, суды это не одобряют... Если ваши действия не направлены на конкуренцию, суды, как правило, находят способы признать это допустимым».
Хендерсон ссылается на дело, в котором медиа- и технологическая компания Thomson Reuters подала в суд на исследовательскую фирму Ross Intelligence за копирование своего контента для создания конкурирующей ИИ-платформы в области права.
«Использование Ross не является преобразующим, поскольку оно не имеет „дополнительной цели или иного характера“, чем у Thomson Reuters», — написал судья Стефанос Бибас в прошлом году.
В этом деле судья Бибас решил, что обучение на контенте Reuters для создания новой платформы, которая напрямую конкурировала бы с ней, не является добросовестным использованием. Хотя авторы потенциально могут утверждать, что чат-боты конкурируют с ними, используя их произведения для создания новых синтетических книг, этот аргумент пока не победил в суде.
Когда речь заходит о взаимоотношениях ИИ и авторского права, Геллис считает полезным сузить круг обсуждаемого — наше представление об авторском праве в контексте обучения ИИ сильно отличается от того, как мы думаем об авторских правах на контент, созданный ИИ.
В одном деле, Thaler v. Perlmutter, суд постановил, что если произведение создано ИИ на 100%, оно не подлежит защите авторским правом, что открывает новую банку с червями — как мы можем окончательно доказать, было ли произведение создано с помощью ИИ, и если да, то как мы узнаем, какой процент был создан или создан при помощи ИИ?
«Если вы пишете свой роман в [Microsoft] Word и запускаете проверку орфографии, мы вполне комфортно принимаем идею, что Word не владеет вашим романом, — сказала Геллис. — [ИИ] заставляет нас взглянуть на множество решений, которые мы некоторое время игнорировали».
Большинство ИИ-компаний по-прежнему находятся в стадии незавершенных судебных разбирательств по этим вопросам, что означает, что окончательное решение этих проблем появится не скоро.
«Вы видите, что первые залпы влиятельны, и это влияние может быть сведено на нет, если другие суды примут иные решения, и потребуются более поздние стадии судебных разбирательств, чтобы выяснить, какое из них возобладает, — сказала Геллис. — Но тем временем все эти решения формируют все происходящее. Было бы глупо со стороны ИИ-компаний игнорировать их».

0 комментариев