Покупали книги, сканировали, а потом уничтожали: как Anthropic обучала Claude

Поделиться
Покупали книги, сканировали, а потом уничтожали: как Anthropic обучала Claude Фотография приведена в качестве иллюстрации.
Компания создала Project Panama, чтобы получить большие массивы качественных текстовых данных.

Компания Anthropic использовала так называемое «разрушающее сканирование» книг для получения данных, необходимых для обучения большой языковой модели Claude. Разработчик приобретал печатные издания, сканировал их, а затем уничтожал бумажные оригиналы. Эта практика стала известна благодаря судебному делу Bartz v. Anthropic PBC, в котором суд признал обучение ИИ на произведениях, защищенных авторским правом, допустимым, сообщает The Guardian.

Проект Anthropic по оцифровке книг имел кодовое название Project Panama. Внутренняя служебная записка, ставшая доказательством по делу Bartz v. Anthropic PBC, описывала его как «попытку провести разрушительное сканирование всех книг в мире», а также содержала призыв не разглашать информацию о проекте.

«Разрушительное сканирование» было способом получить большие массивы качественных текстов для обучения Claude. Компании нужны были прежде всего тексты, созданные до 2022 года, когда генеративный искусственный интеллект ещё не начал массово влиять на современные текстовые данные. Согласно материалам судебного дела, компания рассчитывала, что «тщательно подобранные факты, структурированный анализ и увлекательные художественные сюжеты» помогут Claude писать точнее и убедительнее.

Перед Anthropic стоял вопрос о способе получения таких данных. Компания могла договориться о лицензировании электронных книг с правообладателями, но это, по словам соучредителя и генерального директора Anthropic, предполагало «значительные юридические, операционные и коммерческие сложности».

Сначала компания использовала пиратские источники книг, однако впоследствии этот подход привел к судебному спору и внесудебному соглашению с авторами на сумму 1,5 миллиарда долларов. После этого Anthropic, согласно материалам дела, утратила интерес к использованию пиратских книг по юридическим соображениям.

Тогда компания обратилась к печатным книгам: закупала издания у поставщиков, нанимала персонал и размещала издания на складах, а для оцифровки привлекла специального подрядчика. В ходе этого процесса с книг снимали переплёты, обрезали страницы до нужного размера и сканировали их, преобразуя в цифровые файлы, после чего бумажные экземпляры утилизировали.

В США доктрина «добросовестного использования» (Fair use) допускает определённое трансформационное использование произведений, защищённых авторским правом, без разрешения правообладателя. В случае с Anthropic компания утверждала, что сканирование печатных книг с последующим уничтожением оригиналов создает новую цифровую форму использования текста.

Для реализации проекта компания фактически построила отдельный логистический процесс. В материалах дела есть фотографии складов с пронумерованными книгами и работниками, которые готовили их к сканированию, тогда как сам процесс последующего измельчения и утилизации книг остался за кадром.

Автор материала в Guardian Кэтрин Джеймс обращает внимание и на более широкий культурный аспект этой практики. Книга является не только носителем текста, но и культурным объектом, однако в США существует лишь несколько норм, определяющих правила обращения с книгами как частью культурного наследия. Если рассматривать 2022 год как момент, когда созданные ИИ тексты начали существенно проникать в общий массив текстовых данных, возникает вопрос: не стоит ли отдельно защищать тексты, созданные людьми?

В деле Bartz v. Anthropic PBC «разрушительное сканирование» предстает как способ устранить физический носитель текста после его оцифровки и использовать полученную информацию для совершенствования искусственного интеллекта. В материале Guardian автор задает вопрос о том, что произойдет, если такую практику начнут широко использовать другие компании, разрабатывающие генеративный ИИ.

В прошлом месяце группа крупных издательств, писатель Скотт Туроу и организация S.C.R.I.B.E. подали коллективный иск против компании Google из-за незаконного использования защищенных книг для обучения моделей Gemini. Истцы утверждают, что компания без согласия скопировала материалы с сервисов Google Books и Google Play и намеренно удаляла данные об авторских правах, чтобы скрыть нарушение. Этот процесс пополнил серию масштабных судебных споров между правообладателями и технологическими гигантами относительно границ добросовестного использования контента при разработке ИИ.

Поделиться
Заметили ошибку?

Пожалуйста, выделите ее мышкой и нажмите Ctrl+Enter или Отправить ошибку

Добавить комментарий
Всего комментариев: 0
Текст содержит недопустимые символы
Осталось символов: 2000
Пожалуйста выберите один или несколько пунктов (до 3 шт.) которые по Вашему мнению определяет этот комментарий.
Пожалуйста выберите один или больше пунктов
Нецензурная лексика, ругань Флуд Нарушение действующего законодательства Украины Оскорбление участников дискуссии Реклама Разжигание розни Признаки троллинга и провокации Другая причина Отмена Отправить жалобу ОК
Оставайтесь в курсе последних событий!
Подписывайтесь на наш канал в Telegram
Следить в Телеграмме