Компании, занимающиеся разработкой ИИ, скупают миллионы книг и уничтожают их после использования

Компанії з розвитку ШІ скуповують мільйони книг й знищують їх після використання

Расследование, проведенное 404 Media сообщает, что компании по развитию ИИ скупают миллионы подержанных книг, а затем уничтожают их после использования.


В отчете по итогам расследования указывается, что этим компаниям для развития ИИ требуются огромные объемы данных высокого качества. Однако в интернете в настоящее время распространяется контент, созданный ИИ, который обычно считается мусором. Он загрязняет базу данных и негативно влияет на обучение моделей искусственного интеллекта.

В результате этого ведущие компании по развитию ИИ обратились к печатным источникам, опубликованным до 2022 года, поскольку в них с большей вероятностью будет содержаться высококачественная информация. Существуют прецеденты, когда компании, занимающиеся разработкой ИИ, использовали печатные издания для обучения своих моделей. Например, Anthropic инвестировала миллионы долларов в извлечение информации из огромного количества печатных изданий для создания собственных моделей Claude, а потом уничтожила эти книги.

Компания закупала книги у Better World Books. И хотя решение суда подтвердило, что использование книг для обучения ИИ соответствует определению добросовестного использования в соответствии с законом об авторском праве, Anthropic грозил огромный штраф в размере $1,5 млрд за хранение архива из 7 млн пиратских книг, которые нарушали авторские права авторов и издателей.


Недавно аналогичным образом коалиция издателей подала иск против Google, обвинив технологического гиганта в незаконном использовании миллионов книг, защищенных авторским правом, для разработки собственных моделей Gemini. Сообщается, что онлайн-база данных ISBNdb, содержащая более 111 млн каталогизированных книг, долгое время была популярной платформой для книготорговцев, библиотек и дистрибьюторов.

Однако в связи со стремительным развитием ИИ платформа переориентировалась на предоставление специализированных услуг по оптовой закупке книг для компаний, занимающихся развитием ИИ. По данным 404 Media: объемы заказов варьируются от 1000 до миллиона книг за одну транзакцию.

По словам одного из профессиональных книготорговцев, с апреля этого года наблюдается беспрецедентный рост продаж книг. Ранее этот продавец реализовывал около 20 книг в неделю, однако в течение последних месяцев еженедельные продажи выросли до нескольких сотен книг и в 5 раз превысили традиционные объемы. Другие книготорговцы на таких платформах, как Alibris и Biblio, сообщили об аналогичном росте продаж.

Хотя на данный момент нет конкретных доказательств того, что ISBNdb или какая-либо другая компания, занимающаяся разработкой ИИ, осуществляет подобные оптовые закупки, существует ряд тревожных признаков. В частности, крупные заказы включали только книги с международным стандартным книжным номером (ISBN) — уникальным 13-значным кодом, который используется во всем мире для идентификации книг. При этом не было выявлено никаких закономерностей в отношении тематики, жанра или автора. Кроме того, создавалось впечатление, что покупатели игнорировали цены на книги и скупали их по любой цене, даже по завышенным ценам.

Спецпроекты

В ходе судебного разбирательства с участием Anthropic Том Харви, который ранее участвовал в создании Google Books, а затем возглавил проект оцифровки Anthropic под названием “Проект Панама”, подтвердил, что Anthropic нанимала несколько сторонних компаний, занимающихся сканированием документов.

Одной из этих компаний была Datamation Information Services, которая предлагает услуги по сканированию книг в больших объемах как неразрушающим, так и разрушающим методом. Первый метод использует различные инструменты, в частности, безконтактные сканеры, планшетные сканеры и V-образные системы сканирования. Второй метод предполагал разбор книг на отдельные страницы и их подачу в промышленный высокоскоростной сканер. Ожидаемо, что компании, занимающиеся разработкой ИИ, отдают предпочтение второму методу, поскольку он более эффективен и дешев. Это приводит к уничтожению миллионов книг.

Очевидно, что печатные издания служат богатым источником информации для ИИ. Однако у многих возникает вопрос об этичности изъятия большого количества книг, поскольку непонятно, отфильтровывают ли компании, занимающиеся разработкой ИИ, редкие или снятые с печати книги от широко распространенных изданий в процессе оцифровки. Другая важная проблема заключается в том, что отсканированные книги попадают непосредственно в частную базу данных для обучения ИИ, к которой широкая общественность не имеет доступа. Это позволит в конечном итоге добиться более разумного ИИ, однако может лишить будущие поколения людей важной информации.

Источник: 404 Media; Tom’s Hardware

Источник материала
loader
loader