В последние несколько дней в социальных сетях появилось много видео о том, что AI-гиганты уничтожают книги миллионами. Они похожи на моральную панику, поэтому нужно понять, что происходит, уничтожаются ли книги и почему мы узнаём обо всём этом только сейчас.
Данил Степанов рассказывает, что эта история значит для будущего ИИ, печати и юриспруденции.
Что случилось
Всё началось с материала от 21 июля англоязычного медиа 404, в котором говорилось о значительном скачке спроса на старые бумажные книги со стороны ИИ-гигантов из-за отсутствия в них нейрослопа. Хотя 404 и известны критическим взглядом на искусственный интеллект, к фактологической составляющей их работы вопросов никогда не было, а само негативное отношение открыто декларируется на протяжении всей недолгой истории работы издания. Проблема действительно есть, и внимание на неё обращали раньше.
Спрос на бумажные книги от бигтеха стал понятен общественности после того, как недавно завершился суд первой инстанции (дело Bartz v. Anthropic) по поводу обучения моделей от Anthropic. Компания, основным продуктом которой является Claude, достигла договорённости с авторами и правообладателями на полтора миллиарда долларов — это самое крупное правовое соглашение в истории ИИ. Дело в том, что для обучения моделей были скачаны и систематизированы около семи миллионов книг с пиратских сайтов, таких как LibGen.
В суде обсуждалось два основных вопроса. Во-первых, использование текстов для обучения моделей без согласия авторов и правообладателей. Во-вторых, способ получения книг, то есть пиратское скачивание. Первое было признано fair use — это правовая концепция, которая классифицирует действие как законное, но делает это не нормативно, а прецедентно, то есть просто по решению суда. А вот способ получения книг оказался действительно нелегальным, и создатели Claude заплатят именно за него. Это не штраф, а выплаты правообладателям по соглашению сторон.
Уничтожение книг
В январе этого года гриф секретности с материалов дела на четыре тысячи страниц был снят, и с ним, наконец, смогли полноценно ознакомиться журналисты. The Washington Post подробно изучили документы и особенное внимание уделили тому, что в документах Anthropic называлось Project Panama. Именно он и касается бумажных книг.
Проект ИИ-гиганта запустился в 2024 году и не был предназначен для утечки в публичное поле, в документах прямо говорилось: «Мы не хотим, чтобы кто-то об этом узнал». После прихода в компанию Тома Тёрви, ранее отвечавшего за партнёрство с правообладателями в Google Books, Anthropic начали массово скупать бумажные книги для так называемого destructive scanning. Это метод оцифровки бумажных книг, когда с них срезаются переплёты, а затем сверхбыстрый промышленный сканер очень быстро сканирует все страницы. Книга теряет физическую целостность, бумага перерабатывается, остаётся только оцифрованная версия — это тоже оказалось важным для суда.
С точки зрения суда первой инстанции оцифровка одной физической копии книги с последующим её уничтожением и без дальнейшего распространения также оказалась fair use, поскольку один экземпляр заменён на один экземпляр, одно-однозначное соответствие суд посчитал правом покупателя использовать товар законным образом. Как пишут WP, таким образом могло быть уничтожено от 500 000 до 2 000 000 экземпляров бумажных книг.
Реакция
Какие именно книги были уничтожены — не уточняется. Не уточняется даже язык оригинала, вполне может быть, что это была не только англоязычная литература. Однако никаких доказательств того, что была уничтожена хотя бы одна уникальная книга, нет. Более того, нет свидетельств о том, что уничтожению подверглась хотя бы одна антикварная книга.
Несмотря на это, общественность, особенно критически настроенная, реагирует очень резко. В Futurism вышла статья с громким заголовком «AI Companies Are Buying Antique Books, Ingesting Their Contents to Train Models, and Then Destroying Them at Incredible Scale». Это не соответствует действительности, но много людей в интернете воспринимают ситуацию именно так.
TikTok и другие социальные сети с короткими видеороликам пестрят постами о том, что «ИИ-гиганты уничтожают книги», а комментаторы регулярно проводят параллели с антиутопиями Оруэлла и романом Рэя Брэдбери «451 градус по Фаренгейту».
Особенно ярко ситуация выглядит на фоне позиционирования Anthropic на рынке. С самого начала компания заявляла о себе как о самом этичном участнике ИИ-гонки. Более того, основатели организации отделились от OpenAI именно из соображений безопасности, а сама организация имеет статус public benefit corporation. На деле оказалось, что «ИИ-компания с душой» мало чем отличается от конкурентов и также идёт вразрез с культурными ценностями большинства населения земли — книги ценят все.

Дарио Амодей, СЕО и сооснователь Anthropic
Почему речь о многих компаниях
Пока нет прямых доказательств того, что другие компании также занимались скупкой книг с их последующим уничтожением. Тем не менее, 404 нашли довольно интересную деталь. Крупнейший американский поставщик книжных данных ISBNdb публично предлагает ИИ-гигантам услуги по закупке и передаче физических книг. Преимущество даже прямо задекларировано: в книгах до 2022 года отсутствует текст, сгенерированный LLM. Это автоматически означает, что ИИ не будет обучаться на самой себе и избежит так называемого model collapse — ситуации, когда нейросеть попадает в замкнутый круг и воспроизводит собственные паттерны.
В англоязычном мире уже стали появляться крупные закупки научных монографий, которые десятилетиями пылились на библиотечных полках, или специфических краеведческих работ, о которых никто даже не знал. Такие тексты обладают важнейшим свойством, которое ищут ИИ-гиганты — уникальностью языка, региональными особенностями или отсутствием вхождения в языковой корпус. Всё это нужно для того, чтобы снова и снова обучать модели, совершенствуя их даже на доли процентов.

Заметка ISBNdb после публикации 404: компания утверждает, что это прощупывание рынка, страница с предложением удалена
Что это значит для будущего?
Если Anthropic сумели договориться с авторами и правообладателями после того, как спиратили миллионы книг, то смогут и другие. Учитывая небывалый хайп вокруг ИИ, ажиотаж среди инвесторов и менеджеров, почти любая проблема, теоретически решаемая деньгами, именно деньгами решаться и будет. Полтора миллиарда долларов — неприятная, но не критичная сумма для компании, которая стоит двести и дорожает с каждым днём.
Создатели Claude поучаствовали в формировании прецедента, пусть и в суде первой инстанции, для своих конкурентов. Теперь у OpenAI, Google или Meta будет значительно меньше опасений по поводу юридических последствий в виде ограничения деятельности или прямого влияния на выпускаемые продукты — нужно будет просто платить.
Сам ИИ на этом фоне будет развиваться только с большей силой, параллельно поднимая статистику утилизации макулатуры. Остаётся только проблема с не самыми популярными книгами — государство разрешило one to one replace, а это значит, что высока вероятность перехода множества относительно редких книг в уникальную цифровую собственность частных компаний. Как это повлияет на издательства и печать в принципе — остаётся только гадать.
Читайте также:
Искусственный интеллект теперь везде или нам просто кажется?
Сексуализированные фейки и реальное насилие: как ИИ стал новым этапом гендерного неравенства?