Гильотина для библиотеки: зачем AI-лаборатории уничтожают редкие книги
AI-компании скупают антикварные книги палетами, срезают корешки, сканируют и пускают в шредер. Разбираем, почему бумага стала последним чистым источником данных.

Представьте склад, куда каждый день приходят палеты с подержанными книгами — от дешёвых покетбуков до изданий XIX века. Гидравлический резак срезает корешки, промышленный сканер прогоняет страницы, а дальше бумага отправляется в шредер. Это не антиутопия, а рабочий конвейер индустрии ИИ в 2026 году. Расследование 404 Media, разошедшееся по сети за выходные, показало масштаб: счёт идёт на миллионы томов, и среди них попадаются книги, которых почти не осталось в мире.
Почему именно бумага
Ответ прячется в самой неприятной проблеме индустрии — загрязнении данных. Интернет, основной источник обучающих корпусов, стремительно наполняется текстами, которые сами написаны нейросетями. Обучать модель на выхлопе других моделей — прямой путь к деградации качества, и лаборатории это прекрасно понимают.
Бумажная книга, изданная до эпохи ChatGPT, таких рисков лишена по определению. Компания ISBNdb, владеющая «крупнейшей в мире базой данных книг», формулирует это без стеснения в своих маркетинговых материалах: печатные книги до-LLM эры «структурно гарантированно свободны от этого загрязнения», а издания до 2022 года «структурно чисты от современных инструментов отравления данных». Лучшие обучающие данные мира, по версии ISBNdb, «стоят на полке».
Когда-то ISBNdb помогала библиотекам и книжным магазинам находить и продавать книги. Теперь, по данным 404 Media, она обслуживает оптовые заказы AI-компаний — от тысячи до миллиона книг за раз. И обещает клиентам анонимность: покупатели прячутся за посредниками и NDA. Сама ISBNdb понимает, как это выглядит со стороны, и пишет об этом с обезоруживающей прямотой: «Проблема с оптикой реальна. "AI-компания уничтожила два миллиона книг" — не тот заголовок, который вызывает сочувствие».
Как это устроено юридически
У конвейера уничтожения книг есть прочный правовой фундамент, и заложила его судебная история Anthropic. В рамках проекта, известного по судебным документам как Project Panama, компания потратила десятки миллионов долларов на скупку и сканирование физических книг для обучения Claude: гидравлический резак отделял страницы, промышленные сканеры оцифровывали их, оригиналы уничтожались.
Судья Уильям Алсуп постановил: купить книгу, отсканировать её, уничтожить бумажную копию и оставить только цифровую версию для обучения ИИ — это добросовестное использование. Логика опирается на доктрину первой продажи: с законно купленным экземпляром владелец волен делать что угодно, а поскольку цифровая копия «заменила» физическую и никогда не распространялась как замена книги, использование признали трансформативным. Отдельная история с пиратскими цифровыми копиями закончилась для Anthropic хуже — соглашением на $1,5 млрд за примерно 500 тысяч произведений. Но сами обученные модели остались нетронутыми, а главное — легальный рецепт теперь известен всем: покупай физическую книгу, и никакой правообладатель тебе не указ.
Кто попадает под нож
Пока речь шла о тиражных изданиях, история выглядела как курьёз. Проблема в том, что оптовые закупки не разбирают, что именно попадает в палету. Один мелкий букинист рассказал 404 Media, что в апреле его продажи внезапно выросли с двадцати книг в неделю до сотен — и он почти уверен, что покупатели связаны с AI-лабораториями: заказы хаотичны по тематике, все книги с ISBN, а цена покупателя не волнует вовсе. Его склад полон редких и давно не переиздававшихся книг, а значит, под сканер могут уходить одни из последних сохранившихся экземпляров.
«У меня смешанные чувства, — признался он. — Финансово мне это выгодно, склад очищается от того, что иначе не продалось бы. Но мне не нравится конечное применение, и не нравится, что редкие книги идут в макулатуру».
Похожие сигналы приходят из Европы: голландские торговцы антикварными книгами жалуются на вал оптовых закупок, за которыми, по их подозрениям, стоят технологические компании. Доказать это почти невозможно — анонимность, обещанная посредниками, работает.
Есть ли другой путь
Есть, и он даже показан на практике. Гарвард в партнёрстве с Google и Microsoft выложил в открытый доступ почти миллион оцифрованных книг из общественного достояния на 254 языках — без единой уничтоженной страницы: библиотечная оцифровка не требует резать корешки. Разница в том, что библиотечный путь медленный и упирается в авторские права на всё, что моложе ста лет. Конвейер с гильотиной решает проблему копирайта грубой силой чековой книжки — и потому побеждает.
В сухом остатке индустрия пришла к парадоксу. Компании, продающие будущее знаний, физически уничтожают его прошлое — не со зла, а потому что так дешевле и юридически чище. На Reddit тред об этом собрал почти две тысячи апвоутов, и главный аргумент критиков звучит так: оцифрованная копия не идёт в открытый доступ, она ложится в закрытый корпоративный датасет. Книга, которой почти не осталось в мире, продолжает существовать — но теперь только как веса в чьей-то модели.


