31 августа 2026 г.
Мировые новости

Проект «Панама»: как ИИ уничтожает старинные книги в процессе оцифровки

11 августа 2026 г.Валерий Градов9 мин

В конце апреля книготорговца Марсаля Фонта из старинного книжного магазина «Феникс» в испанской Бадалоне удивил необычный заказ. Он, будучи опытным букинистом и профессором литературы, повидал множество странных покупок, но этот случай был особенным. Заказ поступил от канадской компании, что само по себе не было редкостью, ведь магазин отправлял книги по всему миру. Однако «паттерн покупки был необычным».

Когда в начале мая поступила новая серия заказов, Фонт, опасаясь мошенничества, решил провести расследование. «Нечасто мы ищем тех, кто у нас покупает, но в этом случае мы начали проверять, главным образом, потому что заказы поступали в течение часа или 40 минут. У нас было три или четыре письма с просьбой о разном количестве книг. А связанные с этим расходы на доставку были заоблачными», — рассказал Фонт.

Он обратился к своему другу Ксавьеру Винайше, исследователю искусственного интеллекта и техническому директору компании Sorensen.ai. Винайша вспоминает: «Он позвонил мне и сказал: „Слушай, мне тут приходят заказы со странными паттернами, один и тот же клиент, доставка за границу, и они платят тройную стоимость доставки“. И первое, что он подумал, это что это не мошенничество».

«Именно тогда мы начали тянуть за ниточку и нашли других людей, с такими же опасениями, как у Марсаля, в Германии, Новой Зеландии… И тогда нам стало совершенно ясно», — добавил Винайша.

(Фото: Getty Images)

Поиск в интернете по запросам «старинные книги» и «искусственный интеллект» быстро выявляет эти «опасения». В статье британской газеты The Telegraph под заголовком «Культурное варварство: как компании ИИ уничтожают книги мира» букинист из Харлема, Нидерланды, рассказал о своем удивлении, получив массовый заказ: «В торговле старинными книгами очень редко кто-то хочет купить больше одной книги. Так что, если кто-то приходит и говорит: „Я хочу пару сотен ваших книг“, это очень странно».

Газета The Guardian процитировала владелицу книжного магазина из австралийской Виктории, которая получила заказ от той же компании, что и Марсаль Фонт: «Они сделали заказ, оплатили его заранее и не возражали против стоимости доставки».

Обе эти статьи, а также те, что рассказывали историю каталонского книготорговца, ссылаются на журналистское расследование, которое раскрыло то, что стало известно как «Проект Панама».

ИИ постоянно нуждается в новой информации для обучения. (Фото: Getty Images)

Уничтожение и обучение

В сентябре 2025 года компания Anthropic, специализирующаяся на искусственном интеллекте, согласилась выплатить 1,5 миллиарда долларов для урегулирования коллективного иска. Авторы произведений утверждали, что компания использовала их работы без разрешения для обучения своих моделей ИИ.

Четыре месяца спустя газета Washington Post эксклюзивно опубликовала документ, который был частью судебного процесса. В нем упоминалось о существовании плана по оцифровке всех письменных произведений человечества. «Проект „Панама“ — это наша попытка деструктивно сканировать все книги в мире», — гласил просочившийся текст, который далее уточнял: «Мы не хотим, чтобы стало известно, что мы работаем над этим».

Максимилиано Фиртман, аргентинский профессор и автор книг по программированию и искусственному интеллекту, был одним из авторов, подавших в суд на Anthropic. Как он рассказал, судья постановил, что если компания купила экземпляр книги, она может использовать его для обучения ИИ. «И тут стали появляться свидетельства книготорговцев по всему миру, которые получали заказы на книги, которые никто не трогал, и некоторых компаний, которые занимаются сканированием этих книг и предоставлением отсканированного текста компаниям искусственного интеллекта. Так появилась тема уничтожения книг».

Родриго Альварес, аргентинский журналист, специализирующийся на технологиях, объясняет, что существует два метода оцифровки книг. Один из них не предполагает уничтожения экземпляра, используя плоские сканеры или V-образные устройства, которые сканируют страницы, не нарушая переплета.

«Процедура „деструктивного“ сканирования, по сути, начинается с обрезки корешка, чтобы листы стали отдельными; уже разделенные страницы затем подаются в высокоскоростные промышленные сканеры, которые сканируют их гораздо быстрее, автоматически», — объясняет Альварес. После оцифровки страниц книгу невозможно собрать заново, и ее остатки обычно отправляются на переработку.

«Компании выбирают вторую альтернативу из соображений масштаба: она позволяет оцифровать миллионы экземпляров быстрее и с меньшими затратами. В документированном случае Anthropic для „Проекта Панама“ использовалась именно эта процедура», — заключает Альварес.

Для книготорговца Фонта все передачи знаний с одной платформы на другую ценны, хотя и приводят к потере данных и информации. (Фото: Getty Images)

Обучение ИИ

Оцифровка книг позволяет сохранить тексты, написанные на протяжении всей истории человечества, но основная цель, по-видимому, больше связана с обучением искусственного интеллекта, нежели с духом сохранения.

«Когда мы говорим об ИИ, обычно подразумевается, что речь идет о LLM (Large Language Model), большой языковой модели», — уточняет Ксавьер Винайша. LLM, такие как, например, ChatGPT, — это программы искусственного интеллекта, которые учатся понимать, обобщать, переводить и генерировать текст или другой контент, предсказывая следующее слово или фрагмент.

«Все мы используем предиктивный набор текста на наших телефонах. Вы говорите „привет, я приду…“ и он, возможно, предлагает слово „позже“. Как работает этот предиктивный ввод? На основе статистики предыдущих текстов, которые вы писали. То же самое, но возведенное в миллионную степень, — это LLM», — поясняет Максимилиано Фиртман.

Для обучения этих больших языковых моделей сложному искусству нахождения связей между словами их сначала «кормили» всей информацией, которая была в интернете — Википедией, блогами, форумами. Когда этот ресурс начал иссякать, их стали обучать на газетных статьях и даже на субтитрах к видеороликам YouTube.

«Все, что было под рукой, отдавали этой машине, которая поглощает тексты, и когда это закончилось, они начали искать печатные книги, которые уже были оцифрованы, затем в библиотеках, а теперь начали искать редкие, некоммерческие книги. И где они находятся? В букинистических магазинах и у антикваров», — добавляет Фиртман.

«В случае с Марсалем, — говорит Ксавьер Винайша, — он рассказывал мне о заказах, которые к нему поступали, например, на историю каталонских колбас — вещей, которые, скорее всего, еще не использовались для обучения».

(Фото: Getty Images)

Данные без контекста — это не данные

Уничтожение книг, отсканированных для обучения ИИ, вызвало вопросы и сомнения в различных кругах.

Мигель Анхель Ортега, президент Испанской профессиональной ассоциации старинной книги и коллекционирования, считает, что необходимо различать массовые тиражи и ограниченные издания. «Как торговцы, которые сохраняют наследие и выполняют работу по консервации, мы считаем, что конечное использование произведения, очень ограниченного, редкого или уникального издания, логично, не должно быть уничтожением».

С этим согласен Родриго Альварес, журналист, специализирующийся на технологиях. По его мнению, наибольший риск заключается в том, что «беспорядочные покупки уничтожают редкие или вышедшие из печати экземпляры без предварительной проверки, сколько таких экземпляров осталось на складах дистрибьюторов и книжных магазинов, или даже у частных лиц».

Однако Марсаля Фонта разрушение книг беспокоит не так сильно: «Я совсем не романтик в этом смысле». Он поясняет, что «никто не уничтожает больше книг, чем старый книготорговец, потому что мы покупаем целые библиотеки, спасаем все, что можно спасти, но многое не спасается». Фонт считает, что если книга имеет обязательный экземпляр (что обеспечивает сохранение как минимум 5 или 10 копий), то «уничтожение одного экземпляра, чтобы вся эта информация перешла в новый формат знаний, кажется мне даже правильным».

Его беспокойство заключается в том, что оцифровка всего материала, произведенного человечеством, может обойти вниманием то, что не имеет ISBN (Международный стандартный книжный номер). «Все мировое политическое диссидентство, борьба ЛГБТКИ+, все фэнзины бунтарей, контркультура, все андерграундное было создано без ISBN», — отмечает он и предупреждает, что этот материал может быть потерян для будущих поколений, если его не оцифровать.

По этой причине как Альварес, так и Фонт подчеркивают, что нельзя путать оцифровку с сохранением. «Оцифровка книги — это не то же самое, что сохранение книги; как правило, этот цифровой файл остается в частной базе данных, недоступной для читателей, библиотек и исследователей», — предупреждает Альварес.

Букинистические магазины и антиквариаты стали новым пристанищем для поиска «пищи» для ИИ. (Фото: Getty Images)

Технологический журналист добавляет, что при такой экстремальной оцифровке также могут быть потеряны характеристики, выходящие за рамки текста, такие как переплет, аннотации, иллюстрации, качество печати, происхождение и другие особенности. Для Фонта отсутствие этих «метаданных» скрывает фундаментальные ключи для правильной интерпретации текста, из-за чего данные, производимые даже для самой индустрии ИИ, по его мнению, являются неполноценными.

«Переход знаний из формата книги в новые форматы кажется мне очень позитивным; в XV и XVI веках уже происходил аналогичный процесс с книгами недавно появившейся типографии, и тогда также терялось качество данных при переходе из одного формата в другой. Как это было решено? С помощью метаданных». Он приводит пример, когда собиралась информация, высеченная на камнях, для переноса ее на бумагу: «Недостаточно было просто переписать текст, который был на камне, нужно было даже нарисовать камень, рассказать о его материалах, его местонахождении, все эти метаданные — это то, что позволяет нам теперь восстановить, что на самом деле говорила эта надпись».

Президент Испанской профессиональной ассоциации старинной книги и коллекционирования объясняет, что даже две книги с одним и тем же текстом могут иметь совершенно разную культурную ценность. «Они могут содержать одну и ту же информацию, но у одной есть экслибрис (небольшая декоративная этикетка, наклеиваемая на внутреннюю сторону обложки для указания владельца), ручной переплет или аннотации, которые не могут быть перенесены в цифровой формат, как это происходит с форматом электронной книги».

Краткое содержание краткого содержания краткого содержания…

Чтобы избежать деструктивной оцифровки, которая уничтожает книги и оставляет без внимания ключевую информацию, Фонт и Винайша предлагают отказаться от посредников. «Предлагаемое нами решение — это сканировать наше собственное наследие на нашем языке, мы его храним и лицензируем данные; если вам нужны данные, я вам их предоставлю наилучшим образом, а книгу я сохраню, потому что для исследователей важно также, как выглядит обложка книги, как она была сшита, а не только содержание», — говорит Винайша.

Технический директор компании Sorensen.ai добавляет, что спрос на данные будет продолжаться до тех пор, пока нечем будет «кормить» искусственный интеллект. «Мы думали, что ИИ станет „маленьким“, когда не будет больше вычислительных мощностей. Но нет, ограничение — это данные, ИИ стал „маленьким“, потому что больше нет данных».

По мнению Фиртмана, мы пока не знаем, что произойдет, когда закончится информация, созданная человеком: «Следующим шагом будут синтетические данные, тексты, написанные самим ИИ. Самый большой риск через несколько десятилетий заключается в том, что, когда мы будем спрашивать обо всем у ИИ, не обращаясь к источникам, этот ИИ начнет деградировать, потому что он тренируется на той же информации, которую сам и сгенерировал».

Мигель Анхель Ортега предупреждает о возможном уничтожении уникальных или редких экземпляров. (Фото: Предоставлено Мигелем Анхелем Ортегой)

Журналист Родриго Альварес иллюстрирует эту деградацию образом змеи, поедающей свой собственный хвост: «Компании будут кормить свои модели контентом, сгенерированным другими искусственными интеллектами, и в этом случае ошибки могут множиться, язык становиться все более примитивным, как краткое изложение краткого изложения краткого изложения, все более простое, синтез синтеза, который все больше отдаляется от исходной информации».

Тем временем в книжном магазине «Феникс» Марсаля Фонта ситуация изменилась после «странных» покупок в апреле и мае. «Они меняли логистику и компании. Также они начали просить нас отправлять книги не только в Северную Америку, но и в Германию». И после месяца без новостей Фонт получил новый заказ, как раз на этой неделе, что, по его мнению, может означать только одно: «Проект „Панама“ продолжается».