Рядка книга, изпратена като част от необичайна поръчка от 1000 заглавия е снабдена с Apple AirTag и проследяването ѝ завършва в склад на Amazon в Лас Вегас, където се разрязват и сканират, твърди разследване на 404 Media. Този процес реално ги унищожава, а разкритието отваря отново големия въпрос каква е цената на данните, с които се обучава изкуственият интелект.
Историята започва през юли, когато журналисти от 404 Media поставят проследяващо устройство в рядка книга от пратка с около 1000 заглавия. Поръчката е направена чрез Biblio – онлайн пазар за книги, а подобни необичайно големи покупки стават все по-често срещани на фона на нарастващото търсене на книги за обучение на AI модели.
AirTag-ът проследява книгата до Лас Вегас и в крайна сметка до обект на Amazon, обозначен като VGT3. Според разследването там служители получават големи пратки с печатни книги, отрязват гръбчетата им и подават страниците към скенер. Така физическата книга се превръща в дигитален набор от данни, но самият екземпляр вече не може да бъде прочетен или съхранен като книга. В последващо разследване, публикувано на 26 август, 404 Media разговаря с анонимен бивш служител на VGT3. По думите му основната работа на обекта е именно обработването на книги за сканиране.

Тук се появява и въпросът: Защо някой би купил хиляди книги, за да ги разреже? Отговорът е в качеството на данните. Големите езикови модели се нуждаят от огромни количества текст, а публикуваните книги представляват особено ценен материал. Те съдържат редактиран, структуриран и сравнително качествен език, който трудно се намира в същата концентрация в свободното съдържание в интернет. Затова през последните години започнаха да се появяват необичайни поръчки към независими книжарници.
Книжарите все по-често разказват за заявки за стотици или хиляди заглавия, без особен интерес към конкретния подбор. В една пратка може да има специализирана нехудожествена литература, следвана от напълно несвързано заглавие. Общото между книгите е, че могат да бъдат идентифицирани и дигитализирани.
В случая с VGT3 служителите според 404 Media сканират ISBN кодовете на книгите. Това подсказва, че процесът може да е организиран около конкретни списъци със заглавия, а не просто около произволно събиране на книги.
Когато Google започна проекта Google Books преди повече от две десетилетия, целта също беше огромни количества книги да бъдат превърнати в дигитални файлове. Но технологията беше съобразена с това физическите книги да бъдат запазени. За целта специализирани скенери позволяваха страниците да бъдат заснемани, без да се разрушава подвързията. При разрушителното сканиране логиката е различна: физическата книга е само средство за достигане до информацията в нея.
През 2026 г. вече знаем, че подобна практика не е само хипотеза. Съдебни документи по делото срещу Anthropic разкриха Project Panama – вътрешна инициатива, чиято заявена цел е била сканиране на огромен брой книги. Според публикуваните документи компанията е похарчила десетки милиони долари за придобиването и физическото разрязване на милиони книги, чиито страници след това са били сканирани за използване в AI модели.
Случаят завърши с историческо споразумение. През юли федерален съд в САЩ одобри окончателно споразумение за 1,5 млрд. долара между Anthropic и група автори, което е най-голямото известно споразумение по дело за авторски права в САЩ.
Важно е обаче да се прави разлика: съдът прие, че самото обучение на AI върху защитени с авторски права книги може да представлява допустимо използване в конкретния казус. Проблемът, за който Anthropic беше изправена пред отделна отговорност, беше придобиването и съхраняването на милиони пиратски книги.
Другият голям казус е Meta. Съдебни документи по делото Kadrey v. Meta показаха, че компанията е използвала книги от т.нар. shadow libraries за обучението на своите модели. В материалите се посочват огромни количества пиратско съдържание, включително книги, разпространявани чрез торент системи. През 2025 г. съдията се произнесе в полза на Meta по основното твърдение за нарушаване на авторски права чрез обучението на моделите. Решението обаче беше конкретно за представените доказателства по този случай и не реши окончателно глобалния въпрос дали AI компаниите могат свободно да използват защитени книги за обучение.
Прочети още:
Адв. Диана Попова: Споразумението на Anthropic за $1,5 млрд. отправя послание
Anthropic ще плати рекордните $1,5 млрд. за теглене на пиратски книги за обучението на Claude
Писатели съдят компания за изкуствен интелект заради авторски права
Издатели осъждат използване на Meta и пиратство в обучението на изкуствен интелект
Meta обсъждала купуване на „Simon & Schuster“ за обучение на изкуствен интелект
Американски издатели съдят Google заради Gemini
Харуки Мураками: Изкуственият интелект не може да пише романи като човека


