Firmy rozwijające modele językowe coraz częściej kupują hurtowo papierowe książki, skanują je, a potem fizycznie niszczą egzemplarze. To zderzenie prawa, ekonomii danych i ochrony dziedzictwa nabiera tempa.
Papier w epoce modeli językowych
Dla twórców dużych modeli językowych książka przestaje być nośnikiem lektury czy obiektem kolekcjonerskim. Staje się zasobem danych: uporządkowanym, redagowanym, zwykle lepiej „oczyszczonym” z błędów niż przypadkowe treści z internetu. W praktyce oznacza to rosnący popyt na druk — nie z sentymentu, lecz z kalkulacji jakości.
W tle jest jeszcze jeden powód: sieć została w ostatnich latach zalana tekstami generowanymi masowo przez AI, często niskiej jakości. Dla laboratoriów to problem, bo modele uczące się na „AI-owym szumie” mogą powielać błędy i schematy. Starsze publikacje, zwłaszcza sprzed 2022 roku, są postrzegane jako materiał mniej skażony tą „kontaminacją”.
Od skupu do destrukcji egzemplarzy
Mechanizm jest brutalnie prosty: kupuje się duże partie używanych książek, rozdziela je na kartki (czasem przy użyciu przemysłowych urządzeń tnących), skanuje w wysokiej jakości, a następnie pozbywa się fizycznych pozostałości. To nie jest digitalizacja w duchu archiwizacji, tylko produkcyjny proces pozyskania danych treningowych, w którym papierowy egzemplarz bywa jednorazowym „opakowaniem” dla tekstu.
W głośnych sporach prawnych wskazywano, że takie działania mogą opierać się na doktrynie pierwszej sprzedaży: nabywca egzemplarza ma szeroką swobodę dysponowania nim. Kluczowe staje się jednak to, co dzieje się po skanowaniu. Jeśli rezultat jest uznany za „transformacyjny” (czyli zmienia funkcję i charakter wykorzystania), sąd może potraktować to jako dozwolony użytek w ramach „fair use”. To otwiera drzwi do skali przemysłowej.
Pośrednicy i hurtowe zakupy w cieniu
Wraz z normalizacją praktyki wyrósł ekosystem pośredników, którzy pomagają w hurtowych zakupach — od tysięcy do nawet setek tysięcy czy miliona egzemplarzy w jednym zamówieniu. Firmy, które wcześniej obsługiwały biblioteki, dystrybutorów i księgarnie, zaczynają pozycjonować druk jako „najlepsze dane treningowe”, bo jest redakcyjnie spójny i mniej podatny na internetowe zanieczyszczenia.
Istotnym elementem tej infrastruktury jest obietnica dyskrecji. Sprzedawcy słyszą, że „problem wizerunkowy jest realny”, bo nagłówki o niszczeniu milionów książek nie budzą społecznej sympatii. W praktyce anonimowość kupujących utrudnia ocenę skali zjawiska i ogranicza możliwość reakcji autorów, wydawców czy instytucji kultury.
Księgarze między zyskiem a etyką
Dla części małych sprzedawców to nagły, nieoczekiwany boom: z kilkunastu–kilkudziesięciu książek tygodniowo do setek. Charakter zamówień bywa podejrzany — losowy dobór tytułów, nacisk na egzemplarze z numerami ISBN, brak zainteresowania stanem kolekcjonerskim. Sprzedawcy często domyślają się, że to zakupy pod trening modeli, ale zwykle nie mają pewności.
Największy dylemat dotyczy pozycji rzadkich i wyczerpanych. Jeśli w obiegu zostało niewiele egzemplarzy, ich „przemiał” na dane może realnie uszczuplać dostępność kultury w wersji materialnej. Z perspektywy księgarza to konflikt interesów: finansowa ulga i czyszczenie magazynu kontra świadomość, że końcowe użycie jest wątpliwe, a niektóre tytuły mogą znikać bezpowrotnie.
Ryzyko dla dziedzictwa i rynku książki
W Europie pojawiają się sygnały, że hurtowe zakupy dotykają także antykwariatów i sprzedawców rzadkich wydań, m.in. w Niderlandach. Nawet jeśli nie każda duża transakcja oznacza laboratorium AI, sama presja popytu może podbijać ceny i wypychać z rynku biblioteki, badaczy czy kolekcjonerów działających w interesie publicznym.
Długofalowo problemem nie jest wyłącznie to, że książki są skanowane. Chodzi o to, że proces bywa zaprojektowany tak, by fizyczny nośnik stał się odpadem. To odwraca logikę ochrony zasobów: zamiast digitalizować, by zachować, digitalizuje się, by zużyć.
Prawo nadąża, ale nie rozwiązuje napięć
Rozstrzygnięcia oparte na „fair use” i transformacyjności mogą być spójne z literą prawa w określonych jurysdykcjach, ale nie zamykają sporu społecznego. Autorzy i wydawcy widzą w tym eksploatację pracy twórczej bez realnej kontroli i bez proporcjonalnego wynagrodzenia. Z kolei branża AI argumentuje, że potrzebuje wysokiej jakości korpusów, a skanowanie legalnie nabytych egzemplarzy to racjonalna droga.
Wątpliwości budzi też asymetria: prawo może pozwalać na masowe pozyskanie treści, ale nie wymusza standardów przejrzystości ani minimalizacji szkód dla dziedzictwa. Jeśli dodatkowo pośrednicy oferują anonimowość, społeczna kontrola praktycznie zanika.
Co można zrobić bez zatrzymywania innowacji
Najbardziej obiecujące wydają się rozwiązania, które rozdzielają „dostęp do tekstu” od „niszczenia egzemplarzy”. Możliwe są modele licencyjne dla skanowania i treningu, programy współpracy z bibliotekami oraz standardy, które wymagają zachowania części nakładu lub przekazania egzemplarzy do instytucji publicznych po digitalizacji.
Równolegle potrzebna jest większa transparentność łańcucha dostaw danych: skąd pochodzą książki, w jakiej skali są kupowane i co dzieje się z nimi po skanowaniu. Bez tego rynek będzie premiował najtańsze i najmniej widoczne praktyki. A wtedy „czyste” dane treningowe mogą okazać się kosztowne nie dla laboratoriów, lecz dla kultury i dostępu do wiedzy.
Oryginalny tekst: AI Companies Are Buying Antique Books, Ingesting Their Contents to Train Models, and Then Destroying Them at Incredible Scale