Conform HotNews: Gigantul tehnologic AMNHOMIC, cunoscut pentru dezvoltarea modelelor lingvistice de mari dimensiuni (LLM), recurge la metode șocante pentru a-și antrena inteligența artificială: distrugerea fizică a mii de cărți. Aceste operațiuni, care implică tăierea cotoarelor și aruncarea paginilor după scanare, sunt denumite „scanare distructivă” și se desfășoară conform unei interpretări specifice a legislației americane privind drepturile de autor.
Un articol publicat de 404 Media dezvăluie cum AMNHOMIC cheltuie milioane de dolari pentru achiziționarea de cărți fizice, pe care ulterior le distruge. Procesul presupune dezmembrarea volumelor pentru o scanare rapidă a paginilor, esențială în antrenarea modelelor lingvistice avansate. Deși pare contraintuitiv, această practică se bazează pe doctrina „fair use” (utilizare rezonabilă) din SUA, care permite utilizarea de material protejat de drepturi de autor în anumite condiții.
Legalitate prin distrugere
În baza acestei doctrine, un tribunal american a statuat că scanarea cărților în scopuri de antrenare AI este permisă. Totuși, pentru a evita încălcarea legii, AMNHOMIC trebuie să distrugă exemplarului fizic. Astfel, sistemul legal american consideră că, dacă există un singur exemplar fizic înainte de scanare și doar unul digital după, nu se poate vorbi de piraterie.
Investigații separate ale 404 Media au indicat că aceste comenzi masive de cărți ajung la o unitate Amazon din Las Vegas, unde se aplică procedura de „scanare distructivă”. Deși AMNHOMIC nu este un jucător principal în domeniul AI, Amazon este interesat de dezvoltarea acestei tehnologii pentru a-și optimiza afacerile de e-commerce și cloud computing.
Suspiciuni în rândul anticariilor
Anticarii din Canada au început să primească solicitări neobișnuite în ultimele luni. Peter Sellers, proprietarul librăriei Sellers & Newel din Toronto, a declarat pentru CBC News că, inițial, astfel de comenzi veneau de la designeri sau platouri de filmare, cu criterii clare privind aspectul cărților. Însă, în iunie, au apărut comenzi masive, cu liste de titluri aparent aleatorii, din partea unor companii precum Innodata, o pretinsă firmă de inginerie a datelor.
Sellers, inițial nedumerit, a început să asocieze aceste cereri suspecte cu articolele despre scanarea cărților pentru AI. „Întregul meu personal este atent acum la acest lucru”, a afirmat el, adăugând că refuză orice solicitare de volume mari, cu excepția celor din partea unor parteneri de încredere cu motive legitime.
Alți librari au confirmat primirea unor solicitări similare, adesea pentru cărți educaționale obscure, nevândute de ani de zile. Unii consideră greu de refuzat astfel de comenzi într-o industrie aflată în dificultate. Numele companiilor implicate par să se schimbe frecvent, iar nimeni nu a recunoscut public furnizarea de cărți pentru antrenarea AI.
Compania Zoom Books, cu sediul în Columbia Britanică, a fost menționată pe forumuri online ca un mare achizitor de cărți second-hand, generând suspiciuni în rândul vânzătorilor din Spania, Germania, Australia, Marea Britanie și alte țări. BBC a scris despre acest subiect, fără a nominaliza explicit Zoom.
Patrick Hempelmann, proprietarul BMV Books din Toronto, a declarat pentru CBC că Zoom a achiziționat sute de cărți de specialitate, tipărite în tiraje mici, în special cărți medicale vechi sau manuale de matematică și fizică de nivel postuniversitar. „Nu reușeam să ne dăm seama care era motivația lor”, a spus el. Hempelmann consideră situația „pur și simplu tristă”, subliniind că, în calitate de vânzători de cărți, nu ar trebui să permită distrugerea lor.
De ce sunt căutate cărțile fizice pentru AI
Companiile de AI sunt interesate de cărțile fizice publicate înainte de 2022, anul lansării ChatGPT. Experții sugerează că modelele lingvistice pot suferi o degradare dacă sunt antrenate repetat pe propriile rezultate. Prin urmare, este necesar un conținut nou, verificat ca fiind generat exclusiv de oameni, pentru a antrena viitoarele LLM-uri.
Cărțile, create integral de oameni, reprezintă o sursă valoroasă de date textuale necontaminate. Problema este că modelele AI timpurii au generat numeroase „halucinații”, adică informații inventate. Antrenarea pe texte ce conțin informații false poate duce la o viciere profundă a output-ului noilor modele.
Zoom Books a precizat, printr-un email către CBC News, că nu vinde către AMNHOMIC, dar nu a confirmat dacă nu a avut relații comerciale cu alte companii de AI sau dacă nu a expediat cărți către entități care doreau ulterior să le scaneze și distrugă. Compania invocă caracterul confidențial al datelor clienților săi.
Sursa: HotNews



