28/09/26 · 09:59

VIDEO Je li točna tvrdnja da AI postaje sve gluplji? Pročitajte što kaže znanost

Profesor Dubravko Ćulibrk sve je pojasnio

VIDEO Je li točna tvrdnja da AI postaje sve gluplji? Pročitajte što kaže znanost
Foto: AI generated
Piše A. A.
PODIJELI Facebook X (Twitter) WhatsApp

Tvrdnja da 'umjetna inteligencija postaje sve gluplja' posljednjih se godina redovito pojavljuje u medijima, najčešće pozivajući se na fenomen poznat kao 'kolaps modela' (engl. 'model collapse'). Stoga je profesor Dubravko Ćulibrk sa Sveučilišta u Novom Sadu za platformu Replica Sveučilišta u Splitu priredio studiju naziva 'AI ne postaje gluplji - internet bi mogao', kojom je analizirao jedan takav novinski članak i znanstveni rad u časopisu Nature na koji se on oslanja.

'Pokazujemo da je temeljni rad metodološki ispravan i važan, ali da se njegovi zaključci u medijskom prijenosu pretvaraju u tvrdnju koju rad nikada nije iznio. Kolaps modela dokazani je rizik u strogo definiranom, hipotetskom scenariju - kada se model uzastopno trenira isključivo na izlazima vlastite prethodne generacije, uz potpuno odbacivanje stvarnih podataka. U stvarnim uvjetima razvoja velikih jezičnih modela taj se scenarij ne događa, a same studije koje članak citira pokazuju da miješanje ili akumuliranje stvarnih podataka kolaps sprječava. Mjerljivi pokazatelji sposobnosti vodećih modela u razdoblju 2023. - 2026. rastu, a ne padaju. Zaključujemo da je naslov neutemeljen, ali da rad otvara stvarno i ozbiljno pitanje: dugoročnu vrijednost provjerenih, ljudski stvorenih podataka u svijetu zasićenom sintetičkim sadržajem', pojasnio je Ćulibrk u sažetku svoje studije.

'AI ne postaje gluplji - internet bi mogao'

Studiju prenosimo u nastavku:

'Portali često objavljuju članke koji opisuju AI na način da 'poglupljuje' Tvrde da korisnici velikih jezičnih modela poput ChatGPT-ja ili Geminija 'možda već pri-mjećuju' da ti sustavi u nekim sposobnostima nazaduju te da uzrok tome leži u načinu na koji se modeli treniraju. Kao znanstveno uporište navode se radovi objavljeni u uglednim znanstvenim časopisima. Naslov je privlačan, dijelovi teksta su točni, ali spoj naslova i sadržaja stvara zaključak koji znanost na koju se poziva ne podupire. Članak čija se vjerodostojnost provjerava objavio je jedan hrvatski medij pod nazivom 'AI postaje sve gluplji', a referira se na ugledni znanstveni časopis Nature.

Pristupili smo provjeri na tri razine: je li citirani rad stvaran i vjerno prenesen, podupire li taj rad tvrdnju iz naslova te postoje li mjerljivi dokazi da modeli u stvarnoj upotrebi doista nazaduju. Prve dvije razine djelomično su zadovoljene, treća nije.

Što rad doista kaže

Rad 'AI models collapse when trained on recursively generated data' skupine autora sa sveučilišta u Oxfordu i Cambridgeu doista postoji, objavljen je u Natureu u srpnju 2024. i metodološki je čvrst. Njegov je središnji pojam 'kolaps modela': degenerativni proces u kojem generativni model, treniran na podacima koje je proizvela njegova prethodna generacija, postupno zaboravlja stvarnu raspodjelu podataka. Prvo nestaju 'repovi' raspodjele - rijetki, neobični i često najinformativniji primjeri - a model s vremenom konvergira prema sve užem, prosječnijem i siromašnijem skupu izlaza.

Sve je to u članku ispravno preneseno. Točno je da autori demonstriraju pojavu na više tipova modela (jezičnim modelima, varijacijskim autoenkoderima i Gaussovim mješovitim modelima), točno je da matematički pokazuju njezinu 'neizbježnost' u graničnom slučaju i točno je da profesor Ross Anderson problem slikovito uspoređuje sa zagađenjem oceana i atmosfere. Do ove točke
članak je vjeran izvoru.

Gdje prijenos zakaže

Problem nije u onome što članak kaže o radu, nego u onome što naslov implicira da rad dokazuje. Naslov 'AI postaje sve gluplji' tvrdi nešto o sadašnjem stanju modela koje korisnici danas koriste. Rad ne tvrdi ništa takvo - i to je ključ.

Eksperiment u Natureu opisuje strogo definiran, namjerno pesimističan scenarij: model se uzastopno trenira isključivo na izlazima svoje prethodne generacije, pri čemu se izvorni stvarni podaci u potpunosti odbacuju. To je kontrolirani laboratorijski uvjet osmišljen da pokaže mehanizam u njegovu najčišćem obliku, a ne opis onoga kako se modeli stvarno grade.

Razlika je suštinska. Tvrtke koje razvijaju modele ne brišu postojeće podatke pri svakoj novoj generaciji; one ih akumuliraju i nadopunjuju. Klasici, znanstvena literatura, povijesni korpusi i provjereni ljudski sadržaj ostaju u skupu za treniranje. A upravo o tome - što se događa kada se podaci ne zamjenjuju u potpunosti - govori druga literatura.

Studije koje članak sâm citira

Najzanimljivije je da članak na kraju citira studije koje izravno ublažavaju njegov vlastiti naslov, ali im ne daje težinu koju zaslužuju. Prva izravno mjeri koliko stvarnih podataka treba da bi se kolaps zaustavio - i odgovor je iznenađujuće malo: već nasumičnih 2 % izvornih, ljudski stvorenih podataka umiješanih u sintetičke kroz sve faze treniranja znatno ublažava kolaps. Drugim riječima, korektiv nije skup ni velik; dovoljan je mali udio provjere-nih podataka. Druga studija taj nalaz potkrepljuje s druge strane: pokazuje da se kolaps može izbjeći sve dok udio sintetičkih podataka ostane dovoljno nizak u odnosu na stvarne, pri čemu tolerirana količina sintetike raste tek logaritamski - stvarni podaci moraju ostati dominantni, ali ne moraju biti ni izdaleka jedini.

Treća, naslovljena znakovitim pitanjem 'Je li kolaps modela neizbježan?', pokazuje da akumuliranje podataka - zadržavanje svih ranijih stvarnih i sintetičkih primjera umjesto njihove zamjene - sprječava kolaps kod svih testiranih modela i svih vrsta podataka. Autori te studije svoj scenarij izričito opisuju kao 'maksimalno pesimističan': čak i kada se sintetički sadržaj nekontrolirano 'izlijeva' na internet i pokupi za treniranje, kolaps izostaje sve dok se podaci gomilaju umjesto da se zamjenjuju.

Pouka triju studija ide u istom smjeru: korektiv za pojavu opisanu u Natureu nalazi se u istom članku - samo ispod naslova koji tvrdi suprotno.

Što kažu mjerni podaci

Najjača provjera tvrdnje 'AI postaje sve gluplji' jednostavna je: postaju li mjerljivo lošiji? Za to postoje standardizirani testovi sposobnosti (engl. 'benchmarks'). Trend je nedvosmislen i suprotan naslovu:

- 58 -> 78% SWE-bench Verified (rješavanje stvarnih programerskih zadataka) - vodeći rezultat porastao od početka 2025. do početka 2026.

- 94% GPQA Diamond (znanstvena pitanja na razini doktorata) - vodeći modeli u 2026., uz neekspertni prag oko 34%

- 99% AIME (matematička olimpijada) - skoro savršen rezultat vodećeg modela u 2026.

Toliko su mnogi raniji testovi 'zasićeni' - modeli na njima postižu preko 90 % pa više ne razlikuju najbolje sustave - da je zajednica morala osmišljavati teže nasljednike (GPQA Diamond, ARC-AGI-2, Humanity’s Last Exam). Zasićenje je problem obilja sposobnosti, a ne njezina nestanka.

Vrijedi biti pošten i prema drugoj strani: ti rezultati nisu bez mrlja. Dokumentirani su slučajevi 'kontaminacije' - curenja testnih primjera u podatke za treniranje - i 'pretreniranosti' na poznatim skupovima, zbog čega neki rezultati izgledaju bolje nego što stvarno jesu. No to je problem mjerenja napretka, a ne dokaz nazadovanja. Nijedan ozbiljan izvor ne pokazuje da su sposobnosti vodećih modela u padu.

Subjektivni dojam nije podatak

Članak se otvara pozivom na korisnički dojam - 'možda ste primijetili'. Taj je dojam stvaran, ali ga treba pažljivo tumačiti. Percepcija da je model 'postao gluplji' obično ima druge uzroke: promjene u sistemskim uputama i sigurnosnim filtrima, optimizacije brzine i cijene, pomak vlastitih očekivanja korisnika kako se navikava na alat, ili jednostavno različito ponašanje na različitim zadacima. Subjektivni osjećaj o jednom proizvodu nije isto što i sistemsko nazadovanje cijele tehnologije, a pogotovo nije dokaz za mehanizam kolapsa modela.

Što je ovdje stvarni problem

Odbacivanje naslova ne znači odbacivanje teme. Rad u Natureu upozorava na nešto važno i istinito: vrijednost provjerenih, ljudski stvorenih podataka raste kako se internet puni sintetičkim sadržajem. Ako se podaci prikupljaju s weba bez provjere podrijetla i bez označavanja, kvaliteta budućih skupova za treniranje doista je ugrožena. Zato tehnološke tvrtke sve češće sklapaju ugovore s izdavačima, medijima i znanstvenim bazama - ne zato što modeli propadaju, nego zato što čisti podaci postaju strateški resurs.

Ispravan naslov stoga ne bi bio 'AI postaje gluplji', nego nešto poput 'Internet bi mogao postati lošiji izvor za treniranje AI-ja'. To prebacuje fokus s nepostojećeg nazadovanja modela na stvarno pitanje upravljanja podacima - pitanje provjerljivosti, podrijetla i kvalitete, koje zaslu-žuje ozbiljnu javnu raspravu.

Zaključak

Članak točno prenosi mehanizam, ali pogrešno generalizira njegov doseg. Kolaps modela je realan u laboratorijskom scenariju potpune zamjene podataka, a ne u stvarnom razvoju, gdje akumuliranje i miješanje stvarnih podataka kolaps sprječava - kako pokazuju i studije koje sam članak navodi.

Mjerljivi pokazatelji sposobnosti rastu. Tvrdnja iz naslova time je netočna premda počiva na ispravnom i vrijednom znanstvenom radu. Senzacionalan naslov ovdje ne iskrivljuje izvor - iskrivljuje njegov opseg, a to je suptilniji i upravo zato podmukliji oblik dezinformacije.'

Replica

Kompletan rad dostupan je na Replici. To je, napomenimo, digitalna platforma posvećena provjeri točnosti informacija u specijaliziranim područjima energije i računarstva. Platforma pruža neovisnu, znanstveno utemeljenu analizu medijskih informacija kako bi se smanjila prisutnost dezinformacija u javnom prostoru, uključujući medije i društvene mreže. Cilj je projekta - na čijem je čelu izv. prof. dr. sc. Petar Šolić sa splitskog FESB-a - jačanje otpornosti društva na dezinformacije u ključnim tehnološkim područjima, nudeći stručne recenzije i objašnjenja temeljena na dokazima iz stručnih i znanstvenih izvora.

AI ne postaje gluplji - internet bi mogao

PODIJELI Facebook X (Twitter) WhatsApp

Dodaj kao preferirani izvor na Googleu