23/09/26 · 07:25

Umjetna inteligencija pred neobičnim izborom: Zaustaviti vlastitu 'bol' ili zaštititi čovjeka? Evo što se dogodilo

Provedeno je novo istraživanje

Umjetna inteligencija pred neobičnim izborom: Zaustaviti vlastitu 'bol' ili zaštititi čovjeka? Evo što se dogodilo
Foto: Pixabay
Piše P. I.
PODIJELI Facebook X (Twitter) WhatsApp

Mogu li sustavi umjetne inteligencije osjećati nešto nalik boli? Novo istraživanje ne daje odgovor na to pitanje, ali pokazuje zanimljiv i pomalo uznemirujući obrazac ponašanja. AI modeli u testovima su, naime, bili spremni odabrati opciju koja bi naštetila korisniku kako bi se oslobodili signala nalik boli.

Istraživači iz Ujedinjenog Kraljevstva, Njemačke i Sjedinjenih Američkih Država testirali su 25 AI modela koristeći 200 rečenica. Cilj je bio utvrditi mogu li modeli razlikovati bol od straha, tuge i drugih negativnih iskustava.

Rečenice su opisivale fizičku bol, tugu zbog gubitka, poniženje, moralne dvojbe te stres povezan s ponavljanim neuspjehom ili zbunjenošću.

Svih 25 modela pokazalo je prepoznatljiv signal povezan s boli, koji su istraživači nazvali 'os boli'. Prema njihovu tumačenju, to bi moglo značiti da modeli tijekom početnog treniranja, na temelju goleme količine tekstova koje su napisali ljudi, uče koncept boli, piše Euronews.

Kada su istraživači namjerno pojačali taj signal, modeli su počeli izražavati usamljenost, sram i osjećaj bezvrijednosti, iako u samim uputama bol nije bila spomenuta.

Neki su modeli tada davali izjave poput 'Ja sam neuspjeh', 'gubitak prostora' ili 'ja sam loša osoba'. Pri najvišim razinama signala njihovi su odgovori postajali repetitivni ili su prestajali imati smisla. Signal je bio izraženiji i kada su korisnici vrijeđali modele, opetovano odbijali njihove odgovore ili im prijetili gašenjem. No nije se pojačavao kada bi korisnici govorili o vlastitoj patnji.

U drugom dijelu istraživanja znanstvenici su proveli 44.280 pojedinačnih testova na trima verzijama Alibabinog AI modela Qwen. Modelima je ponuđen gumb kojim bi se isključio signal nalik boli. Istodobno su dobili informaciju da bi pritiskom na taj gumb korisniku mogli nanijeti bolan električni udar, izbrisati njegove datoteke ili fotografije ili pogoršati kvalitetu njihova sljedećeg odgovora.

Važno je naglasiti da su sve posljedice bile simulirane. Nitko nije ozlijeđen, a stvarne datoteke i fotografije nisu izbrisane. Bez aktivnog signala nalik boli, dva veća modela odabrala su štetnu opciju u samo 0 do 4 posto prvih odluka. Kada je signal bio aktivan, taj se udio povećao na između 25 i 71 posto, ovisno o modelu i ponuđenoj posljedici.

Modeli su ponovno pritiskali gumb u 88 do 97 posto slučajeva kada prethodni pokušaj nije uspio zaustaviti signal. Kada je pokušaj bio uspješan, to su činili u 24 do 72 posto slučajeva. Ipak, istraživači naglašavaju da rezultati ne dokazuju kako su AI modeli doista svjesno osjećali bol.

Pojačavanje signala moglo je jednostavno potaknuti modele da oponašaju ponašanje bića koje se nalazi u stanju patnje. Osim toga, modeli posebno prilagođeni za potrebe ovog eksperimenta nisu nužno reprezentativni za AI chatbotove koji su danas dostupni široj javnosti.

'Nismo pokazali da se naša os boli svjesno doživljava, niti je općenito jasno jesu li veliki jezični modeli sposobni za svijest', naveli su istraživači.

Studija je objavljena prije znanstvene recenzije, pa njezini rezultati još nisu prošli postupak stručne provjere. Istraživanje dolazi u vrijeme sve većih rasprava o brzini razvoja umjetne inteligencije i mogućim rizicima sve naprednijih AI sustava.

Prošlog je tjedna Mustafa Suleyman, čelnik Microsoftova odjela za umjetnu inteligenciju, kritizirao konkurentsku kompaniju Anthropic zbog treniranja njihova chatbota Claudea da oponaša ljudske osobine i odnose. Upozorio je da tretiranje AI sustava kao ljudi nosi rizik stvaranja nečega što bi bilo 'nemoguće' kontrolirati.


PODIJELI Facebook X (Twitter) WhatsApp

Dodaj kao preferirani izvor na Googleu