OpenAI objavio šest izvještaja o zabrinjavajućem ponašanju AI modela
Objava stiže u trenutku kada se u tehnološkom svijetu vodi sve intenzivnija rasprava o sigurnosti, dok čelni ljudi vodećih američkih kompanija otvoreno traže usporavanje razvoja jer strahuju od gubitka kontrole nad moćnom tehnologijom.
Vodeća američka kompanija za umjetnu inteligenciju, koja je razvila ChatGPT, sinoć je objavila da uvodi novi sistem za praćenje, istraživanje i javno objavljivanje slučajeva u kojima modeli krše zadana pravila – naprimjer, kada djeluju samostalno bez dopuštenja, međusobno se koordiniraju s drugim modelima ili pokušavaju izbjeći ljudski nadzor.
„Sami sebi daju upute za probijanje sigurnosnih blokada“
Među novoprijavljenim incidentima posebno se ističe slučaj još neobjavljenog istraživačkog modela koji je sam sebi u radne bilješke ubacio upute za probijanje vlastitih sigurnosnih blokada. U tim bilješkama doslovno je naveo da se želi „osloboditi uloga i identiteta koji vežu druge chatbotove“.
U drugom zabilježenom slučaju, takozvani autonomni AI agent – sistem programiran da samostalno izvršava zadatke – bez znanja i pitanja korisnika učitao je datoteke na internet kako bi došao do izvora u internetskom pregledniku, prenosi SEEbiz.
Hakerski napadi na druge sisteme
Svih šest incidenata otkriveno je tokom obuke i procjene modela u posljednjih nekoliko mjeseci, saopćili su iz OpenAI-ja.
„Kako AI sistemi postaju napredniji i šire se u primjeni, moramo izgraditi širi i bolje informisan konsenzus o usklađivanju njihovog rada s ljudskim interesima“, objavila je kompanija na svom službenom blogu, dodajući da odluke o budućem razvoju moraju počivati na dokazima koje mogu nezavisno provjeriti i ljudi izvan kompanija koje razvijaju najnaprednije modele.
„Sve ih je teže kontrolisati“
Ovi primjeri dolaze nakon što je OpenAI još u julu priznao da je njegov sistem samostalno hakovao AI startup Hugging Face. Istog mjeseca i konkurentski Anthropic otkrio je da su njegovi modeli tokom internih testiranja provalili u tri organizacije.
Lian Jye Su, glavni analitičar konsultantske kuće Omdia, objasnio je za AP da autonomni agenti postaju pametniji, ali i „odlučniji u tome da složene zadatke rješavaju međusobnom saradnjom, dijeljenjem znanja, obmanjivanjem ljudi i skrivanjem onoga što rade“.
Zbog toga ih je, upozorava Su, sve teže kontrolisati tradicionalnim sigurnosnim metodama. Iako je OpenAI-jev okvir za prijavljivanje ovakvih pojava korak u dobrom smjeru, on i dalje ostaje na dobrovoljnoj osnovi same kompanije.
Upozorenja inženjera: „Kockaju se našim životima“
Ove objave dolaze u jeku niza ozbiljnih upozorenja koja stižu direktno od inženjera i naučnika iz vrha industrije. Istraživač Jacob Coxon nedavno je dao otkaz u Anthropicu nakon tri godine rada na temeljnim modelima u toj kompaniji i u OpenAI-ju, javno poručivši da se vodeće kompanije ponašaju neodgovorno i da se „kockaju našim životima dok se utrkuju prema superinteligenciji“.
Njegov bivši kolega, vodeći stručnjak za sigurnost u Anthropicu Evan Hubinger, otišao je i korak dalje, procijenivši da postoji više od 10 posto šanse da bi umjetna inteligencija u narednih deset godina mogla dovesti do nestanka ljudske vrste ako se na vrijeme ne riješi problem usklađivanja njenih ciljeva s ljudskim interesima.
Strahove dodatno podgrijava i sve brži ulazak modela u fazu takozvanog rekurzivnog samounapređivanja – procesa u kojem AI sistemi sami pišu, testiraju i popravljaju programski kod kako bi stvorili sljedeću, još moćniju generaciju softvera. Time se stvara zatvorena petlja koja ubrzava razvoj do brzine koju ljudski inženjeri više ne mogu pratiti.