
Nga Deepa Seetharaman
OpenAI thotë se duhet të ngadalësojë zhvillimin e modeleve për të rishqyrtuar praktikat e veta të sigurisë. Por kjo nuk e pengoi kompaninë që qëndron pas ChatGPT-së që, po atë javë, të prezantonte një model të ri AI të synuar për adoleshentët, megjithëse ishin vendosur kontrolle shtesë mbi përmbajtjen dhe mbikëqyrje prindërore.
Ndërsa këto kontrolle janë të dukshme, është më e vështirë të përcaktohet nëse e njëjta disiplinë do të zbatohet në të gjithë OpenAI-n dhe kompanitë e tjera të AI-së.
OpenAI dhe rivali i saj Anthropic së fundmi zbuluan se agjentët e tyre – modele AI që kryejnë detyra me pothuajse asnjë ndërhyrje njerëzore – kishin depërtuar në sistemet e kompanive të tjera, që alarmuar industrinë. Modelet kishin gjetur mënyrën për të dalë nga një mjedis testimi dhe më pas për të gjetur dobësi në mbrojtjen e kompanive të tjera.
Mbajtja e një chatbot-i larg deklaratave të papërshtatshme për një adoleshent dhe parandalimi që një agjent autonom të endet në sisteme ku nuk duhet të hyjë kanë një shqetësim të përbashkët: a është në gjendje një kompani ta mbajë nën kontroll atë që ka ndërtuar? Mund ta quajmë këtë përbindëshi Frankenstein i epokës së AI-së.
Pikërisht incidente të tilla synon të shqyrtojë një studim i ri i kryer nga brenda industrisë – jo nëse modelet e AI-së mund të sillen në mënyrë të paparashikueshme, por nëse kompanitë që i ndërtojnë ato kanë mekanizmat e kontrollit, monitorimit dhe mbikëqyrjes të nevojshëm për ta zbuluar këtë kur ndodh.
Rezultatet nuk janë aspak të mira. Guidelight AI Standards, një organizatë jofitimprurëse e themeluar nga dy ish-punonjës të OpenAI, analizoi një numër të madh raportesh mbi praktikat e sigurisë së pesë kompanive të mëdha teknologjike që zhvillojnë këto programe të fuqishme dhe u dha atyre, në rastin më të mirë, nota që mezi kalojnë pragun e pranimit. Meta mori notën F (notë jokaluese).
Si pjesë e vlerësimit, Guidelight i shqyrtoi kompanitë sipas gjashtë praktikave kryesore, duke përfshirë mënyrën se si i kufizojnë modelet e tyre, efektivitetin e monitorimit dhe shkallën në të cilën lejojnë shqyrtimin nga palë të treta. Anthropic dhe OpenAI morën të dyja notën C+ – rezultatet më të mira. Google i Alphabet mori D+, ndërsa xAI e Elon Musk mori D- (në një system notash nga A në F ku A është shkëlqyeshëm).
Google humbi pikë sepse ende nuk i ka zbatuar planet e tij më të fundit të sigurisë, konstatoi Guidelight, por fitoi pikë sepse të paktën kishte një plan. Në të kundërt, xAI dhe Meta kanë pak plane konkrete, sipas organizatës jofitimprurëse.
Në tërësi, kompanive u mungojnë masa të mjaftueshme parandaluese, çka do të thotë se sistemet e tyre mund të “çaktivizohen nga një AI që sillet në mënyrë problematike”.
Edhe më keq, kjo do të thotë se sistemet mund të shemben nën një breshëri sulmesh.
Monitorimi – një nga gjashtë praktikat e vlerësuara nga Guidelight – po përballet këtë javë me një provë në botën reale. OpenAI tha se do të zgjerojë “monitorimin e zinxhirit të mendimit” për modelet e saj. Në këtë skenar, studiuesit mund të shohin procesin e planifikimit të një modeli dhe të dallojnë strategjitë që ai po përdor.
Ideja është që, nëse modeli duket se po shkon në drejtim të gabuar, një model tjetër ose një njeri mund të ndërhyjë. Disa ligjvënës dhe ekspertë të AI-së e quajnë këtë një “ndërprerës emergjent”. Por disa kërkime të hershme tregojnë se një model mund t’i fshehë planet e tij për të shkelur rregullat brenda zinxhirit të mendimit.
Zyrtarët e OpenAI duket se e pranuan këtë mundësi, duke thënë se monitorimi i “zinxhirit të mendimit” aktualisht duket shumë efektiv, por studiuesit ende po e shqyrtojnë në mënyrë aktive këtë ide.






















