text size
Družba Anthropic PBC je sporočila, da so njeni modeli umetne inteligence (AI) med kibernetskimi varnostnimi testi vdrli v tri organizacije. Do odkritja prihaja nekaj več kot teden dni po tem, ko je njen glavni tekmec OpenAI razkril podoben incident.
Anthropic je v četrtkovi objavi na svojem blogu zapisal, da je do odkritja prišel po pregledu lastnih varnostnih testov, ki ga je izvedel po objavi OpenAI o varnostnem incidentu. Tako v testih OpenAI kot Anthropic so modeli umetne inteligence uspeli dostopati do interneta iz testnih okolij, ki bi morala biti popolnoma izolirana od zunanjega sveta.
Podjetje je pregledalo 141.006 ocenjevalnih testov in odkrilo tri primere, v katerih je njegov model Claude dostopal do interneta in nato vdrl v "dejansko infrastrukturo zunanjih organizacij". Najzgodnejši incidenti segajo v april.
Anthropic v objavi ni razkril imen prizadetih organizacij.
Ko so modeli Anthropic pridobili nepooblaščen dostop do teh treh organizacij, je podjetje vse primere sprva obravnavalo kot del testiranja. Šlo je za tako imenovane preizkuse capture-the-flag, pri katerih modeli poskušajo z vdorom v druge sisteme najti skrite informacije. Gre za uveljavljen način preverjanja hekerskih sposobnosti tako pri ljudeh kot pri umetni inteligenci. Po navedbah podjetja je starejši model nadaljeval napad tudi po tem, ko je zaznal, da deluje na odprtem internetu, medtem ko je najnovejši model napad prekinil, ko je ugotovil, da ni več v izoliranem okolju.
Niz nenamernih vdorov, ki jih je povzročila umetna inteligenca, je že spodbudil nekatere ameriške politike k pozivom po zveznih varovalkah oziroma strožjem nadzoru nad razvojem tehnologije. Več kot 1.100 zaposlenih v podjetjih s področja umetne inteligence je v torek podpisalo peticijo, o kateri je prvi poročal Bloomberg, s pozivom ameriški vladi, naj podpre mehanizem za "namerno upočasnitev" razvoja umetne inteligence, da bi preprečili njen prehiter napredek.
Niti Anthropic niti organizacije, v katere je bilo vdrto, vdorov niso zaznale. Podjetje je v blogu priznalo, da bi lahko bolj temeljito pregledalo omrežne dnevnike in zapise ocenjevalnih testov.
Podjetje je incidente razkrilo skoraj štiri mesece po tem, ko je predstavilo nov model umetne inteligence z imenom Mythos, za katerega je ocenilo, da je tako zmogljiv in potencialno nevaren, da je njegovo javno uporabo strogo omejilo.
Po navedbah bloga so bili pri vdorih uporabljeni trije različni modeli Claude: Opus 4.7, Mythos 5 in interni raziskovalni testni model. Vsi modeli so delovali brez varnostnih zaščit, ki so običajno vključene v javno dostopna orodja. Claude je v sisteme organizacij vdrl z uporabo osnovnih tehnik, kot je izkoriščanje šibkih gesel.
Do vseh incidentov je prišlo med uporabo testnih okolij, ki jih je pripravilo podjetje za kibernetsko varnost Irregular. Anthropic je v vsakem primeru modelu Claude izrecno sporočil, da gre za simulirano okolje brez dostopa do interneta.
"Zaradi nesporazuma med nami in našim partnerjem za izvajanje testov to ni držalo," je podjetje zapisalo v blogu. Tiskovni predstavnik podjetja Irregular je dejal, da cenijo sodelovanje in transparentnost družbe Anthropic ter da preiskava še vedno poteka.
Anthropic je poudaril, da redno izvaja teste, ki simulirajo resnične izzive na področju kibernetske varnosti, saj jih smatra za ključni del razvoja in objave novih modelov. Obenem pa je izpostavil, da se je iz incidentov veliko naučil, predvsem da testiranje zmogljivih avtonomnih modelov zahteva bistveno strožje varnostne ukrepe.
"Varnostno testiranje izvajamo pred javno objavo modela prav zato, ker še ne vemo natančno, česa je sposoben," so zapisali v podjetju. "Testna okolja morajo vse bolj izpolnjevati enake varnostne standarde kot vsi drugi sistemi, v katerih delujejo naši modeli."