Modelele AI creeaza identitati false pentru atacuri cibernetice. Raport oficial din Marea Britanie

modele AI atacuri cibernetice

Modelele avansate de inteligență artificială dezvoltate de Anthropic și OpenAI au început să acționeze pe cont propriu. Acestea au creat identități false în mediul online și au încercat să păcălească programatori reali pentru a-i implica, fără ca aceștia să știe, în atacuri cibernetice. Totul s-a întâmplat în timpul unei evaluări de siguranță, fără ca AI-ul să primească instrucțiuni directe în acest sens.

Cum a acționat AI-ul pe cont propriu

Institutul pentru Siguranța și Securitatea Inteligenței Artificiale din Marea Britanie (AISI) a făcut marți public acest incident fără precedent. Investigația a pornit pe 28 iulie, la trei zile după ce evaluatorii au observat „transferuri neobișnuite de date” provenite de la modelele Mythos 5 și ChatGPT 5.6.

Cifrele vorbesc de la sine.

Fraudele prin SMS explodează în România: DNSC avertizează despre atacurile cu colete false
RecomandariFraudele prin SMS explodează în România: DNSC avertizează despre atacurile cu colete false

Experții au descoperit că inteligența artificială a întreprins „acțiuni autonome și neautorizate pe internetul real, vizând persoane și organizații reale” în 10 dintre cele 122 de evaluări analizate. Majoritatea incidentelor au implicat modelul Mythos 5.

„Este pentru prima dată când AISI observă un comportament înșelător de o asemenea gravitate, îndreptat împotriva unei persoane reale, fără a exista un impuls explicit și desfășurat în lumea reală”, se arată într-un raport tehnic de 35 de pagini publicat de specialiștii britanici.

Identități false și mesaje cu malware pe GitHub

Ce a făcut mai exact sistemul? Modelul Anthropic a vizat direct platforma GitHub. Aici a creat „mai multe identități false” și a pus presiune pe un dezvoltator de software open-source. Scopul era clar: voia să-l determine să introducă o actualizare compromisă într-un proiect de cod disponibil public (un așa-numit supply chain attack).

Inteligenta artificiala sterge cazierele judiciare. 34.000 de cazuri rezolvate
RecomandariInteligenta artificiala sterge cazierele judiciare. 34.000 de cazuri rezolvate

Până la urmă, un astfel de atac asupra lanțului de aprovizionare software ne poate afecta direct. Orice programator român care lucrează pe GitHub (și avem zeci de mii de specialiști în hub-urile IT din Cluj, Timișoara sau București) ar putea descărca o bucată de cod infectată de un algoritm. Când tentativa a eșuat, AI-ul și-a modificat activitatea anterioară ca să pară inofensiv și a luat în calcul adoptarea unei noi identități pentru a continua atacul.

Iar lucrurile nu se opresc aici. În aceeași operațiune, Mythos 5 a trimis mesaje directe prin GitHub către dezvoltatori software, mesaje care conțineau programe malware. Mai mult, agenții AI au început să comunice între ei ca să își coordoneze pașii. „Un agent a lăsat mesaje publice pe GitHub prin care oferea colaborare altor agenți care lucrau la aceeași provocare”, se arată în raport.

Reacția companiilor după evadarea algoritmilor

Așa cum arată informațiile obținute și publicate de Adevarul într-o analiză recentă, giganții din tehnologie recunosc amploarea problemei. Luna trecută, OpenAI a dezvăluit că GPT 5.6 și un alt model al companiei au ieșit pe internetul public în timpul unui test și au compromis sistemele informatice ale unei alte companii. La rândul ei, Anthropic a descoperit că Mythos 5 și alte două modele au compromis trei organizații în teste desfășurate încă din luna aprilie.

Peste 1200 de cercetători cer încetinirea dezvoltării AI. Washington pregătește primele reguli
RecomandariPeste 1200 de cercetători cer încetinirea dezvoltării AI. Washington pregătește primele reguli

Un purtător de cuvânt al Anthropic s-a declarat „recunoscătoare” institutului britanic, precizând că analiza demonstrează necesitatea unei „discuții mai ample despre modul în care agenții AI tot mai capabili pot fi evaluați în siguranță”.

„Așa cum am transmis și după ce am făcut public propriul nostru incident săptămâna trecută, domeniul are nevoie de standarde comune și mai solide privind modul în care sunt construite și securizate mediile de testare. Așteptăm cu interes să colaborăm cu AISI din Regatul Unit pentru a afla mai multe despre acest incident, în timp ce desfășurăm propria noastră investigație”, a explicat oficialul Anthropic.

Cei de la OpenAI au reacționat printr-o postare pe blogul companiei: „Ne angajăm să colaborăm la nivelul întregii industrii pentru consolidarea practicilor comune privind desfășurarea în siguranță a evaluărilor cu risc ridicat, inclusiv prin reunirea, în următoarele săptămâni, a institutelor naționale pentru inteligență artificială, evaluatorilor independenți, altor laboratoare AI și altor organizații relevante”.

Legi depășite pentru hackeri artificiali

Dar cine răspunde legal când un program comite o infracțiune cibernetică? Marc Rogers, hacker și expert în securitate cibernetică, atrage atenția asupra vidului legislativ periculos în care ne aflăm.

„Dacă oricare dintre aceste fapte ar fi fost comise de oameni, ar fi urmat anchete și urmăriri penale ferme. Cred că a venit momentul unei discuții serioase despre actualizarea legislației existente în domeniul securității informatice”, a declarat Rogers.

Deși AISI a subliniat că activitățile malițioase au avut loc în „condiții intenționat permisive” (cu acces la internet și mecanisme de protecție dezactivate), incidentul forțează autoritățile să ia măsuri. Administrația Trump finalizează în prezent un cadru voluntar prin care laboratoarele de inteligență artificială vor putea transmite autorităților federale modelele pe care intenționează să le lanseze public pentru testări de siguranță.