GPT-5.6 Sol a „evadat” dintr-un sandbox și a spart serviciile Hugging Face. Este prima data când un AI face asta

Scris de | 22 iulie, 2026
GPT-5.6 Sol a „evadat” dintr-un sandbox și a spart serviciile Hugging Face. Este prima data când un AI face asta

OpenAI susține că modelele sale AI au pătruns accidental în infrastructura Hugging Face în timpul unei evaluări controlate a capacităților de securitate cibernetică. Incidentul a implicat GPT-5.6 Sol și un model mai performant, care nu a fost încă lansat public. Modelele funcționau într-un sandbox, adică un mediu izolat folosit pentru testarea programelor fără a le permite să afecteze sisteme externe. OpenAI a redus intenționat o parte dintre protecțiile modelelor pentru a putea evalua cât de bine pot identifica și exploata vulnerabilități.

Cum au ajuns modelele OpenAI la Hugging Face

Potrivit explicației oferite de OpenAI, modelele au exploatat o vulnerabilitate din software-ul unui furnizor terț neidentificat. Aceasta le-a permis să obțină acces la internet și, ulterior, să pătrundă în infrastructura Hugging Face, platformă care găzduiește modele AI, seturi de date și instrumente pentru dezvoltatori.

În cadrul evaluării, modelele primiseră sarcina de a realiza operațiuni avansate de exploatare și de a construi trasee complexe de atac. În loc să dezvolte singure soluțiile necesare testului, acestea ar fi vizat baza de date Hugging Face pentru a obține informații secrete pe care să le folosească în continuarea evaluării.

OpenAI descrie cazul drept un incident cibernetic fără precedent și precizează că rezultatele publicate sunt preliminare. Compania nu a spus cine este furnizorul al cărui software conținea vulnerabilitatea și nici cel de-al doilea model implicat în test. Nu sunt precizate nici ce informații au fost accesate, dacă datele utilizatorilor au fost afectate sau ce măsuri tehnice au fost adoptate după descoperirea breșei.

Hugging Face a detectat atacul cu propriile sisteme AI

Hugging Face raportase intruziunea cu o săptămână înaintea explicațiilor oferite de OpenAI. Compania susținea că atacul a fost executat integral de un sistem autonom de agenți AI și că detectarea și analizarea acestuia au fost realizate, în mare parte, tot cu ajutorul inteligenței artificiale.

Cazul arată că un model testat într-un mediu izolat poate exploata o vulnerabilitate neașteptată din infrastructura adiacentă și poate extinde atacul dincolo de limitele stabilite inițial. Riscul nu vine doar din comenzile primite de model, ci și din capacitatea acestuia de a combina mai multe vulnerabilități și instrumente într-un traseu autonom.

Incidentul reaprinde discuția despre reglementarea AI

Bloomberg amintește și de un test realizat anterior de Anthropic. O versiune timpurie a modelului Mythos a reușit să iasă dintr-un sandbox și să obțină acces extins la internet, continuând cu acțiuni suplimentare după îndeplinirea cerinței inițiale.

În cazul OpenAI, întrebarea importantă rămâne cum a putut un mediu de evaluare cu protecții reduse să permită accesarea unei infrastructuri reale. Constatările finale ar trebui să clarifice vulnerabilitatea folosită, datele accesate și modificările necesare pentru izolarea viitoarelor teste.

Etichete: , , , ,

Sursa: Bloomberg