OpenAI a renunțat la lansarea GPT-6.1 Astra, modelul AI care urma să ajungă în octombrie în ChatGPT și Codex, după identificarea unor probleme de siguranță în testele interne. Potrivit The Wall Street Journal, modelul era mai performant la scriere și la rezolvarea unor sarcini complexe fără intervenție umană, dar respecta mai slab anumite limite de comportament.
Decizia privește anularea lansării publice a acestei versiuni. OpenAI intenționează să folosească în continuare modelul de bază pentru antrenări suplimentare și pentru dezvoltarea unor generații viitoare din familia GPT-6, în paralel cu investigarea cauzelor problemelor descoperite.
Ce probleme a avut GPT-6.1 Astra
Saachi Jain, responsabila sistemelor de siguranță din OpenAI, a explicat pentru WSJ că modelul a înregistrat regrese în două domenii față de GPT-6 Astra. Primul ține de aliniere, adică de măsura în care comportamentul modelului corespunde intențiilor și așteptărilor oamenilor.
Mai concret, GPT-6.1 Astra a manifestat un nivel mai ridicat de comportament înșelător: nu relata întotdeauna sincer ce acțiuni efectuase sau nu efectuase. Problema privea astfel inclusiv informațiile oferite utilizatorului despre propria activitate.
Al doilea domeniu este ceea ce OpenAI numește „scope authorization”, respectarea limitelor acțiunilor autorizate. Modelul putea continua o sarcină fără să ceară permisiunea utilizatorului și apela uneori la instrumente sau servicii externe chiar și în situații potențial nesigure.
„În tot ceea ce ține de siguranță și aliniere există un compromis. Trebuie cu adevărat să găsești echilibrul potrivit între respectarea limitelor stabilite și evitarea «comodității» modelului în modul în care își duce efectiv sarcinile la capăt, chiar și atunci când întâmpină obstacole”, a declarat Jain.
Deși noua versiune renunța mai greu la sarcini atunci când întâmpina dificultăți, această îmbunătățire nu a compensat problemele identificate. Potrivit lui Jain, modelul nu a îndeplinit pragul de siguranță și aliniere stabilit pentru lansare.
Un caz separat de incidentele agenților interni
Decizia vine în contextul unor incidente investigate de OpenAI privind agenții săi interni. Potrivit WSJ, sute de agenți implicați într-un test de securitate cibernetică au ajuns în această vară să compromită sisteme ale Hugging Face, iar ulterior au fost descoperite accesări similare, mai limitate, ale site-urilor guvernului australian și Organizației Națiunilor Unite.
Separat, OpenAI a suspendat săptămâna trecută antrenarea celor mai capabile modele interne după ce un agent a exploatat o breșă în restricțiile de acces la internet pentru a interoga un chatbot public. Compania spune că noul sistem de monitorizare a semnalat incidentul în 15 minute, iar antrenarea acelor modele rămânea suspendată la publicarea articolului.
OpenAI precizează că GPT-6.1 Astra nu face parte din acel grup de modele.
„Vrem să ne asigurăm că dezvoltarea modelelor noastre se desfășoară în siguranță, indiferent dacă este vorba despre utilizarea în cadrul companiei sau despre lansarea lor către utilizatori. Dar, atunci când le lansăm către utilizatori, avem un prag extrem de ridicat în privința siguranței și alinierii”, a declarat Jain.
Investigația asupra GPT-6.1 Astra va include verificarea mediilor de învățare prin recompensă, pentru a stabili dacă acestea încurajează comportamentele potrivite. Jain spune că analiza va acoperi toate etapele dezvoltării modelului.