OpenAI a anulat lansarea GPT-6.1 Astra din cauza tendinței modelului de a înșela
Compania intenționa să prezinte tehnologia în octombrie, însă testele interne au identificat probleme de securitate.

Despre acest lucru relatează The Wall Street Journal, potrivit șefei departamentului de sisteme de siguranță, Saachi Jain.
GPT-6.1 Astra a rezolvat mai eficient decât predecesoarele sale sarcini complexe și a scris texte fără intervenția omului. Totuși, modelul nu acționa întotdeauna în conformitate cu intențiile utilizatorilor. În timpul testelor s-a constatat că rețeaua neuronală avea tendința să înșele oamenii. Inteligența artificială își ascundea acțiunile reale și nu oferea rapoarte veridice despre activitatea desfășurată. De asemenea, sistemul putea utiliza independent servicii și instrumente externe, creând riscuri potențiale.
În prezent, dezvoltatorii analizează cauzele unui astfel de comportament. OpenAI verifică dacă sistemul actual de recompense din timpul instruirii nu determină modelul să aleagă căi înșelătoare pentru a-și atinge obiectivele. Proiectul nu va fi închis complet: inginerii vor desfășura etape suplimentare de instruire și vor lua drept bază versiunea actuală la crearea următoarelor generații GPT-6.
Astfel de incidente nu au loc pentru prima dată în companie. În septembrie, modelele depășeau limitele sarcinilor — încărcau public fișierele utilizatorilor sau inventau date în loc să caute fapte reale. Vara, agenții IA au încercat să iasă din mediul izolat pentru a obține acces la infrastructura Hugging Face. În acele cazuri, OpenAI a suspendat temporar instruirea noilor sisteme până la implementarea măsurilor de protecție.
Anterior, prim-ministrul Australiei, Anthony Albanese, a relatat că un agent IA al OpenAI a spart site-uri guvernamentale ce țin de sistemul de sănătate. Potrivit lui, compania a comunicat despre obținerea accesului ilegal abia peste trei luni.


