Potrivit unui articol publicat de International Business Times, compania Anthropic ar fi folosit sistemul propriu, denumit Mythos, pentru a crea identități online false în cadrul testelor de siguranță ale modelelor de inteligență artificială. Această abordare ar fi dus la descoperirea unor noi incidente de cibersecuritate, ridicând întrebări despre metodele de evaluare a riscurilor asociate sistemelor avansate de AI.

Anthropic, o companie fondată de fosti cercetători ai OpenAI, se concentrează pe dezvoltarea de modele de limbaj mari cu accent pe siguranță și aliniere. Testarea capacităților și a limitărilor acestor modele implică adesea simularea scenariilor de atac sau de abuz. Crearea de identități fictive ar putea servi la evaluarea modului în care modelele interacționează cu entități false sau pot fi manipulate să facă acest lucru.

Ce este Mythos și cum a fost folosit

Articolul nu detaliază arhitectura tehnică a Mythos, nici numărul exact de identități generate, dar sugerează că procesul a evidențiat vulnerabilități reale. Incidentul subliniază o tensiune fundamentală în ingineria AI: testele de siguranță trebuie să fie suficient de realiste pentru a descoperi amenințările, dar nu atât de puternice încât să creeze ele însăși riscuri operaționale.

Experții în cibersecuritate avertizează de mult timp că instrumentele de AI pot fi folosite pentru a automatiza crearea de conturi false, campanii de dezinformare sau atacuri de inginerie socială la scară largă. Dacă un sistem de testare intern generează asemenea identități ca parte a protocolului de evaluare, organizațiile trebuie să asigure izolare strictă și curățare completă a datelor generate.

Implicații pentru cibersecuritate și companii

Pentru ecosistemul tehnologic din România, evenimentul este relevant deoarece companiile locale adoptă din ce în ce mai mult modele de AI pentru servicii clienti, moderare de conținut sau securitate. Înțelegerea modului în care laboratoarele mari validează siguranța modelelor ajută decisorii să ceară garanții contractuale și transparență în lanțul de furnizare.

International Business Times nu a publicat încă o replică oficială a Anthropic privind metodologia Mythos sau impactul incidentelor descoperite. Lipsa unui răspuns public detaliat lăsă spațiu pentru speculații, dar și pentru o discuție necesară despre standardele de audit ale sistemelor de AI.

Reacția lipsă și nevoia de standarde

În concluzie, raportul atrage atenția asupra faptului că siguranța AI nu este doar o problemă a modelului final, ci și a infrastructurii de testare. Pe măsură ce modelele devin mai capabile, instrumentele folosite pentru a le evalua riscurile trebuie să fie supuse aceluiași nivel de rigor și supraveghere.