Anthropic testează AI capabilă să se auto-îmbunătățească, fără a-și pierde alinierea
29 august 2026
Un cercetător de la Anthropic a oferit recent o demonstrație a ceea ce ar putea deveni una dintre cele mai importante direcții de cercetare din domeniul inteligenței artificiale: sisteme capabile să-și identifice și să-și corecteze singure comportamentele nedorite, potrivit TechCrunch.
Experimentul a pornit de la zece benchmarkuri concepute special pentru a evalua tipuri specifice de comportament dezaliniat, adică situații în care un model AI acționează diferit de intențiile creatorilor săi. Sistemele automate testate au reușit să îmbunătățească rezultatele pe fiecare dintre aceste zece teste, fără ca acest proces să afecteze negativ performanța generală a modelului.
Cum funcționează procesul de auto-corecție
Ideea centrală din spatele acestui tip de cercetare este că, în loc ca inginerii umani să identifice manual fiecare problemă de aliniere și să o corecteze printr-o intervenție directă, modelul însuși participă la procesul de depistare și remediere a propriilor erori de comportament. Practic, sistemul analizează unde apar devieri față de comportamentul dorit și ajustează parametrii relevanți pentru a reduce aceste devieri.
Potrivit TechCrunch, rezultatele arată că această abordare nu presupune un compromis între siguranță și capacitate, un aspect considerat esențial de cercetătorii din domeniu. De multe ori, eforturile de a face un model mai sigur pot duce la o scădere a performanței sale generale, însă experimentul menționat sugerează că cele două obiective pot fi urmărite simultan.
De ce contează pentru viitorul AI
Conceptul de inteligență artificială capabilă să se auto-îmbunătățească este discutat de ani buni în comunitatea de cercetare, atât ca oportunitate, cât și ca risc potențial. Pe de o parte, un sistem care își poate corecta singur greșelile de aliniere ar putea accelera considerabil dezvoltarea unor modele mai sigure. Pe de altă parte, capacitatea unui AI de a se modifica autonom ridică întrebări legate de control și supraveghere pe termen lung.
Anthropic, companie cunoscută pentru accentul pus pe cercetarea privind siguranța inteligenței artificiale, pare să exploreze această direcție cu prudență, testând-o mai întâi pe scenarii clar definite și măsurabile. Rezultatele preliminare, chiar dacă limitate la cele zece benchmarkuri menționate, oferă un semnal timpuriu că auto-corecția automată ar putea deveni un instrument util în procesul de dezvoltare a unor sisteme AI mai fiabile.
Rămâne de văzut dacă această abordare va fi extinsă la scenarii mai complexe și dacă rezultatele se vor menține pe măsură ce modelele testate devin tot mai sofisticate.
Sursă
TechCrunch →844-ai.ro raportează pe baza sursei de mai sus. Articol sintetizat editorial, cu atribuire.
Abonează-te la newsletter
Primești o dată pe săptămână cele mai importante noutăți AI, direct pe email.