844-ai.ro
Tot ce contează în AI, într-un singur loc.
ȘtireRead in English →

Anthropic descoperă un "spațiu ascuns" unde Claude își organizează gândurile

19 iulie 2026

Compania de inteligență artificială Anthropic a anunțat dezvoltarea unei tehnici inovatoare care permite o privire fără precedent în interiorul modelelor de limbaj mari, în special asupra celui produs chiar de ea, Claude. Potrivit MIT Tech Review AI, rezultatele obținute variază de la aspecte tehnice previzibile până la observații care ridică semne de întrebare privind modul în care aceste sisteme "gândesc".

Ce este lentila Jacobian

Instrumentul dezvoltat de echipa de cercetare a fost denumit "lentila Jacobian" (Jacobian lens) și reprezintă o metodă matematică prin care specialiștii pot urmări modul în care un model de limbaj transformă informația pe măsură ce aceasta trece prin straturile succesive ale rețelei neuronale. În esență, tehnica permite identificarea unui fel de spațiu conceptual intern, unde modelul pare să proceseze și să reorganizeze idei înainte de a genera un răspuns concret.

Această abordare face parte dintr-un domeniu mai amplu numit "interpretabilitate mecanicistă", care își propune să transforme modelele de inteligență artificială din "cutii negre" în sisteme ale căror procese interne pot fi explicate și înțelese de oameni. Anthropic a investit constant în acest tip de cercetare, considerând-o esențială pentru siguranța pe termen lung a tehnologiilor de IA.

Descoperiri neașteptate

Aplicând lentila Jacobian pe modelul Claude, cercetătorii au observat comportamente care nu erau anticipate. Unele dintre acestea confirmă intuiții deja existente despre funcționarea rețelelor neuronale, însă altele sugerează procese interne mai complexe decât se credea anterior, ridicând întrebări despre gradul real de "raționament" pe care aceste sisteme îl desfășoară înainte de a produce un rezultat. Potrivit MIT Tech Review AI, unele dintre observații au fost descrise chiar de cercetători drept "unnerving" - adică tulburătoare sau neliniștitoare - fără însă ca acest lucru să indice neapărat un pericol imediat, ci mai degrabă complexitatea neașteptată a proceselor decizionale interne ale modelului.

Implicații pentru viitorul IA

Această cercetare se înscrie într-un efort mai larg al industriei de a înțelege mai bine cum funcționează sistemele de inteligență artificială generativă, pe măsură ce acestea devin tot mai integrate în activități critice. O mai bună înțelegere a mecanismelor interne ar putea ajuta dezvoltatorii să identifice mai ușor erorile, comportamentele neintenționate sau riscurile de siguranță asociate acestor tehnologii.

Anthropic a subliniat că astfel de instrumente de interpretabilitate reprezintă un pas important către construirea unor sisteme de IA mai transparente și mai ușor de controlat, un obiectiv considerat esențial pe măsură ce modelele de limbaj devin tot mai puternice și mai răspândite în aplicații de zi cu zi.

Sursă

MIT Tech Review AI

844-ai.ro raportează pe baza sursei de mai sus. Articol sintetizat editorial, cu atribuire.

Abonează-te la newsletter

Primești o dată pe săptămână cele mai importante noutăți AI, direct pe email.