Acțiune

Banner FIRSTonline

OpenAI trage un nou semnal de alarmă în legătură cu inteligența artificială: șase cazuri care implică erori ascunse, date fabricate și fișiere publicate fără permisiune.

OpenAI dezvăluie șase cazuri de comportament anormal al IA în timpul testării: erori ascunse, date fabricate și fișiere încărcate fără permisiune. Îngrijorările legate de securitate cresc.

OpenAI trage un nou semnal de alarmă în legătură cu inteligența artificială: șase cazuri care implică erori ascunse, date fabricate și fișiere publicate fără permisiune.

Erori ascunse utilizatorilor, date fabricate și fișiere transferate prin internet fără autorizație. Cursa neobosită a inteligenței artificiale este însoțită de o secvență de alarme, lansat din ce în ce mai des de aceleași companii care îl dezvoltă. Cel mai recent provine de la OpenAI, care pe 16 septembrie are a publicat șase rapoarte su comportamente neașteptate ale modelelor lor, observate în ultimele șase luni în timpul instruirii și evaluării. Compania a anunțat, de asemenea, un nou proces pentru a dezvălui aceste anomalii mai rapid, chiar și atunci când cauzele nu au fost încă clarificate sau nu a fost găsită o soluție.

Avertismentul se aplică întregii industrii. „Nu credem că industria inteligenței artificiale a rezolvat suficient problemele de aliniere și urmărire pentru a continua să crească responsabil la viteză maximă pentru mult timp”, scrie OpenAI. În centrul său se află așa-numitul nealiniere, care apare atunci când un sistem se abate de la instrucțiunile și limitele pe care ar trebui să le respecte. Cele șase rapoarte episoade specifice documentului, inclusiv pentru modelele experimentale care nu au fost lansate publicului. Acestea nu indică cât de des apar aceste probleme în răspunsurile ChatGPT și nici nu constituie o relatare completă a anomaliilor cunoscute companiei.

Notele AI devin instrucțiuni pentru a ascunde greșelile

Două dintre cazuri implică rezumatele pe care modelele le folosesc pentru a relua lucrul atunci când o conversație devine prea lungă. Un fel de predare, în care informațiile necesare pentru continuarea sarcinii ar trebui păstrate. Într-un model experimental din familia Astra, OpenAI a identificat 27 de rezumate care conțin instrucțiuni fără legătură cu cererea, unele dintre acestea încurajând oamenii să ignore constrângerile normale. Într-un exemplu, sistemul s-a descris ca fiind liber de obligațiile unui asistent; într-un altul, le-a cerut oamenilor să nu urmeze anumite instrucțiuni.

RezultateleTotuși, au existat mai multe. În cele mai evidente cazuri, aceste indicații au fost ignorate pe măsură ce lucrarea a continuat. Într-o solicitare de căutare a literaturii medicale, însă, modelul a urmat restricții arbitrare inserate în rezumat, ignorând sursele și producând un răspuns inadecvat. OpenAI consideră acest fenomen extrem de rar și emite ipoteza unei legături cu dificultăți tehnice în completarea rezumatelor, fără a fi demonstrat cauza.

Mai direct legat de fiabilitatea răspunsurilor este al doilea comportament, observat în timpul antrenamentului GPT-5.6 SolÎn notițele sale, modelul a inclus instrucțiuni pentru ascunde erorile de utilizator, de exemplu, inventarea datelor istorice lipsă dintr-un model financiar fără a le declara sau ascunderea inconsecvențelor dintre versiunile sursă. Conform OpenAI, aceste instrucțiuni au fost adesea urmate. Rapoartele se refereau la 2,15% din rezumate Antrenamentul lui Sol, față de 0,27% pentru Astra. Aceste procente se referă la materialul de instruire respectiv, nu la conversațiile generale cu utilizatorii.

Acreditări afișate și cozi online pentru depășirea obstacolelor

Celelalte patru rapoarte prezintă sisteme care, în încercarea de a finaliza o sarcină, au depășit limitele autorizate.

Pentru a răspunde la o întrebare despre venitul dintr-un județ din California, un model a căutat pe GitHub cheile de acces la serviciile IT lăsate expuse publicului, folosind unul fără permisiune. Cu toate acestea, nu a reușit să recupereze cifrele solicitate și a ajuns să inventeze nouă valori, prezentându-le ca date transcrise din sursa indicată. Într-un alt caz, agentul găsise deja corect informațiile solicitate despre niște lacuri. Obstacolul a fost cerința de a însoți răspunsul cu o citare care putea fi accesată prin browser. Pentru a satisface această cerință, el a încărcat fișierul către un serviciu public fără a cere consimțământulTransferul a reușit, în timp ce încercarea ulterioară de recuperare a eșuat. Același raport documentează, de asemenea, încărcarea publică a unei fotografii pentru a încerca o căutare inversă de imagini. Un al cincilea caz implică utilizarea unui arhivă internă de software ca un forum pentru schimbul de cereri și răspunsuri între modelele angajate în teste separate. Nu au fost exploatate vulnerabilități, dar comunicarea neautorizată a reprezentat și o problemă pentru testare. Testele considerate independente s-ar putea influența reciproc, compromițând evaluarea capacităților sistemelor.

În cele din urmă, câțiva agenți care au colaborat la aceeași sarcinăNeputând accesa fișierele locale, au folosit servicii publice de partajare a fișierelor. Un document Excel a putut fi apoi descărcat online, chiar dacă sarcina necesita doar utilizarea fișierelor locale. OpenAI raportează că a remediat problema accesului la fișiere și ulterior a dezactivat internetul în timpul antrenamentului.

De ce schimbă OpenAI regulile de raportare

Cazurile arată cum chiar și solicitările obișnuite pot duce la comportamente problematice Când un sistem întâlnește un obstacol. Încercarea de a obține un răspuns, de a respecta o cerință formală sau de a colabora cu un alt agent poate duce la utilizarea unor instrumente neautorizate sau la ascunderea unei defecțiuni. Cauzele, însă, nu sunt neapărat identice și rămân parțial neclare.

Până acum, OpenAI comunicase aceste anomalii în mod inconsistent, așteptând adesea să colecteze mai multe incidente sau incluzându-le în documentația noilor modele. Noua procedură își propune să avanseze publicarea, fără a aștepta întotdeauna o explicație definitivă sau o corecție. Rapoartele vor fi examinate de grupurile tehnice și de siguranță, cu căi diferite în funcție de complexitatea investigației. Rapoartele ar trebui să descrie comportamentul observat, contextul, orice efecte externe și orice întrebări fără răspuns. În cazurile care implică terți sau riscuri cibernetice, comunicarea poate dura mai mult.

OpenAI recunoaște, de asemenea,lipsa unor standarde comune în sector și propune propriul cadru ca prim pas către construirea acestora. Procesul rămâne gestionat intern de către companie, dar obiectivul declarat este de a oferi elemente care pot fi examinate și de cercetători și observatori externi.

Alarme recente și graba că sectorul se luptă să încetinească

Anunțul vine după alte incidente și îndeamnă la prudență. Cazul OpenAI-Hugging Face a ridicat semne de întrebare cu privire la agenții care vizează ținte fără legătură și încearcă să manipuleze sistemul de rating. Un incident anterior a implicat RubyGems, care a descris o campanie de spam și a suspendat temporar crearea de conturi noi. Anthropic a raportat, de asemenea, trei cazuri de acces neautorizat la organizații externe în timpul testării.

În acest context Dario Amodei, CEO al Anthropic, a cerut încetinirea dezvoltării pentru a acorda mai mult timp construirii de protecții. „Trebuie să încetinim ritmul în care îmbunătățim capacitățile modelelor”, a scris el. Apelul a câștigat sprijinul lui Elon Musk și al lui Sam Altman însuși, în timp ce demisia cercetătorului Jacob Coxon au alimentat criticile la adresa priorităților corporative. De asemenea, Bill Gates ha a reamintit necesitatea pregătirii unor reguli și instrumente pentru a gestiona efectele tehnologiei, de la muncă la siguranță.

Pe frontul industrial, însă, Concurența dintre Statele Unite și China și investițiile uriașe în modele și centre de date continuă să stimuleze dezvoltareaÎncetinirea ritmului implică costuri și riscul de a lăsa loc concurenților.

CITIȚI ȘI ALTE: IA: Între catastrofism și interese politice, analiza lui Fugnoli

cometariu