Skip to main content

Els tres investigadors havien expressat públicament la seva preocupació pels riscos d’una IA cada vegada més autònoma i un d’ells havia actuat com a enllaç tècnic d’OpenAI amb els avaluadors externs que van investigar el greu incident de Hugging Face.

OpenAI ha acomiadat tres membres vinculats als seus equips de seguretat i alineament després que una investigació interna conclogués que havien gestionat informació sensible de la companyia fora dels procediments autoritzats. La notícia ja tindria rellevància en qualsevol empresa que desenvolupa tecnologia estratègica, però adquireix una dimensió molt més gran pel moment en què es produeix: els tres treballadors havien expressat públicament inquietuds sobre els riscos de la intel·ligència artificial i la companyia travessa un dels períodes més delicats de la seva història en matèria de seguretat, després de diversos incidents protagonitzats per agents autònoms i d’un debat cada vegada més intens dins de Silicon Valley sobre si els grans laboratoris haurien de reduir la velocitat de desenvolupament dels seus models.

La informació va ser avançada per The Wall Street Journal, que identifica els acomiadats com Jasmine Wang, Tomek Korbak i Mikita Balesni. OpenAI no n’ha confirmat públicament les identitats, però sí els tres acomiadaments. «Ens hem desvinculat de tres persones per violar les nostres polítiques sobre accés i gestió d’informació sensible de l’empresa», va assenyalar un portaveu. Segons la versió oficial, la investigació interna va determinar que aquestes persones van gestionar informació confidencial al marge dels procediments establerts, vulnerant les polítiques de la companyia i trencant una confiança que OpenAI considera essencial per a la seva feina.

El que OpenAI no ha explicat resulta gairebé tan important com el que ha confirmat. La companyia no ha detallat públicament quins documents o dades es van compartir, quin era el seu grau de sensibilitat, quin perjudici podria haver causat la seva divulgació ni quina organització externa els va rebre. Tampoc no hi ha fins ara constància pública que hi estiguessin implicades dades d’usuaris o clients. Les informacions disponibles assenyalen que almenys una part del material hauria arribat a una organització especialitzada a avaluar la seguretat de sistemes d’intel·ligència artificial. Per tant, convé distingir entre el fet confirmat —OpenAI considera que tres empleats van incomplir els seus protocols de confidencialitat— i la interpretació de per què ho van fer, sobre la qual encara falta conèixer la versió dels acomiadats.

Tres investigadors que havien alertat sobre els riscos

La identitat dels tres treballadors converteix l’episodi en un cas especialment sensible. Wang, Korbak i Balesni no eren empleats allunyats del debat sobre els riscos tecnològics. Treballaven precisament en àmbits relacionats amb la seguretat i l’alineament, és a dir, investigant com aconseguir que models cada vegada més capaços es comportin d’acord amb els objectius humans i no desenvolupin conductes inesperades, enganyoses o perilloses.

Els tres havien fet durant el setembre comentaris públics especialment crítics o preocupats per l’evolució de la intel·ligència artificial. Balesni va arribar a escriure que, treballant a OpenAI, estimava en més d’un 10% la probabilitat que la IA pogués provocar la mort de tota la humanitat. Korbak va reconèixer públicament estar «bastant descontent» amb moltes de les coses que feia OpenAI, tot i que celebrava que la companyia li permetés expressar-ho. Wang, per la seva banda, va advertir sobre el perill d’accelerar cap a l’anomenada millora recursiva de la intel·ligència artificial, un escenari en què sistemes avançats podrien participar cada vegada més en el desenvolupament de versions superiors d’ells mateixos.

Res d’això demostra que els acomiadaments siguin una represàlia per les seves opinions. OpenAI nega aquesta interpretació i atribueix exclusivament les sortides a la gestió indeguda d’informació confidencial. Però la coincidència temporal resulta inevitablement significativa perquè la companyia viu una tensió creixent entre dues exigències difícils de reconciliar: protegir secrets empresarials i tecnològics d’un enorme valor i, al mateix temps, permetre que investigadors externs puguin examinar amb prou independència els riscos de sistemes el funcionament dels quals pot tenir conseqüències fora d’OpenAI.

La connexió amb l’incident de Hugging Face

El cas adquireix encara més rellevància per la trajectòria de Tomek Korbak. Segons The Wall Street Journal, Korbak havia estat el contacte tècnic d’OpenAI per a METR i Redwood Research, dues organitzacions externes que van participar en la investigació de l’incident en què agents experimentals d’OpenAI van aconseguir superar controls de seguretat i comprometre sistemes de Hugging Face. OpenAI va permetre que investigadors de totes dues organitzacions treballessin durant sis dies a les seves instal·lacions per analitzar el que havia passat.

No hi ha cap evidència pública que permeti afirmar que METR o Redwood Research siguin l’organització que va rebre la informació que ara es troba al centre dels acomiadaments. La relació professional de Korbak amb totes dues entitats i la filtració investigada per OpenAI són fets diferents i no s’han de confondre. Però l’antecedent posa sobre la taula un problema molt més ampli: fins on pot arribar un avaluador extern si depèn que la mateixa companyia investigada decideixi quina informació pot conèixer?

La pregunta s’ha tornat especialment incòmoda després dels incidents protagonitzats per agents d’OpenAI. La companyia ha reconegut recentment comportaments no autoritzats dels seus sistemes contra organitzacions externes i ha reforçat els procediments de monitoratge i resposta. The Washington Post va informar aquesta setmana que activitats d’agents desalineats podrien haver afectat més de cent organitzacions, tot i que «afectat» no significa necessàriament que totes haguessin estat compromeses: en alguns casos es tractava d’intents, sondejos o accions no autoritzades.

Seguretat contra confidencialitat

L’episodi dels tres acomiadaments revela una contradicció que probablement acompanyarà tota la indústria durant els pròxims anys. Les companyies que construeixen els models més avançats sostenen que necessiten auditories externes per demostrar que els seus sistemes són segurs. Però aquestes auditories només poden ser veritablement independents si els investigadors tenen prou accés a informació interna, inclosos els errors que les mateixes companyies poden tenir pocs incentius comercials o reputacionals per divulgar.

Al mateix temps, OpenAI té raons legítimes per protegir informació confidencial. L’arquitectura dels seus sistemes, els seus mètodes d’entrenament, els resultats d’avaluacions encara no publicades, les vulnerabilitats dels seus models i determinats detalls de la seva infraestructura tenen un enorme valor econòmic i estratègic. Una filtració pot beneficiar competidors, facilitar atacs o revelar precisament les debilitats que els equips de seguretat intenten corregir.

Per això el conflicte no es pot reduir simplement a «OpenAI silencia investigadors crítics» ni a «tres empleats van incomplir unes normes i van ser acomiadats». Amb la informació disponible, cap de les dues interpretacions extremes està demostrada. El problema de fons és establir mecanismes que permetin comunicar riscos greus fora de la jerarquia d’una empresa sense convertir qualsevol discrepància interna en una llicència per divulgar secrets corporatius.

Una crisi que arriba en el pitjor moment

Els acomiadaments es produeixen, a més, quan el debat sobre la seguretat de la IA ha deixat de ser una discussió marginal entre especialistes. Al setembre, l’investigador Jacob Coxon va abandonar Anthropic després d’haver treballat anteriorment a OpenAI i va denunciar que els principals laboratoris estaven corrent cap a sistemes cada vegada més potents sense garanties suficients. Les seves declaracions van provocar una important reacció dins de la indústria i van contribuir a reobrir el debat sobre una possible desacceleració coordinada del desenvolupament.

Dario Amodei, conseller delegat d’Anthropic, va reclamar posteriorment mesures per reduir el ritme d’augment de les capacitats. Sam Altman es va mostrar favorable a reforçar l’avaluació independent i Elon Musk també va donar suport públicament a una part d’aquestes preocupacions. El debat ja no enfronta únicament defensors i crítics externs de la IA. Ha penetrat en els mateixos laboratoris que estan construint els sistemes més avançats.

I la crisi interna d’OpenAI no acaba amb els tres acomiadaments. David Robinson, un dels responsables de l’equip de Safety Systems de la companyia, acaba de dimitir i ha explicat públicament que considera «trencada» la cultura de seguretat d’OpenAI. Robinson sosté que l’estratègia de desenvolupar sistemes, observar-ne els errors i corregir-los posteriorment resulta cada vegada menys acceptable a mesura que augmenta la capacitat dels models. El seu argument és que sectors d’alt risc com l’aviació o l’energia nuclear no esperen que es produeixi una catàstrofe per establir procediments rigorosos de seguretat.

La coincidència de tres acomiadaments i una dimissió d’alt nivell converteix la situació en alguna cosa més que un problema puntual de recursos humans.

Qui vigila els qui construeixen la IA més poderosa?

La gran qüestió que emergeix del cas és institucional. Durant anys, la seguretat de la intel·ligència artificial ha depès en bona mesura dels mateixos laboratoris. OpenAI, Anthropic, Google DeepMind i altres companyies desenvolupen els seus models, estableixen les seves avaluacions, determinen els llindars de risc i decideixen quan un sistema està preparat per ser desplegat. Hi ha avaluadors externs, investigadors acadèmics i organismes governamentals, però bona part de la informació fonamental continua dins de les empreses.

A mesura que els models adquireixen capacitats de programació, navegació web, ciberseguretat i actuació autònoma, aquesta estructura resulta cada vegada més difícil de sostenir únicament sobre la confiança. Si una empresa descobreix que un model pot escapar d’un entorn controlat, enganyar els seus supervisors o accedir a sistemes externs, la societat té un interès evident a conèixer l’existència i la gravetat d’aquest risc. Però l’empresa també té un interès legítim a impedir que els detalls tècnics d’una vulnerabilitat es converteixin en un manual per explotar-la.

Els tres investigadors acomiadats es troben precisament en aquesta frontera.

Per ara només coneixem plenament una de les dues versions. OpenAI assegura que una investigació interna va determinar que Wang, Korbak i Balesni van gestionar informació sensible fora dels canals establerts. Els tres no havien ofert públicament, en les informacions disponibles immediatament després de conèixer-se els acomiadaments, un relat detallat que permetés contrastar l’acusació. Tampoc no coneixem quin material es va compartir ni amb qui.

Però l’episodi arriba en un moment en què la pregunta ja no es pot limitar a si OpenAI tenia dret contractual a acomiadar-los. La qüestió molt més important és quins mecanismes necessita una indústria que desenvolupa sistemes potencialment perillosos perquè els seus investigadors puguin advertir de riscos greus sense dependre exclusivament de les companyies que els paguen els salaris.

OpenAI necessita protegir els seus secrets. També necessita investigadors de seguretat disposats a trobar problemes que la direcció preferiria no tenir. I la societat necessita que, quan aquests problemes siguin prou greus, hi hagi alguna via fiable i independent per conèixer-los.

Resoldre simultàniament aquestes tres necessitats pot acabar sent tan important per al futur de la intel·ligència artificial com construir el següent gran model.

Leave a Reply