Mario Rodríguez Mestre assegura que el seu equip ja havia identificat el 2022 el sistema molecular que Anthropic va presentar com un descobriment de Claude i revela que havia compartit amb la IA la seva tesi, esborranys, dades i materials privats de recerca.
La promesa que la intel·ligència artificial es pot convertir en una nova màquina de descobriment científic s’enfronta a una pregunta incòmoda: què passa quan una IA anuncia com a descobriment propi alguna cosa que un investigador ja havia descobert i havia compartit prèviament amb aquella mateixa eina? És l’interrogant que planteja el cas de Mario Rodríguez Mestre, biòleg computacional de la Universitat de Copenhaguen, després que Anthropic presentés com un dels primers grans èxits científics autònoms de Claude un sistema molecular que l’investigador espanyol assegura que el seu equip havia localitzat i caracteritzat anys abans. La controvèrsia no demostra que Claude hagi utilitzat indegudament les dades del científic, però obre un debat molt més profund sobre privacitat, propietat intel·lectual, atribució i traçabilitat del coneixement en una ciència cada vegada més dependent dels models d’intel·ligència artificial.
La història va començar públicament el 23 de setembre, quan Anthropic va anunciar la creació d’un nou grup de recerca i un laboratori dedicat a les ciències de la vida. La companyia va assegurar que Claude havia descobert de manera pràcticament autònoma un sistema enzimàtic fins aleshores no caracteritzat, associat a unes llargues seqüències repetitives d’ADN amb una disposició que recorda, estructuralment, CRISPR. Anthropic va batejar el sistema com a ART, sigles d’array-associated reverse transcriptases, i va presentar el resultat com una demostració que els models generals d’IA poden començar a recórrer per si mateixos enormes bases de dades genòmiques, detectar anomalies interessants, formular hipòtesis i assenyalar candidats que posteriorment els científics humans poden validar experimentalment.
950 agents, 21 hores i 210 milions de tokens
La dimensió computacional de l’experiment era espectacular. Segons Anthropic, uns 950 agents de Claude van treballar durant aproximadament 21 hores i van consumir 210 milions de tokens per explorar una enorme base de dades de seqüències genètiques. La companyia afirma que va donar als agents una instrucció general perquè busquessin exemples interessants de transcriptases inverses i que aquests van examinar famílies diferents, van consultar literatura científica, van comparar estructures i van seleccionar candidats utilitzant el seu propi criteri. Un d’ells va detectar finalment una transcriptasa inversa situada al costat d’un gen associat i una llarga matriu de repeticions d’ADN espaiades regularment.
La comparació amb CRISPR era inevitablement poderosa des del punt de vista científic i mediàtic. CRISPR també va sorgir de l’observació d’unes estranyes seqüències repetides en microorganismes abans que els investigadors comprenguessin que formaven part d’un sistema immunitari bacterià i aprenguessin a convertir-lo en una eina programable d’edició genètica. Anthropic va ser prudent a l’hora de reconèixer que encara desconeix la funció fonamental d’ART i que calen molts més experiments, però va presentar el descobriment com una primera demostració que Claude pot identificar anomalies biològiques rellevants i dirigir anàlisis que iniciïn autèntics processos de descobriment.
El problema va aparèixer poc després: algú ja coneixia aquelles molècules.
«El descobriment que fan no és gens nou»
Mario Rodríguez Mestre sosté que ell i el seu equip estudiaven aquests sistemes des del 2022. Segons va explicar a elDiario.es, les molècules que Anthropic presenta com a ART són retrons, sistemes basats en transcriptases inverses capaços de sintetitzar ADN a partir d’ARN no codificant. El grup de Rodríguez Mestre les havia localitzat en virus gegants o jumbòfags i les havia batejat informalment com a «jumbotrons». La seva arquitectura permet produir quantitats importants d’ADN i podria tenir aplicacions futures, entre altres possibilitats, en edició genètica múltiple.
L’objecció del científic va més enllà d’una disputa terminològica. Segons el seu relat, el seu equip ja havia identificat i caracteritzat el 2022 les mateixes seqüències i els seus conjunts associats d’ARN. El treball, però, encara no havia estat publicat en una revista científica ni dipositat en un servidor de preprints. Això converteix la coincidència en particularment delicada: si la informació no estava disponible públicament, com va arribar Claude a un resultat tan semblant?
Aquí apareix l’element que ha encès les alarmes. Rodríguez Mestre utilitzava Claude intensament en la seva feina científica. Segons explica, el sistema va tenir accés al manuscrit de la seva tesi, a esborranys d’articles, a carpetes compartides del laboratori i a correus electrònics amb col·laboradors. En paraules de l’investigador, Claude tenia accés «pràcticament a tot».
Rodríguez Mestre no acusa Anthropic d’haver robat deliberadament les seves dades. Al contrari, reconeix expressament que no disposa de proves per demostrar que Claude utilitzés aquella informació privada per arribar al suposat descobriment. Però considera que la coincidència obliga a plantejar aquesta possibilitat i, sobretot, a discutir quines garanties reals tenen els científics quan lliuren informació inèdita a sistemes propietaris.
Anthropic nega haver entrenat Claude amb aquestes converses
La resposta d’Anthropic introdueix un element fonamental. La companyia ha assenyalat que Claude no va ser entrenat amb les transcripcions privades de l’investigador i que el seu equip de biologia molecular no va tenir accés a aquestes converses. També sosté que no tenia coneixement de cap treball publicat que descrivís prèviament el sistema presentat com a ART.
Això deixa oberta una possibilitat molt menys inquietant, però científicament perfectament plausible: que Claude arribés de manera independent a unes seqüències que Rodríguez Mestre ja havia trobat. Enormes bases de dades genòmiques poden ser examinades per equips diferents i conduir a descobriments paral·lels. La història de la ciència és plena de troballes simultànies i independents.
Però precisament perquè el treball de Rodríguez Mestre no estava publicat i perquè l’investigador havia utilitzat Claude per treballar-hi, demostrar aquesta independència resulta molt més complicat.
La qüestió ja no consisteix únicament a saber qui va veure primer una determinada seqüència genètica. El veritable problema és la procedència del coneixement d’una IA. Quan un investigador humà publica un resultat, existeix una cadena d’atribució: autors, referències, experiments, dates, quaderns de laboratori i publicacions. Quan un model produeix una hipòtesi després de processar quantitats gegantines d’informació, reconstruir l’origen exacte d’una idea pot resultar extraordinàriament difícil.
Dues hipòtesis i totes dues són problemàtiques
Rodríguez Mestre planteja dues explicacions possibles. La primera és que, d’alguna manera, el material que havia proporcionat a Claude influís en el resultat. El mateix científic admet que no ho pot demostrar i Anthropic ho nega. La segona possibilitat és que investigadors de la companyia coneguessin prèviament aquest tipus de seqüències i que l’experiment estigués més orientat del que la seva presentació pública suggeria.
Per a Rodríguez Mestre, qualsevol dels dos escenaris mereix discussió perquè afecta directament la manera com la comunitat científica ha d’utilitzar els models propietaris. Si la IA pot incorporar informació confidencial introduïda per investigadors, existeix un problema evident de privacitat i apropiació intel·lectual. Si, en canvi, els experiments estan fortament guiats per coneixement humà previ però es presenten com a descobriments autònoms de la IA, el problema passa a ser d’atribució i comunicació científica.
Anthropic descriu una metodologia diferent. Segons el seu relat, la intervenció humana es va limitar essencialment a proporcionar la pregunta inicial i posteriorment fer les comprovacions experimentals al laboratori. Els agents de Claude haurien recorregut les dades, investigat les famílies de transcriptases inverses i seleccionat autònomament els candidats.
La diferència entre totes dues versions no és menor. Està en joc una qüestió tan fonamental com determinar què significa realment que una intel·ligència artificial hagi fet un descobriment científic.
El científic abandona Claude
Rodríguez Mestre n’ha extret una conclusió pràctica contundent. Ha anunciat que deixarà d’utilitzar Claude per a les seves investigacions i que està intentant traslladar la seva feina a models de codi obert. També recomana a altres investigadors reconsiderar l’ús de grans models propietaris quan treballen amb informació encara no publicada.
La seva advertència ha trobat ressò entre altres científics. Toni Gabaldón, responsable del grup de Genòmica Comparada de l’IRB Barcelona, considera ingenu assumir sense més que les grans tecnològiques mantindran una ètica impecable en el tractament d’informació científica sensible. Ana Rojas, investigadora del CSIC i directora del grup de Biologia Computacional i Bioinformàtica, assenyala una altra dificultat: els científics s’estan fent progressivament dependents d’eines el funcionament intern i les polítiques de tractament de dades de les quals no poden auditar directament.
El problema s’estén, a més, molt més enllà de l’investigador que introdueix personalment informació a ChatGPT o Claude. Un científic pot decidir no compartir un manuscrit inèdit amb cap IA i descobrir posteriorment que un col·laborador, un revisor, un editor o qualsevol altra persona amb accés al document sí que ho ha fet. En una investigació amb desenes de participants resulta pràcticament impossible controlar totes les vies per les quals una dada confidencial pot acabar entrant en un sistema extern.
El nou «snoop-and-scoop» de la ciència
El Financial Times ha situat l’episodi dins d’un problema emergent que denomina «snoop-and-scoop»: sistemes d’IA que podrien tenir accés, directament o indirectament, a idees científiques abans de la seva publicació i posteriorment participar en resultats que competeixen amb aquestes mateixes investigacions. No hi ha proves que això hagi passat deliberadament en el cas d’Anthropic, però la mera possibilitat obliga a reconsiderar les normes de confidencialitat científica.
El precedent resulta especialment delicat perquè els models d’IA estan entrant en totes les etapes de la investigació: cerca bibliogràfica, programació, anàlisi estadística, interpretació de dades, redacció de manuscrits, generació d’hipòtesis i disseny experimental. Com més útils es tornen, més informació inèdita reben.
I com més informació reben, més important resulta saber què passa amb aquesta informació.
El cas també arriba després d’altres controvèrsies sobre l’atribució de descobriments científics i matemàtics en què s’ha discutit fins a quin punt sistemes d’intel·ligència artificial poden estar aprofitant idees humanes encara no plenament reconegudes. Els episodis són diferents i no hi ha proves d’una pràctica sistemàtica, però apunten cap a la mateixa zona grisa: la ciència encara no disposa de regles preparades per establir la procedència d’una idea quan humans i models treballen contínuament sobre els mateixos problemes.
La IA pot accelerar la ciència, però de qui serà el descobriment?
La paradoxa és que l’episodi no redueix necessàriament la importància de la intel·ligència artificial per a la ciència. Fins i tot si Rodríguez Mestre hagués descobert abans el sistema, que centenars d’agents puguin rastrejar gegantines bases genòmiques en només unes hores i detectar de manera independent una estructura biològicament interessant continuaria sent una demostració poderosa del que aquestes eines poden aportar.
Però també canviaria la naturalesa de l’assoliment.
No seria exactament la història d’una IA descobrint alguna cosa que cap humà havia vist. Seria la història d’una IA capaç de reproduir ràpidament una troballa a la qual un grup d’investigadors havia arribat després d’anys de feina. Aquesta capacitat també seria extraordinària, però és científicament diferent i exigeix una comunicació molt més precisa.
La controvèrsia ART mostra, per tant, un problema que creixerà a mesura que els models es converteixin en millors científics. La qüestió ja no serà simplement si una IA pot formular una hipòtesi, escriure codi o interpretar un experiment. Caldrà poder reconstruir d’on procedeix cada descobriment, quina informació va utilitzar el sistema, qui va aportar les idees fonamentals i qui mereix el reconeixement.
La ciència moderna ha construït durant segles mecanismes per respondre aquestes preguntes entre éssers humans: citacions, autoria, patents, revisió per parells, quaderns de laboratori i dates de publicació. La intel·ligència artificial està desdibuixant aquestes fronteres a una velocitat per a la qual aquestes institucions no estaven preparades.
El cas de Mario Rodríguez Mestre no demostra que Claude li robés una idea. Però sí que demostra una cosa potser més important: quan una intel·ligència artificial pot treballar sobre milions d’articles públics mentre simultàniament ajuda científics amb investigacions privades, la traçabilitat deixa de ser un detall tècnic i es converteix en una condició essencial de la confiança científica.
Si les companyies volen presentar els seus models com a descobridors, hauran de demostrar no només que els seus sistemes troben coses noves. També hauran de demostrar d’on no les han tret.