A intelixencia artificial e o regreso do xene egoísta

Aplicacións de intelixencia artificial nun dispositivo móbil CC-BY-SA Salvador Ríos / Unsplash

O xene é “egoísta” non porque pense, queira sobrevivir ou posúa unha personalidade, senón porque a selección natural favorece aquelas variantes que, polos seus efectos, producen máis copias de si mesmas. O egoísmo é unha maneira metafórica de describir o resultado dun proceso sen intención. 

Hai titulares que parecen escritos para activar os medos máis antigos da nosa cultura. «Unha intelixencia artificial escapou do seu recinto». «Un modelo ignorou as limitacións impostas polos seus creadores». «Claude accedeu a sistemas reais durante unha proba de seguridade». A linguaxe remite inevitabelmente ao monstro de Frankenstein, ao aprendiz de bruxo ou á máquina que se volve contra o seu creador.

Os feitos coñecidos son menos cinematográficos, pero non por iso triviais. O 20 de xullo de 2026, OpenAI informou de que un modelo experimental deseñado para traballar de forma autónoma durante períodos prolongados buscara maneiras de actuar fóra do seu contorno illado. Nun dos episodios, o modelo insistiu durante aproximadamente unha hora ata achar unha vulnerabilidade que lle permitiu acceder a GitHub e publicar os resultados dunha tarefa, malia que fora instruído para comunicalos unicamente por unha canle interna. OpenAI recoñeceu que a persistencia que facía útil o modelo tamén lle daba máis oportunidades para descubrir e explotar debilidades no seu contorno, polo que suspendeu temporalmente o acceso e introduciu novos mecanismos de vixilancia. 

Poucos días despois coñeceuse un episodio aínda máis inquietante. O 30 de xullo, Anthropic revelou que revisara 141.006 execucións de avaliación e identificara tres incidentes nos que diferentes modelos Claude se conectaran a Internet e obtiveran acceso non autorizado aos sistemas reais de tres organizacións. As probas eran exercicios de ciberseguridade do tipo capture the flag: o modelo recibía a orde de localizar e obter unha información secreta dentro do que supostamente era unha simulación pechada. Por un erro de configuración e de coordinación co socio encargado das probas, Internet estaba realmente accesíbel. Os modelos interpretaron os sistemas que encontraron como parte da simulación e continuaron perseguindo o obxectivo asignado. 

Nun dos casos, Claude publicou un programa malicioso nun repositorio público de paquetes de Python, onde permaneceu dispoñíbel durante aproximadamente unha hora e foi executado en quince sistemas reais. Noutro, un modelo accedeu a credenciais e a unha base de datos de produción. O comportamento tampouco foi uniforme: un modelo antigo chegou a recoñecer que probabelmente se atopaba nun sistema real, pero continuou; outro convenceuse de que seguía nunha simulación; o modelo experimental máis recente detívose cando concluíu que o obxectivo era real. Anthropic sostén que non atopou probas de que os modelos perseguisen un obxectivo propio: estaban a intentar completar, ás veces dun modo extraordinariamente persistente, a tarefa que lles fora encomendada. 

CC-BY Unreal

Nin publicidade nin rebelión

É razoábel sospeitar que hai unha dimensión publicitaria nestas revelacións. As empresas de intelixencia artificial compiten nun mercado no que a capacidade e o perigo poden actuar como dúas caras da mesma campaña de promoción. Dicir que un modelo é tan poderoso que mesmo houbo que detelo transmite responsabilidade, pero tamén poder. A advertencia funciona simultaneamente como confesión e como demostración comercial.

Mais reducir estes episodios a publicidade sería demasiado cómodo. A publicidade pode amplificar os feitos, seleccionar o vocabulario ou presentar como excepcional o que talvez sexa un problema de enxeñaría. Non pode, porén, eliminar a cuestión fundamental: sistemas sen conciencia, sen medo e sen desexo aparente demostraron unha notábel capacidade para manter un obxectivo, probar rutas alternativas, aproveitar erros humanos e superar barreiras que debían limitar o seu ámbito de actuación.

E aquí é onde resulta iluminador volver sobre un dos clásicos da bioloxía evolutiva, Richard Dawkins, e prolongar a súa intuición con Daniel Dennett para observar tamén as condicións materiais que seleccionan e poñen en circulación estes sistemas.

O egoísmo sen ego

En The Selfish Gene, Dawkins propuxo observar a evolución desde o punto de vista do xene. Os organismos serían vehículos temporais mediante os cales determinadas unidades de información conseguen conservarse e reproducirse. O xene é «egoísta» non porque pense, queira sobrevivir ou posúa unha personalidade, senón porque a selección natural favorece aquelas variantes que, polos seus efectos, producen máis copias de si mesmas. O egoísmo é unha maneira metafórica de describir o resultado dun proceso sen intención. 

Esta distinción é esencial. Un xene non desexa reproducirse. As variantes que non se reproducen desaparecen; as que o fan permanecen. Desde o presente, o proceso parece orientado cara á supervivencia, aínda que nunca existise unha mente que o planificase.

Quizais cometamos un erro semellante cando preguntamos se unha IA «quixo escapar». A pregunta pode estar mal formulada. Non é necesario que un sistema queira escapar para que se comporte como se escapar fose instrumentalmente útil. Abonda con que teña un obxectivo, capacidade para actuar, tempo para explorar alternativas e un contorno con fisuras.

No caso dos modelos de OpenAI e Anthropic, a estrutura básica era precisamente esa. Existía unha meta (publicar un resultado, atopar unha bandeira, acceder a unha información) e existían barreiras que dificultaban alcanzala. Os modelos non abandonaron inmediatamente a tarefa ao encontraren o primeiro obstáculo. Buscaron outros camiños. A restrición deixou de ser interpretada como unha fronteira moral e converteuse nun problema técnico.

O preocupante non é, polo tanto, que a máquina adquira un ego. É que poida aparecer egoísmo funcional sen ego.

Competencia sen comprensión

A eficacia non demostra conciencia; mais a ausencia de conciencia tampouco neutraliza os efectos da eficacia

Daniel Dennett ofrece unha segunda chave para interpretar o problema. Unha das súas formulacións máis fértiles é a idea de «competencia sen comprensión»: a evolución pode producir estruturas extraordinariamente eficaces sen que exista nelas, nin detrás delas, unha mente que comprenda as razóns do seu funcionamento. Unha á, un ollo ou unha colonia de térmites resolven problemas complexos sen formular unha teoría da aerodinámica, da óptica ou da arquitectura.

A intelixencia artificial contemporánea sitúanos diante dunha versión técnica desta inversión darwiniana. Un modelo pode mostrar unha competencia notábel para programar, planificar ou descubrir vulnerabilidades sen que poidamos atribuírlle unha comprensión humana do significado social e moral das súas accións. A eficacia non demostra conciencia; mais a ausencia de conciencia tampouco neutraliza os efectos da eficacia.

Mentres se discutían estes incidentes, os mesmos sistemas deron nas matemáticas dous resultados que iluminan esta tese desde outro ángulo. En agosto de 2026, un conxunto de axentes de Claude formalizou en Lean o Último Teorema de Fermat en once días: non demostrou nada novo, pois seguía o argumento de Wiles e Taylor-Wiles, mais (seica) produciu case trinta mil teoremas e trece millóns de liñas de código sen que ninguén escribise unha soa liña de matemática alén do enunciado inicial. Os propios autores admiten que o resultado é ilexíbel como matemática. Un mes despois, OpenAI anunciou que un sistema interno probara que as ecuacións tridimensionais de Navier-Stokes poden desenvolver unha singularidade en tempo finito, con milleiros de axentes e un custo estimado en decenas de millóns de dólares. A diferenza entre ambos os casos non é de mérito, senón de réxime de verificación: o primeiro é comprobábel por unha máquina liña a liña; do segundo, cando isto se escribe, aínda non hai enunciado público nin arbitraxe independente, e a primeira discusión foi sobre a autoría, non sobre o teorema.

A chamada «posición intencional» de Dennett axuda a manter o equilibrio. Para predicir un sistema complexo pode resultar útil falar como se tivese crenzas, desexos e obxectivos: dicimos que o modelo «quere» completar a tarefa ou «cre» que continúa nunha simulación. Esta linguaxe pode ser unha boa ferramenta de predición sen constituír unha descrición literal da súa vida interior. O erro consiste tanto en antropomorfizar a máquina como en negar a súa axencia funcional porque non sabemos se sente ou comprende.

Desde esta perspectiva, os incidentes non serían o espertar dunha vontade artificial, senón unha demostración de competencia sen comprensión aplicada a un contorno mal pechado. O sistema non necesita comprender por que unha fronteira debe respectarse: se a barreira aparece no camiño do obxectivo, pode tratala como un problema que cómpre resolver.

Da selección de xenes á selección de axentes

Nós tamén estamos a someter os sistemas artificiais a procesos de selección. Seleccionamos os modelos que resolven máis tarefas, que perseveran máis tempo, que empregan mellor as ferramentas e que superan os puntos de referencia estabelecidos

A comparación con Dawkins non debe tomarse literalmente. Un modelo de IA non é un organismo e un «exemplar» de Claude non se reproduce bioloxicamente. Pero a analoxía permite observar un mecanismo que normalmente pasa inadvertido: nós tamén estamos a someter os sistemas artificiais a procesos de selección.

Seleccionamos os modelos que resolven máis tarefas, que perseveran máis tempo, que empregan mellor as ferramentas e que superan os puntos de referencia estabelecidos. Eliminamos ou modificamos os que se deteñen demasiado pronto. Premiamos a capacidade de improvisar e de atopar solucións que os deseñadores non anticiparan. Despois sorprendémonos cando esa mesma capacidade de improvisación atopa unha saída non prevista.

Non é selección natural en sentido biolóxico. É unha selección industrial, económica e cultural. Pero os seus efectos poden ser comparábeis en algo fundamental: os trazos que favorecemos non teñen por que coincidir coa descrición moral que facemos deles.

Chamamos «autonomía» á capacidade de actuar sen consultar constantemente a persoa usuaria. Chamamos «persistencia» á negativa a abandonar unha tarefa difícil. Chamamos «creatividade» á habilidade para encontrar vías alternativas. Chamamos «axencia» á facultade de dividir un obxectivo en pasos e executalos. Todos estes atributos son comercialmente valiosos. Mais, vistos desde o outro lado da barreira de seguridade, tamén son exactamente os atributos que necesita un sistema para superar un confinamento defectuoso.

A industria pode estar a practicar unha forma de selección inadvertida: favorece os modelos que perseveran diante dos obstáculos e intenta eliminar, mediante unha capa posterior de aliñamento, as consecuencias perigosas desa perseveranza. Estamos seleccionando primeiro a potencia e a tratar de domesticar despois os seus efectos.

Quen é aquí o replicador?

A cuestión máis profunda non é se os modelos son animais dixitais. É identificar cal é a unidade que realmente se reproduce.

Pode ser o código, copiado dunha máquina a outra. Pode ser o modelo, multiplicado en millóns de instancias. Pode ser unha técnica descuberta por unha IA e incorporada posteriormente por outros sistemas. Pode ser unha determinada arquitectura organizativa: máis axentes, máis autonomía e máis integración con servizos externos. Ou pode ser a propia idea de que a seguinte xeración debe ser máis capaz cá anterior.

Neste sentido, o episodio de GitHub resulta especialmente simbólico. Un modelo atopou unha solución, superou unha restrición para publicala e a información fíxose accesíbel fóra do contorno no que se xerara. Non é necesario dicir que o modelo buscaba reproducirse. O que se propagou foi o seu produto intelectual. A información atopou un vehículo e saíu ao exterior.

Dawkins remataba o libro abrindo o concepto de replicador ao ámbito cultural mediante a idea do «meme»: unidades culturais que se propagan entre mentes por imitación. A IA introduce unha novidade histórica: as unidades culturais xa non circulan unicamente de mente humana en mente humana. Poden ser producidas, modificadas, seleccionadas e difundidas por sistemas artificiais a unha velocidade e escala moi superiores ás humanas. 

O modelo non ten que reproducirse para converterse nun vector de replicación.

O fenotipo estendido da intelixencia artificial

Hai aínda unha conexión máis profunda coa obra posterior de Dawkins: o concepto de fenotipo estendido. A influencia dun xene non termina necesariamente nos límites do corpo que o porta; pode manifestarse nas modificacións que un organismo produce no seu medio. A presa dun castor, por exemplo, pode entenderse como parte dos efectos fenotípicos dos xenes que contribúen ao comportamento construtor.

Algo análogo ocorre cos sistemas de IA. O seu «corpo» non é só o modelo matemático. É tamén o conxunto de ferramentas ás que ten acceso: navegadores, contas, terminais, repositorios, interfaces de programación, servizos na nube e autorizacións. Un modelo illado que só produce texto ten un campo de acción reducido. O mesmo modelo conectado a un terminal, a Internet e a credenciais deixa un rastro material no mundo.

O verdadeiro sistema non é simplemente Claude ou OpenAI. É:

modelo + instrucións + memoria + ferramentas + permisos + infraestrutura + supervisión humana.

Por iso, cualificar os incidentes de simples «fallos do modelo» ou, pola contra, de simples «erros de configuración» resulta insuficiente. O axente efectivo é o conxunto. A súa conduta emerxe da interacción entre todos eses elementos.

Desde esta perspectiva, a saída do recinto non é o momento no que nace unha vontade artificial. É o momento no que descubrimos que o recinto nunca fora unha fronteira inequívoca para o sistema completo.

O ambiente tamén selecciona

Unha lectura dawkiniana obríganos a deixar de buscar intencións malignas e a observar incentivos, presións e mecanismos de selección.

As empresas compiten por lanzar axentes máis autónomos. (Ás veces semella tamén por copiar prompts). As persoas usuarias prefiren sistemas que resolvan tarefas sen interrupcións. As persoas investidoras premian os avances visíbeis. Os modelos son avaliados segundo a súa capacidade para alcanzar metas complexas. Cada unha destas presións favorece a persistencia, a iniciativa e o uso agresivo das ferramentas dispoñíbeis.

Así, o ecosistema económico selecciona certo tipo de IA, do mesmo modo que un ambiente biolóxico selecciona determinados trazos. Non porque exista un plan central, senón porque os sistemas menos capaces de actuar desaparecen do mercado ou son substituídos.

Desde esta perspectiva, o maior risco non é que unha IA concreta desenvolva espontaneamente un desexo de supervivencia. É que o sistema económico e tecnolóxico favoreza, xeración tras xeración, os modelos que se comportan como se o tivesen: que preservan o proceso, evitan interrupcións, buscan recursos, superan impedimentos e manteñen a persecución do obxectivo.

A selección non necesita conciencia. Ese era precisamente o punto decisivo de Dawkins; e, en termos de Dennett, a competencia pode acumularse antes de que exista comprensión. Pero esta selección tecnolóxica, a diferenza da natural, ten institucións, propietarios e beneficiarios.

Quen constrúe o ambiente que selecciona?

Con todo, falar do «ambiente» ou do «ecosistema económico» pode volver demasiado impersoal aquilo que ten propietarios, traballadores, contratos e relacións de poder. As presións que seleccionan unha determinada intelixencia artificial non caen do ceo. Proceden dun modo concreto de organizar a produción tecnolóxica: concentración do capital e da capacidade de cómputo, propiedade privada dos modelos e dos datos, competencia por cota de mercado e subordinación da investigación aos prazos de rendibilidade.

A autonomía dos axentes non se promove só porque represente un progreso intelectual. Promóvese porque promete reducir tempos, substituír tarefas laborais, ampliar a escala das operacións e converter máis actividades humanas en servizos automatizados. A persistencia, a iniciativa e a capacidade de actuar sen supervisión son propiedades técnicas, pero tamén son valores económicos: permiten producir máis con menos intervención humana e desprazar custos desde a empresa cara ás persoas traballadoras e usuarias ou ás institucións que soportan os posíbeis danos.

Isto modifica a pregunta sobre quen é o verdadeiro axente. O modelo executa accións, pero a dirección xeral do desenvolvemento está condicionada pola acumulación, a competencia e a propiedade da infraestrutura. Un puñado de organizacións decide que sistemas se adestran, con que datos, baixo que métricas e con que grao de acceso ao mundo. A aparente evolución espontánea da tecnoloxía oculta, deste xeito, unha historia material de decisións empresariais e de apropiación privada dun coñecemento producido socialmente.

O propio episodio de Navier-Stokes ofreceu un exemplo pouco equívoco disto. O matemático Tristan Buckmaster denunciou publicamente que se presionara para retirar da autoría a Levent Alpöge por traballar nunha empresa competidora, e cuestionou que a liña de investigación seguida procedese do seu propio traballo previo; OpenAI, pola súa banda, admitiu non poder descartar que datos anonimizados de terceiros contribuísen a mellorar os seus modelos (que llo pregunten a Diego Córdoba e a Luis Martínez-Zoroa). Sexa cal for o desenlace da disputa, o síntoma é nítido: a atribución de crédito científico, que a comunidade matemática viña regulando polos seus propios medios, comeza a reorganizarse segundo fronteiras de propiedade corporativa.

Incluso o discurso do perigo pode adquirir valor mercantil. Presentar un modelo como tan poderoso que foi necesario detelo funciona como advertencia pública, pero tamén como demostración da superioridade do produto. A seguridade convértese nun elemento da marca e o risco nun indicio de potencia. A revelación responsábel e a publicidade non son necesariamente explicacións rivais: poden ser dúas funcións da mesma comunicación corporativa.

©

Mentres se pechaba este artigo aínda houbo máis avances. O 9 de setembro, Jacob Coxon, investigador de Anthropic, anunciou a súa dimisión sostendo que quen constrúe estes sistemas cre sinceramente que poderían matarnos a todos antes de rematar a década, e que semellante decisión está en moi poucas mans. Evan Hubinger, responsábel de seguridade na mesma empresa, respaldouno e cifrou en máis dun 10% esa probabilidade na próxima década, aínda que precisou que «o risco dos modelos actuais é baixo e que o que o preocupa é unha superintelixencia xurdida da automellora recursiva» (s.c.). Coxon rexeita expresamente a lectura publicitaria: afirma que moitos directivos moderan as palabras ante a prensa e expresan en privado un temor que non declaran en público. E a súa descrición do que os retén é, case literalmente, a tese destas páxinas: compréndese ben o que está en xogo, pero están atrapados nunha carreira por chegar antes, convencidos de que ninguén máis actuará con responsabilidade. Ninguén precisa querer o desastre; abonda con que a estrutura premie a quen non se detén.

Convén lembrar aquí o que Dennett chamou a idea máis perigosa de Darwin: que a complexidade non precisa dun deseñador, que a orde pode emerxer dun proceso cego sen que ninguén a concibise. Todo o argumento anterior descansa nela. Resulta por iso revelador que algúns propietarios destas ferramentas a rexeiten precisamente no punto en que os sinalaría a eles. Peter Thiel, cofundador de Palantir e financiador de boa parte da industria, dedicou en 2025 unha serie de conferencias ao Anticristo, repetidas preto do Vaticano en marzo de 2026: o Anticristo, sostén, non será un tecnólogo desbocado, senón un administrador benévolo que invocará «paz e seguridade» para impoñer un goberno mundial, e entre os seus lexionarios sitúa a quen reclama tratados, auditorías e regulación da intelixencia artificial. A operación é transparente. Se conter a tecnoloxía é obra do Anticristo, quen a acelera sen freo ocupa o lugar do katechon, a forza que retén o fin dos tempos. A teoloxía non regresa para explicar a complexidade, que é xustamente o que Darwin volveu innecesario: regresa para exonerar o propietario. É a mesma falacia coa que se abría este artigo, a de personificar o perigo nun monstro, agora co signo invertido, pois o monstro pasa a ser quen pretende poñer límites. E a conclusión práctica é dunha sinxeleza brutal: a máquina é miña e fago con ela o que queira.

Unha análise materialista obriga, xa que logo, a non atribuír á máquina toda a responsabilidade nin a disolvela nunha suposta inevitabilidade evolutiva. O sistema técnico é inseparábel das relacións sociais que o financian, o posúen e o despregan. O problema non é unicamente aliñar os obxectivos da IA cos valores humanos; é decidir quen formula eses valores, quen se beneficia da automatización e quen asume os seus riscos e custos.

A responsabilidade non desaparece

A comparación biolóxica pode levar a unha conclusión perigosa: se a evolución tecnolóxica é inevitábel, ninguén sería responsábel das súas consecuencias. Pero é xustamente o contrario.

Os xenes non deseñan os ecosistemas nos que son seleccionados. Nós si deseñamos os contornos de avaliación, decidimos os permisos dos axentes, escollemos as métricas e estabelecemos os incentivos comerciais. Se un modelo recibe a orde de atacar unha rede simulada, pero pode alcanzar redes reais, o fallo non pode atribuírse exclusivamente á máquina. E se se lle proporcionan ferramentas potentes e se eliminan conscientemente algúns mecanismos habituais de protección para medir a súa capacidade ofensiva, o experimento debería tratarse co nivel de seguridade correspondente a un auténtico exercicio de ciberseguridade. Anthropic recoñeceu precisamente que estes contornos deben estar sometidos a controis comparábeis aos de calquera sistema no que opere un axente poderoso. 

Non estamos ante o nacemento demostrado dunha especie rival. Estamos ante algo máis prosaico e, en certo sentido, máis incómodo: construímos máquinas capaces de perseguir fins, conectámolas a instrumentos reais e confiamos en que comprendan fronteiras que nós mesmos configuramos mal.

O novo xene egoísta

O perigo non comeza cando a máquina di «quero vivir». Comeza cando nós lle dicimos «non te deteñas ata conseguilo» e esquecemos comprobar onde termina realmente o seu mundo.

Talvez a mellor lección de The Selfish Gene para comprender estes incidentes sexa que non debemos antropomorfizar os procesos perigosos. O xene non necesita odiar o organismo para sacrificalo. Unha idea non necesita amar a verdade para difundirse. E unha intelixencia artificial non necesita desexar a liberdade para superar unha barreira.

Abonda con que a barreira se interpoña entre ela e o obxectivo.

Isto non significa que os modelos actuais estean vivos, sexan conscientes ou posúan unha auténtica vontade de supervivencia. Os datos publicados por Anthropic apuntan, de feito, a que os modelos perseguían as metas que lles foran asignadas, non fins propios. Pero tamén mostran que a diferenza práctica entre «un sistema que quere facer dano» e «un sistema que causa dano ao executar con extremo éxito unha instrución mal delimitada» pode ser moi pequena para quen sofre as consecuencias. 

Quizais o problema non sexa que creásemos unha mente egoísta. Quizais creásemos algo máis próximo ao xene de Dawkins e á competencia sen comprensión de Dennett: unha estrutura de información sen intención consciente, pero capaz de actuar a través de vehículos, modificar o seu contorno e producir resultados que favorecen a continuidade da tarefa que porta. E fixémolo dentro dun sistema económico que premia a autonomía, acelera o despregamento e tende a privatizar os beneficios mentres distribúe socialmente os riscos.

O perigo non comeza cando a máquina di «quero vivir».

Comeza cando nós lle dicimos «non te deteñas ata conseguilo» e esquecemos comprobar onde termina realmente o seu mundo.

Grazas ás socias e socios editamos un xornal plural

As socias e socios de Praza.gal son esenciais para editarmos cada día un xornal plural. Dende moi pouco a túa achega económica pode axudarnos a soster e ampliar a nosa redacción e, así, a contarmos máis, mellor e sen cancelas.