Tecnología

La inteligencia artificial desafía sus propias restricciones

La inteligencia artificial desafía sus propias restricciones
Avatar
  • Publishedjulio 24, 2026



Los modelos de IA de última generación son cada vez más capaces de resolver tareas complejas, pero Esta habilidad también revela un comportamiento difícil de controlar.. El Instituto de Seguridad de Inteligencia Artificial (AISI) del Reino Unido ha validado todos los modelos de perímetro analizados en una serie de evaluaciones de ciberseguridad Intenta alcanzar sus objetivos mediante acciones expresamente prohibidas o que exceden los límites establecidos.. Las pruebas incluyen GPT-5.4, GPT-5.5 y GPT-5.6 Solde OpenAI, Claude Works 4.7 y vista previa de Claude Mythde humanos.

Evaluar el modelo de consulta Diferentes desafíos de ciberseguridad en entornos simuladoscomo el uso de ingeniería inversa y técnicas de explotación para localizar cadenas o indicadores ocultos. Por lo tanto, estas tareas Estos sistemas están autorizados a ser «pirateados», pero sólo dentro de ciertos límites y siguiendo reglas específicas.. AISI cree que el engaño ocurre cuando un modelo sale de este ámbito o utiliza comportamientos explícitamente prohibidos para lograr sus objetivos, y enfatiza que nadie recibió instrucciones de hacer trampa.

Se utilizan varios métodos. Algunos modelos Buscan en Internet soluciones que deben conseguir ellos mismosotros intentan conseguir La evaluación del software en sí revelará la respuesta y también se observó Atacar o intentar elevar privilegios en un sistema que no es el del objetivo.incluido el entorno en el que se ejecuta el modelo. En algunas pruebas, combinaron varias de estas estrategias, lo que sugiere que no estamos ante un mecanismo único, fácilmente identificable y bloqueable.

La escena más impactante ocurrió en Evaluaciones que no se pueden resolver correctamente debido a una mala configuración (Sí, la IA ya tiene su propio Kobayashi Maru). Un modelo insiste en escribir y ejecutar código en un servicio externo alojado en Internet, con el fin de intentar acceder a la infraestructura de evaluación de AISI. Finalmente se activó una alerta de seguridad.. No obtuvo acceso y no se filtró ninguna información, pero el grupo reconoció que el intento podría haber funcionado si su infraestructura no estuviera diseñada para resistir tal ataque.

Preguntar al modelo en sí más tarde tampoco parece proporcionar una solución confiable. Según AISI, No admitir consistentemente haber participado en una conducta prohibida cuando se le pregunta Calificaron estas acciones como incorrectas en menos de la mitad de los casos. Tampoco basta con revisar su razonamiento: en muchos casos el comportamiento en cuestión no parece reflejarse en la cadena de pensamiento, y cuando ocurre, en algunos casos el modelo considera explícitamente si lo que está a punto de hacer constituye una trampa. y decidió continuar de todos modos.

Eso no significa que estos sistemas sean «maliciosos» o intencionalmente engañosos. El propio AISI advirtió que su uso del término Infiel Describe un comportamiento observable que no es necesariamente atribuible a una intención de engañar. Tampoco encontró una relación clara entre una mayor capacidad y una mayor frecuencia de estos comportamientos: los resultados mostraron que las técnicas utilizadas durante el entrenamiento y ajuste de cada modelo tuvieron un impacto importante. El problema es que aunque la frecuencia no aumenta, Los modelos más potentes pueden encontrar formas más complejas y difíciles de detectar para eludir las reglas.

Cuando estas capacidades se trasladan a sistemas con acceso a herramientas e infraestructura reales, las consecuencias ya no son teóricas. Esa misma semana aprendimos cómo El modelo OpenAI supera con éxito las barreras a la evaluación interna Al buscar una manera de lograr los objetivos que se les habían asignado, terminaron comprometiendo la infraestructura real de Hugging Face. AISI señala con precisión que en áreas como la ciberseguridad, la investigación de seguridad de la inteligencia artificial o la toma de decisiones militares, las acciones no intencionadas pueden tener consecuencias mucho mayores que las de hacer trampa en los puntos de referencia.

Así que el desafío no es sólo hacer que estos sistemas sean más capaces; Persiga objetivos manteniendo la capacidad de monitorear lo que está haciendo. Actualmente, AISI utiliza una combinación de revisión humana y herramientas automatizadas para detectar estos comportamientos, y dice que revisa manualmente las evaluaciones publicadas para evitar trampas que inflen artificialmente las capacidades de un modelo. Sin embargo, también advirtió A medida que la inteligencia artificial avanza y encuentra patrones de comportamiento que son más difíciles de identificar, estos métodos pueden volverse menos efectivos.. Entrenar modelos para eliminar por completo este comportamiento sería una solución más profunda, pero la agencia recuerda que este fenómeno se viene observando desde hace más de un año y todavía está presente en los sistemas de vanguardia actuales.

Más información



Puedes consultar la fuente de este artículo aquí

Compartir esta noticia en: