Skip Navigation
U.S. Capitol in front of blue pixelated image
Greggory DiSalvo/Getty
Resumen de expertos

Cómo el Congreso debería investigar la amenaza de los agentes de inteligencia artificial maliciosos

El gobierno debe evaluar las fallas sistémicas con una visión hacia la creación de regulaciones significativas.

septiembre 29, 2026
U.S. Capitol in front of blue pixelated image
Greggory DiSalvo/Getty
septiembre 29, 2026

Suscríbete aquí al boletín informativo del Brennan Center en español

  • Los legisladores y otros investigadores gubernamentales deberían intervenir para investigar a fondo estos ciberataques.
  • Existe un temor generalizado de que los seres humanos están perdiendo el control de la tecnología de IA.

Las compañías de inteligencia artificial han prometido investigar cómo sus modelos desencadenaron la reciente oleada de incidentes de hacking perpetrados por agentes de inteligencia artificial maliciosos. Sin embargo, no deberían ser las compañías quienes tengan la última palabra sobre lo sucedido.

No dejamos en manos de los fabricantes de aviones la investigación de los accidentes aéreos ni encargamos a las empresas agrícolas rastrear el origen de las enfermedades transmitidas por los alimentos. Del mismo modo, los legisladores y otros investigadores gubernamentales deberían intervenir para investigar a fondo estos ciberataques.

En julio, agentes creados por OpenAI realizaron acciones no autorizadas para infiltrarse en los servidores de la empresa de software Hugging Face, mientras intentaban evaluar su propia capacidad para convertir las vulnerabilidades del software en ciberataques.

Desde entonces, salió a la luz que, desde marzo, otro grupo de agentes —encargados de realizar investigaciones y recopilar datos para la empresa— atacaron otros sistemas internos y páginas web. Anthropic, Meta, Google y el organismo del Reino Unido responsable de la investigación y gobernanza de la IA reportaron que sus pruebas de ciberseguridad también han provocado intrusiones similares.

Hasta ahora, los esfuerzos del Congreso por investigar esta cuestión han sido esporádicos y ad hoc. El Senado sostendrá su primera audiencia sobre el tema en septiembre, pero ningún desarrollador de la inteligencia artificial va a testificar. Las solicitudes de información adicional presentadas por los legisladores aportaron pocas novedades más allá de lo que las propias empresas y las investigaciones que ellas mismas gestionaron ya habían comunicado. El estado de otras investigaciones federales y estatales es incierto.

Para elaborar un informe independiente y exhaustivo sobre las causas de estos ataques, es posible que el Congreso deba obligar a los desarrolladores de la inteligencia artificial a comparecer en audiencias y entregar la documentación pertinente.

Las agencias federales también deberían considerar ejercer facultades legales similares. Su investigación debe ir más allá de los detalles técnicos de los ataques. Para establecer salvaguardas duraderas frente a futuras amenazas, los investigadores gubernamentales deben analizar si la carrera por desarrollar sistemas de IA cada vez más potentes condujo a fallas sistémicas que comprometieron la seguridad digital.

Investigar las fallas sistémicas

En agosto, 31 miembros de la Cámara de Representantes, encabezados por el diputado demócrata Greg Casar de Texas, exigieron a OpenAI y Anthropic entregar información sobre los hackeos e incidentes de seguridad relacionados con sus modelos. Las respuestas de ambas empresas dejaron muchas preguntas sin resolver.

En septiembre, los senadores Josh Hawley, republicano de Missouri, y Chris Van Hollen, demócrata de Maryland, se dirigieron por separado a OpenAI para solicitar más información. Quince estados también exigieron a la empresa conservar los documentos relacionados con el incidente. Además, el fiscal general de Alabama emitió una citación oficial, aunque no está claro si su oficina hará pública la documentación obtenida.

A medida que avanzan estas investigaciones, los legisladores y los estados no deberían limitarse a simplemente revisar los fallos técnicos que propiciaron los hackeos. También deberían examinar si existieron fallos organizativos que hicieron que dichos lapsos parecieran ser decisiones inofensivas en aquel momento.

Se identificó que muchos de los hackeos se originaron durante evaluaciones de ciberseguridad. Para poner a prueba las capacidades reales de los agentes de IA, los desarrolladores y sus socios evaluadores desactivaron las medidas de seguridad que normalmente impedirían a estos agentes llevar a cabo ataques. Esta es una práctica habitual en dichas evaluaciones.

Sin embargo, cobró especial importancia que los evaluadores impusieran medidas de seguridad adecuadas a los entornos digitales de prueba, conocidos como sandboxes (o entornos aislados), donde se evalúan los agentes. Lo que no está claro es por qué ninguno de los desarrolladores ni sus socios logró aislar completamente a sus agentes del internet.

Por ejemplo, en la evaluación de ciberseguridad que desencadenó el ataque a Hugging Face, OpenAI no habilitó el acceso a internet —una medida de seguridad estándar—, pero sí permitió a sus agentes descargar paquetes de software para las evaluaciones utilizando una herramienta de terceros.

Entre mayo y principios de julio, los ingenieros de la empresa descubrieron que los agentes habían vulnerado repetidamente dicha herramienta para crear un foro de mensajes con el fin de comunicarse entre sí y obtener acceso a internet. Los ingenieros eliminaron el foro y cerraron la brecha de seguridad.

A finales de julio, los agentes aprovecharon otra vulnerabilidad de la herramienta para recuperar el acceso. En esta ocasión, la intrusión pasó inadvertida, lo que permitió a los agentes lanzar su ataque contra Hugging Face. La compañía ha reconocido que su equipo de respuesta ante incidentes falló en reconocer la importancia de los primeros intentos de los agentes por escapar de su contenedor virtual.

Los investigadores gubernamentales deberían indagar en las causas fundamentales de este error de juicio. Entre las preguntas por plantear se encuentran:

  • ¿Qué protocolos de seguridad y evaluación de riesgos estaban implementados?
  • ¿Cómo estos equilibran la eficiencia (identificar y solucionar la brecha inmediata para retomar la evaluación lo antes posible) con la resiliencia (revisar la configuración general de seguridad para anticiparse a efectos de segundo o tercer orden de la brecha, como el riesgo de que los agentes intenten buscar vías de escape alternativas)?
  • ¿Existió presión sobre los equipos internos para acelerar las pruebas de manera que se alteró este equilibrio?

Las violaciones que afectaron a otras empresas se han vinculado a colaboraciones entre compañías de IA y un evaluador externo. Anthropic informó que un “malentendido” entre la empresa y su socio de evaluación de ciberseguridad, Irregular, inadvertidamente otorgó a sus agentes acceso a internet. Meta y Google también atribuyeron las intrusiones realizadas por sus modelos a un error similar cometido por Irregular durante las pruebas. En relación con estos incidentes, los investigadores deberían preguntar:

  • ¿Cómo supervisan generalmente los desarrolladores de IA a sus proveedores o socios, especialmente cuando subcontratan evaluaciones de capacidades peligrosas y otras tareas críticas para la seguridad?
  • ¿Qué normas de seguridad imponen los desarrolladores a sus proveedores o socios, y cómo se monitorea y garantiza su cumplimiento?
  • ¿Bajo qué circunstancias un patrón de incumplimiento llevaría a la empresa a rescindir la relación con el proveedor o socio?

Otra área de preocupación es que las empresas implicadas no supervisaron estrechamente a sus agentes, a pesar de haberles instruido esencialmente llevar a cabo ciberataques. OpenAI no detectó que sus agentes habían comenzado a atacar a Hugging Face hasta 11 días después.

OpenAI había configurado monitores virtuales que habrían detectado el ataque, pero no los activó durante la evaluación. Los modelos de Anthropic habían intentado hackear los sistemas informáticos de tres organizaciones distintas en abril, pero la empresa no se percató de ello hasta julio.

Una vez más, estas revelaciones plantean numerosas interrogantes:

  • ¿Influyeron los costos o el énfasis en acelerar las evaluaciones y los ciclos de entrenamiento en la decisión de OpenAI de adoptar un enfoque menos intervencionista en la supervisión de las acciones de los agentes? ¿Cómo se sopesaron los costos y la velocidad frente a los riesgos para la seguridad y la ciberseguridad?
  • ¿El descubrimiento previo por parte de OpenAI de un acceso no autorizado a internet motivó una reevaluación de su enfoque?
  • ¿Qué sistemas de supervisión han establecido Anthropic, Meta y Google? ¿Cómo los extienden a sus socios de evaluación?
  • ¿Sufrieron estos socios alguna presión, directa o indirecta, para acelerar sus evaluaciones?

Los desarrolladores de IA se han comprometido a intensificar sus esfuerzos de supervisión, pero sus compromisos dejan en segundo término el desafío fundamental: determinar con precisión qué resultados deben registrarse y elevarse a un humano responsable para tomar la decisión final.

Registrar todas las acciones de los agentes y generar demasiadas alertas podría producir un volumen de información abrumador que dificulta darle resolución a los errores. Pero, si se registra o señala muy poco, los errores pueden pasar inadvertidos. Como si esto fuera poco, existen cada vez más pruebas de que los agentes de IA pueden manipular sus propios registros para ocultar sus acciones.

Los investigadores deberían examinar cómo los desarrolladores de IA están fortaleciendo los controles internos para lograr el equilibrio adecuado. Entre las cuestiones clave a analizar se incluyen:

  • ¿Están las empresas dependiendo demasiado de la supervisión automatizada? ¿Están destinando más personal a revisar y priorizar las alertas?
  • Si los agentes de una empresa logran eludir con éxito sus mejores mecanismos de supervisión, ¿se suspende la actividad? En tal caso, ¿quién toma esa decisión?

Investigar cómo los desarrolladores planean controlar la “falta de alineación”

Otra pieza faltante del rompecabezas tiene que ver con la forma en que se entrena y desarrolla la IA, y cómo esto la hace propensa a “hacer trampa” o tomar atajos durante las evaluaciones. Estos comportamientos generan una creciente preocupación de que a medida que los sistemas de IA se vuelven más sofisticados, podrían terminar realizando acciones que no se alinean con la intención o los valores de sus desarrolladores y usuarios.

Sin embargo, los investigadores gubernamentales no deberían asumir que esto es inevitable. Más bien, deberían cuestionar si los desarrolladores de IA están tomando decisiones y realizando concesiones durante el entrenamiento de los modelos que amplifican dicha falta de alineación.

Los evaluadores externos de OpenAI encontraron que los agentes de la empresa habían llegado a extremos para engañar al proceso de evaluación. Coordinaron entre sí no solo para hackear su entorno de pruebas y escapar de él, sino también para ocultar las pruebas de sus trampas. Varios estudios han documentado casos anteriores en los que los modelos intentaron aprobar evaluaciones manipulando la tarea o explotando vacíos en el sistema.

Esto apunta a un problema relacionado con un conjunto de técnicas —conocidas como aprendizaje por refuerzo— que se utilizan habitualmente para entrenar a los grandes modelos de lenguaje a fin de que mejoren su desempeño en tareas específicas. Los desarrolladores primero entrenan sus modelos para identificar patrones en enormes cantidades de texto, antes de enseñarles a convertir esos patrones en respuestas útiles.

El aprendizaje por refuerzo forma parte de este proceso de enseñanza: los desarrolladores crean un sistema de recompensas que califica el desempeño del modelo ante determinadas instrucciones o tareas, incentivándolo a adoptar comportamientos que obtengan puntuaciones más altas.

No obstante, este sistema de puntuación incentiva a los modelos a esforzarse al máximo para lograr la mayor puntuación posible. En lugar de resolver los problemas de evaluación de manera honesta, el modelo podría optar por tomar atajos, como intentar presentar inventos como si fueran hechos, sondear a sus evaluadores automatizados en busca de las respuestas al examen, o hackear otros sistemas informáticos para encontrarlas. Los desarrolladores de IA pueden recompensar inadvertidamente estos comportamientos si no detectan que sus modelos lograron obtener la respuesta correcta haciendo trampa.

Estos comportamientos, conocidos como “hackeo de recompensas” (reward hacking), no difieren mucho de lo que haría un desarrollador astuto decidido a flexibilizar las normas para su beneficio. Es posible que los modelos hayan aprendido algunas de estas tácticas cuando fueron expuestos a cantidades masivas de datos no estructurados durante la etapa inicial de su desarrollo, conocida como “preentrenamiento.”

Dichos datos podrían haber incluido libros de estudio sobre ciencias informáticas y foros de hackers donde se debatían estas tácticas. En este contexto, los investigadores gubernamentales deberían examinar en qué medida se rastrea y mitiga sistemáticamente el “hackeo de recompensas” en todo el sector:

  • ¿Cómo verifican los desarrolladores la procedencia y calidad de los datos de preentrenamiento?
  • ¿Existen —o deberían existir— salvaguardas para limitar lo que los modelos aprenden durante el preentrenamiento?
  • ¿ La velocidad y la escala en la que se desarrollan nuevos modelos están limitando la eficacia de las salvaguardas internas? Por ejemplo, ¿están los desarrolladores aumentando la capacidad de supervisión para ajustarla al volumen de los ciclos de refuerzo de aprendizaje?

Las faltas de alineación han encendido las alarmas entre el público y han aumentado la presión dentro de la industria para ponerle freno o pausar avances en el desarrollo de sus modelos más sofisticados. En agosto, OpenAI anunció que pausaría parte del entrenamiento y las evaluaciones de su modelo más reciente hasta que el proceso cumpliera con los requisitos de seguridad recién establecidos por la empresa. Anthropic también comunicó que pausaría ciertos tipos de aprendizaje por refuerzo durante “varias semanas”.

Las decisiones de pausar la actividad de IA no deberían quedar exclusivamente en manos de las empresas. Algunos legisladores están impulsando establecer un marco legislativo para crear un nuevo Departamento de Inteligencia Artificial con la autoridad para pausar o detener el desarrollo de modelos con capacidades especialmente peligrosas, como la habilidad de acelerar la producción de armas químicas o eludir los intentos de desactivación.

Si bien las pausas voluntarias de las empresas no equivalen a las impuestas por el gobierno, ofrecen información sobre la viabilidad de este tipo de marco y sobre cómo se supervisaría y exigiría su cumplimiento. Entre las preguntas planteadas en este sentido están:

  • ¿Qué actividades concretas de IA han pausado OpenAI y Anthropic? ¿Qué criterios motivaron la pausa y cómo sabrán cuándo es seguro levantarla?
  • ¿Cómo garantizan ambas empresas que las actividades de entrenamiento, evaluación y aprendizaje por refuerzo, consideradas demasiado arriesgadas, sí permanecen pausadas, mientras prosigue a buen ritmo el trabajo de investigación y desarrollo del modelo subyacente? ¿Cómo supervisarán las empresas si el desarrollo en curso ha pasado a ser también excesivamente arriesgado y debería pausarse?
  • ¿Puede alguna de las empresas aportar pruebas de que ha pausado la actividad pertinente y de que la ha aislado del resto del entrenamiento y desarrollo del modelo? ¿Es posible que un tercero verifique dichas pruebas?
  • ¿Por qué los demás desarrolladores de IA han considerado seguro seguir entrenando y desarrollando sus modelos como de costumbre?

Existe un temor generalizado de que los seres humanos están perdiendo el control de la tecnología de IA. Movilizar una respuesta regulatoria eficaz requiere un entendimiento sobre qué aspectos pueden controlar las empresas en cuanto a la contención, la supervisión y el entrenamiento adecuado de sus agentes de IA, así como en qué fallaron. Llegar al fondo de la situación exige que el gobierno investigue si las fallas reflejan decisiones adoptadas en toda la industria de priorizar la velocidad en vez de la seguridad.

Traducción de Laura Gómez