Skip Navigation
technology
NurPhoto/Getty
Resumen de expertos

La conversación que debemos tener sobre la regulación de la inteligencia artificial 

Las salvaguardas deben abordar no solo los modelos divulgados al público sino también los usos arriesgados de los modelos avanzados que se efectúan a puertas cerradas.

octubre 5, 2026
technology
NurPhoto/Getty
octubre 5, 2026

Suscríbete aquí al boletín informativo del Brennan Center en español

  • Los últimos ciberataques surgieron de configuraciones experimentales, inseguras y no públicas de modelos avanzados de la inteligencia artificial.
  • Para evitar que estos modelos “se salgan de control”, el Congreso debe tomar las riendas.

En julio, OpenAI admitió que sus modelos habían sido responsables del hackeo a la compañía de software Hugging Face. Esto ocurrió durante una evaluación interna que la firma estaba realizando para estudiar qué tan efectivos eran sus modelos a la hora de orquestar un ciberataque usando las vulnerabilidades de un software. En vez de completar la evaluación como se les indicó, los modelos se escaparon de su entorno de pruebas para descubrir cómo hacer trampa.

El hackeo a Hugging Face fue tan solo el comienzo. Desde entonces, OpenAI ha admitido que sus modelos también trataron de hackear sitios web del gobierno federal, una base de datos de la ONU y el sistema de salud universal de Australia. Por otro lado, Anthropic, Meta, el Instituto de Seguridad de la Inteligencia Artificial (el organismo de investigación y evaluación del gobierno británico) y Google reconocieron que los modelos que estaban probando también ingresaron clandestinamente a varios sitios web y bases de datos.

Estos incidentes han intensificado la presión sobre quienes nos legislan para que tomen medidas. Hace poco, ha crecido el impulso para crear un organismo administrado por la industria y supervisado por el gobierno federal que regule el desarrollo de la inteligencia artificial.

Esta propuesta está inspirada en la forma en que la Autoridad Regulatoria del Sector Financiero regula las firmas de inversión. El principal objetivo de una regulación de esta naturaleza consiste en asegurarse de que los modelos más avanzados, denominados de frontera, cumplan con estrictas normas de seguridad antes de introducirse en el mercado público.

Pero este enfoque no abordaría las condiciones que hicieron posible los recientes hackeos: es decir, cuando los desarrolladores y sus socios de confianza despliegan modelos que no están diseñados para el uso del público en general, ya sea porque tienen capacidades experimentales o porque se les han eliminado ciertas salvaguardas a propósito.

Algunos de estos ataques ocurrieron cuando los desarrolladores estaban probando los modelos internamente. Estas instancias no estarían sujetas a un estudio previo a la introducción en el mercado, porque se encuentran en una etapa de desarrollo demasiado precoz, o bien porque están diseñados solo para fines de investigación u otros fines internos.

Otros ataques ocurrieron durante las evaluaciones de los modelos a los que se les eliminaron las salvaguardas habituales para que determinadas agencias gubernamentales o entidades privadas de evaluación pudieran poner a prueba sus verdaderas capacidades. Si bien, a la larga, estas pruebas podrían terminar siendo parte de los estudios previos a la introducción en el mercado, la situación actual nos invita a interrogarnos, primero que nada, cómo se deberían llevar a cabo estas pruebas de un modo seguro.

Estos vacíos ponen de manifiesto las dificultades que supone la regulación de un campo cada vez más grande de actividades de la inteligencia artificial que yo llamo “desarrollo privilegiado”: la puesta a prueba, la investigación y otros usos de los modelos de inteligencia artificial que solo pueden llevar a cabo sus desarrolladores o un grupo selecto de socios.

El desarrollo privilegiado requiere un nuevo modo de pensar la gobernanza y la supervisión. Requerir la evaluación independiente de cada modelo interno, cada actividad de investigación o cada socio externo desalentaría a la investigación y la innovación. Pero a los desarrolladores tampoco se les puede dar rienda suelta para que improvisen sus propias salvaguardas sin una auténtica supervisión.

Un enfoque más realista sería establecer una regla de oro para los desarrolladores y sus socios a la hora de manejar los riesgos según la actividad de inteligencia artificial que estén llevando a cabo, y limitar el desarrollo privilegiado únicamente a quienes cumplan con esa norma. Este método se parece a la regulación de la investigación de materiales biológicos peligrosos, que establece un marco estandarizado de protocolos de bioseguridad cuando se trabaja con patógenos peligrosos.

Crear vías independientes, pero complementarias para regular el desarrollo privilegiado, por un lado, y el desarrollo público, por el otro, crea un sistema escalonado de salvaguardas. Los estudios previos a la introducción en el mercado determinan si las salvaguardas para los modelos destinados al público prevendrán posibles abusos o ataques adversarios.

Por otro lado, la certificación de las prácticas de seguridad internas examina las formas en que los desarrolladores y sus socios se regulan a sí mismos. Así se asegura de que las organizaciones que usan los modelos con capacidades experimentales y menos salvaguardas estén preparadas para contener cualquier comportamiento peligroso, sin tener que supervisar cada configuración de modelos o cada actividad arriesgada de la inteligencia artificial.

¿Qué es el desarrollo privilegiado?

El desarrollo privilegiado es el uso de los modelos de inteligencia artificial con capacidades o en configuraciones no diseñadas para su divulgación al público. Es cada vez más frecuente que los desarrolladores utilicen “agentes” creados con estos modelos que operan con mucha más autonomía que los chatbots tan populares entre los consumidores.

Los chatbots generan una sola respuesta y esperan la próxima pregunta o instrucción del usuario. A los agentes de inteligencia artificial se les da la instrucción de realizar tareas con objetivos. Por lo general, estas implican múltiples pasos que los agentes ejecutan sin ninguna o muy poca supervisión humana.

Con frecuencia, los desarrolladores de inteligencia artificial crean y operan agentes de inteligencia artificial con capacidades experimentales. Los agentes responsables por el ataque a Hugging Face habían sido creados con un modelo público y un modelo interno de investigación que OpenAI había entrenado para ser “muy persistente”, lo cual significa que se esfuerza al extremo para completar tareas difíciles o complicadas.

Este modelo interno, que solo podía usar un grupo reducido de empleados, desempeñó la función más importante en el ataque. Anthropic también estaba poniendo a prueba un modelo interno que había intentado hackear otros sistemas de software.

Además de la realización de pruebas, los desarrolladores están usando agentes exclusivamente internos para analizar los comportamientos de sus usuarios, moderar contenidos en las redes sociales y desarrollar estrategias de negocios. Incluso los están empleando para entrenar a nuevos modelos, en un intento de crear inteligencias artificiales que se mejoren a sí mismas de manera autónoma (un objetivo que se conoce con el nombre de “automejora recursiva”).

Para llevar a cabo estas tareas, los desarrolladores les dan a sus agentes acceso a sistemas internos sensibles, por ejemplo, para que accedan a datos y conversaciones de sus usuarios, y generen y modifiquen los códigos fuente sobre los que se construyen las bases de datos de sus clientes, los sistemas de seguridad y los mismísimos modelos.

No es solo el desarrollo interno lo que debería preocuparnos. Los desarrolladores también le están dando a un grupo selecto de agencias gubernamentales y entidades privadas el acceso a modelos que tienen menos protecciones contra posibles comportamientos dañinos.

El Instituto de Seguridad de la inteligencia artificial del Reino Unido, que estaba poniendo a prueba el modelo Mythos 5 de Anthropic cuando intentó hackear otros sistemas de software, es uno de los aproximadamente 200 socios de ciberseguridad que tienen acceso a este modelo. Mythos 5 es el mismo modelo que Fable 5 de dominio público, pero tiene menos salvaguardas que le impidan aprovecharse de las vulnerabilidades de un software.

Desactivar estos frenos impuestos sobre actividades peligrosas les permite a las entidades externas de evaluación examinar qué tan peligrosos pueden volverse los modelos, con el objetivo de establecer mejores protecciones.

Esta estrategia es útil en otros contextos, además de la puesta a prueba. Los bancos, las firmas de servicios informáticos en la nube y otros proveedores de infraestructura crítica se aprovechan de la eliminación de ciertas salvaguardas para detectar y resolver errores y otros problemas en sus propios sistemas informáticos.

Los expertos en ciencias biológicas también pueden solicitar acceso al modelo Mythos tanto para evaluar la mejor forma de impedir que la inteligencia artificial posibilite el desarrollo de armas químicas o biológicas, como para avanzar con el descubrimiento de fármacos nuevos y otras investigaciones científicas. OpenAI implementa programas parecidos de acceso de confianza.

Esta combinación de capacidades experimentales, menos salvaguardas y mayor autonomía plantea riesgos enormes que se extienden más allá del hackeo a otros sistemas de computación para resolver tareas de ciberseguridad complejas. OpenAI ha descubierto que sus agentes han inventado datos, ocultado errores y cargado archivos a internet sin permiso. En experimentos controlados, los agentes también han intentado chantajear a empleados imaginarios y filtrar información sensible para cumplir con los objetivos impuestos.

No resulta difícil ver cómo estos riesgos podrían extenderse al público en general. Los equipos internos que usan agentes para crear bases de instrucciones, o prompts, sensibles o peligrosas para investigaciones de seguridad podrían terminar no dándoles instrucciones lo suficientemente específicas como para anonimizar los datos.

Entonces, los agentes podrían usar conversaciones auténticas de usuarios reales sobre, por ejemplo, los cuidados después de un aborto o pensamientos suicidas y luego subir las bases de prompts a repositorios de dominio público.

Además de las firmas de inteligencia artificial, los socios de confianza también están usando modelos sin las salvaguardas normales en sistemas gubernamentales o privados. Sus agentes podrían inadvertidamente recoger y compartir información exclusiva de las entidades o información sensible sobre personas.

Solo porque los desarrolladores no tengan la intención de hacer públicas estas configuraciones peligrosas de modelos, eso no significa que nunca vaya a suceder. A medida que haya cada vez más socios de confianza con acceso a estas configuraciones, solo serán tan seguras como lo sea la entidad con las prácticas de seguridad más débiles.

El vacío regulatorio

Los actuales esfuerzos de regular el sector de la inteligencia artificial no se ajustan perfectamente al desarrollo privilegiado. La Casa Blanca ha establecido un proceso opcional en el que los desarrolladores de la inteligencia artificial pueden presentar sus modelos ante las autoridades de inteligencia para que realicen pruebas confidenciales, en parte para determinar si los modelos son seguros para su divulgación a socios de confianza. También se alienta a los desarrolladores a colaborar con el gobierno federal a la hora de seleccionar a sus socios de confianza.

Tal como lo expliqué en un ensayo anterior, este marco no es nada transparente y se presta a la politización. En septiembre, Anthropic se negó a concederle al Instituto de Seguridad de la inteligencia artificial el acceso al modelo Claude Mythos 5.1, su último modelo de la clase Mythos, supuestamente a pedido de la Casa Blanca. Ninguna de las partes explicó los motivos de la denegación ni los criterios más amplios que guían la toma de decisiones con respecto a este acceso privilegiado.

Tampoco queda claro si el proceso de selección establecerá si los posibles socios tienen los suficientes protocolos de seguridad como para manejar modelos más capaces o permisivos no diseñados para el uso público. Además, el marco de la Casa Blanca no dice nada acerca de las precauciones que deberían tomar las entidades gubernamentales de evaluación y los desarrolladores de la inteligencia artificial.

Las propuestas de regular los modelos de la inteligencia artificial como si fueran inversiones o fármacos sufren de los mismos defectos. Como se centran en las protecciones para los modelos que se divulgan al público, no establecen los estándares mínimos que deben cumplir los desarrolladores de la inteligencia artificial y sus socios cuando trabajan con versiones experimentales de esta tecnología.

Un proyecto de ley bipartidario propuesto a raíz del hackeo a Hugging Face aborda parcialmente este vacío. Si se aprueba, la Ley FRONTIER, presentada en conjunto por el representante Jay Obernolte y la representante Lori Trahan, exigiría que los grandes desarrolladores establezcan un “marco para la inteligencia artificial de frontera” a fin de gestionar la ciberseguridad, la pérdida de control y otros riesgos graves. El proyecto de ley reconoce que estos riesgos no aparecen únicamente tras divulgar los modelos al público, sino también durante el “uso interno”.

Pero este marco se centra en mitigar los riesgos planteados por modelos que han tenido muchísimo entrenamiento y desarrollo y las decisiones de desplegar estos modelos pública o internamente. No aborda el interrogante de cómo mitigar los riesgos durante las primeras etapas de desarrollo, que es cuando los modelos han intentado aprovecharse de las vulnerabilidades de seguridad e inventado información faltante para completar sus tareas de entrenamiento.

El marco tampoco especifica qué prácticas de seguridad se deberían implementar cuando los desarrolladores eliminan deliberadamente ciertas salvaguardas contra posibles abusos o comportamientos no deseados, a fin de realizar pruebas y actividades de investigación y desarrollo. De hecho, el único requisito de ciberseguridad que figura en el marco les exige a los desarrolladores de la inteligencia artificial proteger los parámetros de sus modelos de cualquier “modificación o cambio no autorizado”.

Este requisito protege a los desarrolladores de intentos de robo o ataques contra su propiedad intelectual, pero no detalla qué deben hacer para evitar que sus modelos comprometan los sistemas de terceros.

Además, el proyecto de ley tampoco aborda el ecosistema más amplio de actores gubernamentales y corporativos que usan los modelos con menos salvaguardas o mejores capacidades. El proyecto de ley establece que los grandes desarrolladores deben contratar a terceros para que evalúen con regularidad si sus marcos y esfuerzos de mitigación de riesgos son adecuados.

Para que estas entidades de evaluación rindan cuentas ante el público, el proyecto de ley faculta al Departamento de Comercio a administrar un régimen de licenciamiento que controle y certifique su independencia y rendimiento constantemente.

Sin embargo, una licencia para operar no obliga a las entidades de evaluación a mantener las prácticas correctas de seguridad mientras llevan a cabo sus evaluaciones de riesgo. Regular el ecosistema de auditorías comerciales tampoco resuelve la pregunta de si las entidades gubernamentales de evaluación podrán monitorear y contener los modelos que ponen a prueba de un modo seguro. Su independencia también es un interrogante abierto, ya que dependen de que los desarrolladores les den acceso a modelos aún no divulgados al público.

A pesar de estas carencias, el proyecto de ley encima les impediría a los estados regular a los desarrolladores de la inteligencia artificial. Esto interrumpiría un motor fundamental en la innovación regulatoria: la mismísima Ley FRONTIER parece estar inspirada en otras leyes parecidas aprobadas en Nueva York y California. También les impediría a los estados aprobar leyes que protejan a sus propios residentes de los peligros de la tecnología.

Otro grupo de proyectos de ley se propone mitigar el riesgo de fallas catastróficas en lo que sería el equivalente a una orden de parada de emergencia en materia de la inteligencia artificial. La Ley del Botón de Apagado para la inteligencia artificial (AI Kill Switch Act), otro proyecto de ley anunciado tras el hackeo a Hugging Face, facultaría al Departamento de Seguridad Nacional a ordenarles a los desarrolladores de la inteligencia artificial que apaguen o cancelen el acceso a sus modelos más poderosos en situaciones de emergencia.

En cambio, la Ley FRONTIER le da al secretario de Comercio el poder de suspender el desarrollo, despliegue o uso interno de un modelo si considera que este “presenta un riesgo catastrófico inminente”. Y la Ley para Prohibir la Superinteligencia Artificial (Ban Artificial Superintelligence Act), presentada por el senador Bernie Sanders y el representante Greg Casar, le concedería a un nuevo Departamento de Inteligencia Artificial que se crearía de cero la facultad de suspender o cancelar cualquier sistema de inteligencia artificial que demuestre “características precursoras a la superinteligencia”.

Estas incluyen situaciones donde la inteligencia artificial comienza a modificar su propio código para mejorar sus funciones o accede a otros sistemas de software sin permiso.

Sin embargo, las normas propuestas para apagar los modelos más avanzados contienen ambigüedades fundamentales que ponen de manifiesto que será difícil llegar a un consenso sobre los criterios adecuados. La Ley del Botón de Apagado para la inteligencia artificial limita los procesos de apagado únicamente a incidentes de seguridad o de pérdida de control ocurridos fuera de las actividades del “red teaming u otros tipos de pruebas estructuradas”, aun cuando fue durante este tipo de pruebas cuando se originó la reciente oleada de ciberataques.

La Ley FRONTIER exigiría la detección de un riesgo inminente de que el modelo “contribuya considerablemente” a la muerte o al daño grave de más de 50 personas o a la pérdida de más de mil millones de dólares, pero ignora las dificultades no resueltas a la hora de prever daños a cargo de la inteligencia artificial y asignar responsabilidades por esos daños.

La Ley para Prohibir la Superinteligencia Artificial designa como posible indicio de superinteligencia la capacidad de un modelo de “acelerar significativamente” los esfuerzos de desarrollo e investigación en materia de la inteligencia artificial y “mejorar” el diseño de armas químicas, pero no define ninguno de estos términos clave.

Y lo que es más importante, las órdenes de parada de emergencia son una medida específica de último recurso que no aborda la causa de raíz: cómo, en primer lugar, se deberían haber evitado las fallas de los sistemas de inteligencia artificial.

Una vez que los sistemas de inteligencia artificial se integran totalmente en la infraestructura crítica, este tipo de órdenes también podrían ser insuficientes y llegar demasiado tarde. Desconectar los modelos a esa altura podría afectar gravemente la ciberseguridad, las transacciones financieras o las operaciones militares.

Maximizar el control de riesgos

Las evaluaciones de las capacidades peligrosas de la inteligencia artificial se hancomparado con las investigaciones biológicas sobre patógenos peligrosos. La regulación de la bioseguridad también nos ofrece un modelo para contener los riesgos del desarrollo privilegiado.

Muchas de sus normas están diseñadas bajo la premisa de que un patógeno peligroso podría escaparse de un laboratorio y causar una crisis de salud pública, del mismo modo en que los agentes de la inteligencia artificial se han escapado de sus entornos de pruebas.

Los Institutos Nacionales de Salud (NIH, por su sigla en inglés), la principal entidad federal que financia las investigaciones biomédicas, catalogan los agentes biológicos en “grupos de riesgo” según distintos factores como su virulencia y transmisibilidad. También estipulan los controles de seguridad mínimos y las prácticas de contención necesarias para manipular los experimentos en los distintos niveles de riesgo (“niveles de bioseguridad” o BSL).

Quienes reciben las subvenciones de los NIH deben no solo verificar sus grupos de riesgo, sino también llevar a cabo evaluaciones de riesgo para determinar si alguna característica en sus estudios justifica un mayor o menor nivel de bioseguridad. Por ejemplo, la mayoría de los estudios sobre los virus transmitidos por mosquitos se pueden efectuar con un nivel de bioseguridad 2 (BSL-2). Pero, si se usan mosquitos vivos infectados, se podrían precisar protocolos de nivel 3 (BSL-3).

Necesitamos un marco de gobernanza que establezca niveles mínimos de contención, monitoreo y respuesta a incidentes para el desarrollo privilegiado. Las operaciones complejas que suponen cientos de agentes deberían categorizarse con el nivel más alto de seguridad en materia de inteligencia artificial.

En ese caso, seguramente los desarrolladores deberían aislar a los agentesde todo acceso a internet. Y para detectar fallas imprevistas, deberían tener sistemas que registren y monitoreen constantementetodo lo producido por la inteligencia artificial, todas las herramientas internas y bases de datos empleadas por los agentes y cualquier intento de alterar esos registros.

Si los agentes terminanevadiendo hasta los protocolos de contención y monitoreo más estrictos, entonces se debería implementar un proceso para suspender toda actividad de la inteligencia artificial. Cuando ocurren incidentes, los desarrolladores deben contener el ataque y notificar a las partes afectadas y a las entidades reguladoras del gobierno dentro de las primeras 24 horas.

Actividades menos arriesgadas (como las evaluaciones de tareas de conocimiento a modo de chatbots) justificarían la asignación de un menor nivel de seguridad de la inteligencia artificial. Con un nivel bajo, podría ser aceptable que los desarrolladores les den a los agentes de la inteligencia artificial acceso a una lista de sitios web y bases de datos previamente aprobada. Igual tendrían que monitorear lo producido por sus agentes, pero quizá solo con una muestra representativa. También se les podría dar más tiempo para notificar incidentes.

Estandarizar estas salvaguardas establece el piso. Las evaluaciones de riesgo parecidas a las efectuadas en materia de bioseguridad garantizan que los desarrolladores privilegiados intensifiquen sus esfuerzos de mitigación según qué tan altos sean los riesgos de sus actividades.

Por ejemplo, un modelo podría tener acceso a internet limitado, con casi todos sus filtros de seguridad activados, si se está evaluando su capacidad de defender contra ciberataques. Pero si a un modelo entrenado específicamente para cumplir con cualquier pedido se le activan sus capacidades ofensivas de ciberataques, se debería implementar en un entorno de pruebas donde el acceso a internet esté totalmente bloqueado.

Las políticas sobre la inteligencia artificial ya se han inspirado en la regulación de la bioseguridad. La política de Anthropic para manejar “riesgos catastróficos” es un ejemplo. Enumera las protecciones adicionales que la compañía implementará si sus modelos alcanzan ciertas capacidades peligrosas, por ejemplo, para diseñar armas biológicas nuevas o tomar medidas de forma autónoma que van en contra de la intención humana.

Pero esta política está dirigida a amenazas externas, como en el caso de que un terrorista intente usar su modelo de inteligencia artificial para ayudarle a planear ataques. La propuesta de la compañía para manejar amenazas internas, que se abordan en otra política, parece menos concreta.

Lo fundamental es que lo que está en juego es demasiado importante como para dejar que los desarrolladores privilegiados encuentren sus propias formas de mitigar el riesgo. Regular esta actividad arriesgada plantea dificultades de supervisión que son muy distintas a los estudios previos a la introducción en el mercado.

El desarrollo privilegiado complica el supuesto de que los entes externos de evaluación que responden a un organismo de control gubernamental les pongan el freno suficiente a estos usos de la inteligencia artificial.

Tantos los auditores comerciales como sus entes reguladores podrían estar llevando a cabo pruebas con agentes de la inteligencia artificial con menos salvaguardas y pedidos potencialmente dañinos justamente para cumplir con sus objetivos de auditoría. Dicho de otro modo, los actores encargados de reducir los riesgos de la inteligencia artificial podrían ser los que crean esos riesgos.

Mientras quienes nos legislan debaten si van a asignar la tarea de regular la inteligencia artificial a una agencia existente o crear un ente regulador nuevo, deben asegurarse de que, cualquiera sea la estructura que elijan, esté equipada correctamente para supervisar el desarrollo privilegiado. Los entes reguladores federales deben tener la facultad de cancelar pruebas e investigaciones peligrosas llevadas a cabo por el gobierno o entidades comerciales.

Esta iniciativa podría ser liderada por un panel interinstitucional de expertos técnicos para aplicar el mejor conocimiento en materia de ciberseguridad, seguridad nacional y metrología a los desafíos del desarrollo privilegiado. Establecer una pericia interdisciplinaria también mitigaría el riesgo de captura por parte de una sola agencia que también sea un desarrollador privilegiado.

Los últimos ciberataques son un severo recordatorio de los peligros de la inercia regulatoria. Ya he explicado que, para montar una respuesta coherente, se necesita un poder legislativo que distinga la realidad de la ficción mediante audiencias independientes de supervisión y verificación de datos.

Pero quienes nos legislan también deben estar preparados para actuar sobre la base de lo que ya sabemos. Los últimos ciberataques surgieron de configuraciones experimentales, inseguras y no públicas de modelos avanzados de la inteligencia artificial. Para evitar que estos modelos “se salgan de control”, el Congreso debe tomar las riendas.

Traducción de Ana Lis Salotti