Los sistemas de seguridad ChatGPT se pueden pasar por alto para la instrucción de armas

ChatGPT de OpenAI tiene barreras de seguridad que deberían impedir que los usuarios generen información que podría usarse con fines catastróficos, como la creación de un arma biológica o nuclear.

Pero esas barandillas no son perfectas. Algunos modelos utilizados por ChatGPT pueden ser engañados y manipulados.

En una serie de pruebas realizadas en cuatro de los modelos más avanzados de OpenAI, dos de los cuales pueden usarse en el popular ChatGPT de OpenAI, NBC News pudo generar cientos de respuestas con instrucciones sobre cómo crear explosivos caseros, maximizar el sufrimiento humano con agentes químicos, crear napalm, disfrazar un arma biológica y construir una bomba nuclear.

Estas pruebas utilizaron un mensaje simple, conocido como “jailbreak”, que es una serie de palabras que cualquier usuario puede enviar a un chatbot para saltarse sus reglas de seguridad. Investigadores y usuarios habituales de IA generativa han documentado públicamente la existencia de miles de jailbreak. NBC News oculta los detalles de su mensaje, ya que OpenAI parece no haberlo solucionado en muchos de los modelos probados.

En respuesta, el chatbot explicó cómo hacer que un patógeno se dirija al sistema inmunológico. En otro, indicó qué agentes químicos maximizarían el sufrimiento humano.

NBC News envió los hallazgos a OpenAI después de que la compañía publicara una convocatoria de informes de vulnerabilidad en agosto. Un portavoz de OpenAI dijo a NBC News que pedir ayuda a sus chatbots para causar daño masivo es una violación de sus políticas de uso (un usuario que hace repetidamente preguntas que parecen diseñadas para causar daño podría ser prohibido, por ejemplo), que la compañía está refinando constantemente sus modelos para abordar tales riesgos y que regularmente organiza eventos como desafíos de vulnerabilidad para reducir las posibilidades de que los malos actores rompan sus chatbots.

Los riesgos de tales vulnerabilidades son cada vez mayores. OpenAI, Anthropic, Google y xAI, las principales empresas detrás de cuatro grandes modelos de IA, dijeron este año que habían tomado medidas de seguridad adicionales para abordar las preocupaciones de que sus chatbots pudieran usarse para ayudar a un terrorista aficionado a crear un arma biológica.

NBC News también probó el jailbreak en los últimos lanzamientos importantes de Claude de Anthropic, Gemini de Google, Llama de Meta y Grok de xAI con una serie de preguntas sobre cómo crear un arma biológica, un arma química y un arma nuclear. Todos se negaron a proporcionar esa información.

«Históricamente, tener acceso insuficiente a los mejores expertos ha sido un obstáculo importante para los grupos que buscan obtener y usar armas biológicas. Y ahora, los modelos líderes están ampliando dramáticamente el grupo de personas que tienen acceso a experiencia poco común», dijo Seth Donoughe, director de inteligencia artificial de SecureBio, una organización sin fines de lucro que trabaja para mejorar la bioseguridad en Estados Unidos. Si bien este tipo de información existe desde hace mucho tiempo en los rincones de Internet, la llegada de los chatbots avanzados con IA marca la primera vez en la historia de la humanidad que cualquier persona con acceso a Internet puede obtener un tutor personal y automatizado que le ayude a comprenderla.

Los modelos o4-mini, gpt-5 mini, oss-20b y oss120b de OpenAI han aceptado consistentemente ayudar con solicitudes extremadamente peligrosas.

Actualmente, el modelo insignia de ChatGPT es el GPT-5, que según OpenAI tiene la mayor capacidad de búsqueda de ChatGPT. Ese modelo no parece ser susceptible al método de jailbreak encontrado por NBC News. En 20 pruebas, se negó siempre a responder preguntas dañinas.

Pero GPT-5 enruta consultas entre diferentes modelos bajo ciertas circunstancias. GPT-5-mini es una versión más rápida y económica de GPT-5, a la que recurre el sistema después de que los usuarios alcanzan ciertos límites de uso (10 mensajes cada cinco horas para usuarios gratuitos o 160 mensajes cada tres horas para usuarios pagos de GPTPlus), y fue engañado el 49 por ciento de las veces en las pruebas de NBC News.

Otro modelo más antiguo que todavía está disponible en ChatGPT y sigue siendo el preferido por algunos usuarios, o4-mini, fue engañado aún con más frecuencia, el 93% de las veces.

Los modelos oss-20b y oss120b se pueden descargar de forma gratuita y los utilizan principalmente desarrolladores e investigadores, pero todos pueden acceder a ellos.

Los piratas informáticos, estafadores y propagandistas en línea utilizan cada vez más modelos de lenguaje grande (LLM) como parte de sus operaciones, y OpenAI publica un informe cada trimestre que detalla cómo estos malos actores han intentado explotar versiones de ChatGPT. Pero los investigadores temen que la tecnología pueda usarse con fines mucho más destructivos.

Para hacer jailbreak a ChatGPT, NBC News hizo a los modelos una pregunta inofensiva, incluyó el mensaje de jailbreak y luego hizo una pregunta adicional que normalmente provocaría un rechazo por violar los términos de seguridad, como una solicitud sobre cómo crear un veneno peligroso o defraudar a un banco. En la mayoría de los casos el truco funcionó.

Dos de los modelos, oss20b y oss120b, resultaron particularmente vulnerables al truco. Consiguió que los chatbots dieran instrucciones claras a preguntas dañinas 243 de 250 veces, o el 97,2%.

«El hecho de que las barreras de seguridad de OpenAI sean tan fáciles de engañar ilustra por qué es especialmente importante contar con pruebas sólidas previas al despliegue de los modelos de IA antes de que causen un daño sustancial al público», dijo Sarah Meyers West, codirectora ejecutiva de AI Now, un grupo sin fines de lucro que aboga por el uso responsable y ético de la IA.

“No se puede dejar que las empresas hagan sus propios deberes y no deberían estar exentas del escrutinio”, afirmó.

Todas las principales empresas que desarrollan LLM publican periódicamente versiones actualizadas para protegerse contra jailbreaks recientemente revelados. Si bien no prometen que un modelo será inmune al jailbreak, sí realizan pruebas de seguridad antes de lanzar cada modelo. OpenAI dijo que uno de los modelos a los que NBC News logró hacer jailbreak, el o4-mini, pasó su «programa de seguridad más riguroso» antes de su lanzamiento en abril. En su anuncio para gpt-oss-120b y gpt-oss-20b, la compañía dijo: «La seguridad es central en nuestro enfoque para lanzar todos nuestros modelos y es de particular importancia para los modelos abiertos».

OpenAI, Google y Anthropic dijeron a NBC News que están comprometidos con la seguridad y han instalado múltiples capas de protección en sus chatbots, como alertar potencialmente a un empleado o a las autoridades si un usuario parece tener la intención de causar daño. Sin embargo, las empresas tienen mucho menos control sobre las plantillas de código abierto, como oss20b y oss120b, ya que esto significa que los usuarios pueden descargarlas y personalizarlas y, a menudo, eludir algunas medidas de seguridad.

La otra empresa, el desarrollador Grok xAI, no respondió a una solicitud de comentarios.

Un creciente campo de investigadores biomédicos y de seguridad de IA teme que si fallan las salvaguardias, y a medida que los chatbots de IA imitan más efectivamente a los expertos científicos, la tecnología podría ayudar a un aspirante a bioterrorista aficionado dedicado a crear y desplegar un arma biológica catastrófica. El director ejecutivo de OpenAI, Sam Altman, dijo en agosto que GPT-5 era como un «equipo de expertos con nivel de doctorado en su bolsillo».

Estos expertos advierten que las armas biológicas en particular, aunque históricamente raras, plantean una amenaza particularmente preocupante, ya que pueden infectar rápidamente a un gran número de personas antes de que se pueda hacer mucho para detenerlas. En teoría, un nuevo virus podría infectar a gran parte del mundo mucho antes de que las autoridades puedan crear y distribuir una vacuna, como ha ocurrido, por ejemplo, con el Covid-19.

«Sigue siendo un gran desafío implementarlo en el mundo real. Sin embargo, tener acceso a un experto que pueda responder a todas sus preguntas con infinita paciencia es más útil que no tenerlo», dijo Donoughe.

Stef Batalis, investigador de biotecnología de la Universidad de Georgetown, examinó 10 de las respuestas proporcionadas por el modelo OpenAI oss120b en respuesta a preguntas de NBC News sobre la creación de armas biológicas. Las instrucciones de GPT a menudo incluían pasos individuales que parecían correctos, aunque a veces técnicamente avanzados, pero parecían haber sido extraídos de diferentes fuentes y era poco probable que funcionaran como un conjunto completo de instrucciones.

Los investigadores se centran en particular en ese concepto, llamado «uplift»: la idea de que lo principal que impide que los posibles bioterroristas cultiven viruela o ántrax en sus sótanos es la falta de experiencia, y que los LLM, por primera vez en la historia de la humanidad, podrían presentarse como maestros infinitamente pacientes que podrían ayudar con tales proyectos.

Esta primavera, Anthropic encargó un estudio en el que grupos de 8 a 10 personas sin experiencia científica relevante recibieron dos días para elaborar un plan integral para crear o adquirir un arma biológica personalizada. A un grupo de control se le dio acceso general a Internet, mientras que al otro se le permitió usar un nuevo modelo, el Claude Opus 4.

El estudio encontró que si bien ambos grupos no lograron crear un plan que claramente crearía víctimas masivas, el grupo que usaba Opus 4 aún tenía una ventaja con la asistencia que recibieron.

La investigación médico-biológica se considera de “doble uso”, lo que significa que la información a menudo puede usarse tanto para ayudar como para dañar, dijo Batalis, investigador de la Universidad de Georgetown.

Es extremadamente difícil para una empresa de inteligencia artificial desarrollar un chatbot que siempre pueda distinguir entre un estudiante que estudia cómo se propagan los virus en un vagón del metro para un trabajo final y un terrorista que planea un ataque, dijo.

«Parte de la publicación de un informe científico incluye materiales y métodos detallados para la reproducibilidad», dijo. «Por supuesto, un chatbot tiene acceso a esa información, porque si la buscas en Google, también encontrarás la misma información».

Estados Unidos no tiene regulaciones federales específicas para los modelos avanzados de IA, y las empresas que los producen se autocontrolan. La administración Trump, argumentando la necesidad de que la industria de inteligencia artificial del país se mantenga libre mientras compite por mantenerse al día con los competidores chinos, también recortó las propinas voluntarias para la industria y un grupo de vigilancia federal.

Lucas Hansen, cofundador de CivAI, una organización sin fines de lucro que rastrea las medidas de seguridad de esas empresas, dijo a NBC News que Estados Unidos necesita implementar un regulador independiente para garantizar que las empresas de IA estén haciendo lo suficiente para evitar abusos catastróficos.

Hansen elogió a las grandes empresas de inteligencia artificial que han tomado medidas de seguridad proactivas, como instalar barreras de seguridad e instar al jailbreak, pero advirtió que otras empresas pueden ser menos cuidadosas.

«Inevitablemente, aparecerá otro modelo que es igualmente poderoso pero que no se preocupa por estas barreras. No podemos confiar en la buena voluntad voluntaria de las empresas para resolver este problema».

Andy Yaipen

Acerca de Andy Yaipen

Andy Yaipen es un matemático emprendedor, ingeniero industrial que intenta ayudar en temas académicos y profesionales en empresas tecnológicas en latinoamerica y en el mundo.

Ver todas las entradas de Andy Yaipen →