Las mejores compañías de inteligencia artificial han pasado meses trabajando con nosotros, gobiernos en el Reino Unido sobre la seguridad del modelo

Tanto Operai como Anthrope declararon a principios de este mes que están trabajando con los gobiernos de los Estados Unidos y el Reino Unido para fortalecer la seguridad de sus grandes modelos comerciales para hacerlos más difíciles de abusar o abusar.

En un par de blogs publicados en sus sitios web el viernes, las compañías declararon sobre el año que trabajaron con investigadores del Centro de Normas de AI para la Innovación del Instituto Nacional de Normas y Tecnología para la Innovación y la IA del Reino Unido del Reino Unido.

Esta colaboración incluyó la concesión de investigadores gubernamentales acceso a modelos, clasificadores y datos de capacitación de empresas. Su propósito era permitir a los expertos independientes evaluar cuán resistentes son los modelos para ataques externos de piratas informáticos dañinos, así como su efectividad para bloquear a los usuarios legítimos de explotar la tecnología para fines legales o éticamente cuestionables.

El blog de Openai describe en detalle el trabajo con los Institutos, que ha estudiado las habilidades de ChatGPT en cibernético, químico-biológico y «otros dominios relevantes para la seguridad nacional». Desde entonces, esa asociación se ha ampliado a nuevos productos, incluido el equipo rojo de los agentes de inteligencia artificiales de la compañía y exploran nuevas formas para que OpenNI «colabore con los evaluadores externos para encontrar y arreglar la vulnerabilidad de la seguridad».

Operai ya trabaja con los equipos rojos seleccionados que patrullan sus productos por vulnerabilidad, por lo tanto, el anuncio sugiere que la compañía podría explorar un proceso separado de equipos rojos para sus agentes.

Según Openi, el compromiso con NIST ha producido ideas sobre dos nuevas vulnerabilidades que afectan sus sistemas. Estas vulnerabilidades «podrían haber permitido que un atacante sofisticado elude nuestras protecciones de seguridad y controle de forma remota los sistemas de TI a los que el agente podría acceder para esa sesión y se hace pasar por correctamente al usuario para otros sitios web en los que habían accedido», dijo la compañía.

Inicialmente, los ingenieros de Openi creían que las vulnerabilidades estaban inexploradas e «inútiles» debido a las garantías de seguridad existentes. Pero los investigadores identificaron una forma de combinar la vulnerabilidad con una nota técnica de Ijacking de la IA, que corrompe los datos de contexto subyacentes en los que el agente se basa para guiar su comportamiento, lo que les ha permitido detectar un agente de otro usuario con una tasa de éxito del 50%.

Entre mayo y agosto, Openai trabajó con investigadores desde el Reino Unido hasta el Instituto de Seguridad para probar y mejorar las garantías GPT5 y el agente de ChatGPT. El compromiso se centró en el equipo rojo de modelos para prevenir el abuso biológico, evitando que el modelo proporcione instrucciones paso a paso para producir bombas, armas químicas o biológicas.

La compañía ha declarado que ha proporcionado al gobierno británico a los prototipos no públicos de sus sistemas de salvaguardia, modelos de prueba despojados de cualquier barandilla, guía política interna sobre su trabajo de seguridad, acceso a modelos internos de monitoreo de seguridad y otras herramientas personalizadas.

Anthrope también afirmó haber otorgado a los investigadores del gobierno de los Estados Unidos y al Reino Unido acceso a sus sistemas de Claude a las pruebas e investigaciones continuas en diferentes fases de desarrollo, así como a su sistema de clasificación para encontrar vulnerabilidad de jailbreak.

Ese trabajo ha identificado varios ataques de inyección rápidos que han eligido las protecciones de seguridad dentro de Claude, nuevamente envenenando el contexto en el que se basa en las indicaciones ocultas y dañinas, así como un nuevo método universal de jailbreak capaz de evadir las herramientas de detección estándar. La vulnerabilidad del jailbreak fue tan grave que Anthrope optó por renovar toda su arquitectura de salvaguardia en lugar de tratar de parcharla.

Anthrope declaró que la colaboración ha enseñado a la compañía que dar a los gobiernos de acceso más profundos a sus sistemas podría conducir a un descubrimiento más sofisticado de vulnerabilidad.

«Los gobiernos aportan habilidades únicas a este trabajo, en particular una profunda competencia en áreas de seguridad nacional, como la seguridad informática, el análisis de la inteligencia y el modelado de amenazas que les permiten evaluar portadores de ataque específicos y mecanismos de defensa si se combinan con su competencia automática de aprendizaje», dijo el blog de Anthrope.

El trabajo de OpenA y Anthrope con los Estados Unidos y el Reino Unido llega, mientras que algunos expertos en seguridad artificial y seguridad se han preguntado si esos gobiernos y las compañías de inteligencia artificial pueden deducir las barandillas de seguridad técnica, mientras que los políticos intentan dar a sus industrias nacionales la mayor libertad de competir con China y otros competidores por el dominio del mercado global.

Después de ingresar al cargo, el Vicepresidente de los Estados Unidos JD Vance minimizó la importancia de la seguridad de la IA en los líderes internacionales, mientras que el primer ministro laborista británico, Keir Starmer, informó una promesa en el manifiesto electoral del partido para hacer cumplir las reglas de seguridad en las compañías de inteligencia artificial después de las elecciones de Donald Trump. Un ejemplo más simbólico: tanto las instituciones de IA del gobierno de los Estados Unidos como el Reino Unido han cambiado sus nombres este año para eliminar la palabra «seguridad».

Pero las colaboraciones indican que parte de este trabajo permanece en progreso, y no todos los investigadores de seguridad están de acuerdo en que los modelos son necesariamente peores.

MD Raz, un estudiante de doctorado de la Universidad de Nueva York que forma parte de un equipo de investigadores que estudia la seguridad informática y los sistemas de inteligencia artificial, dijo a CybersCoop que en su experiencia los modelos comerciales se están volviendo más difícil, ya no es fácil, para jailbreak con cada nueva versión.

«Ciertamente, en los últimos años, creo que entre GPT4 y GPT 5 … He visto muchas más barandillas en GPT5, donde GPT5 armará las piezas antes de que respondan y, a veces, dirá:» No, no lo haré. «

Otras herramientas de inteligencia artificial, como los modelos de codificación «son mucho menos considerables para la imagen más amplia» de lo que se le pide que haga y si es dañino o no, agregó, mientras que los modelos de código abierto «tienen más probabilidades de hacer lo que usted dice» y las barandillas existentes pueden estar más fáciles de rodear.

Derek B. Johnson

Escrito por Derek B. Johnson

Derek B. Johnson es periodista en Cyberscoop, donde su ritmo incluye seguridad informática, elecciones y el gobierno federal. Anteriormente, proporcionó una cobertura múltiple de información sobre seguridad informática en todos los sectores público y privado para varias publicaciones desde 2017. Derek ha logrado un título en periodismo impreso de la Universidad Hofstra en Nueva York y una maestría en políticas públicas en la Universidad George Mason en Virginia.

Andy Yaipen

Acerca de Andy Yaipen

Andy Yaipen es un matemático emprendedor, ingeniero industrial que intenta ayudar en temas académicos y profesionales en empresas tecnológicas en latinoamerica y en el mundo.

Ver todas las entradas de Andy Yaipen →