Las nuevas herramientas de seguridad de IA de OpenAI pueden dar una falsa sensación de seguridad

OpenAI presentó la semana pasada dos nuevas herramientas de descarga gratuita que deberían facilitar a las empresas la construcción de vallas en torno a las sugerencias que los usuarios hacen a los modelos de IA y los resultados generados por esos sistemas.

Las nuevas barreras de seguridad están diseñadas para que una empresa pueda, por ejemplo, establecer controles más fácilmente para evitar que un chatbot de servicio al cliente responda con un tono grosero o revele políticas internas sobre cómo debe tomar decisiones sobre ofrecer reembolsos, por ejemplo.

Pero si bien estas herramientas están diseñadas para hacer que los modelos de IA sean más seguros para los clientes empresariales, algunos expertos en seguridad advierten que la forma en que OpenAI las lanzó podría crear nuevas vulnerabilidades y dar a las empresas una falsa sensación de seguridad. Y, si bien OpenAI afirma haber lanzado estas herramientas de seguridad para el bien de todos, algunos se preguntan si las motivaciones de OpenAI están impulsadas en parte por un deseo de mitigar una ventaja de su rival de IA Anthropic, que ha ganado fuerza entre los usuarios empresariales en parte debido a la percepción de que sus modelos Claude tienen barreras de seguridad más fuertes que otros competidores.

Las herramientas de seguridad de OpenAI, llamadas gpt-oss-safeguard-120b y gpt-oss-safeguard-20b, son en sí mismas un tipo de modelo de IA conocido como clasificador, diseñado para evaluar si la solicitud que hace un usuario a un modelo de IA más grande y genérico, así como el modelo de IA más grande producido, satisface un conjunto de reglas. En el pasado, las empresas que compran e implementan modelos de IA podían entrenar ellos mismos estos clasificadores, pero el proceso consumía mucho tiempo y era potencialmente costoso, ya que los desarrolladores tendrían que recopilar ejemplos de contenido que violaba las políticas para entrenar al clasificador. Y luego, si la empresa quisiera ajustar las políticas utilizadas para las barreras de seguridad, tendría que recopilar nuevos ejemplos de infracciones y volver a capacitar al clasificador.

OpenAI espera que nuevas herramientas puedan hacer que este proceso sea más rápido y flexible. En lugar de ser entrenados para seguir un código fijo, estos nuevos clasificadores de seguridad pueden simplemente leer una política escrita y aplicarla a contenido nuevo.

OpenAI dice que este método, al que llama “clasificación basada en razonamiento”, permite a las empresas adaptar sus políticas de seguridad tan fácilmente como editar texto en un documento en lugar de reconstruir un modelo de clasificación completo. La compañía está posicionando el lanzamiento como una herramienta para las empresas que desean tener más control sobre cómo sus sistemas de inteligencia artificial manejan información confidencial, como registros médicos o registros sanitarios.

Sin embargo, aunque se supone que las herramientas son más seguras para los clientes empresariales, algunos expertos en seguridad dicen que pueden dar a los usuarios una falsa sensación de seguridad. Esto se debe a que OpenAI ha hecho que los clasificadores de IA sean de código abierto. Esto significa que han puesto a disposición de forma gratuita todo el código de los clasificadores, incluidos los pesos o configuraciones internas de los modelos de IA.

Los clasificadores actúan como puertas de seguridad adicionales para un sistema de IA, diseñados para bloquear instrucciones inseguras o maliciosas antes de que lleguen al modelo maestro. Pero al hacerlos de código abierto, OpenAI corre el riesgo de compartir los proyectos hasta esas puertas. Esta transparencia podría ayudar a los investigadores a fortalecer los mecanismos de seguridad, pero también podría facilitar que los malos actores detecten debilidades y riesgos, creando una especie de falsa comodidad.

«Hacer que estos modelos sean de código abierto puede ayudar tanto a los atacantes como a los defensores», afirmó David Krueger, profesor de seguridad de IA en Mila. Fortuna. Facilitará el desarrollo de enfoques para eludir los clasificadores y otras salvaguardas similares”.

Por ejemplo, cuando los atacantes tienen acceso a los pesos del clasificador, pueden desarrollar más fácilmente los llamados ataques de “inyección rápida”, en los que desarrollan indicaciones que engañan al clasificador para que ignore la política que se supone que debe aplicar. Los investigadores de seguridad han descubierto que, en algunos casos, incluso una serie de personajes que a una persona le parecen absurdos pueden, por razones que los investigadores no comprenden del todo, convencer a un modelo de IA para que ignore sus barreras de seguridad y haga algo que no debería hacer, como ofrecer consejos sobre cómo construir una bomba o lanzar insultos raciales.

Representantes directos de OpenAI Fortuna hasta el anuncio de la entrada del blog de la empresa y la memoria técnica de los modelos.

Dolor a corto plazo para ganancias a largo plazo

El código abierto puede ser un arma de doble filo cuando se trata de seguridad. Permite a investigadores y desarrolladores probar, mejorar y adaptar las medidas de protección de la IA más rápidamente, aumentando la transparencia y la confianza. Por ejemplo, puede haber formas en que los investigadores de seguridad puedan modificar los pesos del modelo para hacerlo más robusto para provocar la inyección sin degradar el rendimiento del modelo.

Pero también puede facilitar que los atacantes estudien y eludan esas mismas protecciones, por ejemplo, utilizando otro software de aprendizaje automático para ejecutar cientos de miles de posibles instrucciones hasta que encuentren aquellas que harán que el modelo salte de sus barreras de seguridad. Además, los investigadores de seguridad han descubierto que estos tipos de ataques oportunos generados y desarrollados automáticamente en modelos de IA de código abierto a veces también funcionan contra modelos de IA propietarios, donde los atacantes no tienen acceso al código subyacente ni a los pesos del modelo. Los investigadores plantearon la hipótesis de que esto se debe a que puede haber algo intrínseco a la forma en que todos los modelos de lenguaje grandes codifican el lenguaje, de modo que inyecciones oportunas similares tendrán éxito contra cualquier modelo de IA.

De esta manera, los clasificadores de código abierto no sólo podrían dar a los usuarios una falsa sensación de seguridad de que su sistema está bien protegido, sino que también podrían hacer que cada modelo de IA sea menos seguro. Pero los expertos dijeron que probablemente valía la pena correr ese riesgo porque los clasificadores de código abierto también deberían facilitar que todos los expertos en seguridad del mundo encuentren formas de hacer que los clasificadores sean más resistentes a este tipo de ataques.

«A largo plazo, es útil compartir cómo funcionan las defensas; puede causar algún tipo de dolor a corto plazo. Pero a largo plazo, resulta en defensas sólidas que en realidad son bastante difíciles de sortear», dijo Vasilios Mavroudis, investigador principal del Instituto Alan Turing.

Mavroudis dijo que si bien los clasificadores de código abierto podrían, en teoría, facilitar que alguien intente eludir los sistemas de seguridad en los principales modelos de OpenAI, la compañía probablemente crea que este riesgo es bajo. Dijo que OpenAI cuenta con otras salvaguardas, incluido el hecho de contar con equipos de expertos en seguridad humana que intentan continuamente probar las barreras de seguridad de sus modelos para encontrar vulnerabilidades y, con suerte, mejorarlas.

«El acceso abierto a un modelo de clasificación brinda a aquellos que desean eludir a los clasificadores la oportunidad de aprender cómo hacerlo. Pero los jailbreakers decididos aún tienen probabilidades de tener éxito», dijo Robert Trager, codirector de la Iniciativa de Gobernanza de IA de Oxford Martin.

«Recientemente nos encontramos con un método que evita todas las protecciones de los principales desarrolladores aproximadamente el 95% de las veces, y no estábamos buscando tal método. Dado que los jailbreakers decididos aún tendrán éxito, es útil abrir sistemas de código abierto para que los desarrolladores los utilicen con personas menos determinadas», añadió.

La carrera por la inteligencia artificial corporativa

El lanzamiento también tiene implicaciones competitivas, especialmente porque OpenAI busca desafiar la creciente posición de la empresa rival de IA Anthropic entre los clientes empresariales. La familia Claude de modelos de IA de Anthropic se ha vuelto popular entre los clientes empresariales en parte debido a su reputación de tener controles de seguridad más sólidos que otros modelos de IA. Entre las herramientas de seguridad utilizadas por Anthropic se encuentran los “clasificadores constitucionales” que funcionan de manera similar a los de código abierto OpenAI.

Anthropic se ha hecho un hueco en el mercado entre los clientes empresariales, especialmente en lo que respecta a la codificación. Según un informe de julio de Menlo Ventures, Anthropic tiene el 32% de la participación de mercado de modelos de lenguaje para grandes empresas según el uso, en comparación con el 25% de OpenAI. En casos de uso específicos de codificación, Anthropic posee el 42%, mientras que OpenAI posee el 21%. Al ofrecer herramientas centradas en la empresa, OpenAI podría intentar ganarse a algunos de estos clientes empresariales y al mismo tiempo posicionarse como líder en seguridad de IA.

Los “clasificadores constitucionales” de Anthropic consisten en pequeños modelos de lenguaje que comparan los resultados de un modelo más grande con un conjunto escrito de valores o políticas. Al hacer que una función similar sea de código abierto, OpenAI ofrece efectivamente a los desarrolladores el mismo tipo de barreras personalizables que ayudaron a que los modelos de Anthropic fueran tan atractivos.

«Por lo que he visto en la comunidad, parece ser bien recibido», dijo Mavroudis. «Ven el modelo como una forma potencial de implementar la automoderación. También tiene una buena connotación, como en ‘estamos dando a la comunidad’. Probablemente también sea una herramienta útil para las pequeñas empresas que no podrían entrenar un modelo de este tipo por sí mismas».

A algunos expertos también les preocupa que el acceso abierto a estos clasificadores de seguridad pueda centralizar lo que se considera IA “segura”.

«La seguridad no es un concepto bien definido. Cualquier implementación de estándares de seguridad reflejará los valores y prioridades de la organización que los crea, así como las limitaciones y deficiencias de sus modelos», dijo John Thickstun, profesor asistente de informática en la Universidad de Cornell. VentureBeat. «Si la industria en su conjunto adopta los estándares desarrollados por OpenAI, corremos el riesgo de institucionalizar una perspectiva particular sobre la seguridad y obstaculizar investigaciones más amplias sobre las necesidades de seguridad para las implementaciones de IA en muchos sectores de la sociedad».

Andy Yaipen

Acerca de Andy Yaipen

Andy Yaipen es un matemático emprendedor, ingeniero industrial que intenta ayudar en temas académicos y profesionales en empresas tecnológicas en latinoamerica y en el mundo.

Ver todas las entradas de Andy Yaipen →