OpenAI Global Affairs anunció su lanzamiento a través de una publicación de LinkedIn y un blog adjunto. gpt-oss-protecciónuna vista previa de la investigación sobre «modelos de razonamiento ponderados abiertos diseñados para la clasificación de seguridad».
Las plantillas, disponibles en dos versiones, gpt-oss-safeguard-120b y gpt-oss-safeguard-20b, amplían la arquitectura abierta de la empresa hacia la seguridad y la moderación. OpenAI dijo que las plantillas «permiten a los desarrolladores utilizar sus propias políticas personalizadas para revisar el contenido, brindando a los desarrolladores flexibilidad y fomentando la libertad de expresión».
OpenAI, con sede en San Francisco, desarrolla sistemas de inteligencia artificial que incluyen ChatGPT y un conjunto de grandes modelos de lenguaje utilizados en negocios, investigación y educación. La empresa lo dijo gpt-oss-protección «permite a los desarrolladores, investigadores y equipos de seguridad de todo el mundo mejorar la seguridad del contenido en línea o filtrar los resultados de un modelo de IA».
Razonamiento basado en políticas y adaptabilidad en tiempo real
A diferencia de los clasificadores tradicionales entrenados en conjuntos de datos fijos, gpt-oss-protección Utiliza el razonamiento al hacer inferencias. El modelo interpreta una política proporcionada por el desarrollador y clasifica los mensajes de usuario o las finalizaciones de IA en función de esa política. Dado que la política se proporciona durante la inferencia en lugar de durante el entrenamiento, los desarrolladores pueden revisar y probar políticas sin volver a entrenar un modelo.
El blog de OpenAI explica: «La política se proporciona durante la inferencia, en lugar de entrenarse en el modelo, por lo que es fácil para los desarrolladores revisar las políticas de forma iterativa para aumentar el rendimiento». Los desarrolladores también pueden revisar la cadena de pensamiento del modelo para comprender cómo se realizó una clasificación.
Ambas plantillas se publican bajo la licencia Apache 2.0 y están alojadas en Hugging Face, lo que permite a cualquiera descargarlas, modificarlas y distribuirlas libremente. OpenAI señaló que el diseño de peso abierto respalda la experimentación y la colaboración dentro de la comunidad de seguridad de IA en general.
Asociación con ROOST y lanzamiento de la comunidad Hugging Face
OpenAI trabajó con su socio ROOST para probar modelos, identificar los requisitos de los desarrolladores y publicar documentación. ROOST también liderará el lanzamiento de Model Community, una red colaborativa para desarrolladores que utilizan herramientas de seguridad de IA de código abierto.
Como parte del lanzamiento, alojar modelos en Hugging Face proporciona a los desarrolladores una ruta inmediata para acceder a puntos de control y documentación, y para compartir ajustes públicamente. La infraestructura de Hugging Face admite pruebas reproducibles y control de versiones, lo cual es fundamental para evaluar modelos abiertos a escala.
Vinay Rao, director de tecnología de ROOST, dijo: «gpt-oss-safeguard es el primer modelo de razonamiento de código abierto con un diseño de ‘traiga sus propias políticas y definiciones de daños’. Las organizaciones merecen estudiar, modificar y utilizar libremente tecnologías de seguridad críticas y poder innovar. En nuestras pruebas, fue experto en comprender diferentes políticas, explicar su razonamiento y mostrar matices en la aplicación de políticas, lo que creemos que será beneficioso para los constructores y los equipos de seguridad».
Las herramientas de seguridad interna informan el comunicado público.
Los nuevos modelos provienen de OpenAI contador de seguridad framework, que impulsa los sistemas de moderación y seguridad en todas sus plataformas principales. Safety Reasoner permite a la empresa actualizar rápidamente las políticas sobre el contenido en producción sin tener que volver a capacitar a los clasificadores.
OpenAI lo escribió gpt-oss-protección es «una implementación abierta de un enfoque que desarrollamos internamente, en una herramienta que llamamos Safety Reasoner que nos permite actualizar nuestras políticas de seguridad para combatir nuevas amenazas en producción en menos tiempo del que llevaría volver a capacitar a un clasificador».
Este sistema basado en razonamiento se ha integrado en el proceso interno de OpenAI para lanzamientos que incluyen Sora y ChatGPT Agent. Ayuda a detectar y bloquear dinámicamente resultados inseguros, particularmente en áreas como imágenes, biología y prevención de autolesiones.
EL gpt-oss-protección Los modelos se compararon con conjuntos de datos internos y puntos de referencia públicos como ToxicChat y el conjunto de moderación OpenAI 2022. En la clasificación de políticas múltiples, los modelos tuvieron un desempeño comparable o mejor que el pensamiento gpt-5 y los modelos abiertos gpt-oss originales.
Sin embargo, OpenAI ha reconocido que los clasificadores especialmente diseñados y entrenados en grandes conjuntos de datos etiquetados aún pueden lograr un rendimiento superior. gpt-oss-protección en escenarios de moderación altamente complejos. Los modelos también requieren más recursos informáticos, lo que puede limitar la escalabilidad. OpenAI dijo que mitiga este problema internamente al combinar clasificadores livianos con modelos de razonamiento para equilibrar la precisión y la latencia.
Desarrollo colaborativo y próximos pasos
OpenAI enfatizó que el lanzamiento es parte de su estrategia de seguridad de “defensa en profundidad”, que combina protecciones en capas y colaboración abierta. A través de la comunidad modelo ROOST y el alojamiento Hugging Face, los desarrolladores e investigadores pueden contribuir con datos de evaluación, modelos de políticas y comentarios sobre la implementación.
La compañía dijo que planea iterar modelos basados en aportes de la comunidad más amplia de investigación de confianza y seguridad, con el objetivo de refinar la calidad del razonamiento y reducir la sobrecarga computacional.
OpenAI Global Affairs concluyó su anuncio en LinkedIn reiterando su objetivo de responsabilidad colectiva en la seguridad de la IA: «En OpenAI, juntos hacemos que la industria sea más segura».

