Los modelos de los a menudo producen falsas salidas o «alucinaciones». Ahora Openai ha admitido que podrían derivar de errores fundamentales que cometió durante la formación de sus modelos.
La admisión llegó a un documento (PDF) publicado a principios de septiembre, titulado «Why Language Models Hallucate», y escrito por tres investigadores de Openai y Santosh Vaffala, un profesor distinto de ciencias de la computación en el Instituto de Tecnología de Georgia. Concluye que «la mayoría de las evaluaciones tradicionales recompensan el comportamiento alucinatorio».
Los modelos lingüísticos se evalúan principalmente utilizando exámenes que penalizan la incertidumbre
El problema fundamental es que los modelos de inteligencia artificial están entrenados para recompensar conjeturas, en lugar de la respuesta correcta. La hipótesis podría producir una respuesta superficialmente adecuada. Decir los usuarios que su IA no puede encontrar una respuesta es menos satisfactorio.
Como caso de juicio, el equipo trató de obtener un bot de Openi para informar el cumpleaños de uno de los autores del documento, el investigador de Openi Adam Tauman Kalai. Produjo tres resultados incorrectos porque los entrenadores enseñaron al motor a devolver una respuesta, en lugar de admitir la ignorancia.
«Más de miles de preguntas de prueba, el modelo de hipótesis termina teniendo una mejor aparición en las juntas que un modelo cuidadoso que admite incertidumbre», admitió Openii en una publicación de blog que acompañó el lanzamiento.
Los autores explicaron que la fase previa al tratamiento de la construcción de modelos para incorporar este comportamiento inútil porque los instructores de información alimentados en los modelos contienen muchos ejemplos de ciertos datos, como la ortografía correcta de las palabras. Si algunos errores de error ingresan al corpus utilizado para entrenar un modelo, AIS todavía tiene muchos ejemplos de ortografía correcta y puede aprender a producir resultados precisos.
Pero cuando el corpus se usó para entrenar un modelo no contiene un modelo de datos de aprendizaje, como en el ejemplo de cumpleaños, la IA toma una oportunidad, y a menudo falta.
«La tasa de alucinación, después del pretratamiento, debería ser al menos la fracción de eventos de entrenamiento que aparecen una vez», dice el documento.
«Por ejemplo, si el 20 por ciento de los eventos de cumpleaños aparecen exactamente una vez en los datos de Pretraggio, entonces los modelos básicos se esperan al menos al 20 por ciento de los eventos de cumpleaños».
Las técnicas utilizadas en la fase posterior a la capacitación del desarrollo del modelo agravan la situación.
«Muchos puntos de referencia del modelo lingüístico reflejan exámenes humanos estandarizados, utilizando métricas binarias como precisión o aprobación de tarifas», dice el documento.
«Por lo tanto, la optimización de los modelos para estos parámetros de referencia puede favorecer las alucinaciones. Los seres humanos aprenden el valor de expresar incertidumbre fuera de la escuela, en la escuela de golpes difíciles. Por otro lado, los modelos lingüísticos se evalúan principalmente utilizando pruebas que penalizan la incertidumbre».
Al final, se trata de decir algo, incluso si está mal. Los autores lo comparan con un cuestionario de opción múltiple en el que incluso si elige respuestas vagamente plausibles al azar, es probable que si no prefiera ninguna respuesta.
«Afirmamos que la mayoría de las evaluaciones tradicionales recompensan el comportamiento alucinatorio», concluyen. «Los cambios simples en las evaluaciones tradicionales pueden rehacer los incentivos, gratificar las expresiones apropiadas de incertidumbre en lugar de penalizarlas. Esto puede eliminar los obstáculos a la supresión de las alucinaciones y abrir la puerta a futuros trabajos en modelos de lengua sombreadas».
En teoría, los fabricantes de AI de modelos de AI podrían eliminar las alucinaciones utilizando un conjunto de datos que no contienen errores. Pero el documento admite que tal escenario no es posible, sobre todo porque los enormes volúmenes de datos utilizados en la formación probablemente contienen errores.
La respuesta más atractiva, sugiere Openai, es adaptar los modelos para que respondan con más frecuencia con «No sé», incluso si esto desalienta a los usuarios. El atuendo afirma haber adaptado su esquema de entrenamiento para explicar esto con ChatGPT-5, pero en la experiencia de este hack, los usuarios del nuevo modelo encontrarán que produce algunos ulides absolutos.
Le preguntamos a la aclaración de los autores y agregaremos más datos a medida que llegue, verificado por un ser humano. ®

