Operai afirma haber entendido lo que está guiando «alucinaciones» o la fuerte tendencia de los modelos para inventar respuestas que en realidad son incorrectas.
Es un problema grave que aflige a todo el sector, subestimando significativamente la utilidad de la tecnología. Peor aún, los expertos descubrieron que el problema está empeorando ya que los modelos son más capaces.
En consecuencia, a pesar de apoyar los gastos astronómicos en su implementación, los modelos de frontera AI AI todavía son propensos a hacer declaraciones inexactas frente a una solicitud a la que no conocen la respuesta.
Si hay una solución al problema sigue siendo un tema muy debatido, con algunos expertos que afirman que las alucinaciones son intrínsecas a la tecnología misma. En otras palabras, los modelos grandes pueden ser un callejón sin salida en nuestra investigación para desarrollar AIS con una comprensión confiable de las declaraciones fácticas.
En un documento publicado la semana pasada, un equipo de investigadores de Openi trató de desarrollar una explicación. Sugieren que grandes modelos alucinados porque cuando se crean, se les alienta a adivinar en lugar de admitir que simplemente no saben la respuesta.
Las alucinaciones «persisten debido a la forma en que se clasifican la mayoría de las evaluaciones: los modelos lingüísticos están optimizados para ser buenos testigos de prueba y adivinar cuando incierto mejora el rendimiento de las pruebas», lee el documento.
Convencionalmente, el resultado de la inteligencia artificial se clasifica binariamente, lo que lo recompensa cuando da una respuesta correcta y la penaliza cuando da incorrecto.
En términos simples, en otras palabras, la hipótesis es recompensada, porque es Podría ser Tenga razón: en una inteligencia artificial admitiendo que no conoce la respuesta, que se clasificará como incorrecta, no importa.
En consecuencia, a través de «presiones estadísticas naturales», el LLM está mucho más inclinado a alucinar una respuesta en lugar de «reconocer la incertidumbre».
«La mayoría de los marcadores dan prioridad a los modelos de rango basados en la precisión, pero los errores son peores que las abstenciones», escribió Openii en una publicación en el blog de acompañamientos.
En otras palabras, Operai dice que esto, y todos sus imitadores en todo el sector, han cometido un grave error estructural en la forma en que entrenaron a la IA.
Habrá muchas cosas que montar si el problema es correcto en el futuro. Operai dice que «hay una solución simple» para el problema: «penalizar los errores seguros más de lo que la incertidumbre penaliza y da un crédito parcial por las expresiones apropiadas de incertidumbre».
En el futuro, las evaluaciones deben garantizar que «su puntaje desalienta la hipótesis», lee la publicación del blog. «Si los puntajes principales continúan recompensándonos hipótesis afortunadas, los modelos continuarán aprendiendo a adivinar».
«Los cambios simples en las evaluaciones tradicionales pueden rehacer los incentivos, gratificando las expresiones apropiadas de incertidumbre en lugar de penalizarlas», concluyeron los investigadores de la compañía en el documento. «Esto puede eliminar los obstáculos a la supresión de las alucinaciones y abrir la puerta al trabajo futuro en modelos de idiomas desvaídos, por ejemplo, con una competencia pragmática más rica».
Queda por ver cómo estos ajustes a las evaluaciones tienen lugar en el mundo real. Si bien la compañía ha afirmado que su último modelo GPT-5 Allucines menos, los usuarios no estaban impresionados en gran medida.
Por ahora, la industria de la inteligencia artificial tendrá que continuar lidiando con el problema, ya que justifica docenas de miles de millones de dólares en los gastos de capital y las emisiones de la parte inferior.
«Las alucinaciones siguen siendo un desafío fundamental para todos los modelos grandes, pero estamos trabajando duro para reducirlos aún más», prometió Openi su publicación de blog.
Más sobre alucinaciones: GPT-5 está cometiendo enormes errores objetivos, dicen los usuarios

