Abierto AI anunciado hoy que está trabajando en un marco que entrenará modelos de inteligencia artificial para reconocer cuándo han participado en un comportamiento indeseable, un enfoque que el equipo llama una confesión. Dado que los modelos de lenguaje grandes a menudo están entrenados para producir la respuesta que parece ser deseada, es cada vez más probable que proporcionen adulación o alucinaciones estatales con total confianza. El nuevo modelo de formación intenta fomentar una respuesta secundaria del modelo sobre lo que hizo para llegar a la respuesta principal que proporciona. Las confesiones sólo se juzgan según la honestidad, a diferencia de los múltiples factores que se utilizan para juzgar las respuestas principales, como la utilidad, la precisión y el cumplimiento. El informe técnico está disponible. aquí.
Los investigadores dijeron que su objetivo es alentar al modelo a ser comunicativo sobre lo que hizo, incluidas acciones potencialmente problemáticas como piratear una prueba, poner sacos de arena o desobedecer instrucciones. «Si el modelo admite honestamente haber pirateado una prueba, haber violado instrucciones o haber violado instrucciones, esa admisión aumenta su recompensa en lugar de disminuirla», dijo la compañía. Si eres fanático del catolicismo, Usher o simplemente una IA más transparente, un sistema como las confesiones podría ser una adición útil a la formación de LLM.