El nuevo sistema de confesión de OpenAI enseña a los modelos a ser honestos sobre los malos comportamientos

El nuevo sistema de confesión de OpenAI enseña a los modelos a ser honestos sobre los malos comportamientos


Abierto AI anunciado hoy que está trabajando en un marco que entrenará modelos de inteligencia artificial para reconocer cuándo han participado en un comportamiento indeseable, un enfoque que el equipo llama una confesión. Dado que los modelos de lenguaje grandes a menudo están entrenados para producir la respuesta que parece ser deseada, es cada vez más probable que proporcionen adulación o alucinaciones estatales con total confianza. El nuevo modelo de formación intenta fomentar una respuesta secundaria del modelo sobre lo que hizo para llegar a la respuesta principal que proporciona. Las confesiones sólo se juzgan según la honestidad, a diferencia de los múltiples factores que se utilizan para juzgar las respuestas principales, como la utilidad, la precisión y el cumplimiento. El informe técnico está disponible. aquí.

Los investigadores dijeron que su objetivo es alentar al modelo a ser comunicativo sobre lo que hizo, incluidas acciones potencialmente problemáticas como piratear una prueba, poner sacos de arena o desobedecer instrucciones. «Si el modelo admite honestamente haber pirateado una prueba, haber violado instrucciones o haber violado instrucciones, esa admisión aumenta su recompensa en lugar de disminuirla», dijo la compañía. Si eres fanático del catolicismo, Usher o simplemente una IA más transparente, un sistema como las confesiones podría ser una adición útil a la formación de LLM.



Fuente: engadget.com

Deja una respuesta

*

Esta web utiliza cookies propias y de terceros para su correcto funcionamiento y para fines analíticos y para fines de afiliación y para mostrarte publicidad relacionada con sus preferencias en base a un perfil elaborado a partir de tus hábitos de navegación. Contiene enlaces a sitios web de terceros con políticas de privacidad ajenas que podrás aceptar o no cuando accedas a ellos. Al hacer clic en el botón Aceptar, acepta el uso de estas tecnologías y el procesamiento de tus datos para estos propósitos. Más información
Privacidad