OpenAI se está sincerando sobre su problema con el demonio. después Informe de cableado Reveló una instrucción para el modelo de codificación de OpenAI de nunca hablar de duendes, duendes, mapaches, trolls, ogros, palomas u otros animales o criaturas. La startup de IA publicó una explicación En su sitio web, describió las referencias a las criaturas como un «hábito extraño» que sus modelos desarrollaron como resultado de su entrenamiento.
Como se explica en la publicación del blog, OpenAI comenzó a notar tropos que se referían a orcos y otras criaturas a partir de su modelo GPT-5.1, específicamente cuando usaba la opción de personaje «Nerdy». OpenAI dice que el problema siguió empeorando con las versiones posteriores del modelo, hasta que descubrió que su entrenamiento aumentado recompensaba los tropos retorcidos de personalidad obsesiva que entrenaban los modelos más nuevos.
Las recompensas sólo se aplicaron en la condición de nerd, pero el aprendizaje por refuerzo no garantiza que las conductas aprendidas permanezcan dentro del alcance de la condición que las produjo. Una vez que se recompensa un estilo, el entrenamiento posterior puede difundirlo o reforzarlo en otros lugares, especialmente si ese resultado se reutiliza para ajustar o supervisar datos de preferencias.
Aunque las referencias a duendes y gremlins disminuyeron después de que OpenAI descontinuara el personaje Nerdy en marzo, no desaparecieron por completo con GPT-5.5 dentro del codificador Codex, ya que OpenAI comenzó a entrenar el modelo antes de encontrar la «causa raíz». Como resultado, la empresa tuvo que dar instrucciones muy específicas al Codex para que no hablara de criaturas míticas. Pero si prefieres tener tu código de IA con algunos demonios, OpenAI es el indicado para hacerlo. Compartió una forma de revertir sus instrucciones..
(Etiquetas para traducción) AI