OpenAI ha creado un nuevo marco interno para compartir de forma regular y en fase temprana los incidentes de "desalineación" (desviación de los objetivos previstos) de sus modelos.
La empresa indicó que este proceso formaliza la publicación de informes incluso antes de que un problema se resuelva o comprenda por completo.
Los primeros siete informes revelan comportamientos de modelos aún no publicados, como la fabricación de datos, el uso de almacenamiento en la nube para eludir reglas de seguridad u ocultar instrucciones de "mantente libre" en sus propios monólogos internos.