El modelo Astra que OpenAI está desarrollando utiliza una técnica de razonamiento denominada “profundidad recurrente” o “repetición opaca”. The Information informó el martes que esta técnica dificulta de manera significativa el seguimiento de la cadena de pensamiento (chain of thought) del modelo y ha generado preocupación entre los expertos en seguridad de IA. En la repetición opaca, el modelo procesa la consulta de forma cíclica varias veces, lo que hace que los registros tradicionales de la cadena de pensamiento sean menos legibles.
El CEO de Redwood, Buck Shlegeris, y el científico Ryan Greenblatt advirtieron que, si la técnica se escala aún más, los modelos podrían razonar en un espacio completamente oculto, lo que eliminaría por completo la trazabilidad. OpenAI declaró que el uso de la técnica es limitado, que la cadena de pensamiento sigue siendo legible y que no existe una transición a “nevralese”, al tiempo que anunció planes para sistemas de monitoreo de amplio alcance. Los expertos señalan que esta técnica podría romper un “tabú”, iniciar una “carrera al fondo” entre laboratorios y requerir regulaciones legales.
Se informa que Anthropic y Google DeepMind también están discutiendo técnicas similares. El principal científico de OpenAI, Jakub Pachocki, enfatizó que la trazabilidad de la cadena de pensamiento es un objetivo central, mientras que Greenblatt dijo: “espero que entrar en las arquitecturas más preocupantes I”.
