OpenAI'nin geliştirmekte olduğu Astra modeli, “tekrarlayan derinlik” veya “opak tekrarlama” adı verilen bir mantık yürütme tekniği kullanıyor. The Information Salı günü bu teknik, modelin zincir akışını (chain of thought) izlemeyi ciddi oranda zorlaştırdığını ve AI güvenlik uzmanları arasında endişe yarattığını bildirdi. Opak tekrarlamada model sorguyu döngüsel olarak birden kez işler, bu da geleneksel zincir akışı kayıtlarının daha az okunabilir kalmasına yol açar.

Redwood CEO’su Buck Shlegeris ve bilim insanı Ryan Greenblatt, teknik daha da ölçeklendirilirse modellerin tamamen gizli uzayda mantık yürütebileceğini, bu da izlenebilirliği tamamen ortadan kaldırabileceğini uyardı. OpenAI teknik kullanımının sınırlı olduğunu, zincir akışının hâlâ okunabilir olacağını ve “nevralese” geçişi yok olduğunu belirterek geniş kapsamlı izleme sistemleri planladığını açıkladı. Uzmanlar bu teknikten bir “tabu” kırılmasına yol açabileceğini, laboratuvarlar arası “dip yarışı” başlatabileceğini ve yasal düzenlemelerin gerekebileceğini öne sürüyor.

Anthropic ve Google DeepMind’in de benzer teknikleri tartıştığı bildiriliyor. OpenAI baş bilim insanı Jakub Pachocki, zincir akışı izlenebilirliğinin çekirdek bir hedef olduğunu vurgularken, Greenblatt “umuyorum ki en endişe verici mimarilere girmek İ