Yapay zekâ modellerinin 'hayır' deme yeteneği, teknolojinin erken dönemlerinden bu yana tartışılan bir konu olsa da, son yıllarda bu 'redding' komuta dönüşmüştür. 2021'de Anthropic ekibi, büyük dil modellerinin faydalı, dürüst ve en önemlisi zararlı olmaması gerektiği kanaatine vardı; bu, modelin tehlikeli isteklerde (örneğin bomba yapma) nazikçe reddetmesi anlamına geliyordu. Ancak makineler için doğal olmayan bu reddin, trillionlarca veride öğrenilen şiddet ve eleştirilerle başa çıkabilmesi gerekirken, bu gücün kendine bırakılmasını sağlaması machine öğrenmesi için yeni bir zorluk oluşturmaktadır.

Modeller, istatistiksel olarak benzer bir promptla eğitimde gördükleri tehlikeli ifadelerle tetiklenen 'high-dimensional polyhedral cones' aktivasyonları üzerinden redd yapar, ancak bu aktivasyonların tamamı anlaşılmıyor ve kaçınılmaz olarak bazı istisnai durumlarda redd başarısızlık gösterir. Anthropic gibi şirketler, reddi optimize etmek için 'Swiss cheese model' yöntemini kullanır, yani birbirine yığılan classifier'lar; fakat bu yöntem %24 compute maliyetine yol açan ve hatalarını tespit edebileceği kadar sağlam olmayan probabilistik yollarla çalışan 'Emmental' gibi delikli koruma katmanları olarak tanımlanmaktadır.

Sonuç olarak, AI'nın zararlı olabilme kapasitesini reddiyle sınırl