Araştırmada, GenAI'nin büyük dil modellerinin, insan değerlendirmesine benzer şekilde uzun yazılı ödevleri değerlendirebileceği test edilmiştir. İki farklı GenAI platformu kullanılarak 50 lisans öğrencisinin biyobilim ödevleri değerlendirilmiştir.

GenAI tarafından verilen puanlar, insan puanlarıyla karşılaştırılmış ve önemli farklılıklar bulunmuştur. GenAI, genellikle insanlara göre daha yüksek puanlar vermiştir ve yüksek puanlı ödevlerin puanlarını azaltırken, düşük puanlı ödevlerin puanlarını artırmıştır.

Araştırma, GenAI'nin şu anda insanlara benzer şekilde yazılı ödevleri değerlendirebilecek düzeyde olmadığını göstermiştir.