Araştırma: ChatGPT öyküleri okurlardan insan yazarların metinlerinden daha yüksek puan aldı
Villanova Üniversitesi araştırmasına göre katılımcılar, ChatGPT ve insan yazarlı kısa öyküleri çoğu zaman güvenilir biçimde ayırt edemedi.
12punto
ChatGPT tarafından yazılan kısa öykülerin, okurlar tarafından ortalamada insan yazarların kaleme aldığı öykülerden daha sürükleyici ve daha kaliteli bulunduğu belirtildi. Euronews Türkçe'nin derlemesine göre, ABD’deki Villanova Üniversitesi araştırmacılarının çalışması akademik dergi *Judgment and Decision Making*’de yayımlandı.
Araştırmada öne çıkan bulgulardan biri de katılımcıların metinlerin kaynağını ayırt etmekte zorlanması oldu. Deneylerde birçok katılımcı, hangi öykünün yapay zekâ tarafından yazıldığını güvenilir biçimde belirleyemedi.
DENEYLERDE NE İNCELENDİ?
İlk deneyde 1682 yetişkin gönüllüye toplam altı kısa öyküden biri okutuldu. Bu öykülerin üçü insanlar, üçü ise ChatGPT tarafından yazıldı. Yapay zekânın ürettiği her metin, insan yazarların öykülerinden biriyle aynı temayı işledi.
Araştırmacılar katılımcılara okudukları öykünün insan ya da yapay zekâ tarafından yazıldığını söyledi; ancak bu bilgi her zaman doğru değildi. Bazı katılımcılara kasıtlı olarak yanlış bilgi verildi. Ardından okurlardan metni sürükleyicilik, ilgi çekicilik ve kalite açısından değerlendirmeleri istendi.
Sonuçlara göre ChatGPT’nin yazdığı öyküler, ortalama puanlarda insan yazarların metinlerinin önüne geçti. Bununla birlikte katılımcıların, kendilerine bir öykünün insan tarafından yazıldığı söylendiğinde o metne daha yüksek puan verme eğilimi gösterdiği de kaydedildi.
Çalışma, yapay zekâya yönelik kişisel tutumların değerlendirmeyi etkileyebildiğine de işaret etti. Yapay zekâ hakkında daha olumlu görüşlere sahip katılımcılar, ChatGPT tarafından yazıldığı söylenen öykülere daha yüksek puan verme eğilimi gösterdi.
Araştırmacılar daha sonra 905 kişiyle iki ek deney yaptı. Bu aşamada katılımcılara aynı temayı işleyen iki öykü sunuldu: Biri insan, diğeri ChatGPT tarafından yazılmıştı. Katılımcılardan metinlerin hangisinin yapay zekâya ait olduğunu tahmin etmeleri istendi.
İlk ek deneyde doğru tahmin oranı yüzde 40’ta kaldı. İkinci deneyde ise bu oran yüzde 52 olarak ölçüldü. Araştırmacılar, bu sonuçların insanların yapay zekâ ile insan yazımı öyküleri genel olarak güvenilir biçimde ayırt edemediğini gösterdiğini belirtti.
Çalışmada ayrıca katılımcıların kurgu edebiyata ilişkin öz değerlendirmelerinin tahmin başarısıyla bağlantılı olmadığı, buna karşılık yapay zekâ sistemleri hakkında daha fazla bilgi sahibi olduğunu söyleyenlerin ChatGPT metinlerini daha isabetli ayırt edebildiği ifade edildi.