iScience’da yayımlanan yeni bir araştırma, GPT-4’ün farklı metinlerden kişilik testleri oluşturabildiğini ve insanların bu testlere vereceği yanıtların genel dağılımını, anketler uygulanmadan önce tahmin edebildiğini ortaya koydu. Kudüs İbrani Üniversitesi ve Hadassah Tıp Fakültesi’nden Rotem Monsa, Aviv Zohar ve Shahar Arzy tarafından yürütülen çalışmada, GPT-4’ten iki farklı kaynağı temel alan kişilik anketleri hazırlaması istendi.
Araştırmacılar kaynaklardan biri olarak psikiyatride kullanılan DSM-5’in kişilik bozuklukları bölümünü, diğeri olarak ise bilimsel geçerliliği bulunmayan bir astroloji kitabını seçti. Araştırmanın başyazarı Rotem Monsa, iki metnin insan kişiliğini ayrıntılı biçimde ele almasına rağmen bilimsel dayanak bakımından spektrumun farklı uçlarında yer aldığını belirtiyor.

Anketler 600 katılımcıyla test edildi
GPT-4 tarafından oluşturulan anketler, 600 yetişkine uygulandı. Katılımcılar aynı zamanda kişilik araştırmalarında yaygın biçimde kullanılan Beş Büyük Kişilik Envanteri’ni de doldurdu. DSM-5 temel alınarak hazırlanan ankette, gerçek hayatta birbiriyle ilişkili olan kişilik özelliklerinin katılımcı yanıtlarında da birlikte hareket ettiği görüldü. Örneğin kaçınma ve bağımlılık gibi birbiriyle bağlantılı özellikler arasında tutarlı ilişkiler tespit edildi. Bu anketin iç tutarlılığı, Beş Büyük Kişilik Envanteri’nde gözlemlenen örüntülerle benzerlik gösterdi.
Astroloji kitabından üretilen ankette ise burçlar veya elementler altında bir araya getirilen kişilik özelliklerinin tutarlı psikolojik boyutlar oluşturmadığı görüldü. Buna rağmen her iki anketin ayrı ayrı maddeleri; depresyon, kaygı ve genel iyilik hali gibi çeşitli sonuçlarla anlamlı ilişkiler kurabildi. Araştırmacılara göre bu durum astrolojinin geçerliliğini göstermiyor. Bulgular, GPT-4’ün bilimsel olmayan bir metindeki kişilikle ilgili ifadelerden bile ölçülebilir psikolojik sinyaller çıkarabildiğine işaret ediyor.
GPT-4, yanıtları anket uygulanmadan önce tahmin etti

Çalışmanın dikkat çeken bölümü, GPT-4’ün katılımcılardan veri toplanmadan önce yaptığı tahminler oldu. Modelden, beşli Likert ölçeğindeki her soruya verilecek ortalama yanıtları ve sorular arasındaki ilişkileri öngörmesi istendi. Paylaşılan sonuçlara göre, modelin tahminleriyle katılımcıların ortalama yanıtları arasındaki korelasyon DSM-5 tabanlı ankette 0,71, astroloji tabanlı ankette ise 0,85 olarak ölçüldü. GPT-4’ün sorular arasındaki ilişkileri tahmin etme performansı ise sırasıyla 0,74 ve 0,69 seviyesinde gerçekleşti. Bu rakamların doğruluk oranı olmadığını belirtmek gerekiyor. Değerler, modelin tahminleriyle gerçek katılımcı verileri arasındaki benzerliği gösteren korelasyon ölçümlerini ifade ediyor. Araştırmacılara göre kişilik özellikleri gündelik dile yansıdığı için büyük dil modelleri, eğitim verileri üzerinden insan kişiliğinin genel yapısını dolaylı biçimde öğrenmiş olabilir. Böylece model yalnızca anket soruları üreten bir araç olarak değil, kendi ürettiği sorulara insanların toplu olarak nasıl yanıt vereceğini öngören bir değerlendirici olarak da çalışabiliyor.
Araştırma bireysel düşüncelerin tahmin edildiği anlamına gelmiyor
Çalışmanın bulguları, GPT-4’ün belirli bir kişinin ne düşündüğünü veya bir kişilik testine nasıl cevap vereceğini bildiği anlamına gelmiyor. Model, bireysel yanıtlar yerine 600 kişilik bir grubun ortalama eğilimlerini ve sorular arasındaki istatistiksel ilişkileri tahmin ediyor. Bununla beraber sonuçların, bu sistemlerin klinik değerlendirmelerin veya uzman psikologların yerini alabileceğine dair bir kanıt sunmadığını da belirtmekte fayda var.
İlk Yorumu yazmak ister misiniz?
Yorum Yazmak için Giriş Yap