Dil Modelleri
Yıllara göre
Tüm yıllarBir döneme tıklayarak yazıları o yıllarla sınırlayın.
-
LLM-as-a-Judge for Multilingual Question Answering Evaluation: An Experimental Study on an English–Turkish Bilingual SQuAD Dataset
Bu çalışma, büyük dil modellerinin İngilizce ve Türkçe sorucevap değerlendirmesinde otomatik değerlendirici olarak kullanılabilirliğini karşılaştırmalı olarak incelemektedir. Bu kapsamda, beş farklı büyük dil modelinin kısmi insan anotasyonu ve kural tabanlı vekil skorlardan oluşan karma referans puanlama yapısıyla uyumu, sınıflandırma başarımı, diller arası tutarlılığı ve prompt duyarlılığı analiz edilmiştir. Paralel İngilizce–Türkçe SQuAD veri kümesinden seçilen 100 örnek için doğru, kısmen doğru ve yanlış olmak üzere üç farklı aday yanıt oluşturulmuş, bu yanıtlar basit ve rubrik tabanlı iki prompt stratejisiyle değerlendirilmiştir. Model çıktıları Spearman sıra korelasyonu, doğruluk, makro-F1, Cohen’in kappa katsayısı ve Wilcoxon işaretli sıralar testi kullanılarak incelenmiştir. Bulgular, tüm modellerin karma referans puanlarıyla yüksek düzeyde sıra korelasyonu gösterdiğini ortaya koymuştur. GPT-4o-mini İngilizcede en yüksek korelasyonu üretirken, Türkçe değerlendirmede Claude Sonnet 4.6 ve GPT-5.4-mini en yüksek korelasyonu paylaşmış;birleşik İngilizce–Türkçe sonuçlarda ise Claude Sonnet 4.6 en yüksek korelasyonu göstermiştir. Claude Sonnet 4.6, sınıflandırma başarımı ve prompt kararlılığı açısından en dengeli model olarak öne çıkmıştır. Sonuçlar, LLM-as-aJudge yaklaşımının Türkçe soru-cevap değerlendirmesi için umut verici olduğunu ancak model seçimi, dil etkisi, prompt tasarımı ve puan kalibrasyonunun birlikte ele alınması gerektiğini göstermektedir.