Bilimsel Dergi · Cilt: 2 Sayı:2 · Aralık/2012
DERLEME MAKALE: TÜRKÇE METİNLERİN SINIFLANDIRILMASINDA METİN TEMSİL YÖNTEMLERİNİN PERFORMANS KARŞILAŞTIRILMASI
Bilgisayar, yazılım ve internet Teknik / bilimsel makale
- Yıl
- 2012
- Sayfa
- 10
- Okuma süresi
- 31 dk
- Görüntülenme
- 0
Konu
Bilgisayar, yazılım ve internet
İlgili: Mühendislik eğitimi
Anahtar kelimeler
- doğal dil işleme
- metin sınıflandırma
- n-gram
- kelime kökleri
- Zemberek
- özellik çıkarımı
Özet
Bu derleme makalede, Türkçe metinlerin otomatik sınıflandırılmasında kullanılan 17 farklı metin temsil yöntemi (kelime kökleri, n-gramlar, kelime türleri, ekler, kelime kümeleme vb.) altı farklı Türkçe veri kümesi üzerinde karşılaştırılmış ve n-gram tabanlı yöntemlerin genel olarak daha başarılı sonuçlar verdiği bulunmuştur.
Tam metin
Metin PDF'ten otomatik çıkarılmıştır; tablo, şekil ve formüller eksik ya da hatalı olabilir. Özgün dizgi için PDF'e bakın.
Amasyalı M. F., Balcı S., Varlı E. N., Mete E., Türkçe Metinlerin Sınıflandırılmasında Metin Temsil Yöntemlerinin Performans Karşılaştırılması, Cilt 2, Sayı 4, Syf 95-104, Aralık 2012
Türkçe Metinlerin Sınıflandırılmasında Metin Temsil Yöntemlerinin Performans Karşılaştırılması
A Comparison of Text Representation Methods for Turkish Text Classification
M.Fatih AMASYALI 1, Sümeyra BALCI1, Esra Nur VARLI1, Emrah METE1
1Elektrik Elektronik Fakültesi, Bilgisayar Mühendisliği Bölümü Yıldız Teknik Üniversitesi mmffaattiihh@@ccee..yyiillddiizz..eedduu..ttr, [email protected], esraannuurrvvaarrllii@@ggmmaaiill..ccoomm,,eemmrraahhmmeettee@@ggmmaaiil.lc.coomm
Özet
Bir metnin sınıfına metnin hangi özelliklerine bakılarak karar verilebilir? Sınıflandırma probleminin türünün (metnin yazarını, yazarın cinsiyetini, yazarın ruh halini, metnin konusunu, metnin olumlu ya da olumsuz ifadeler içerdiğini tanıma) bu soruya verilecek cevaba etkisi nedir? Bu sorulara çeşitli cevaplar vererek, metin dosyalarının otomatik sınıflandırılması için uzun zamandır çalışmalar sürmektedir. Bu çalışmada çeşitli türdeki 6 adet Türkçe sınıflandırma veri kümesi üzerinde 17 adet özellik grubunun etkisi incelenmiştir. Çıkarılan özellik gruplarına örnek olarak; cümle, kelime, ek sayıları, ngramlar, kelimeler, kelime grupları ve saklı anlam indeksi verilebilir. Türkçe için bugüne kadar yapılmış en kapsamlı karşılaştırma çalışması sunulmuştur. Sonuçlarda n-gramların genel olarak diğer temsil yöntemlerinden daha başarılı sonuçlar ürettiği görülmüştür.
Anahtar kelimeler: Doğal Dil İşleme, Metin Sınıflandırma, Metin Özellikleri, Metin Temsil Yöntemleri
Abstract
Which features are the most important for text classification tasks? How does the type of text classification problem (authorship attribution, gender identification, mood identification, topic identification, sentiment analysis) affect the answer of this question? By giving various answers to these questions, the automatic text classification studies are ongoing for a long time. In this study, 17 text representation methods are compared over 6 different Turkish text classification tasks. Frequencies of the words, stem words, word phrases, n-grams, tokens, and word clusters, Latent Semantic Indexing are examples of the extracted text features. To the best of our knowledge, the most comprehensive study for Turkish text classification is presented. In general, n-grams were produced more successful results than the other text representing methods. Keywords: Natural Language Processing, Text Classification, Text Categorization, Text Features, Text Representation Methods
1. Giriş
Bir metnin yazarı, konusu, yazarının cinsiyeti, yazarının ruh hali otomatik olarak tahmin edilebilir mi? Bu soruya cevap arayan çalışmalar otomatik metin sınıflandırma adıyla anılmaktadır. Bu çalışmalarda önceden sınıfı belli metinlerin çeşitli özelliklerinin incelenmesiyle yeni gelen bir metnin hangi sınıfa ait olduğu tahmin edilmektedir. Ancak bunun yapılabilmesi için metinlerin hangi özelliklerinin inceleneceğine diğer bir deyişle metinlerin nasıl temsil edileceğine de karar vermek gerekir. Bununla birlikte, sınıflandırma probleminin türünün (yazar, konu, cinsiyet vb.) temsil yöntemine etkisinin olup olmadığı da ayrı bir araştırma konusudur.
Literatürde çeşitli metin sınıflandırma problemleri için birçok başarılı çalışma yapılmıştır. Bunlara örnek olarak yazar tanıma [1, 2], metin konusunu belirleme [3, 4], e-posta sınıflandırma [5], metnin yazarının cinsiyetini belirleme [1] verilebilir. Bu çalışmalarda her problem türü için çeşitli metin temsil yöntemleri önerilmiştir. En çok kullanılan yöntemler; kelime / kelime grubu frekansları [3], ngram frekansları [5, 6], kelime kümeleme [3], saklı anlam indeksleme [7] ve fonksiyonel kelimelerdir [8].
Bununla birlikte literatürde farklı problem türleri için, metin temsil yöntemlerinin detaylı bir karşılaştırılması bulunmamaktadır. Bu çalışmada, bu boşluğu doldurmak amacıyla literatürdeki birçok yöntem ve kendi önerdiğimiz (çok boyutlu ölçekleme ile anlamsal uzay [9], sınıf bilgisine dayalı kelime kümeleme) yöntemler, çeşitli veri kümeleri üzerinde karşılaştırılmıştır.
Veri kümesi olarak yazıdan ruh hali tanıma, film yorumlarında yönelim tespiti, köşe yazarlarını tanıma, yazarın cinsiyetini tanıma, şiirin yazarını tanıma, haberin türünü tanıma olmak üzere toplam 6 metin sınıflandırma koleksiyonu üzerinde çalışılmıştır. 2. bölümde bu veri koleksiyonları tanıtılmıştır. 3. bölümde karşılaştırılan metin temsil yöntemleri detaylı olarak anlatılmıştır. 4. bölümde deneysel sonuçlarda her bir veri koleksiyonu üzerinde hangi
metin temsil yönteminin (metin özellikleri) daha başarılı olduğu, genelde en başarılı yöntemler tartışılmıştır. Son bölümde ise sonuçlar tartışılmıştır.
2. Veri Kümeleri
Bu bölümde farklı uygulama alanlarına ait çeşitli veri kümeleri tanıtılacaktır. Tablo 1’de çalışmada kullanılan veri kümeleri verilmiştir.
Tablo 1: Çalışmada kullanılan veri kümeleri
Veri
Sınıf Top. Her
kümesinin say. örn. bir
ismi
say. sınıf.
örn.
say.
Ruh hali
157 38-
Film
yorumları
105 35
Köşe yazarı 18 630 35
Cinsiyet
105 50-
Haberler
1150 230
Şiir
140 20
Ort. kelime say.
Ort. cümle say.
247,1 28,1
49,3 4,8 398,5 45,3 377 54
204,8 17 79,5 7,4
Rast. Başarı %
25,48
28,57 5,56 52,38
20 14,29
Tablo 1’in son sütunundaki rastgele başarı yüzdesi verilerin hepsinin en çok örneği olan sınıfa atandığında elde edilen doğru sınıflandırma yüzdesidir. Kullanılan veri kümelerine www.kkeemmiikk..yyiillddiizz..eedduu..ttrr//??iidd==2288 adresinden erişilebilir.
Veri kümelerinin her birinin nasıl oluşturulduğu ve sınıf bilgilerinin içerikleri aşağıda anlatılmıştır.
Ruh hali: Çeşitli blog sitelerinden toplanan ve elle blog yazarının ruh halinin etiketlenmesiyle oluşturulmuştur. 4 sınıf içermektedir. Sınıf etiketleri neşeli, hüzünlü, sinirli, karışık şeklindedir.
Film Yorumları: Çeşitli sinema sitelerinden filmlere yapılmış yorumların toplanmasıyla ve beğeni yönleriyle etiketlenmesiyle oluşturulmuştur. 3 sınıf içermektedir. Sınıf etiketleri pozitif, negatif, tarafsız şeklindedir.
Köşe Yazarları: Çeşitli gazetelerin web sayfalarından 18 adet köşe yazarının 35’er köşe yazısının toplanmasıyla ve yazar isimleriyle etiketlenmesiyle oluşturulmuştur. Sınıf etiketleri yazarların isimleridir.
Cinsiyet: 5’er adet erkek ve kadın köşe yazarının 50-55’şer köşe yazısının toplanmasıyla ve yazarlarının cinsiyetleriyle etiketlenmesiyle oluşturulmuştur. Erkek ve kadın olmak üzere 2 sınıf etiketi içermektedir.
Haberler: Gazetelerin kategorilere ayrılmış haber sayfalarında 5 farklı konuda toplanmış 1150 haber içeren bir veri kümesidir. Sınıf etiketleri Ekonomi, Magazin, Sağlık, Siyasi, Spor şeklindedir.
Şiir: 7 şaire ait 20’şer şiirin toplanması ve şair adlarıyla etiketlenmesiyle oluşturulmuştur. Sınıf etiketleri şairlerin isimleridir.
3. Karşılaştırılan Metinlerin Temsil Yöntemleri
Bu bölümde literatürde sıklıkla kullanılan ve bizim önerdiğimiz metin temsil yöntemleri anlatılmaktadır.
3.1. Frekans Hesaplamalarında Kullanılan Metotlar
Bu bölümde anlatılacak olan Kelime Kökleri, Kelime Türleri, Ngramlar, Fonksiyonel Kelimeler, Kelime Ekleri, Kavram Genelleştirme özellik grupları için frekans hesaplamasında kullanılmak üzere TF, TFIDF, binary, log, normalize1 ve normalize2 olmak üzere 6 farklı metot kullanılmıştır [10]. i indisli özelliğin j indisli metnindeki TFIDF değeri Eşitlik 1’deki gibi hesaplanır.
TR TFIDF (i, j) TF (i, j) log
(1)
TR(i)
Eşitlik 1’de TF(i,j), i indisli özelliğin, j indisli metninde yer alma sayısıdır. Toplam metin sayısı TR ile, içinde en az bir kere i özelliği geçen metin sayısı TR(i) ile gösterilmiştir. Örneğin i özelliği “gr” 2gramı ise, TF(i,j), “gr” ifadesinin j metninde yer alma sayısı olacaktır. i özelliği “isim” kelime türü ise TF(i,j); j metninde geçen isim türündeki kelime sayısı olacaktır.
Binary(i,j): i indisli özellik j indisli metin yer alıyorsa değeri 1, yer almıyorsa 0’dır.
Log(i,j): Eşitlik 2 ile hesaplanır.
Log(i, j) log10(TF (i, j) 1)
(2)
Normalize1(i,j): TF(i,j)’leri, metindeki toplam kelime
sayısıyla normalize edilmesiyle Eşitlik 3’teki gibi hesaplanır.
N1(i, j)
TF (i, j ) 1 / 2
(3)
(i
j
Normalize2(i,j): TF(i,j)’leri, kelimenin toplam geçiş
sayısıyla normalize edilmesiyle Eşitlik 4’teki gibi hesaplanır.
N 2(i,
j)
TF (i , j )
(
i
1
/
(4)
i
3.2. Sayılar Özellik Grubu
Metinleri içerdikleri noktalama işaretleri sayıları, kelime sayıları, cümle sayıları, devrik cümle sayıları, harf sayıları, ek sayıları, cümlelerdeki ortalama kelime ve harf sayıları, kelimelerdeki ortalama harf ve ek sayılarıyla ifade eden 19 adet özellikten oluşan özellik grubudur.
3.3. Kelime Kökleri
Metinlerin içerdikleri kelimelerle ifade edildikleri, literatürde en yaygın kullanılan özellik grubudur. Metinler tüm metinlerde en az bir kere geçen farklı kelime sayısı boyutlu bir uzayda ifade edilir. Türkçe gibi eklemeli
Amasyalı M. F., Balcı S., Varlı E. N., Mete E., Türkçe Metinlerin Sınıflandırılmasında Metin Temsil Yöntemlerinin Performans Karşılaştırılması, Cilt 2, Sayı 4, Syf 95-104, Aralık 2012
dillerde, kelimelerin kendilerini kullanmak farklı kelime sayısını çok fazla arttırmaktadır. Örneğin insan, insanlık, insanlığa, insanlığım kelimeleri farklı kelimeler olarak ele alınırsa metinlerin ifade edildikleri uzayın boyutu çok büyük olmaktadır.
Literatürde bu probleme çözüm olarak sadece kelime köklerinin kullanılması önerilmektedir [11]. Bu sayede hem aynı anlama işaret eden kelimelerin birleştirilmesi (böylelikle metinler arası benzerliğin daha iyi ifade edilmesi sağlanmakta), hem de özellik boyutunun azaltılmasıyla işlem karmaşıklığının azaltılması sağlanmaktadır. Kelimelerin köklerinin bulunması için Zemberek [12] kütüphanesi kullanılmıştır.
3.4. Kelime Türleri
Metinleri içerdikleri kelimelerin türlerinin (isim, sıfat, zamir, edat vb.) frekanslarıyla ifade eden özellik grubudur. Kelimelerin türlerinin bulunmasında Zemberek kullanılmıştır. Toplam 15 tane kelime türü vardır. Buna göre her metin içerdiği isim, sıfat, vb. türündeki kelime sayılarıyla ifade edilmektedir.
3.5. Harf ve Kelime Ngramları
Metinlerin içerdikleri ngramlar ile ifade edildiği özellik grubudur. Ngramlar N boyutlu karakter ya da kelime çerçeveleridir. Örneğin “gitmek” metni için:
Harf 2 gramları: gi – it – tm – me – ek Harf 3 gramları: git – itm – tme – mek şeklindedir.
Metinlere ait 2 ve 3 harf gramları, 2’li kelime ngramları çıkarılmıştır. Çok seyrek frekans matrisleri üretiyor olmaları sebebiyle, daha büyük pencere boyutuna sahip ngramlar kullanılmamıştır.
3.6. Fonksiyonel Kelimeler
Fonksiyonel kelimeler esasen tek başlarına anlamları olmayan, ancak yazarların üsluplarının belirlenmesinde önemli oldukları düşünülen bağlaç ve edat türündeki kelimelerdir [8] (ve, daha, gibi, de, için vb.). Metinler bu özellik grubunda, önceden belirlenmiş 620 fonksiyonel kelimeyle ifade edilmektedirler.
3.7. Kelime Ekleri
Metinlerin içerdikleri kelimelerin aldıkları eklerin türlerine göre ifade edildikleri özellik grubudur. Türkçe eklemeli bir dil olduğundan anlamın oluşmasında eklerin önemi büyüktür. Kelimelerin eklerinin belirlenmesinde Zemberek kullanılmıştır. Zemberek toplam 126 farklı ek türü çıkarmakta ve dolayısıyla metinler bu 126 ek türünü içermelerine göre sayısallaştırılmaktadırlar.
3.8. Kelime Kümeleme
Bu özellik grubunda, metinlerde geçen yakın anlamlı kelimeler birleştirilip tek bir küme, tek bir özellik haline getirilmektedir [3]. Bu sayede hem boyut sayısı azaltılmakta hem de benzer anlama sahip kelimeler tek bir kavram olarak kullanıldığından metinler arası ilişkilerde artmaktadır.
Örneğin hayvan kavramına ait kelimeler (at, kedi, deve vb.) aynı kümede yer alırlarsa, sadece “at” kavramını içeren ve sadece “kedi” kavramını içeren iki metin aynı özelliğe “hayvan” sahip olacaklardır. Bir kelime kümesinin bir metindeki frekansı, küme içindeki kelimelerin o metindeki geçiş sayılarının toplamıdır.
Kelime kümelerinin belirlenmesinde 4 kaynak kullanılmıştır: TF matrisi, TFIDF matrisi, Cooccurance (birlikte geçme) matrisi ve sınıf bilgisi. TF ve TFIDF matrisi 3.1. bölümde, Cooccurance (birlikte geçme) matrisi 3.9. bölümde, sınıf bilgisi 3.14. bölümde anlatılmıştır. Kelimelerin bu kaynaklar kullanılarak kümelenmesi için 3 algoritma kullanılmıştır.
1. Hiyerarşik Kümeleme: Her bir adımda birbirine en çok benzeyen iki kümenin birleştirildiği algoritmadır [13]. Başlangıçta her bir örnek ayrı bir kümeyi ifade eder. Kümelerin birbirine benzerliklerinin ölçülmesinde 3 yol izlenmektedir. A) En Yakın: Kümeler birbirine en yakın elemanları kadar yakındır. B) Ortalama: İki kümenin her bir elemanının diğer kümenin her bir elemanıyla arasındaki mesafelerin ortalaması ile yakınlık ölçülür. C) En uzak: Kümeler birbirine en uzak elemanları kadar yakındır.
2. K-means: Veri dağılımını en iyi temsil edebilecek küme merkezlerini bulunmaya çalışır [14]. Başlangıçta küme merkezleri rastgele atanır. Küme merkezlerinin kendi kümelerindeki elemanlara olan ortalama mesafesi iterasyonlar ilerledikçe azalır.
3. SOM: Bu algoritmada veri dağılımını en iyi temsil edebilecek küme merkezlerini bulunmaya çalışır. Küme merkezleri başlangıçta yine rastgele atanır. Buna ek olarak merkezler birbirlerine rastgele bağlanırlar. Her bir küme merkezinin güncellenmesinde ona bağlı olan diğer küme merkezleri de güncellenir. Bu sayede hem verileri ifade edecek küme merkezleri hem de verinin topolojisi bulunmaktadır [15].
3.9. Birlikte Geçme Matrisi
Birlikte geçme matrisi metinlerdeki farklı kelime sayısı boyutlu simetrik bir matristir. Matrisin i,j hücresinin değeri, i. kelime ile j. kelimenin eğitim metinlerinden kaçında birlikte geçtiğini ifade etmektedir. Birlikte geçme matrisi kelime kümelemede (Bölüm 3.8) ve anlamsal uzayda (Bölüm 3.12) kullanılmaktadır.
3.10. Kelime Filtreleme
Her metinde geçen kelimelerin ayırt ediciliği azdır. Buna karşın çok az metinde geçen kelimeler de gereksiz yere boyut sayısını arttırabilirler. Bu nedenlerle metinlerin ifadesinde kullanılan kelimeler, frekansa dayalı bir filtreden geçirilmişlerdir. Kelimeler belirlenen minimum ve maksimum geçiş sayılarına göre filtrelenmiştir.
3.11. Saklı Anlam İndeksleme
Bu yöntem, sınıf bilgisini kullanmadan metin-kelime matrisi (A) üzerinde Eşitlik 5’teki Tekil Değer Ayrıştırma (Singular Value Decomposition) işlemini yaparak metinlerin boyut sayısını azaltır [7].
Amn U mk .Skk .VnTk
(5)
Bu işlem sonunda S matrisinde, özvektörlerin özdeğerleri
diagonalde büyükten küçüğe sıralanmış olur. Seçilen boyut
(k) adedi işleme alınarak, A matrisi m*n’lik bir matristen
(mmetin sayısı, n farklı kelime sayısı), m*k’lık (k
metinlerin yeni boyut sayısı) bir matrise dönüştürülür. Tekil
Değer Ayrıştırma için JAMA kütüphanesi [16]
kullanılmıştır.
3.12. Anlamsal Uzay
Bu özellik grubunda, metinlerin anlamsal bir uzaydaki koordinatları bulunmaktadır [17]. Bunun için önce metinleri oluşturan kelimelerin anlamsal uzaydaki koordinatları bulunup, daha sonra, metinlerin koordinatları; içerdikleri kelimelerin koordinatlarının ortalaması alınarak hesaplanmaktadır. Kelimelerin sayısal koordinatları, kelimelerin birbirlerine anlamsal yakınlıklarıyla uyumlu olarak bulunmaktadır. Buna göre birbirine anlamsal olarak yakın 2 kelimenin bulunan koordinatları arasındaki Öklid mesafesi de küçük olmaktadır. 2 kelimenin birbirine anlamsal yakınlığının ölçütü olarak Harris’in [18] yaklaşımı kullanılmıştır. Buna göre 2 kelime ne kadar çok birlikte kullanılıyorsa birbirlerine anlamsal olarak o kadar yakındır. Kelimelerin bu yakınlıklarını ölçmek için birlikte geçtikleri metin sayıları hesaplanmış ve Bölüm 3.9’da anlatılan Birlikte Geçme Matrisi’ne yazılmıştır.
Literatürde aralarındaki 2’li uzaklıklar bilinen kavramların
bu uzaklıklarla uyumlu koordinatlarının bulunması için Çok
Boyutlu Ölçekleme (Multi Dimensional Scaling) [19]
yöntemi kullanılmaktadır. Bu yöntem uzaklıklar üzerinde
çalıştığından bir yakınlık ölçütü olan Birlikte Geçme Matrisi
Eşitlik 6’daki gibi tersine çevrilerek uzaklık ölçütüne
dönüştürülmüştür.
dis(i, j) 1
(6)
sim(i, j)
Eşitlik 6’da, dis(i,j); i. ve j. kelimeler arasındaki uzaklığı, sim(i,j) ; i. ve j. kelimelerin birlikte geçtikleri metin sayısını göstermektedir. Bu yeni matrise Çok Boyutlu Ölçekleme uygulanarak kelimelerin koordinatları bulunmuştur. Çok Boyutlu Ölçekleme için MDSJ Kütüphanesi [20] kullanılmıştır. Metinlerin koordinatları ise daha önce de belirtildiği gibi içinde geçen kelimelerin bu anlamsal uzaydaki koordinatlarının ortalaması alınarak bulunmuştur.
3.13. Kavram Genelleştirme
Kelimelerin anlamlarına göre hiyerarşik bir yapıda düzenlendikleri Wordnet, Conceptnet gibi birçok çalışma mevcuttur. Türkçe için ise benzer yapıda hazırlanmış Türkçe Wordnet [21] bulunmaktadır. Bu özellik grubunda, bu hazır, sabit, eğitim kümesinden bağımsız veri kaynakları, kelimeleri bir üst kavramlarıyla ifade etmede kullanılmıştır. Bu sayede kelime kümelemede olduğu gibi, hem metinlerin boyut sayısı indirgenmiş, hem de metinlerin içerdikleri kavramlar daha anlamsal bir şekilde ifade edilmiş olmaktadırlar.
Kelimeleri bir üst kavramlarıyla ifade etme (genelleştirme) işlemi için 2 veri kümesi kullanılmıştır. İlki Türkçe
Wordnet’ten çıkarılmış 15018 adet kavram-üst kavram ikilisidir. İkincisi ise Zemberek’in kütüphanesinden alınan özel isimler listesidir. Eğer bir kelime kavram–üst kavram ikilileri listesinde kavramlar içinde yer alıyorsa onun yerine karşılık gelen üst kavram kullanılmıştır. Eğer bir kelime özel isimler listesinde yer alıyorsa onun yerine “insan” kavramı kullanılmıştır.
3.14. Sınıf Bilgisiyle Kelime Kümeleme
Bizim önerdiğimiz bu yöntemde, öncelikle kelimelerin her sınıftaki frekansları bulunarak kelimeler sınıf sayısı boyutlu bir uzayda birer noktaya dönüştürülmektedir. Daha sonra kelimeler, bu boyutları üzerinde 3.8. bölümde anlatılan kümeleme metotlarıyla sınıf sayısı adet kümeye ayrılmaktadır. Bu işlem sonunda her bir kelime sınıf sayısı adet kümeden birine ait olmaktadır. Metinler ise, sınıf sayısı adet kümenin frekanslarıyla ifade edilmektedirler. Bir kümenin bir metindeki frekansı, o kümede bulunan tüm kelimelerin o metindeki frekanslarının toplamıdır. Bu sayede metinler kelime sayısı adet boyut yerine, sınıf sayısı adet boyutla ifade edilmiş olmaktadır.
4. Deneysel Sonuçlar
Bölüm 2’de tanıtılmış olan 6 veri kümesi için, Bölüm 4’te anlatılan özellik gruplarının çeşitli konfigürasyonlarıyla arff’ler üretilmiştir. Özellik gruplarının her birinin çeşitli konfigürasyonları bulunmaktadır. Tablo 2’de özellik gruplarının (metin temsil yöntemlerinin) adları ve yazının bundan sonraki kısmında kullanılan kısaltmaları verilmiştir.
Tablo 2: Özellik gruplarının isim ve kısaltmaları
Kısaltm a Say 2G 3G K2G KE KT FK KGI
KGO
KK
KKHAL
KKHCL
KKHSL
KKK KKS
MDS
LSI
Açıklama
Sayılar Özellik Grubu (Bölüm 3.2) Harf 2 gramları (Bölüm 3.5) Harf 3 gramları (Bölüm 3.5) Kelime 2 gramları (Bölüm 3.5) Kelime ekleri (Bölüm 3.7) Kelime Türleri (Bölüm 3.4) Fonksiyonel kelimeler (Bölüm 3.6) Kavram genelleştirme isim tabanlı (Bölüm 3.13) Kavram genelleştirme özel isim tabanlı (Bölüm 4.13) Kelime kökleri Hiyerarşik kelime kümeleme (küme benzerlikleri ortalamaya göre) (Bölüm 3.8) Hiyerarşik kelime kümeleme (küme benzerlikleri en uzak elemanlara göre) (Bölüm 3.8) Hiyerarşik kelime kümeleme (küme benzerlikleri en yakın elemanlara göre) (Bölüm 3.8) Kmeans ile kelime kümeleme (Bölüm 3.8) SOM ile kelime kümeleme (Bölüm 3.8) Birlikte geçme matrisi tabanlı anlamsal uzay (Bölüm 3.12) Saklı Anlam İndeksleme (Bölüm 3.11)
Amasyalı M. F., Balcı S., Varlı E. N., Mete E., Türkçe Metinlerin Sınıflandırılmasında Metin Temsil Yöntemlerinin Performans Karşılaştırılması, Cilt 2, Sayı 4, Syf 95-104, Aralık 2012
Tablo 3’te kelime Türleri, 2 gram, 3 gram, Fonksiyonel kelimeler, kelime 2 gramları, kelime ekleri, kavram genelleştirme isim, kavram genelleştirme özel isim, kelime kökleri olmak üzere toplam 9 özellik gruplarının her biri için kullanılan 6 frekans hesaplama yöntemi ve yazının bundan sonraki bölümlerinde kullanılacak olan kısaltmaları verilmiştir.
Tablo 3: Frekans hesaplama için kullanılan yöntemler
Yöntem
Binary Log N1 N2
TF TFIDF
Açıklama Bir kavram metinde geçiyorsa 1 geçmiyorsa 0 (Bölüm 3.1)
Eşitlik 2.
Eşitlik 3.
Eşitlik 4. Bir kavramın bir metindeki geçiş sayısı (Bölüm 3.1)
Eşitlik 1.
Tablo 4’te kelime kümelemede, KKHAL, KKHCL, KKHSL, KKK, KKS olmak üzere toplam 5 metodun her biri için kelimelerin kümelenmesinde kullanılan 4 matrisin isimleri ve kısaltmaları verilmiştir.
Tablo 4: Kelime Kümeleme için kullanılan matrisler
Yöntem Cooccurance Snf mTF mTFIDF
Açıklama Kelime kümele Birlikte geçme matrisine göre (Bölüm 3.8 ve 3.9) Kelime kümele sınıf bilgisine göre (Bölüm 3.14) Kelime kümele TF matrisine göre (Bölüm 3.8) Kelime kümele TFIDF matrisine göre (Bölüm 3.8)
Kelimelerin kümelenmesinde küme sayısı 50 olarak belirlenmiştir. LSI ve MDS için metinlerin ifade edileceği boyut sayısı 50 olarak belirlenmiştir. MDS’te ve birlikte geçme matrisinin kullanıldığı her yöntemde yakınlıktan uzaklığa geçiş için Eşitlik 6 kullanılmıştır. Say özellik grubu için değişken bir parametre kullanılmamıştır.
Üretilen tüm metin temsil yöntemleri WEKA [22] ile birlikte kullanılabilmeleri için arff formatında kaydedilmiştir. Sonuç olarak 6 veri kümesi her biri için ( 9*6 ) + ( 5*4 ) + 3 (LSI, MDS, Say) =77 arff, toplamda 77*6 = 462 arff üretilmiş ve her arff üzerinde 5’li çapraz geçerlemeyle WEKA kütüphanesinde yer alan 5 adet sınıflandırıcının (en yakın komşu-1NN, karar ağacı-C4.5, destek vektör makineleriSVM, Naive Bayes-NB, Random Forest-RF) performansı ölçülmüştür. Özellik gruplarının sınıflandırma performanslarını gösteren tablolardaki (Tablo 5-10) tüm değerler 5’li çapraz geçerlemenin ortalama değerleridir.
Üretilen arff’lerin özellik sayısı (boyutu) 5000’den fazla olanlarda zaman ve hafıza problemlerinden ötürü özellikler önce InfoGain [23]’lerine göre sıralanmış daha sonra en yüksek IG’e sahip 100 özellik seçilerek arff bu haliyle
kaydedilmiştir. Sonuç tablolarında (Tablo 5-10), kullanılan 5 algoritmadan en yüksek performansa sahip olanının adı ve başarı yüzdesi verilmiştir. Özellik sayısı 101 olan kayıtlarda orijinal özellik sayısı 5000’i aştığından bilgi kazancına göre özellik seçimi yapılmıştır. arff dosya formatında sınıf bir özellik olarak yer almaktadır. Buna göre özellik sayısı d olan bir veri kümesinde, d-1 adet özellikle sınıf etiketi tahmin edilmektedir.
4.1. Şiir Veri Kümesi Denemeleri
Tablo 5’te bir şiirin yazarını tahmin etme problemi üzerinde yaptığımız denemeler verilmiştir.
Tablo 5: Şiir veri kümesinde her bir özellik grubunun en başarılı olduğu konfigürasyon ve başarı yüzdeleri, rastgele başarı % 14,29
Özellik Grubu 3G KKHCL 2G KKK Say KGI KGO KKS LSI KK FK KE KT KKHAL KKHSL MDS K2G
Konfi gürasyon Binary Snf N1 Snf
Binary Binary Snf
Binary N1 TF Log mTFIDF Snf
Özellik sayısı 101 8 1670 8 20 1829 1672 8 51 441 410 102 16 51 8 51 21
Başarı yüzdesi 75,29 67,86 63,86 62,29 53,29 48 43,71 41,86 41,71 40,57 36,14 33,57 32,29 30,71 29,14 28,71 18,86
Sınıflandırıcı NB 1NN SVM RF RF NB NB NB RF NB RF NB SVM RF 1NN SVM C45
Tablo 5 incelendiğinde bir şiirin yazarını tahmin etmede en başarılı metin temsil yönteminin (özellik grubunun) 3gramlar’ı binary olarak kodlamak (3G-Binary) olduğu görülmektedir. Veri kümesi için üretilen tekil 3gramların sayısı 5 bin’i geçtiğinden özellik seçimi yapılmış ve bilgi kazancına göre en iyi 100 adet 3gram metinlerin temsilinde kullanılmıştır. 7 şaire ait 20’şer şiirle elde edilen sonuçlara göre bir şiirin yazarı % 75,29’luk doğrulukla tahmin edilebilmektedir. En başarılı 2 yöntem (3G-Binary, KKHCLSnf) arasında oldukça büyük bir fark bulunmaktadır.
Tablo 6’da bir köşe yazısının yazarını tahmin etme problemi üzerinde yaptığımız denemeler verilmiştir.
Tablo 6: Köşe Yazarı veri kümesinde her bir özellik grubunun en başarılı olduğu konfigürasyon ve başarı
kınlıktan ik grubu birlikte r. Sonuç + 3 (LSI, ilmiş ve
WEKA en yakın kineleriformansı andırma 10) tüm ir.
en fazla zellikler onra en haliyle
Tablo 5 incelendiğinde bir şiirin yazarını tahmin etmede en başarılı metin temsil yönteminin (özellik grubunun) 3gramlar’ı binary olarak kodlamak (3G-Binary) olduğu görülmektedir. Veri kümesi için üretilen tekil 3gramların EksaMayzıaOsnıcıB5nialbimignö’srieegleeDnçteiiyğrigin1id,0eC0n ialötdze2etl,l3iSkgarasymeıç4imm, eiAtiyrnaalpelırıklimn2ıtş0em1v2esilbinildgei kullanılmıştır. 7 şaire ait 20’şer şiirle elde edilen sonuçlara göre bir şiirin yazarı % 75,29’luk doğrulukla tahmin edilebilmektedir. En başarılı 2 yöntem (3G-Binary, KKHCLSnf) arasında oldukça büyük bir fark bulunmaktadır.
Tablo 6’da bir köşe yazısının yazarını tahmin etme problemi üzerinde yaptığımız denemeler verilmiştir.
Tablo 6: Köşe Yazarı veri kümesinde her bir özellik grubunun en başarılı olduğu konfigürasyon ve başarı
Özellik Konfi Özellik Başarı Grubu gürasyon sayısı yüzdesi Sınıflandırıcı
3817 93,78 SVM
3KFKKSKLKKMKKKKKKKSÖFK32GKKLKKMKK2ÖG3SKFKKLKKMKKGGGaKKaSSK2KKTEKKGKGKGGrzKKE2KGGaKSDDrzKGGKKE2KyyuIeIDGGyueISHHHKOIIOKHSGblSSOIKHSblSluACSlCiuCikLkLLLL
LLBLLgKLLBgBLLKüooooooiioüooinnorggggggnnrggaanaafasrrfisryyyiyyoonn SLLLLnoooofgggg SLLnoofgg LSSnongff
BLmSLSLnooiTnongfgfgFarIDy F mCBmBmoiTTinTnFFaFarIIrIDDyDyFFF
55454112514118545Ö4234s18515141434Ö45s1285151144a131100429310976170034801919312az34078001919321yz704804018004047ye00841047ıe7ısl7sllıliıikk 5546866777885536By87789786656565788y8B9776656556ü633755603391593196353913563331aü19563933563313az,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,şz8145511447704966,,,,,,,,,,,,,,67474765441890şda77466745441809d179768944587819a8988869917745er6898889917457erısısii
SVM RNSRRSRRSNSNRSSSSSSSSSRRRRNSNRSSSRSSSSRRNRNSRVVVVVVVVVVıVVVFFFFFFFFFFFBBBBBıVVVVVVVnFFFFFBBnMMMMMMMMMMMMMıMMMMMMMıffllaannddıırrııccıı
TKKabTTlo 6 incLeLlooeggndiğinde11b66ir köşe55y00a,,5z51ı1sınınNNyBaBzarını tahmin
eKtKmKKeHdHeAALLen mmTbTaFFşIaIDDrıFFlı m551e1tin tem447s7i,,1l177yöntSeSVmVMiMnin (özellik
ggKröKurKKbüHulHmnSSueLLnk)te2dgCiCrro.aom18lark’öışLeo5yg5a11zoalarırnaıknk333o55d5,’l,1ş1ae4m4r aykazRı(Rs2FıFGyl-aLeolgd)eoelddiulğenu
kkd(Şks(egdTgs(Tgedgs22ootröüöoöoi2aotrömouGiGnanğğrşmşmbuGrnğrbbüuueerrle-l-büureeeuul-uloçLçLduulomçLyrmdllllnmyoeoilulnuaaaeonuau6aeggirrkuzk6egzzrnkka,a,alnkla,dı)tleyaia33rl)teeaine3anaıeGnG2ndcgGg2rzdttcgvgiıe-taö-aöagier7n-aöerLLlhrhrrr.Lbaleıhrr.lebeoaoemmnimaaenomm1aggnşşr1gdikiş)8al)dıainny8l)iabbnaüniiarbğaaarrkriiğıaımrkriri’rrznıleeöir’nraaılıeöanaedıdış(sdsdrLşdsmedsiiııLkkleeillınnkıoeaomleeönöoniymeddögrğyzbbşdşgbıaıbeaaşbdarfeineieaziote)uillzioertıiabblmmlrianbnmlarünüa1ryyktüıvereykyyıarneaa8aökykaynaaüühökıkzzütrşütıknzktkmşetıyıednekezıesskemdadısk3dmıbıbidro3zıbininyo5e.isiinrrday5siırırradi.s.’ırnnrali.’lşziynflfal(SşzfeaaEıaEüsmeıaEsır%mrırsznnnryıyrynkknaıyyndykıaaöanıykaföaıefbbzzknbbıan9bz)nzbsaanuutazaa3uiıtsare(rllvışşse(ryı,2ılauuşsmayaı2ı7au%mayaıGynnrarrG8ynizırlıımkm%%iznsl-’aılaml%n-aaLleıdııi7rLaaıninrenaıio5nekkıonrı22l,kgn,n2l.dt9t9gı2dt9aa)ışe33a)(9yedydÜ3i(töoyd,,iatööaöoeıı7,7röalzesır7rrhdnilnzd8r8.te.hdtnkd8ve.meittmu’’lmitleeue’lellllleğelliimiinmğıeriiimkknknukşi,nknuk
yyvssadootypT4ykosykvadtokŞysyyotvkkasodŞküüaööaiaaaiaalalallur.uöüöüiaöaiaaatllatmm3öüuömmrriğoğizzzzzzzrrrtrmşşmmbrğillrzzzzrk.şmrşklabıalöaıauöulreeeelaakaallaıaalöualeeelerreerraalrmormalraassHssseerresmmlelrmllranniniynrmsssmrrııllııaayaaaaniynrmnnmidrdııdnayaandıeaıe,,anıiırrnrarndnadnıen,neie7ışunrraşzuknkaııaıııınibezziazşuakaıkrııkrndndzaz’rradkrkındk.a.tetgrürgyrdös.dös.ıaırıakl.tllgyraeös.aarıaanrlnaaıöaöazlaanenoşeoşaanaVaıVöaBğBağdndolşrzyeyrreVrreBlğldverzyırremmıealıeaaaaırvıeueuı7nmıreaaeaılldeudirbn7rbrbeççyyladanıerrreblçbybaaaiıyiVreyiondoadailiirereabanndyrinlodlahiiheyreaeyeıneışzkzkuğulğirihey,,eeeışddkzkuliğrliairaarrıa,dkereryliiaairrrıa.nb.bııüeriyhtriutrruryn.brıürariritruaraılallarlmarddar.am.maaızlanalmeaebdbhh.mşKşaznaebapabbblhlaİşİVrVnrneaaaambmlaamam(İkVrknhehıeıtairaimam(üemkerdsrşhşınrnıirreelimieradrsaşınıiiğrbıaaelbaaai2n2mnoaaarırninnınbaanai2noardrırdnirniiniicğşcşzırdımrilıilığıcşzmeıaıaaıaieniendırlıiflaıilaffknkıağağeindrfilasyıfnyı)ukçiaçiaddğıieiüyıı)uüeçiarıdrıidedizototızıızüneerınndiiottımkzmkneaaanralDrlin1nmnmkmtttvddadarl3a13anslslmtçtçaavad83aesileaaaçaayaeaaeaaa585ııhhiehinaayaaaül5ülmrmıhkrühinkrnynny’’ülermemmümikrynydtts’svssvoemelozmeelyndetmmrrssvaaaozelaılölömedrerrmrraaiiiiimaılöruudezrrşmşimiinnnnnzrzuııez.şmnonngogzbaibiıeş.şeöçödkçdogeabsiiişaaöleçlerdusulirrııriareyollereaoaou(Sertıtikrkyleelseeasnon(Süstbnikbilleeslenraaüsıdadrbaişrşr%leekmekmıazıiudranirşr%ekmıiininnarairzivinirklkluiuidiinnslslarsiılılklıiiauiianadiınasleeeılıfeleelillrariueınarrfesfseetlltalraelbbrf9.v.vlb)lbsstıanlıab9aıı.vi)lbenensıinian3aıaiiileynsynnuin3llairbvrbillsmynrara,şlşaivirbaalememddra,ö7aşaödeider%ariemidy7zaözde%riı.iıi.irykz8kzzııaeaeıtı.şağiarğr8rkzkırraeıeebasğblr’lklİtliİsrisrrıeısb’leeelİdıeilsiletllrth7ıaalilieedıkellnktkrl7klanlnniaanrrinkşmkş5lisi2sn.n2anriirıidiş5dirimsrkm2,kevevöröıidi,n.r0m,k0eıvıöe,eni2.l0luuısnbsznbzeş2n’el’eeue,sn,bzş9ıı’erÜreişışu,ıu9ddroırÜonrnişiuıuuadereosnsddiurailisleıısdrllrrairaeisklakaıkkfekkfrektluuitrakkakkfektlnvlnteutnkmnöööşööşvlnyeayammnebböööşelaabyabaeiaibşşşşşeolroraibnaıiiiiirtşşştorikunkukeeaeeeaıeşiirrrrrtrııiku,keeaeşrrrıi,
44..33.. HHTaaabbbeelrorlle7err: VHVeaerbrieiKrKleüürmmveeesrsiiiDkDüeemnneeemsmineeldleerrihier bir özellik
100 TpTpraroabobblbllogloeremum7bi7i’u’üdüdnzezeueenrribinbeniydinrdrüeebzhydahyaaeşaabpalbpeertetırırığlirğı,ıımormmmalıdseızetztugtndğndeieuinelnnenikeinenbommaneşkfeklaiolegorenrıünrurvu%vsaesuesur2nyrinilo0ulmunmivitştşateatihirhbrm.m.aişinanrıeettmmee
ÖGrzueblgluriTukTababublnlouoKgn7ü7o:re:naHnfHsiaybaboabneşerarlrleıerlrıvÖsvoeaelzrydreiıiuslklkğıiüukümmkeoesBysniüinafnzidşgddaeüeerrıhshaieseryrbobSniirırnvöıöefzzlebaelnalllişdikakırıcı
durumdur. Bu duruma 2 açıklama getirilebilir. İlki sınıflara ait örnek sayılarıdır. Veri kümelerinde şairlere ait 20’şer şiir varken, köşe yazarlarına ait 35’er örnek vardır ki bu köşe yazarlarının daha başarılı tahmin edilebilmesine olanak syaağzlıalamrıınşdanolabçiolTkiMr. MdaİkhOianBcifEazlealaçkıtkrsliaökmzMa süainhsaeetınnaşdiiirsblleearşrdvieuO,rudlkuaöyşoserı olmasıdır. Ve eğer bir şairin üslubu kullandığı söz sanatı türlerine göre belirlenebiliyorsa ve çıkarılan özelliklerde bu söz sanatları yer almadığından şiirlerin yazarlarını köşe yazarları kadar iyi tahmin edemiyor olabilir.
4.3. Haberler Veri Kümesi Denemeleri
Tablo 7’de bir haber metninin konusunu tahmin etme problemi üzerinde yaptığımız denemeler verilmiştir.
Tablo 7: Haberler veri kümesinde her bir özellik grubunun en başarılı olduğu konfigürasyon ve başarı yüzdeleri, rastgele başarı % 20
KGÖGzrueOblluik LgKüoorgnafsiyon 7sÖa1zy9eısllıik 9Byü1az,ş1da3erısi RSıFnıflandırıcı
K2GGI
7326498 9904,,8554 RSVFM
3KGK
180614
9902,,4673 RRFF
MKKSFKKLKKKKKKFKLKKKMKK3KMK3KKLKKKKFGaKKSSKK2EKKKTGGKK2KEKGKSDDGKGKKKE2yIIDGGIKHHSHHIHKSOGSSOKIHHSSCASACCALLLLLLL
SSmNNLLNNnno11To11ffggFIDF
TLmSmSSSmnnoFTTnnTgffIffFFDFIIFIDDDFFF Nmm1TTFFIIDDFF CLLNTNTLooFo1oF1ggIgIDDFF
565151465211547155117166517761465511130117102600721131121012173102410141409194140
886677884565678979689868899987887666972533177786023015937178900173172538,,,,,,,,,,,,,,,,,,,,,,,,85,,,,684462,000,,,2,,,,848644860215848154624860411448356821744531845312475318354142
RRRRRRRRCRSSRRRRRRRRSRRRRRRRRRRRRRRSVVVFFFFFFFF4FFFFFFFFFFFFVFFFFFFFFFFF5MMMM
TSSaabaylyo 7 incelendiğinde bi2r200haberin55t7ü7,r,0ü08n8ü tahRRmFFin etmede en
bKaKşTTarılı meLLtoiongg temsil 116y6öntemin55i6n6,,2211(özelSlSiVkVMMgrubunun)
2NKgK1rK)KaHmoHSllSdaLruL’ğıuECşgCioötolriüklm3’etketkeidgi5r5i1.b1i5nhoarmbea4r4l7i7tz,ü,0e0r6ü6endeipaCkiCto44d525l3a0m’aakr
(2Ghaber
Te2%bm42%bmNbTb2%2NmbTtu.gauaa1m4eugae99aş1rllebb9tşt)r.luuba4a4yyt)ennlulaa4ynmnrnlo,ö,öoCioimrn5ö,o5ıpoimymynn5ılllmy4n47lirıllldla8tt47ınledeoaaa’t’eeruea’’ellkikbsrumm’dlüüikğnm’iıtütlğnmeyıkuktacaeeemukacEeeeddmllEeedlddetbdşldg(ı(ıtdşldge(ıirrtie22iioöoeVrie2it..nnöorüGGt.ğnlğnrGlğdrieüzrrdikü-k-eerriuukel-eNNiğulddmöiNrğltl3dmitlueui3iiş11Kineu’ilen1lemnkk’,e,letemdkkd,teeüdllknneesltaaenkyesmtaeikKKeaiilKbdyitltbdzestsaKaKgaiisaKgısiirorohhpisrro.ih--ibnynm.ım-tNhbNynmnDöıhNiuu5öaiğu5ii1ı1naççneibn1nnnıçnb))nltlhmone)tlheaaoeaeareermyraırermbmirddazammaaabindaaeinirzraeindillrraeaanalteleraietgllgeüsisrinbbgütiesznınıböıörtüziıinörnenrüeüirlrnlerüidrdlımmmeernüdemnenüa(aeünd(aeeeöündeöeikklczbbetikpezbtitapetkkiiraetneaekirrhlaeükürhldildsküvmildtiçoçimiitiokeçyiürürhdhki2rürdh..ei2nkkalai.3nklaatl3bbEEaim0bEmegn0eemegnn’etrnbibrir’tamarburşiaimaiiukbrbinntibrtrkrbneibraaaeuradhuhşşdh.(nşeaaat(tffnm2eaatüfuüab2arruübaGreırırnrrieGeınrlrlenkünkür)lı-ınkür)-ı
44..44.. CCiTinnasbsiiylyoeet8tV:VCeeririnisKKiyüüemtmveeessiriiDDkeüenmneeemmseienlledereriiher bir özellik eTeTtatmambbelelogoprpur8ro8bo’b’dubdlenleeeummbnbiyiiireürünzkzdekbeöreöarişlişnşeeneadrdriey,ıeylayraıyzaazoıaspıslptsıdtgıtnıunıeğığğlınıenımumbyıkyızaazoazşdzndaaeafrrenirııngıne%neüımımnrnae5eslc2lyecie,iron3rnnsv8svieiyveyrerietiltilbminmaniişiişşatttirtairaıhr.h.mmiinn
GÖ2GzrueblggluriruTkuTbabaububnlnlouogKBun8üni8yo:nyreün:aeüanCzfsnCrzidyiybdinbeonaeslanşsleişeaiyrayrrierie,ıt,ıltrlıvrıaÖ1svaoesao0eslrztylrdt1giedgıiueslkueklğlıüiğleüukemumbkbekaeoasşo9yBsşnianüin9aafnrfzird,ışid6gıdeag%eü2e%rührıshraei5ae5sr2sry2yb,ob,3SSoi3ni8rnVı8rnvövMöıezfezlebealblnalalişdikşkaıarrııcı
SFKKKKKKK3LMKKKFKKKSKKKKL3KÖG2ÖGLKKKK23KKKFSGGGaKKaSSKK2GKGKKEKKK2GKEGKzrGGKaSDzrGGKKKK2yyuIIeGGyueIHHOKIHSHHOKIGblSOIKHHblluCSlASCiuSCikLLkLLLLL
SBBLLKgBgKBLünooiiioüoinnnorfggnnrgaaanaafasrrrfisryyyyiyyoonn LSTSTSSTBBSBTSBnnnnoFFFiinnFiinnffgffIIInnffIDDaDaaaDrrFFrrFyyFyy LCmSTLTSLnooFoTnoFgfgIfgFIDDFF
82439339151661483394293151Ö11sÖs589191333142a30235100193320511000az013053200yz11111ye111ıeıslsllıliıikk
8789999999977778999789979999ByyB999998999897ü7915535558801767553915575898aü589755558139az,,,,,,,,,,,,,,,,,,,,,,,,,,,,şz612456881662053,,,,,,,,,,,,6254128638166şda188466626251d24342211774537a234244123127er31212742442erısısii
1NN NS1SC1SSRN1RNSNS1CRS1SNRSS1SSSSSNSR1C11RSNNNNNNVVVVVVVVVVı4FF4FFBBBBBNNNıVVVVVnF4FBn55NNNNNNMMMMMMMMMMı5NNNMMMMMıffllaannddıırrııccıı
Özellik Grubu 2G 3G LSI KK KGI KKK KGO KKHSL KKHC K2G FK Say KE KKS KKHA MDS KT
n artmış medik bir sınıflara 0’şer şiir bu köşe olanak e, köşe uruluyor öz sanatı lerde bu ını köşe in etme ik şarı ndırıcı
Özellik Grubu 2G 3G LSI KK KGI KKK KGO KKHSL KKHCL K2G FK Say KE KKS KKHAL MDS KT
yüzdeleri, rastgele başarı % 52,38
KKHAL mTFIDF 6
52,57 C45
Konfi
gürasyon sayısı yüzdesi Sınıflandırıcı
FK
K2G
48,76 RF 48,19 C45
Binary Amas1y0a1lı M. F.,9B9a,6lc2ı S., VSaVrlıME. N., Mete E., TürkçKeEMetinlerinN1Sınıflandırılm1a0 sında M4e6t,i8n6TemsilSYVöMntemlerinin
101 98,67 1NN
PerfMorDmSans Karşılaştırılması, 5C1ilt 2, Say4ı 64,,2S9yf 95-1N04B, Aralık 2012
98,1 RF
KKHSL Co
46Te,1malı DeNrlBeme Makale
KT
44,19 C45
95,62 95,43 95,24 93,52 87,62 81,14 79,24 77,33
1NN SVM C45 1NN NB SVM RF NB
Tablo 9 incelendiğinde bir filme yapılan yorumun negatif, pozitif ya da nötr olduğunu tahmin etmede en başarılı metin temsil yönteminin (özellik grubunun) kelime köklerini Kmeans ile Sınıf bilgisine göre kodlamak (KKK-Snf) olduğu görülmektedir. 3 gruba ait 35’er yorumla elde edilen sonuçlara göre bir yorumun yönü %96,38’lik doğrulukla tahmin edilebilmektedir. En başarılı 2 yöntem (KKK-Snf, 3G-Binary) arasında büyük bir fark bulunmaktadır.
mTF
76,57 SVM
4.6. Ruh Hali Veri Kümesi Denemeleri
Co
71,05 1NN
70,67 NB
N1
64,19 NB
Tablo 10’da bir yazının yazıldığı anda yazarının içinde bulunduğu ruh halini tahmin etme problemi üzerinde yaptığımız denemeler verilmiştir.
Tablo 8 incelendiğinde bir metnin yazarının cinsiyetini
Ttaahbmloin 8etminecdeeleenndibğainşdareılıbmiretminetenminsilyayzöanrtıenmıninicnin(söiyzeltliinki gtarhumbuinuent)m2egdreamenlarb’aışabriınlaı rmy eotlianratkemksoildlyaömnatekmi(n2iGn -(Böiznealrliyk) oglrduubğuunung)ör2üglrmamekltaerd’ıir.binVareyri olkarüamkeksiodliaçminaküre(2tiGle-nBintaerkyi)l 2olgdruağmulargınörsüalymıseık5tedbirn.’i Vgeeçrtiiğiknüdmenesöizeilçliikn seüçriemtiileynapıtlemkıişl v2egrabmilglairıknaszaynıcsıın5a bgiönr’ei geençtiyğiin1d0e0n öazdeeltlik2gsreaçmimmi yeatipnıllemriınş tveembsilignidekakzuanllcaınnıalmgıöştrıer. enHieyri b1ir00cinadsieytet2tegkraimyazmaerltainraleraiint 5te0m-5s5il’işnedre ykauzlılainlıelmeılşdtıer. edHilern bsironcuinçlsaiyraettgeökrieyabziarrlmareatnaiint 5ya0z-5ar5ı’nşıenr ciynasziıyeitlie%e9ld9e,62edgiilbeinyüskonseukçlbairradogğöruelubkilra mtahetmnin yedazilaerbınilımn eckintesdiyire.tiE%n 9b9aş,6a2rılgıib2i yöünktseemk b(i2rGd-oBğirnualuryk,la3Gta-hLmogin) eadraisleınbdilamkeükçteüdkirb.irEfnarbkabşaurlıulnı m2aykötandteırm. (2G-Binary, 3G-Log)
arasında küçük bir fark bulunmaktadır. 4.5. Film Yorumları Veri Kümesi Denemeleri
4T.a5b.loFil9m’dYa obriurmflialmrıeVyearpi ıKlmüımş eysoirDumenuenmedlueyrgiusal yönünü tTaahbmloin 9’edtamebir pfriolmblemyiapıülmzeırşinydoerumyaupntığdımuyıgzusadlenyeömneülneür vtaehrmilminiştiert.me problemi üzerinde yaptığımız denemeler verilmiştir.
Tablo 9: Film Yorumları veri kümesinde her bir
özeTlalibklogr9u:bFuinlumn Yenorbuamşalarrılııvoelrdiukğüumkeosninfidgeürhaesryobnir ve
özellikbgarşuarbıuynüuzndenlerbia,şraarsıtlgıeolledubğaşuakrıo%nfi2gü8r,5a7syon ve
başarı yüzdeleri, rastgele başarı % 28,57
GÖzrueblluik gKüornafsiyon sÖazyeısllıik yBüazşdaerısi Sınıflandırıcı
GKrKuKbu gSünrfasyon s4ayısı 9yü6z,3d8esi S1NınNıflandırıcı
8986,7368 N1NBN
K3GKHCL SBninfary
7858,8716 SNVBM
LKSKIHCL Snf
75,6821 RSVFM
KLSKIS
675,1642 SRVFM
KGKIS
24 1
645,7164 NSVBM
2KGGI
5694,6726 NB
TBFinary
549,8662 NB
BTFinary
54,2896 SNVBM
KKHAL mBiTnFarIDy F 623
524,5279 CSV45M
FKKKHAL LmoTgFIDF 564
4582,7567 RCF45
KFK2G
TLoFgIDF
48,1796 CR4F5
KE2G
16 0
468,8169 SCV45M
MKEDS N1
46,2896 NSVBM
KMKDHSSL Co
46,129 NB
KTKHSL BCionary
446,19 CN4B5
SKaTy
3484,4189 NC4B5
Tablo 9 incelendiğinde bir filme yapılan yorumun negatif,
pToazbiltoif 9yaindcaenleöntdr ioğlidnudğeunbuir tafihlmmien yeatpmıeladne yeonrubmaşuanrılnı emgaettiifn, tpeomzistiilf yyaödnatenmöitnrinoldu(öğzuenluliktahgmruinbuentmune)de keenlimbaeşarkılöıkmleeritnini KtemmesialnsyiölentSeımnıifnbinilgi(söinzeellgiökregkroudbluanmuank) (kKeKliKm-eSnfk)öoklldeuriğnui gKömrüelamneskitleedSirın. ıf3bilggrisuibnae gaöirte k3o5d’elarmaykoru(mKlKaK-eSldnef) oelddiulğenu sgoönrüulçmlaerkategdöirr.e 3birgryuobraumauint y3ö5n’üer %y9o6ru,3m8l’alikelddoeğruelduiklelna tsaohnmuçinlareadigleöbrielmbeikrteydoirru. mEunn byaöşanrüılı%296y,ö3n8t’elimk (dKoKğrKul-uSknlfa,
Tablo10: Ruh Hali veri kümesinde her bir özellik
grTuabbulnou1n0:eRn ubhaşHaraılliı voeldriukğüumkeosnifnigdüerhaesyr obnirvöezbelalşiakrı grubununyeünzdbealşearri,ılrıaosltdgueğleubkaoşnafriıg%üra2s5y,o4n8ve başarı
yüzdeleri, rastgele başarı % 25,48
ÖGzrueblluik Kgüornafsiyon Ösazyeısllıik Byüazşdaerısi Sınıflandırıcı
G3Grubu gBüinraasryon s1a0y1ısı y8ü5z,2d3esi SNıBnıflandırıcı
850,2637 N1NBN
KKKHCL Snf
8708,6773 1NN
KKGHI CL STnFfIDF
6778,2793 R1NFN
KLSGII
676,291 RF
LKSKI
664,2918 RNFB
64,9189 NB
BNi1nary
641,1693 NRFB
2KG2G
6516,6834 RCF45
K2KGHAL TmFTIFDF
15011
564,894 CR4F5
KKHS AL mSnTfF
5449,9743 RF
KFKKS
SNn1 f
534 498,7439 RF
FMKDS N1
5314 486,4796 RF
MKEDS Log
5118 465,7863 RF
KET
1168 451,8132 RF
KKT HSL CLog
3491,2162 RF
SKaKyHSL Co
26 0
389,026 RF
38,06 RF
Tablo 10 incelendiğinde bir blog yazarının blog yazıldığı
aTnadbaloki 1r0uhinhcaellienniditğaihnmdien beitrmbeldoeg eynazbaarışnaırnılıbmloegtinyazteılmdısğilı yaönndtaekmi irnuinh h(aölzienliliktahmgriunbuentmune)de3gernambalaşra’rıılıbimneatriyn otelmarsaikl kyöondtleamiankin (3(Göz-eBlliinkaryg)ruoblduunğuun)gö3rgürlammelkatre’dıir.biVnaeryi koülmareaski ikçoidnlaümraektilen(3Gte-Bkiilna3ryg)raomldlaurğınu gsöaryüıslmı e5ktebdiinr’.i Vgeerçitikğüinmdeesni öiçzienlliükresteiçleimn i teykapilılm3gışravmelabriılngi skaayzısaınc5ınabignö’rie geençtiğyin1d0e0n aödzeltlik3gsreaçmimimyeatipnıllemriınş vtembsiillgiindkeazaknuclılnanaılgmöırşetıre.n iy4i 1r0u0h hadaleitnin3ghraemr bimrienteinaleitrin38-t4e0m’sairlibnldoeglakuellldaenıelmdiılşetnır.son4uçlraurha yhazlianriın herruhbirinhealaiit 3%8-408’a5r,2b3l’olügkla elddoeğreudliulkenla sontauhçmlarina eydazilaerbınilmerkuthedir.haElin b%aşarı8lı5,223y’ölünktemdo(3ğGru-lBuiknlary, taKhKmKinSednifl)eabrialmsıenkdtaedbiüry. üEknbibr afşaarkrılbıu2lunymönatketmadı(r3. G-Binary, KKK-
Snf) arasında büyük bir fark bulunmaktadır. 4.7. Deneme Sonuçlarının Birlikte Değerlendirilmesi
S4.o7n.uDç etnabelmolearSıo(n5u-ç1l0a)rıennınbBaşiarrlıilkıtesıDnıeflğaenrdleırnıcdıilrairlmyöensiünden
iSnocneuleçndtaibğlionldaerı(s(ı5n-ı1f0la)ndenırıbcıalşaarrıınlıtasbınloıfllaarnındısrıocnılasrütyuönnlaürnınddena yinecrelaelnmdaiğisnadyeıla(srı)nıfTlanbdloırı1cı1l’adrıenkitasbolnoluaçrlıanr seolndesüetudnilmariışntdira. Tyearblaolm11a’dseakyiılsaaryı)ılaTrasbılnoıfl1a1n’ddıerıkciınsıonn1u0ç2lar(1e7ldöezeelldiiklmgirşutbiru. *Ta6blove1r1i ’kdüekmiessai)yılaarrffsıdnoısflyaansdıırüızceınriınd1e02ka(ç1ın7döazelnlikbagşraurbıluı a*lg6orvitemria koüldmueğsuin) uagrföfstdeormsyeaksıtedüizre.rinde kaçında en başarılı
algoritma olduğunu göstermektedir. Tablo 11: En Başarılı sınıflandırıcıların dağılımı 102
101 Taabrlfof 1d1o:syEansıBiçaişnadrıelıksaıçnıkfelarnedeınrıcbıalşaarırnılıdoalğdıluıkmlaı r1ı02 arff dosyası içinde kaç kere en başarılı oldukları Sınıflandırıcı Kaç kere
Sınıflandırıcı eKnaç başkaerırleı
yazarın edilebilm Snf) ara
4.7. Den
Sonuç t incelend yer alm Tablo 11 * 6 ver algoritm
Tab a
negatif, lı metin köklerini ) olduğu edilen ğrulukla KK-Snf, n içinde üzerinde
rzıarı r t ar ı i
Şiir Köşe yazarı Haberler Cinsiyet Film yorumları Ruh hali
Snf) arasında büyük bir fark bulunmaktadır.
4.7. Deneme Sonuçlarının Birlikte Değerlendirilmesi
Sonuç tabloları (5-10) en başarılı sınıflandırıcılar yönünden EinMceOlenBdiilğimindseel(sDıneıfrlgani,dıCrıcilıtla2r,ınSatabylıo4la,rıAnrsaolnıks2üt0u1n2larında yer alma sayıları) Tablo 11’deki sonuçlar elde edilmiştir. Tablo 11’deki sayılar sınıflandırıcının 102 (17 özellik grubu * 6 veri kümesi) arff dosyası üzerinde kaçında en başarılı algoritma olduğunu göstermektedir.
Tablo 11: En Başarılı sınıflandırıcıların dağılımı 102 arff dosyası içinde kaç kere en başarılı oldukları
Sınıflandırıcı
RF SVM NB 1NN C45
Kaç kere en başarılı olduğu 39 24 23 9 7
Tablo 11 incelendiğinde en başarılı sınıflandırıcının Random FToarbelsot 1(R1 Fin)coelldeunğduiğ, ionndueDenesbteakşaVrıelıktsöınr ıMflaankdinıreılceınriın(SRVaMnd)ovme NFoarievset (BRaFy)esold(NuğBu),’oinnutaDkeipsteekttViğeikgtöörrüMlmakeiknteldeiri. (ESnVMya)kvıne kNoamivşeu B(1aNyeNs) (vNeBk)’airnartaakğiapçlaerttıiğ(iC4g.ö5r)ülamlgeokrtietmdiar.laErınınyapkeıkn bkaoşmaşrıulı(o1lNamNa)dvıkelakraırgaörrüağlmaçelkatreıd(iCr.4.5) algoritmalarının pek başarılı olamadıkları görülmektedir.
Tablolar (5-10) Özellik gruplarının en başarılı oldukları kToanbflioglüaras(y5o-n1l0a)r yÖönzeülnlidkengirnucpellaernınmıensiyelne (bikaşilairnıilnı toalbdluolkalraırnı iklokn2figsütruansyuonndlaaryyeör naülmndaesnaiynıclaerlıe)nimlgeisliysloen(uikçlialirniTnabtalbolo1l2a’rdıne vilekri2lmsüişttuinr.unÖdranyeeğrinalm2Ga saöyzıellalriık) iglgruilbi us,on6uçvlaerriTakbülmo e1s2i’ndine üveçrüinlmdeiştNir1. Öilern, eiğkiinsin2dGe Böizneallriyk ilgerubbiuri,nd6e vieseri Lkoügmielseinein büçaşüanrdıleı oNlm1 uişlteu,r.ikisinde Binary ile birinde ise Log ile en başarılı olmuştur.
Tablo 12: Özellik gruplarının en iyi oldukları Tablo 12: Özeklloinkfgigrüurpalsayrıonnılnaren iyi oldukları konfigürasyonlar
Özellik GÖrzueblluik 2GGrubu 23GG 3FGK FKK2G KK2EG KKEGI KKGGIO KKGKO KKKKHAL KKKKHHACLL KKKKHHCSLL KKKKHKSL KKKKKS KKKT S KT
En iyi olduğu Konfigürasyon ve Sayıları 3EnNi1y,i 2olBduinğauryK, o1nLfioggürasyon ve Sayıları 33 NBi1n,a2ryB, i2naLroyg,,11LNo1g 33 BNi1n,a3ryL, o2gLog, 1 N1 35 NTF1I,D3FL, o1gBinary 54 TLoFgID, 1F,N11B, 1inTarFy 43 LBoinga, r1y,N11L, 1ogT, F1 N1, 1 TFIDF 32 BBiinnaarryy,, 12 LLoogg,, 11 NTF1,, 11 TTFFIIDDFF 25 BBiinnaarryy,, 21 LNo1g, 1 TF, 1 TFIDF 54 BmiTnFarIDy,F1, N1 1mTF, 1 Cooccurance 46 mSnTfFIDF, 1 mTF, 1 Cooccurance 64 SCnof, 2 Snf 46 CSnof, 2 Snf 63 SSnnff, 2 mTFIDF, 1 mTF 34 SLnofg,, 21 mNTorFmID1F, ,11BminTaFry 4 Log, 1 Norm1, 1 Binary
Tablo 12’ye göre K2G özellik grubunun TFIDF ile, KK Tözaebllloik 12g’ryuebugnöurne KB2inGaryözeilleik agğrıurlbıkulnaunndırTılFmIDasFı, ilke,eliKmKe ökzüemlleilkemgeruybaupnaurknenBiisnearKyKHileCLağvıerlıKkKlaKndımrıelmtoatlsaır,ınkdealiSmnef küumllaenleılmmeasyıadpaahrakeiyni issoenuKçKlaHr üCrLetmveiştKirK. K metotlarında Snf kullanılması daha iyi sonuçlar üretmiştir.
Özellik gruplarının genel olarak ne kadar başarılı oldukları Öinzcelleimk egkruiçpilnarTınaıbnlog5en-1e0l ’olalardraközneellikkadgarur bbuanşuanrılhıeorlbdiurkvlaerıi iknücmeleesminedkeiçeinnbTaaşbalroılı5k-1a0ç’ılnacrıdoalödzueklllaikrı g(r1u-b1u7naurnashıe)rybaizrılvmeırşi kveümbeusisnadyeılaernınbaoşratarıllaımkaalçaırnıcaı loınldmuıkşltaır.ı E(1ld-1e7eadrialesın) syoanzuılçmlaışr vTeabbluo 1s3ay’tıelavrıenrilomrtiaşltairm. aları alınmıştır. Elde edilen sonuçlar Tablo 13’te verilmiştir.
Tablo 13: Özellik gruplarının ortalama ve her veri
Tkaübmloes1i3n:deÖkizeblalşikargı rsuırpallaarmınaınlaorırt(a1l7amözaevlleikhegrruvbeuri kümareassiınnddeak,i6bvaeşarirıksüımraelasimndalearoırt(a1l7amözaekllaiçkıngcruı bu
102 arasında, 6 veri koülmdueksilnadrıe) ortalama kaçıncı oldukları)
Ortalama
Tablo 12’ye göre K2G özellik grubunun TFIDF ile, KK özellik grubunun Binary ile ağırlıklandırılması, kelime kümeleme yaparken ise KKHCL ve KKK metotlarında Snf kullanılması daha iyi sonuçlar üretmiştir.
Özellik gruplarıTnMın MgeOneBl oEllaerakktrinkeMkaüdharebnadşaisrlıelıriolOdudkalasrıı incelemek için Tablo 5-10’larda özellik grubunun her bir veri kümesinde en başarılı kaçıncı oldukları (1-17 arası) yazılmış ve bu sayıların ortalamaları alınmıştır. Elde edilen sonuçlar Tablo 13’te verilmiştir.
Tablo 13: Özellik gruplarının ortalama ve her veri kümesindeki başarı sıralamaları (17 özellik grubu arasında, 6 veri kümesinde ortalama kaçıncı oldukları)
Özellik Grubu
Ortalama Başarı Sıralamas ı
3,5
31 1
3G
2,2
12 5
KFK2G 1120,,35
KKE2G 1122,,53
KKGE I
512,5
KKGGOI 65,3
KKKGO 56,,73
KKKKHAL 51,27,7
KKKKHHCALL 51,28,7
KKKKHHSCLL 154,8,7
KKKKKHSL 41,47,7
KKKKSK 140,7,2
KKTKS 1150,,32
LKSTI
61,57,3
MLSDI S 162,7,8
SMaDy S 1122,,28
12,2
1171 143 1134 1101 1121 912
1127 1113 1123 1130 1132 194
612 511 412 513 613 414
76 65 34
170 36 23
1104 316 211 415 910 610
214 1106 181 915 310 310
125 1170 187 89
135 136
415 817 717 68
115 216
84 184 97
164 51
12 1
183 1154 196 1174 156 1151
913 915 1106 317 416 515
196 192 610 136 144 153
516 712 165 1126 1174 1173
5 7 15 12 17 17
Tablo 13 incelendiğinde kullanılan 6 veri kümesi için en bTaaşbalroılı13 öizneclelliekngdriuğbinudneunkusılrlasnııylalan 36G,v2erGi vkeümKeKsKi ioçlidnuğeun gböaşrüarlmılıek3teödzierl.lik grubunun sırasıyla 3G, 2G ve KKK olduğu görülmektedir.
Harf 2gramları (2G) film yorumları ve ruh hali veri kümeleri hHaarrifci2ngdreamçolakrıb(a2şGar)ılfıilsmonyuoçrluamr elaldrıeveetmruihştihra. lHi vaerfri3kgürammelaerıi (h3aGri)cinidse çohkabbearlşearrılıhasroincuinçdlaer eçlodke ebtmaşiaşrtıilrı. Hsoanrfuç3lgarramelladreı e(3tmGi)ştiirs.eFohnakbseiryloenrelhkareilciimnedleer çeonk yübkasşeakrılbı aşsaornıulaçrlıanrı keöldşe yeatmzairşltair.ınFı ontkasniıymonaedla keglöimstelremr işelnerydüirk.sekDübzaşamrıleatriınnlıerkdöeşkei üyaslzuabrluanrınbıelitralennımaedsiandegöfsotenrkmsiiyşolenredlir.kelDimüezlermineteintkleinrdebkiri şüeskluilbduen kbuelliarlneınlambeilseicnedğei fobnukrasdiyaonnelgökrüelimmeeklteerdinir.etkKienlimbier 2şegkrailmdelarıku(Klla2nGı)la, bKileelcimeğei tübrulerarida(Kn T)gövreülkmeelikmteedeirk.lerKi e(lKimEe) h2igçrbaimr lavreır(iKk2üGm),esKinedliemebatüşarlreırig(öKstTer)evmeekmeilşilmeredierk.leKriav(KraEm) gheiçnbeilrleşvteirmi eknüimn esinbdaeşarbılaışarısagyöıslatebrielmesmi işleirçdiinr. Kkaevlrimame kgeönkelellreinştdiermn e(nKiKn ) dabhaaşabrıalşıarılısasyoınlaubçillamr eüsrietmeiçsingerekkelliidmire. Bköuknlaerginödrenk(aKvrKa)mdlarhıan bbaişraürısltı ksoanvuraçmlalrarüıryeltamiefasidegeerdeikllmideisri. (BKuGnaI),göşrieir,kafvilrmamlyaorrıunmbliarrıüsvtekaruvhramhalalirıyvleari fakdüemeedleilrminedsei k(KelGimI)e, kşöiikrl,erfiinlmdenyo(rKuKm)lardıahvae iyruiyhkehna,löi zveel riisimkülemreinleirninsadne kaevlirmame ıknöakdleörninüdşteünrü(lKmKes)i (dKaGhaOi)yisyakdeenc,e öşziierl viseirmi kleürminesininsdane kealvirmame ıknöakdleörninüdşteünrüdlamheasiiy(iKsGoOnu)çsladreücreeşteiibrilvmeriiştkirü.mKeesliinmde köelkilmerei k(KökKl)erşiinirdevne fdialmhayioyriumsolnaurıçlhaarriücrinetdeebiblamşiaşrtıilrı.dıKr.elime kökleri (KK) şiir ve film yorumları haricinde başarılıdır.
Kelime kümeleme metotları (KKHAL, KKHCL, KKHSL, KKelKim, eKkKüSm)elaermaseındmaeteontlabrıaş(aKrıKlısHıAkLm, eKanKsHiCleL,küKmKeHleSmLe, (KKKKKK,) KoKlmS)uşaturar.sındTaabelno b1a2şa’drıelkısiı dkemğearlnesreilebaküılmdıeğlıenmdae K(KKKKK’n) ınolemnuiyştiuSr.nf ilTe abbirlolikt1e2ç’daelıkşitığdı egğöezrülekrmeekbtaekdıilrd.ığında KKK’nın en iyi Snf ile birlikte çalıştığı gözükmektedir.
Anlamsal uzaylarda LSI, MDS’e göre oldukça başarılı sAonnluaçmlasralürueztmayilşatirrd.a6 LvSerI,i kMümDeSs’iendeg,örMe DoSl’diunkLçaSI’bdaaşnariıyliı osoldnuuğçularsaüdreectemi1ştivre. r6i kvüemri eksiüm(heasbinedrlee,r)MbDuSlu’ninmaLkStIa’ddıarn. Biyui voeldriuğkuümsaedsiencied1iğevrelreiriknüdmenesaiyı(rhaanbeörzlelrl)iğbiuhluenr mbiarktsaıdnırfa. Baiut çvoekri skaüymıdeasöinrni edğiiğnerolleurşinudeunr. aByıurnana göözreellMiğiDhSeirlebiyr issıonnıfuaçlaairt açlomkaskayıidçainörönrenğeink osluayşuısdıunrın. Bçuonka oglödrueğMu DvSeriilekiyüimseolneuriçnlianr kalumllaknımiçıiönneörrinleebkilisra. ySıasyınılıanr (çSoaky)oölzdeulğliuk gvreurbi ukşüiimr evleerkiönşine ykauzllaarnı ıvmerıiöknüemrileelberiliihr.aSriacyinıldaer (çSoakyk)öötzüelsloiknugçrluabrualşmiiırşvtıer.köşe yazarı veri kümeleri haricinde çok kötü sonuçlar almıştır.
kavramı kelime kökleri
Kelime KKK, K (KKK) KKK’nı
Anlamsa sonuçlar olduğu veri küm çok sayı almak kullanım yazarı v
Sonuçla Tablo 14
Tab
yorumları Ruh hali
ile, KK kelime nda Snf ldukları bir veri yazılmış sonuçlar eri bu
8 1 12
(KGI), şiir, film yorumları ve ruh hali veri kümelerinde kelime köklerinden (KK) daha iyiyken, özel isimlerin insan
başarıların elde edilebildiği görülmüştür.
kavramına dönüştürülmesi (KGO) sadece şiir veri kümesinde kelime köklerinden daha iyi sonuçlar üretebilmiştir. Kelime
5. Sonuçlar ve Tartışma
kökleri (KK) şiir ve AfimlmaysyoarulımMla. rFı.,hBaarilcciınSd.e, Vbaşrlaı rEı.lıNd.ı,r.Mete E., TürkçSeınMıfleatnindlıermrinaSınuıfylagnudlaımrılmalaarsıınnddaa MöerntinekTleerminsil Ynöanstıel mlteemrinsinil Perefodrimlecaenğsi Kpaerrşfıolarmştıarınlmsaaseın, Cçioltk2,etSkaiyeı d4e, nSypfa9r5a-m10e4tr,eAdirra.lıkBu2n01u2n
Kelime kümeleme metotları (KKHAL, KKHCL, KKHSL,
doğal sonucu olarak uygun özellikleTreinmsaelçı iDmeirlesımnıeflaMnadıkramlea
KKK, KKS) arasında en başarılısı kmeans ile kümeleme
performansını arttırmaktadır. Bu çalışmada çeşitli türdeki
(KKK) olmuştur. Tablo 12’deki değerlere bakıldığında
metin sınıflandırma problemleri için özellik gruplarının
KKK’nın en iyi Snf ile birlikte çalıştığı gözükmektedir.
performansa etkileri araştırılmıştır.
Anlamsal uzaylarda LSI, MDS’e göre oldukça başarılı sonuçlar üretmiştir. 6 veri kümesinde, MDS’in LSI’dan iyi olduğu sadece 1 veri kümesi (haberler) bulunmaktadır. Bu veri kümesini diğerlerinden ayıran özelliği her bir sınıfa ait çok sayıda örneğin oluşudur. Buna göre MDS ile iyi sonuçlar almak için örnek sayısının çok olduğu veri kümelerinin kullanımı önerilebilir. Sayılar (Say) özellik grubu şiir ve köşe yazarı veri kümeleri haricinde çok kötü sonuçlar almıştır.
Sonuçlar veri kümelerinin türlerine göre incelenmesiyle Tablo 14 elde edilmiştir.
Tablo 14: Veri kümelerinde en başarılı sonuçlar alan konfigürasyonlar
Ort. KOretl.imKeeliSamyeısıSayısı Ort. COrüt.mlCeüsamlyıesısayısı RastgRelasetgBealşearıBaşarı EldeEldeedileendileenn en yükseykükbsaeşkarıbaşarı ÖzelliÖkzeslaliyıksısayısı ÖzelliÖkzellgirkubugruvbeu ve konfikgoünrfaisgyüornasuyonu
Veri kVüerimeksiümesi
Ruh hali 247,1 28,1 25,48 85,23 101 3G-
FRiulmh hali yorumları KFiölmşe
24947,3,1 34998,3,5
42,88,1 44,58,3
2285,,4578 42,87,567
9856,,3283 9963,,7388
1401 34817
Binary KB3SGniKnf-Kar-y 2KGK-KLo- g
yyaozruarmı ları yKCaiöznşaseriıyet HCianbseiryleetr HŞiairberler Şiir
337978,5
320747,8 79,5 204,8 79,5
4554,3
1574 7,4 17 7,4
45,27,638
2502,38 14,29 20 14,29
9939,,7682
9949,,5642 75,29 94,54 75,29
3180117
3160918 101 3698 101
Snf 22GG--Log Binary B32B22GGGGiinn----aaNNrryy11 3G-
Tablo 14 incelendiğinde, en yüksek başarı elde edBileinnarvyeri
kümesi yazarın cinsiyetini belirlediğimiz veri kümesidir. En Tzoarblove1r4i inkcüemleensdiniğinindşei,irelenriynükyseakzarblaaşraınrıı elbduelmeadileonldvueğrui kgöürmüelmsieykatezdarirın. Bcuinnsuiynelatinbierbaebleirrletdüimğimveirzi vkeürmi eklüemriensdiedier.n Eanz z%or 75v’elriik bkiürmbesaişnairnı eşlidierleeridnilmyiaşzaorllmaraınsıı obtoumlmaatik omldeutğinu gsıönrıüfllamnedkırtemdair. kBounnuusunnladaberçaobkerçteüşmitlivegriörkeüvmleerldeerinbdaeşaernınaınz %yaka7l5a’nldikığıbniırgöbsatşearrmı eekltdeedire.dilmiş olması otomatik metin sınıflandırma konusunda çok çeşitli görevlerde başarının
yEankablaanşadrıığlıınımgeötsitnermteemkstieldi iry.öntemlerine bakıldığında, harf
ngramlarının başarısı göze çarpmaktadır. En başarılı metin temsili yöntemlerine bakıldığında, harf
nNggrraammllaarrıınnınabğaırşlaıkrılsaıngdöırzıelmçaarspınmdaaktoalddıurk. ça popüler olan TF
ve TFIDF yerine Binary, Log ve N1 ağırlıklandırma Nyögnrtaemmllaerrıinnianğdıralhıkalabnadşaırrııllmı oalsdınudkalaroılgdöurküçlampekotpeüdlierr. olan TF ve TFIDF yerine Binary, Log ve N1 ağırlıklandırma
yMöenttienmlelreirninin dbaohyaubtlaaşraıyrlıalı oldubkalşaarrııgörüolmraenkltaerdı ir. birlikte
incelendiğinde, kısa metinlerde de uzun metinlerde de yüksek Mbaeştairnıllearriınn eldebeodyiuletlbairlıdyilğai görüblamşaürşıtür. oranları birlikte incelendiğinde, kısa metinlerde de uzun metinlerde de yüksek
başarıların elde5e.dilSeboinlduiğçilagörrüvlemTüşatürrt.ışma
Sınıflandırma 5u. ygSuloamnualçalraınrdva e Töranerktıleşrmina nasıl temsil edileceği performansa en çok etki eden parametredir. Bunun Sdoınğıafllasnodnıurmcua olauryagkuluaymgaulnaröınzdealliklöerrnineksleerçiinmi nsıansııfllantdeımrmsial epderilfeocremğainpseınrfıoramrtatınrsmaaekntaçdoırk. eBtkui eçdaelınşmpaardaameçterşeidtliir. tBürudneukni dmoeğtainl sosınnuıcfluanodlaırrmaka uypgroubnleömzelellriikleiçriinn seöçziemlliiksıngırfulapnladrıırnmına ppeerrffoorrmmaannssıaneıtkairltetrıirmaraakşttaırdıılrm. ışBtıur. çalışmada çeşitli türdeki metin sınıflandırma problemleri için özellik gruplarının pKeurlfloarnmılaannsa6etfkairlkelrıi amraeşttiınrılvmerışitıkr.ümesinin her biri için 17 özellik grubunun çeşitli konfigürasyonlarından oluşan 77 Kfaurklllaıntıelamnsi6l yföanrktelımmi edteinnenvmeriiş kvüembeusinişilnemhesronbuirciuiçoilnuş1a7n ö4z6e2ll(i6k*7g7r)ubaudneut narfçfedşiotsliyaksıon5fiagdüertassyınonıfllaarnıdnıdramna omlueştoadnuy7l7a fsaınrkıfllıantedmırısliml ıyşötınrt.emSıinıdfelannednımrmişa vpeerbfuormişlaenmslasroın5u’clui çoalupşraanz 4ge6ç2er(l6e*m7e7)ilaedöeltçüarlmffüdşotüsyr.ası 5 adet sınıflandırma metoduyla sınıflandırılmıştır. Sınıflandırma performansları 5’li çapraz
Kullanılan 6 farklı metin veri kümesinin her biri için 17 özellik grubunun çeşitli konfigürasyonlarından oluşan 77 farklı temsil yöntemi denenmiş ve bu işlem sonucu oluşan 462 (6*77) adet arff dosyası 5 adet sınıflandırma metoduyla sınıflandırılmıştır. Sınıflandırma performansları 5’li çapraz geçerleme ile ölçülmüştür.
Ayrıntıları 5.bölümde verilen sonuçlara göre genel olarak ngramların diğer metin temsil yöntemlerinden daha başarılı olduğu görülmüştür. Ngramların her türlü dile uygulanabilir olması, herhangi bir dile özel ön işlem gerektirmiyor olması ngramların diğer olumlu yanları olarak sayılabilir. Ngramların ağırlıklandırılmasında oldukça popüler olan TF ve TFIDF yerine Binary, Log ve N1 ağırlıklandırma yöntemlerinin daha başarılı oldukları görülmüştür. ve TFIDF yerine Binary, Log ve N1 ağırlıklandırma yTöanratefımmlıezrdinainn gdealhişatibrailşmariışlıoolladnukslıanrııf gböirlgüilsminüeştüdra.yalı kelime kümeleme yöntemi, Film Yorumları veri kümesinde en bTaaşraarfıılmı ıztdeamnsiglelyişötnirtielmmiidşiro.laFnilsmınıfyobriulgmislianreı dvaeyrai lıkküemliemsie, Iknütmerenleetmeüzeyröinntdeemkii, kFuillmlanıYcıoruymorluamrılavrıenri okluümmleusinydae edna oblauşmarsıluız tşeemkislidle yeötinkteetmleindmir.esiFiülzmeriynoerubmirlavreıri vkeürmi eksüidmireskii, bInutekronneut güüzneürminüdzedkei tikcaurliladneığceı riyyoürkusmeklaroılnduğoulunmdalun olydaukdçaa soılcuamksbuizr aşreakşitlıdremaetaiklaentlıednırm. esi üzerine bir veri kümesidir ki bu konu günümüzde ticari değeri yüksek olduğundan oldukça Gsıcealekcbekir açraaşlıtşırmmaalaarlanoıldaırra.k anlamsal uzayda yakınlıktan uzaklığa dönüşümde yeni yöntemlerin kullanılması ve yGöenletecmekleriçnalışmİnaglailrizcoelaramk etainnllearmsalüzeurzianyddea ydaeknıennlımkteasni duüzaşkülnıüğlamedkötendüişrü. mde yeni yöntemlerin kullanılması ve yöntemlerin İngilizce metinler üzerinde denenmesi düşünülmektedir. 6. Teşekkür
Özellik çıkarımına ve d6e.neyTleerşinekçaklüışrtırılmasına büyük emek
harcayan Feruz DAVLETOV, Arslan TORAYEW, Ümit ÖÇİzFeTllÇikİ,çıBkaurrıhmaınneattvine dİeRnMeyİlKerÇinİ’yçealıvşteırıdlmeğaesrılnia yboüryuümklaermıyelka çhaalrıcşamyaanmızFaerkuaztkıDdaAbVuLluEnTaOn VK,emAirkslDanoğaTlODRilAİYşlEemWe, GÜrumbiut (ÇwİFwTwÇ.kİ,emBiukr.hyailndeiztt.ienduİ.RtrM) İKüyÇeİl’eyreineve tedşeeğkekrülir yeodruemrizla. rıyBlua ççaallıışşmmaam, bıziar kEartikccıdsaonbuşliurkneatni KoleamnikBiDziotğeakl’iDnil31İş1l0em27e8Gnrou’bluu (TwÜwBwİT.kAeKm-iTkE.yYilDdiEz.Bedpur.otrj)esiükyaeplesarimneındtaeşdeekskteükrlenemdeirşitzir.. Bu ç. alışma, bir Ericcson şirketi olan Bizitek’in 3110278 no’lu TÜBİTAK-TEYDEB projesi kapsamında desteklenmiştir.
.
Kaynaklar
[1] Amasyalı, M. F., KDiaryi,nBak.,la“rAutomatic Turkish Text
Categorization in Terms of Author, Genre and Gender”, [1] 1A1mthasIynatelır,naMtio. nFal.,CDonirfie,reBnc.,e “oAn uAtpomplaictiactioTnusrokfisNhatTuerxalt
LCaantegguoargizeattioon IinnfoTremramtisonof SAyusttheomr,s-GNeLnDreBa2n0d06G, enLdNeCr”S, V11otlhumInete3rn9a9t9io, n2a0l0C6.onference on Applications of Natural [2] LTaünrkgouğalgue, tFo., InDfoirrmi, atBio.n, ASymsatesmyasl-ıN, LMD.B2F0.0,6,“ALuNthCoSr AVtotlruibmueti3on99o9f, T20u0rk6i.sh Texts by Feature Mining”, Third [2] ITnüterkrnoağtliuo,naFl .C, onDfierrie, ncBe.,onAInmtaesllyiagleın, t MCo.mFpu.,tin“gA, uICthIoCr 2A0tt0r7ib, uQtiionngdoafo,TCurhkiinsah, LTNexCtsSbVyoFluemateur4e68M1i,n2i0n0g”7,. Third [3] IBnetekrkneartmioannal RC.o, nRfearnencEel-oYnaInnitve,lliNgaefnttalCi oTm.p, uYtinoagd, ICWIC., “2D00is7t,riQbiuntgiodnaaol, CWhionrad, LCNlCusSteVrsoluvms.e 4W68o1rd, s200fo7r. Text [3] CBaetkekgeorrmizaantioRn”.,, JRoaunrnaEll-oYf aMniavc,hiNneafLtaelairnTi.n,gYRoeasdearWch.,, “1D-4i8s,tr2ib0u0t2i.onal Word Clusters vs. Words for Text [4] CSoantegg,oFri.z,aLtiioun,”,SJ.,ouYrnanalg,of JM.,a“cAhinceomLepaarrnaitnivgeRsetusedayrcohn, t1e-x4t8, r2e0p0r2es. entation schemes in text categorization”, [4] PSaotntger,nFA.,nLaliuA, pSp.l,icY(a8n),g1, 99J–.,20“9A, 2c0om05p.arative study on [5] tÇeixlttikr,eApr.evseenGtaütinognör,scTh.e,m“eTsimien-EftfeixctienctatSepgaomrizaEt-imona”il, FPialttteerrinngAnUasliAngppNlic-g(r8a)m, 19M9o–d2e0l9s,”,20P0a5t.tern Recognition [5] LÇeiltttiekr,s A29. (v1e), G19ü-n3g3ö,r2, 0T0.8, .“Time-Efficient Spam E-mail [6] FCiilyteariLn.g, SUhsaimngimN-Ag.r,amPauMl oDd.e,ls“”F,eaPtautrteernPreRpeacroagtinointioinn LTeetxtterCs a2t9e(g1o)r,iz1a9t-i3o3n,”,20O0r8a.cle Text Selected Papers and [6] PCrieysaenLt.a,tiSohnas,m2i0m01A. ., Paul D., “Feature Preparation in
103 [7] TÖezxetl, CBa.t,eg“Korüizraetsieolnk”,-OOrrtaalcalme aTleı xGt rSueplleacmteadYPöanpteerms iainlde PMreestiennlteartiinonvse, T20er0i1m.lerin Saklı Anlam İndekslenmeleri”, [7] AÖSzeYl,UB, .I,st“aKnbüurel,sTelurkk-eOyr,ta2la2m3-a2l2ı 7G, r2u0p0l4am. a Yöntemi ile [8] MHoeltmineles,rinDv.e TI.e,rim“Tlehrein SEavkollıuAtinolnamoİfndSektyslloemnmeterlyerii”n,
[3] Be “D Cat 1-4
[4] Son tex Pat
[5] Çil Fil Let
[6] Ciy Tex Pre
[7] Öz Me AS
[8] Ho Hu Co
[9] Am “te Ya
[10] Be Eng
e yüksek temsil . Bunun andırma türdeki plarının için 17 uşan 77 u oluşan etoduyla çapraz larak nbaşarılı anabilir r olması yılabilir. olan TF
2007, Qingdao, China, LNCS Volume 4681, 2007.
[3] Bekkerman R., Ran El-Yaniv, Naftali T., Yoad W.,
“Distributional Word Clusters vs. Words for Text
Categorization”, Journal of Machine Learning Research,
1-48, 2002. [E4M] OSoBngili,mFs.,eLl iDu,eSrg., i,YCanilgt, 2,J.S,a“yAı 4co,mApraaralıtkiv2e0s1tu2dy on
text representation schemes in text categorization”,
Pattern Anal Applic (8), 199–209, 2005.
[5] Çiltik, A. ve Güngör, T., “Time-Efficient Spam E-mail
Filtering Using N-gram Models”, Pattern Recognition
Letters 29(1), 19-33, 2008.
[6] Ciya L., Shamim A., Paul D., “Feature Preparation in
Text Categorization”, Oracle Text Selected Papers and
Presentations, 2001.
[7] Özel, B., “Küresel k-Ortalamalı Gruplama Yöntemi ile
Metinlerin ve Terimlerin Saklı Anlam İndekslenmeleri”,
[8] Holmes, D. I., “The Evolution of Stylometry in
Humanities Scholarship”, Literary and Linguistic
Computing, 13 (3): 111-117, 1998.
[9] Amasyalı, M. F., Davletov, F., Torayew, A, Çiftçi, Ü,
“text2arff: Türkçe Metinler İçin Özellik Çıkarım
Yazılımı”, SİU, Diyarbakır, 2010.
[10] Berry, M. W., Browne, M., “Understanding Search
Engines: Mathematical Modeling and Text Retrieval”,
classification of Turkish texts”, INISTA, Istanbul,
Turkey, 112 - 117, 2011.
classification of Turkish texts”, INISTA, Istanbul, Turkey, 112TM- 1M17O, 2B01E1l.ektrik Mühendisleri Odası