Bilimsel Dergi · Cilt: 2 Sayı:2 · Aralık/2012

DERLEME MAKALE: TÜRKÇE METİNLERİN SINIFLANDIRILMASINDA METİN TEMSİL YÖNTEMLERİNİN PERFORMANS KARŞILAŞTIRILMASI

Bilgisayar, yazılım ve internet Teknik / bilimsel makale

Yıl
2012
Sayfa
10
Okuma süresi
31 dk
Görüntülenme
0

Konu

Bilgisayar, yazılım ve internet

İlgili: Mühendislik eğitimi

Anahtar kelimeler

  • doğal dil işleme
  • metin sınıflandırma
  • n-gram
  • kelime kökleri
  • Zemberek
  • özellik çıkarımı

Özet

Bu derleme makalede, Türkçe metinlerin otomatik sınıflandırılmasında kullanılan 17 farklı metin temsil yöntemi (kelime kökleri, n-gramlar, kelime türleri, ekler, kelime kümeleme vb.) altı farklı Türkçe veri kümesi üzerinde karşılaştırılmış ve n-gram tabanlı yöntemlerin genel olarak daha başarılı sonuçlar verdiği bulunmuştur.

Tam metin

Metin PDF'ten otomatik çıkarılmıştır; tablo, şekil ve formüller eksik ya da hatalı olabilir. Özgün dizgi için PDF'e bakın.

Amasyalı M. F., Balcı S., Varlı E. N., Mete E., Türkçe Metinlerin Sınıflandırılmasında Metin Temsil Yöntemlerinin Performans Karşılaştırılması, Cilt 2, Sayı 4, Syf 95-104, Aralık 2012

Türkçe Metinlerin Sınıflandırılmasında Metin Temsil Yöntemlerinin Performans Karşılaştırılması

A Comparison of Text Representation Methods for Turkish Text Classification

M.Fatih AMASYALI 1, Sümeyra BALCI1, Esra Nur VARLI1, Emrah METE1

1Elektrik Elektronik Fakültesi, Bilgisayar Mühendisliği Bölümü Yıldız Teknik Üniversitesi mmffaattiihh@@ccee..yyiillddiizz..eedduu..ttr, [email protected], esraannuurrvvaarrllii@@ggmmaaiill..ccoomm,,eemmrraahhmmeettee@@ggmmaaiil.lc.coomm

Özet

Bir metnin sınıfına metnin hangi özelliklerine bakılarak karar verilebilir? Sınıflandırma probleminin türünün (metnin yazarını, yazarın cinsiyetini, yazarın ruh halini, metnin konusunu, metnin olumlu ya da olumsuz ifadeler içerdiğini tanıma) bu soruya verilecek cevaba etkisi nedir? Bu sorulara çeşitli cevaplar vererek, metin dosyalarının otomatik sınıflandırılması için uzun zamandır çalışmalar sürmektedir. Bu çalışmada çeşitli türdeki 6 adet Türkçe sınıflandırma veri kümesi üzerinde 17 adet özellik grubunun etkisi incelenmiştir. Çıkarılan özellik gruplarına örnek olarak; cümle, kelime, ek sayıları, ngramlar, kelimeler, kelime grupları ve saklı anlam indeksi verilebilir. Türkçe için bugüne kadar yapılmış en kapsamlı karşılaştırma çalışması sunulmuştur. Sonuçlarda n-gramların genel olarak diğer temsil yöntemlerinden daha başarılı sonuçlar ürettiği görülmüştür.

Anahtar kelimeler: Doğal Dil İşleme, Metin Sınıflandırma, Metin Özellikleri, Metin Temsil Yöntemleri

Abstract

Which features are the most important for text classification tasks? How does the type of text classification problem (authorship attribution, gender identification, mood identification, topic identification, sentiment analysis) affect the answer of this question? By giving various answers to these questions, the automatic text classification studies are ongoing for a long time. In this study, 17 text representation methods are compared over 6 different Turkish text classification tasks. Frequencies of the words, stem words, word phrases, n-grams, tokens, and word clusters, Latent Semantic Indexing are examples of the extracted text features. To the best of our knowledge, the most comprehensive study for Turkish text classification is presented. In general, n-grams were produced more successful results than the other text representing methods. Keywords: Natural Language Processing, Text Classification, Text Categorization, Text Features, Text Representation Methods

1. Giriş

Bir metnin yazarı, konusu, yazarının cinsiyeti, yazarının ruh hali otomatik olarak tahmin edilebilir mi? Bu soruya cevap arayan çalışmalar otomatik metin sınıflandırma adıyla anılmaktadır. Bu çalışmalarda önceden sınıfı belli metinlerin çeşitli özelliklerinin incelenmesiyle yeni gelen bir metnin hangi sınıfa ait olduğu tahmin edilmektedir. Ancak bunun yapılabilmesi için metinlerin hangi özelliklerinin inceleneceğine diğer bir deyişle metinlerin nasıl temsil edileceğine de karar vermek gerekir. Bununla birlikte, sınıflandırma probleminin türünün (yazar, konu, cinsiyet vb.) temsil yöntemine etkisinin olup olmadığı da ayrı bir araştırma konusudur.

Literatürde çeşitli metin sınıflandırma problemleri için birçok başarılı çalışma yapılmıştır. Bunlara örnek olarak yazar tanıma [1, 2], metin konusunu belirleme [3, 4], e-posta sınıflandırma [5], metnin yazarının cinsiyetini belirleme [1] verilebilir. Bu çalışmalarda her problem türü için çeşitli metin temsil yöntemleri önerilmiştir. En çok kullanılan yöntemler; kelime / kelime grubu frekansları [3], ngram frekansları [5, 6], kelime kümeleme [3], saklı anlam indeksleme [7] ve fonksiyonel kelimelerdir [8].

Bununla birlikte literatürde farklı problem türleri için, metin temsil yöntemlerinin detaylı bir karşılaştırılması bulunmamaktadır. Bu çalışmada, bu boşluğu doldurmak amacıyla literatürdeki birçok yöntem ve kendi önerdiğimiz (çok boyutlu ölçekleme ile anlamsal uzay [9], sınıf bilgisine dayalı kelime kümeleme) yöntemler, çeşitli veri kümeleri üzerinde karşılaştırılmıştır.

Veri kümesi olarak yazıdan ruh hali tanıma, film yorumlarında yönelim tespiti, köşe yazarlarını tanıma, yazarın cinsiyetini tanıma, şiirin yazarını tanıma, haberin türünü tanıma olmak üzere toplam 6 metin sınıflandırma koleksiyonu üzerinde çalışılmıştır. 2. bölümde bu veri koleksiyonları tanıtılmıştır. 3. bölümde karşılaştırılan metin temsil yöntemleri detaylı olarak anlatılmıştır. 4. bölümde deneysel sonuçlarda her bir veri koleksiyonu üzerinde hangi

metin temsil yönteminin (metin özellikleri) daha başarılı olduğu, genelde en başarılı yöntemler tartışılmıştır. Son bölümde ise sonuçlar tartışılmıştır.

2. Veri Kümeleri

Bu bölümde farklı uygulama alanlarına ait çeşitli veri kümeleri tanıtılacaktır. Tablo 1’de çalışmada kullanılan veri kümeleri verilmiştir.

Tablo 1: Çalışmada kullanılan veri kümeleri

Veri

Sınıf Top. Her

kümesinin say. örn. bir

ismi

say. sınıf.

örn.

say.

Ruh hali

157 38-

Film

yorumları

105 35

Köşe yazarı 18 630 35

Cinsiyet

105 50-

Haberler

1150 230

Şiir

140 20

Ort. kelime say.

Ort. cümle say.

247,1 28,1

49,3 4,8 398,5 45,3 377 54

204,8 17 79,5 7,4

Rast. Başarı %

25,48

28,57 5,56 52,38

20 14,29

Tablo 1’in son sütunundaki rastgele başarı yüzdesi verilerin hepsinin en çok örneği olan sınıfa atandığında elde edilen doğru sınıflandırma yüzdesidir. Kullanılan veri kümelerine www.kkeemmiikk..yyiillddiizz..eedduu..ttrr//??iidd==2288 adresinden erişilebilir.

Veri kümelerinin her birinin nasıl oluşturulduğu ve sınıf bilgilerinin içerikleri aşağıda anlatılmıştır.

Ruh hali: Çeşitli blog sitelerinden toplanan ve elle blog yazarının ruh halinin etiketlenmesiyle oluşturulmuştur. 4 sınıf içermektedir. Sınıf etiketleri neşeli, hüzünlü, sinirli, karışık şeklindedir.

Film Yorumları: Çeşitli sinema sitelerinden filmlere yapılmış yorumların toplanmasıyla ve beğeni yönleriyle etiketlenmesiyle oluşturulmuştur. 3 sınıf içermektedir. Sınıf etiketleri pozitif, negatif, tarafsız şeklindedir.

Köşe Yazarları: Çeşitli gazetelerin web sayfalarından 18 adet köşe yazarının 35’er köşe yazısının toplanmasıyla ve yazar isimleriyle etiketlenmesiyle oluşturulmuştur. Sınıf etiketleri yazarların isimleridir.

Cinsiyet: 5’er adet erkek ve kadın köşe yazarının 50-55’şer köşe yazısının toplanmasıyla ve yazarlarının cinsiyetleriyle etiketlenmesiyle oluşturulmuştur. Erkek ve kadın olmak üzere 2 sınıf etiketi içermektedir.

Haberler: Gazetelerin kategorilere ayrılmış haber sayfalarında 5 farklı konuda toplanmış 1150 haber içeren bir veri kümesidir. Sınıf etiketleri Ekonomi, Magazin, Sağlık, Siyasi, Spor şeklindedir.

Şiir: 7 şaire ait 20’şer şiirin toplanması ve şair adlarıyla etiketlenmesiyle oluşturulmuştur. Sınıf etiketleri şairlerin isimleridir.

3. Karşılaştırılan Metinlerin Temsil Yöntemleri

Bu bölümde literatürde sıklıkla kullanılan ve bizim önerdiğimiz metin temsil yöntemleri anlatılmaktadır.

3.1. Frekans Hesaplamalarında Kullanılan Metotlar

Bu bölümde anlatılacak olan Kelime Kökleri, Kelime Türleri, Ngramlar, Fonksiyonel Kelimeler, Kelime Ekleri, Kavram Genelleştirme özellik grupları için frekans hesaplamasında kullanılmak üzere TF, TFIDF, binary, log, normalize1 ve normalize2 olmak üzere 6 farklı metot kullanılmıştır [10]. i indisli özelliğin j indisli metnindeki TFIDF değeri Eşitlik 1’deki gibi hesaplanır.

TR TFIDF (i, j)  TF (i, j)  log

(1)

TR(i)

Eşitlik 1’de TF(i,j), i indisli özelliğin, j indisli metninde yer alma sayısıdır. Toplam metin sayısı TR ile, içinde en az bir kere i özelliği geçen metin sayısı TR(i) ile gösterilmiştir. Örneğin i özelliği “gr” 2gramı ise, TF(i,j), “gr” ifadesinin j metninde yer alma sayısı olacaktır. i özelliği “isim” kelime türü ise TF(i,j); j metninde geçen isim türündeki kelime sayısı olacaktır.

Binary(i,j): i indisli özellik j indisli metin yer alıyorsa değeri 1, yer almıyorsa 0’dır.

Log(i,j): Eşitlik 2 ile hesaplanır.

Log(i, j)  log10(TF (i, j) 1)

(2)

Normalize1(i,j): TF(i,j)’leri, metindeki toplam kelime

sayısıyla normalize edilmesiyle Eşitlik 3’teki gibi hesaplanır.

N1(i, j)  

TF (i, j ) 1 / 2

(3)

 

(i

 

j

Normalize2(i,j): TF(i,j)’leri, kelimenin toplam geçiş

sayısıyla normalize edilmesiyle Eşitlik 4’teki gibi hesaplanır.

N 2(i,

j)

TF (i , j )

 

(

i

1 

/

(4)

i

3.2. Sayılar Özellik Grubu

Metinleri içerdikleri noktalama işaretleri sayıları, kelime sayıları, cümle sayıları, devrik cümle sayıları, harf sayıları, ek sayıları, cümlelerdeki ortalama kelime ve harf sayıları, kelimelerdeki ortalama harf ve ek sayılarıyla ifade eden 19 adet özellikten oluşan özellik grubudur.

3.3. Kelime Kökleri

Metinlerin içerdikleri kelimelerle ifade edildikleri, literatürde en yaygın kullanılan özellik grubudur. Metinler tüm metinlerde en az bir kere geçen farklı kelime sayısı boyutlu bir uzayda ifade edilir. Türkçe gibi eklemeli

Amasyalı M. F., Balcı S., Varlı E. N., Mete E., Türkçe Metinlerin Sınıflandırılmasında Metin Temsil Yöntemlerinin Performans Karşılaştırılması, Cilt 2, Sayı 4, Syf 95-104, Aralık 2012

dillerde, kelimelerin kendilerini kullanmak farklı kelime sayısını çok fazla arttırmaktadır. Örneğin insan, insanlık, insanlığa, insanlığım kelimeleri farklı kelimeler olarak ele alınırsa metinlerin ifade edildikleri uzayın boyutu çok büyük olmaktadır.

Literatürde bu probleme çözüm olarak sadece kelime köklerinin kullanılması önerilmektedir [11]. Bu sayede hem aynı anlama işaret eden kelimelerin birleştirilmesi (böylelikle metinler arası benzerliğin daha iyi ifade edilmesi sağlanmakta), hem de özellik boyutunun azaltılmasıyla işlem karmaşıklığının azaltılması sağlanmaktadır. Kelimelerin köklerinin bulunması için Zemberek [12] kütüphanesi kullanılmıştır.

3.4. Kelime Türleri

Metinleri içerdikleri kelimelerin türlerinin (isim, sıfat, zamir, edat vb.) frekanslarıyla ifade eden özellik grubudur. Kelimelerin türlerinin bulunmasında Zemberek kullanılmıştır. Toplam 15 tane kelime türü vardır. Buna göre her metin içerdiği isim, sıfat, vb. türündeki kelime sayılarıyla ifade edilmektedir.

3.5. Harf ve Kelime Ngramları

Metinlerin içerdikleri ngramlar ile ifade edildiği özellik grubudur. Ngramlar N boyutlu karakter ya da kelime çerçeveleridir. Örneğin “gitmek” metni için:

Harf 2 gramları: gi – it – tm – me – ek Harf 3 gramları: git – itm – tme – mek şeklindedir.

Metinlere ait 2 ve 3 harf gramları, 2’li kelime ngramları çıkarılmıştır. Çok seyrek frekans matrisleri üretiyor olmaları sebebiyle, daha büyük pencere boyutuna sahip ngramlar kullanılmamıştır.

3.6. Fonksiyonel Kelimeler

Fonksiyonel kelimeler esasen tek başlarına anlamları olmayan, ancak yazarların üsluplarının belirlenmesinde önemli oldukları düşünülen bağlaç ve edat türündeki kelimelerdir [8] (ve, daha, gibi, de, için vb.). Metinler bu özellik grubunda, önceden belirlenmiş 620 fonksiyonel kelimeyle ifade edilmektedirler.

3.7. Kelime Ekleri

Metinlerin içerdikleri kelimelerin aldıkları eklerin türlerine göre ifade edildikleri özellik grubudur. Türkçe eklemeli bir dil olduğundan anlamın oluşmasında eklerin önemi büyüktür. Kelimelerin eklerinin belirlenmesinde Zemberek kullanılmıştır. Zemberek toplam 126 farklı ek türü çıkarmakta ve dolayısıyla metinler bu 126 ek türünü içermelerine göre sayısallaştırılmaktadırlar.

3.8. Kelime Kümeleme

Bu özellik grubunda, metinlerde geçen yakın anlamlı kelimeler birleştirilip tek bir küme, tek bir özellik haline getirilmektedir [3]. Bu sayede hem boyut sayısı azaltılmakta hem de benzer anlama sahip kelimeler tek bir kavram olarak kullanıldığından metinler arası ilişkilerde artmaktadır.

Örneğin hayvan kavramına ait kelimeler (at, kedi, deve vb.) aynı kümede yer alırlarsa, sadece “at” kavramını içeren ve sadece “kedi” kavramını içeren iki metin aynı özelliğe “hayvan” sahip olacaklardır. Bir kelime kümesinin bir metindeki frekansı, küme içindeki kelimelerin o metindeki geçiş sayılarının toplamıdır.

Kelime kümelerinin belirlenmesinde 4 kaynak kullanılmıştır: TF matrisi, TFIDF matrisi, Cooccurance (birlikte geçme) matrisi ve sınıf bilgisi. TF ve TFIDF matrisi 3.1. bölümde, Cooccurance (birlikte geçme) matrisi 3.9. bölümde, sınıf bilgisi 3.14. bölümde anlatılmıştır. Kelimelerin bu kaynaklar kullanılarak kümelenmesi için 3 algoritma kullanılmıştır.

1. Hiyerarşik Kümeleme: Her bir adımda birbirine en çok benzeyen iki kümenin birleştirildiği algoritmadır [13]. Başlangıçta her bir örnek ayrı bir kümeyi ifade eder. Kümelerin birbirine benzerliklerinin ölçülmesinde 3 yol izlenmektedir. A) En Yakın: Kümeler birbirine en yakın elemanları kadar yakındır. B) Ortalama: İki kümenin her bir elemanının diğer kümenin her bir elemanıyla arasındaki mesafelerin ortalaması ile yakınlık ölçülür. C) En uzak: Kümeler birbirine en uzak elemanları kadar yakındır.

2. K-means: Veri dağılımını en iyi temsil edebilecek küme merkezlerini bulunmaya çalışır [14]. Başlangıçta küme merkezleri rastgele atanır. Küme merkezlerinin kendi kümelerindeki elemanlara olan ortalama mesafesi iterasyonlar ilerledikçe azalır.

3. SOM: Bu algoritmada veri dağılımını en iyi temsil edebilecek küme merkezlerini bulunmaya çalışır. Küme merkezleri başlangıçta yine rastgele atanır. Buna ek olarak merkezler birbirlerine rastgele bağlanırlar. Her bir küme merkezinin güncellenmesinde ona bağlı olan diğer küme merkezleri de güncellenir. Bu sayede hem verileri ifade edecek küme merkezleri hem de verinin topolojisi bulunmaktadır [15].

3.9. Birlikte Geçme Matrisi

Birlikte geçme matrisi metinlerdeki farklı kelime sayısı boyutlu simetrik bir matristir. Matrisin i,j hücresinin değeri, i. kelime ile j. kelimenin eğitim metinlerinden kaçında birlikte geçtiğini ifade etmektedir. Birlikte geçme matrisi kelime kümelemede (Bölüm 3.8) ve anlamsal uzayda (Bölüm 3.12) kullanılmaktadır.

3.10. Kelime Filtreleme

Her metinde geçen kelimelerin ayırt ediciliği azdır. Buna karşın çok az metinde geçen kelimeler de gereksiz yere boyut sayısını arttırabilirler. Bu nedenlerle metinlerin ifadesinde kullanılan kelimeler, frekansa dayalı bir filtreden geçirilmişlerdir. Kelimeler belirlenen minimum ve maksimum geçiş sayılarına göre filtrelenmiştir.

3.11. Saklı Anlam İndeksleme

Bu yöntem, sınıf bilgisini kullanmadan metin-kelime matrisi (A) üzerinde Eşitlik 5’teki Tekil Değer Ayrıştırma (Singular Value Decomposition) işlemini yaparak metinlerin boyut sayısını azaltır [7].

Amn  U mk .Skk .VnTk

(5)

Bu işlem sonunda S matrisinde, özvektörlerin özdeğerleri

diagonalde büyükten küçüğe sıralanmış olur. Seçilen boyut

(k) adedi işleme alınarak, A matrisi m*n’lik bir matristen

(mmetin sayısı, n farklı kelime sayısı), m*k’lık (k

metinlerin yeni boyut sayısı) bir matrise dönüştürülür. Tekil

Değer Ayrıştırma için JAMA kütüphanesi [16]

kullanılmıştır.

3.12. Anlamsal Uzay

Bu özellik grubunda, metinlerin anlamsal bir uzaydaki koordinatları bulunmaktadır [17]. Bunun için önce metinleri oluşturan kelimelerin anlamsal uzaydaki koordinatları bulunup, daha sonra, metinlerin koordinatları; içerdikleri kelimelerin koordinatlarının ortalaması alınarak hesaplanmaktadır. Kelimelerin sayısal koordinatları, kelimelerin birbirlerine anlamsal yakınlıklarıyla uyumlu olarak bulunmaktadır. Buna göre birbirine anlamsal olarak yakın 2 kelimenin bulunan koordinatları arasındaki Öklid mesafesi de küçük olmaktadır. 2 kelimenin birbirine anlamsal yakınlığının ölçütü olarak Harris’in [18] yaklaşımı kullanılmıştır. Buna göre 2 kelime ne kadar çok birlikte kullanılıyorsa birbirlerine anlamsal olarak o kadar yakındır. Kelimelerin bu yakınlıklarını ölçmek için birlikte geçtikleri metin sayıları hesaplanmış ve Bölüm 3.9’da anlatılan Birlikte Geçme Matrisi’ne yazılmıştır.

Literatürde aralarındaki 2’li uzaklıklar bilinen kavramların

bu uzaklıklarla uyumlu koordinatlarının bulunması için Çok

Boyutlu Ölçekleme (Multi Dimensional Scaling) [19]

yöntemi kullanılmaktadır. Bu yöntem uzaklıklar üzerinde

çalıştığından bir yakınlık ölçütü olan Birlikte Geçme Matrisi

Eşitlik 6’daki gibi tersine çevrilerek uzaklık ölçütüne

dönüştürülmüştür.

dis(i, j)  1

(6)

sim(i, j)

Eşitlik 6’da, dis(i,j); i. ve j. kelimeler arasındaki uzaklığı, sim(i,j) ; i. ve j. kelimelerin birlikte geçtikleri metin sayısını göstermektedir. Bu yeni matrise Çok Boyutlu Ölçekleme uygulanarak kelimelerin koordinatları bulunmuştur. Çok Boyutlu Ölçekleme için MDSJ Kütüphanesi [20] kullanılmıştır. Metinlerin koordinatları ise daha önce de belirtildiği gibi içinde geçen kelimelerin bu anlamsal uzaydaki koordinatlarının ortalaması alınarak bulunmuştur.

3.13. Kavram Genelleştirme

Kelimelerin anlamlarına göre hiyerarşik bir yapıda düzenlendikleri Wordnet, Conceptnet gibi birçok çalışma mevcuttur. Türkçe için ise benzer yapıda hazırlanmış Türkçe Wordnet [21] bulunmaktadır. Bu özellik grubunda, bu hazır, sabit, eğitim kümesinden bağımsız veri kaynakları, kelimeleri bir üst kavramlarıyla ifade etmede kullanılmıştır. Bu sayede kelime kümelemede olduğu gibi, hem metinlerin boyut sayısı indirgenmiş, hem de metinlerin içerdikleri kavramlar daha anlamsal bir şekilde ifade edilmiş olmaktadırlar.

Kelimeleri bir üst kavramlarıyla ifade etme (genelleştirme) işlemi için 2 veri kümesi kullanılmıştır. İlki Türkçe

Wordnet’ten çıkarılmış 15018 adet kavram-üst kavram ikilisidir. İkincisi ise Zemberek’in kütüphanesinden alınan özel isimler listesidir. Eğer bir kelime kavram–üst kavram ikilileri listesinde kavramlar içinde yer alıyorsa onun yerine karşılık gelen üst kavram kullanılmıştır. Eğer bir kelime özel isimler listesinde yer alıyorsa onun yerine “insan” kavramı kullanılmıştır.

3.14. Sınıf Bilgisiyle Kelime Kümeleme

Bizim önerdiğimiz bu yöntemde, öncelikle kelimelerin her sınıftaki frekansları bulunarak kelimeler sınıf sayısı boyutlu bir uzayda birer noktaya dönüştürülmektedir. Daha sonra kelimeler, bu boyutları üzerinde 3.8. bölümde anlatılan kümeleme metotlarıyla sınıf sayısı adet kümeye ayrılmaktadır. Bu işlem sonunda her bir kelime sınıf sayısı adet kümeden birine ait olmaktadır. Metinler ise, sınıf sayısı adet kümenin frekanslarıyla ifade edilmektedirler. Bir kümenin bir metindeki frekansı, o kümede bulunan tüm kelimelerin o metindeki frekanslarının toplamıdır. Bu sayede metinler kelime sayısı adet boyut yerine, sınıf sayısı adet boyutla ifade edilmiş olmaktadır.

4. Deneysel Sonuçlar

Bölüm 2’de tanıtılmış olan 6 veri kümesi için, Bölüm 4’te anlatılan özellik gruplarının çeşitli konfigürasyonlarıyla arff’ler üretilmiştir. Özellik gruplarının her birinin çeşitli konfigürasyonları bulunmaktadır. Tablo 2’de özellik gruplarının (metin temsil yöntemlerinin) adları ve yazının bundan sonraki kısmında kullanılan kısaltmaları verilmiştir.

Tablo 2: Özellik gruplarının isim ve kısaltmaları

Kısaltm a Say 2G 3G K2G KE KT FK KGI

KGO

KK

KKHAL

KKHCL

KKHSL

KKK KKS

MDS

LSI

Açıklama

Sayılar Özellik Grubu (Bölüm 3.2) Harf 2 gramları (Bölüm 3.5) Harf 3 gramları (Bölüm 3.5) Kelime 2 gramları (Bölüm 3.5) Kelime ekleri (Bölüm 3.7) Kelime Türleri (Bölüm 3.4) Fonksiyonel kelimeler (Bölüm 3.6) Kavram genelleştirme isim tabanlı (Bölüm 3.13) Kavram genelleştirme özel isim tabanlı (Bölüm 4.13) Kelime kökleri Hiyerarşik kelime kümeleme (küme benzerlikleri ortalamaya göre) (Bölüm 3.8) Hiyerarşik kelime kümeleme (küme benzerlikleri en uzak elemanlara göre) (Bölüm 3.8) Hiyerarşik kelime kümeleme (küme benzerlikleri en yakın elemanlara göre) (Bölüm 3.8) Kmeans ile kelime kümeleme (Bölüm 3.8) SOM ile kelime kümeleme (Bölüm 3.8) Birlikte geçme matrisi tabanlı anlamsal uzay (Bölüm 3.12) Saklı Anlam İndeksleme (Bölüm 3.11)

Amasyalı M. F., Balcı S., Varlı E. N., Mete E., Türkçe Metinlerin Sınıflandırılmasında Metin Temsil Yöntemlerinin Performans Karşılaştırılması, Cilt 2, Sayı 4, Syf 95-104, Aralık 2012

Tablo 3’te kelime Türleri, 2 gram, 3 gram, Fonksiyonel kelimeler, kelime 2 gramları, kelime ekleri, kavram genelleştirme isim, kavram genelleştirme özel isim, kelime kökleri olmak üzere toplam 9 özellik gruplarının her biri için kullanılan 6 frekans hesaplama yöntemi ve yazının bundan sonraki bölümlerinde kullanılacak olan kısaltmaları verilmiştir.

Tablo 3: Frekans hesaplama için kullanılan yöntemler

Yöntem

Binary Log N1 N2

TF TFIDF

Açıklama Bir kavram metinde geçiyorsa 1 geçmiyorsa 0 (Bölüm 3.1)

Eşitlik 2.

Eşitlik 3.

Eşitlik 4. Bir kavramın bir metindeki geçiş sayısı (Bölüm 3.1)

Eşitlik 1.

Tablo 4’te kelime kümelemede, KKHAL, KKHCL, KKHSL, KKK, KKS olmak üzere toplam 5 metodun her biri için kelimelerin kümelenmesinde kullanılan 4 matrisin isimleri ve kısaltmaları verilmiştir.

Tablo 4: Kelime Kümeleme için kullanılan matrisler

Yöntem Cooccurance Snf mTF mTFIDF

Açıklama Kelime kümele Birlikte geçme matrisine göre (Bölüm 3.8 ve 3.9) Kelime kümele sınıf bilgisine göre (Bölüm 3.14) Kelime kümele TF matrisine göre (Bölüm 3.8) Kelime kümele TFIDF matrisine göre (Bölüm 3.8)

Kelimelerin kümelenmesinde küme sayısı 50 olarak belirlenmiştir. LSI ve MDS için metinlerin ifade edileceği boyut sayısı 50 olarak belirlenmiştir. MDS’te ve birlikte geçme matrisinin kullanıldığı her yöntemde yakınlıktan uzaklığa geçiş için Eşitlik 6 kullanılmıştır. Say özellik grubu için değişken bir parametre kullanılmamıştır.

Üretilen tüm metin temsil yöntemleri WEKA [22] ile birlikte kullanılabilmeleri için arff formatında kaydedilmiştir. Sonuç olarak 6 veri kümesi her biri için ( 9*6 ) + ( 5*4 ) + 3 (LSI, MDS, Say) =77 arff, toplamda 77*6 = 462 arff üretilmiş ve her arff üzerinde 5’li çapraz geçerlemeyle WEKA kütüphanesinde yer alan 5 adet sınıflandırıcının (en yakın komşu-1NN, karar ağacı-C4.5, destek vektör makineleriSVM, Naive Bayes-NB, Random Forest-RF) performansı ölçülmüştür. Özellik gruplarının sınıflandırma performanslarını gösteren tablolardaki (Tablo 5-10) tüm değerler 5’li çapraz geçerlemenin ortalama değerleridir.

Üretilen arff’lerin özellik sayısı (boyutu) 5000’den fazla olanlarda zaman ve hafıza problemlerinden ötürü özellikler önce InfoGain [23]’lerine göre sıralanmış daha sonra en yüksek IG’e sahip 100 özellik seçilerek arff bu haliyle

kaydedilmiştir. Sonuç tablolarında (Tablo 5-10), kullanılan 5 algoritmadan en yüksek performansa sahip olanının adı ve başarı yüzdesi verilmiştir. Özellik sayısı 101 olan kayıtlarda orijinal özellik sayısı 5000’i aştığından bilgi kazancına göre özellik seçimi yapılmıştır. arff dosya formatında sınıf bir özellik olarak yer almaktadır. Buna göre özellik sayısı d olan bir veri kümesinde, d-1 adet özellikle sınıf etiketi tahmin edilmektedir.

4.1. Şiir Veri Kümesi Denemeleri

Tablo 5’te bir şiirin yazarını tahmin etme problemi üzerinde yaptığımız denemeler verilmiştir.

Tablo 5: Şiir veri kümesinde her bir özellik grubunun en başarılı olduğu konfigürasyon ve başarı yüzdeleri, rastgele başarı % 14,29

Özellik Grubu 3G KKHCL 2G KKK Say KGI KGO KKS LSI KK FK KE KT KKHAL KKHSL MDS K2G

Konfi gürasyon Binary Snf N1 Snf

Binary Binary Snf

Binary N1 TF Log mTFIDF Snf

Özellik sayısı 101 8 1670 8 20 1829 1672 8 51 441 410 102 16 51 8 51 21

Başarı yüzdesi 75,29 67,86 63,86 62,29 53,29 48 43,71 41,86 41,71 40,57 36,14 33,57 32,29 30,71 29,14 28,71 18,86

Sınıflandırıcı NB 1NN SVM RF RF NB NB NB RF NB RF NB SVM RF 1NN SVM C45

Tablo 5 incelendiğinde bir şiirin yazarını tahmin etmede en başarılı metin temsil yönteminin (özellik grubunun) 3gramlar’ı binary olarak kodlamak (3G-Binary) olduğu görülmektedir. Veri kümesi için üretilen tekil 3gramların sayısı 5 bin’i geçtiğinden özellik seçimi yapılmış ve bilgi kazancına göre en iyi 100 adet 3gram metinlerin temsilinde kullanılmıştır. 7 şaire ait 20’şer şiirle elde edilen sonuçlara göre bir şiirin yazarı % 75,29’luk doğrulukla tahmin edilebilmektedir. En başarılı 2 yöntem (3G-Binary, KKHCLSnf) arasında oldukça büyük bir fark bulunmaktadır.

Tablo 6’da bir köşe yazısının yazarını tahmin etme problemi üzerinde yaptığımız denemeler verilmiştir.

Tablo 6: Köşe Yazarı veri kümesinde her bir özellik grubunun en başarılı olduğu konfigürasyon ve başarı

kınlıktan ik grubu birlikte r. Sonuç + 3 (LSI, ilmiş ve

WEKA en yakın kineleriformansı andırma 10) tüm ir.

en fazla zellikler onra en haliyle

Tablo 5 incelendiğinde bir şiirin yazarını tahmin etmede en başarılı metin temsil yönteminin (özellik grubunun) 3gramlar’ı binary olarak kodlamak (3G-Binary) olduğu görülmektedir. Veri kümesi için üretilen tekil 3gramların EksaMayzıaOsnıcıB5nialbimignö’srieegleeDnçteiiyğrigin1id,0eC0n ialötdze2etl,l3iSkgarasymeıç4imm, eiAtiyrnaalpelırıklimn2ıtş0em1v2esilbinildgei kullanılmıştır. 7 şaire ait 20’şer şiirle elde edilen sonuçlara göre bir şiirin yazarı % 75,29’luk doğrulukla tahmin edilebilmektedir. En başarılı 2 yöntem (3G-Binary, KKHCLSnf) arasında oldukça büyük bir fark bulunmaktadır.

Tablo 6’da bir köşe yazısının yazarını tahmin etme problemi üzerinde yaptığımız denemeler verilmiştir.

Tablo 6: Köşe Yazarı veri kümesinde her bir özellik grubunun en başarılı olduğu konfigürasyon ve başarı

Özellik Konfi Özellik Başarı Grubu gürasyon sayısı yüzdesi Sınıflandırıcı

3817 93,78 SVM

3KFKKSKLKKMKKKKKKKSÖFK32GKKLKKMKK2ÖG3SKFKKLKKMKKGGGaKKaSSK2KKTEKKGKGKGGrzKKE2KGGaKSDDrzKGGKKE2KyyuIeIDGGyueISHHHKOIIOKHSGblSSOIKHSblSluACSlCiuCikLkLLLL

LLBLLgKLLBgBLLKüooooooiioüooinnorggggggnnrggaanaafasrrfisryyyiyyoonn SLLLLnoooofgggg SLLnoofgg LSSnongff

BLmSLSLnooiTnongfgfgFarIDy F mCBmBmoiTTinTnFFaFarIIrIDDyDyFFF

55454112514118545Ö4234s18515141434Ö45s1285151144a131100429310976170034801919312az34078001919321yz704804018004047ye00841047ıe7ısl7sllıliıikk 5546866777885536By87789786656565788y8B9776656556ü633755603391593196353913563331aü19563933563313az,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,şz8145511447704966,,,,,,,,,,,,,,67474765441890şda77466745441809d179768944587819a8988869917745er6898889917457erısısii

SVM RNSRRSRRSNSNRSSSSSSSSSRRRRNSNRSSSRSSSSRRNRNSRVVVVVVVVVVıVVVFFFFFFFFFFFBBBBBıVVVVVVVnFFFFFBBnMMMMMMMMMMMMMıMMMMMMMıffllaannddıırrııccıı

TKKabTTlo 6 incLeLlooeggndiğinde11b66ir köşe55y00a,,5z51ı1sınınNNyBaBzarını tahmin

eKtKmKKeHdHeAALLen mmTbTaFFşIaIDDrıFFlı m551e1tin tem447s7i,,1l177yöntSeSVmVMiMnin (özellik

ggKröKurKKbüHulHmnSSueLLnk)te2dgCiCrro.aom18lark’öışLeo5yg5a11zoalarırnaıknk333o55d5,’l,1ş1ae4m4r aykazRı(Rs2FıFGyl-aLeolgd)eoelddiulğenu

kkd(Şks(egdTgs(Tgedgs22ootröüöoöoi2aotrömouGiGnanğğrşmşmbuGrnğrbbüuueerrle-l-büureeeuul-uloçLçLduulomçLyrmdllllnmyoeoilulnuaaaeonuau6aeggirrkuzk6egzzrnkka,a,alnkla,dı)tleyaia33rl)teeaine3anaıeGnG2ndcgGg2rzdttcgvgiıe-taö-aöagier7n-aöerLLlhrhrrr.Lbaleıhrr.lebeoaoemmnimaaenomm1aggnşşr1gdikiş)8al)dıainny8l)iabbnaüniiarbğaaarrkriiğıaımrkriri’rrznıleeöir’nraaılıeöanaedıdış(sdsdrLşdsmedsiiııLkkleeillınnkıoeaomleeönöoniymeddögrğyzbbşdşgbıaıbeaaşbdarfeineieaziote)uillzioertıiabblmmlrianbnmlarünüa1ryyktüıvereykyyıarneaa8aökykaynaaüühökıkzzütrşütıknzktkmşetıyıednekezıesskemdadısk3dmıbıbidro3zıbininyo5e.isiinrrday5siırırradi.s.’ırnnrali.’lşziynflfal(SşzfeaaEıaEüsmeıaEsır%mrırsznnnryıyrynkknaıyyndykıaaöanıykaföaıefbbzzknbbıan9bz)nzbsaanuutazaa3uiıtsare(rllvışşse(ryı,2ılauuşsmayaı2ı7au%mayaıGynnrarrG8ynizırlıımkm%%iznsl-’aılaml%n-aaLleıdııi7rLaaıninrenaıio5nekkıonrı22l,kgn,n2l.dt9t9gı2dt9aa)ışe33a)(9yedydÜ3i(töoyd,,iatööaöoeıı7,7röalzesır7rrhdnilnzd8r8.te.hdtnkd8ve.meittmu’’lmitleeue’lellllleğelliimiinmğıeriiimkknknukşi,nknuk

yyvssadootypT4ykosykvadtokŞysyyotvkkasodŞküüaööaiaaaiaalalallur.uöüöüiaöaiaaatllatmm3öüuömmrriğoğizzzzzzzrrrtrmşşmmbrğillrzzzzrk.şmrşklabıalöaıauöulreeeelaakaallaıaalöualeeelerreerraalrmormalraassHssseerresmmlelrmllranniniynrmsssmrrııllııaayaaaaniynrmnnmidrdııdnayaandıeaıe,,anıiırrnrarndnadnıen,neie7ışunrraşzuknkaııaıııınibezziazşuakaıkrııkrndndzaz’rradkrkındk.a.tetgrürgyrdös.dös.ıaırıakl.tllgyraeös.aarıaanrlnaaıöaöazlaanenoşeoşaanaVaıVöaBğBağdndolşrzyeyrreVrreBlğldverzyırremmıealıeaaaaırvıeueuı7nmıreaaeaılldeudirbn7rbrbeççyyladanıerrreblçbybaaaiıyiVreyiondoadailiirereabanndyrinlodlahiiheyreaeyeıneışzkzkuğulğirihey,,eeeışddkzkuliğrliairaarrıa,dkereryliiaairrrıa.nb.bııüeriyhtriutrruryn.brıürariritruaraılallarlmarddar.am.maaızlanalmeaebdbhh.mşKşaznaebapabbblhlaİşİVrVnrneaaaambmlaamam(İkVrknhehıeıtairaimam(üemkerdsrşhşınrnıirreelimieradrsaşınıiiğrbıaaelbaaai2n2mnoaaarırninnınbaanai2noardrırdnirniiniicğşcşzırdımrilıilığıcşzmeıaıaaıaieniendırlıiflaıilaffknkıağağeindrfilasyıfnyı)ukçiaçiaddğıieiüyıı)uüeçiarıdrıidedizototızıızüneerınndiiottımkzmkneaaanralDrlin1nmnmkmtttvddadarl3a13anslslmtçtçaavad83aesileaaaçaayaeaaeaaa585ııhhiehinaayaaaül5ülmrmıhkrühinkrnynny’’ülermemmümikrynydtts’svssvoemelozmeelyndetmmrrssvaaaozelaılölömedrerrmrraaiiiiimaılöruudezrrşmşimiinnnnnzrzuııez.şmnonngogzbaibiıeş.şeöçödkçdogeabsiiişaaöleçlerdusulirrııriareyollereaoaou(Sertıtikrkyleelseeasnon(Süstbnikbilleeslenraaüsıdadrbaişrşr%leekmekmıazıiudranirşr%ekmıiininnarairzivinirklkluiuidiinnslslarsiılılklıiiauiianadiınasleeeılıfeleelillrariueınarrfesfseetlltalraelbbrf9.v.vlb)lbsstıanlıab9aıı.vi)lbenensıinian3aıaiiileynsynnuin3llairbvrbillsmynrara,şlşaivirbaalememddra,ö7aşaödeider%ariemidy7zaözde%riı.iıi.irykz8kzzııaeaeıtı.şağiarğr8rkzkırraeıeebasğblr’lklİtliİsrisrrıeısb’leeelİdıeilsiletllrth7ıaalilieedıkellnktkrl7klanlnniaanrrinkşmkş5lisi2sn.n2anriirıidiş5dirimsrkm2,kevevöröıidi,n.r0m,k0eıvıöe,eni2.l0luuısnbsznbzeş2n’el’eeue,sn,bzş9ıı’erÜreişışu,ıu9ddroırÜonrnişiuıuuadereosnsddiurailisleıısdrllrrairaeisklakaıkkfekkfrektluuitrakkakkfektlnvlnteutnkmnöööşööşvlnyeayammnebböööşelaabyabaeiaibşşşşşeolroraibnaıiiiiirtşşştorikunkukeeaeeeaıeşiirrrrrtrııiku,keeaeşrrrıi,

44..33.. HHTaaabbbeelrorlle7err: VHVeaerbrieiKrKleüürmmveeesrsiiiDkDüeemnneeemsmineeldleerrihier bir özellik

100 TpTpraroabobblbllogloeremum7bi7i’u’üdüdnzezeueenrribinbeniydinrdrüeebzhydahyaaeşaabpalbpeertetırırığlirğı,ıımormmmalıdseızetztugtndğndeieuinelnnenikeinenbommaneşkfeklaiolegorenrıünrurvu%vsaesuesur2nyrinilo0ulmunmivitştşateatihirhbrm.m.aişinanrıeettmmee

ÖGrzueblgluriTukTababublnlouoKgn7ü7o:re:naHnfHsiaybaboabneşerarlrleıerlrıvÖsvoeaelzrydreiıiuslklkğıiüukümmkeoesBysniüinafnzidşgddaeüeerrıhshaieseryrbobSniirırnvöıöefzzlebaelnalllişdikakırıcı

durumdur. Bu duruma 2 açıklama getirilebilir. İlki sınıflara ait örnek sayılarıdır. Veri kümelerinde şairlere ait 20’şer şiir varken, köşe yazarlarına ait 35’er örnek vardır ki bu köşe yazarlarının daha başarılı tahmin edilebilmesine olanak syaağzlıalamrıınşdanolabçiolTkiMr. MdaİkhOianBcifEazlealaçkıtkrsliaökmzMa süainhsaeetınnaşdiiirsblleearşrdvieuO,rudlkuaöyşoserı olmasıdır. Ve eğer bir şairin üslubu kullandığı söz sanatı türlerine göre belirlenebiliyorsa ve çıkarılan özelliklerde bu söz sanatları yer almadığından şiirlerin yazarlarını köşe yazarları kadar iyi tahmin edemiyor olabilir.

4.3. Haberler Veri Kümesi Denemeleri

Tablo 7’de bir haber metninin konusunu tahmin etme problemi üzerinde yaptığımız denemeler verilmiştir.

Tablo 7: Haberler veri kümesinde her bir özellik grubunun en başarılı olduğu konfigürasyon ve başarı yüzdeleri, rastgele başarı % 20

KGÖGzrueOblluik LgKüoorgnafsiyon 7sÖa1zy9eısllıik 9Byü1az,ş1da3erısi RSıFnıflandırıcı

K2GGI

7326498 9904,,8554 RSVFM

3KGK

180614

9902,,4673 RRFF

MKKSFKKLKKKKKKFKLKKKMKK3KMK3KKLKKKKFGaKKSSKK2EKKKTGGKK2KEKGKSDDGKGKKKE2yIIDGGIKHHSHHIHKSOGSSOKIHHSSCASACCALLLLLLL

SSmNNLLNNnno11To11ffggFIDF

TLmSmSSSmnnoFTTnnTgffIffFFDFIIFIDDDFFF Nmm1TTFFIIDDFF CLLNTNTLooFo1oF1ggIgIDDFF

565151465211547155117166517761465511130117102600721131121012173102410141409194140

886677884565678979689868899987887666972533177786023015937178900173172538,,,,,,,,,,,,,,,,,,,,,,,,85,,,,684462,000,,,2,,,,848644860215848154624860411448356821744531845312475318354142

RRRRRRRRCRSSRRRRRRRRSRRRRRRRRRRRRRRSVVVFFFFFFFF4FFFFFFFFFFFFVFFFFFFFFFFF5MMMM

TSSaabaylyo 7 incelendiğinde bi2r200haberin55t7ü7,r,0ü08n8ü tahRRmFFin etmede en

bKaKşTTarılı meLLtoiongg temsil 116y6öntemin55i6n6,,2211(özelSlSiVkVMMgrubunun)

2NKgK1rK)KaHmoHSllSdaLruL’ğıuECşgCioötolriüklm3’etketkeidgi5r5i1.b1i5nhoarmbea4r4l7i7tz,ü,0e0r6ü6endeipaCkiCto44d525l3a0m’aakr

(2Ghaber

Te2%bm42%bmNbTb2%2NmbTtu.gauaa1m4eugae99aş1rllebb9tşt)r.luuba4a4yyt)ennlulaa4ynmnrnlo,ö,öoCioimrn5ö,o5ıpoimymynn5ılllmy4n47lirıllldla8tt47ınledeoaaa’t’eeruea’’ellkikbsrumm’dlüüikğnm’iıtütlğnmeyıkuktacaeeemukacEeeeddmllEeedlddetbdşldg(ı(ıtdşldge(ıirrtie22iioöoeVrie2it..nnöorüGGt.ğnlğnrGlğdrieüzrrdikü-k-eerriuukel-eNNiğulddmöiNrğltl3dmitlueui3iiş11Kineu’ilen1lemnkk’,e,letemdkkd,teeüdllknneesltaaenkyesmtaeikKKeaiilKbdyitltbdzestsaKaKgaiisaKgısiirorohhpisrro.ih--ibnynm.ım-tNhbNynmnDöıhNiuu5öaiğu5ii1ı1naççneibn1nnnıçnb))nltlhmone)tlheaaoeaeareermyraırermbmirddazammaaabindaaeinirzraeindillrraeaanalteleraietgllgeüsisrinbbgütiesznınıböıörtüziıinörnenrüeüirlrnlerüidrdlımmmeernüdemnenüa(aeünd(aeeeöündeöeikklczbbetikpezbtitapetkkiiraetneaekirrhlaeükürhldildsküvmildtiçoçimiitiokeçyiürürhdhki2rürdh..ei2nkkalai.3nklaatl3bbEEaim0bEmegn0eemegnn’etrnbibrir’tamarburşiaimaiiukbrbinntibrtrkrbneibraaaeuradhuhşşdh.(nşeaaat(tffnm2eaatüfuüab2arruübaGreırırnrrieGeınrlrlenkünkür)lı-ınkür)-ı

44..44.. CCiTinnasbsiiylyoeet8tV:VCeeririnisKKiyüüemtmveeessiriiDDkeüenmneeemmseienlledereriiher bir özellik eTeTtatmambbelelogoprpur8ro8bo’b’dubdlenleeeummbnbiyiiireürünzkzdekbeöreöarişlişnşeeneadrdriey,ıeylayraıyzaazoıaspıslptsıdtgıtnıunıeğığğlınıenımumbyıkyızaazoazşdzndaaeafrrenirııngıne%neüımımnrnae5eslc2lyecie,iron3rnnsv8svieiyveyrerietiltilbminmaniişiişşatttirtairaıhr.h.mmiinn

GÖ2GzrueblggluriruTkuTbabaububnlnlouogKBun8üni8yo:nyreün:aeüanCzfsnCrzidyiybdinbeonaeslanşsleişeaiyrayrrierie,ıt,ıltrlıvrıaÖ1svaoesao0eslrztylrdt1giedgıiueslkueklğlıüiğleüukemumbkbekaeoasşo9yBsşnianüin9aafnrfzird,ışid6gıdeag%eü2e%rührıshraei5ae5sr2sry2yb,ob,3SSoi3ni8rnVı8rnvövMöıezfezlebealblnalalişdikşkaıarrııcı

SFKKKKKKK3LMKKKFKKKSKKKKL3KÖG2ÖGLKKKK23KKKFSGGGaKKaSSKK2GKGKKEKKK2GKEGKzrGGKaSDzrGGKKKK2yyuIIeGGyueIHHOKIHSHHOKIGblSOIKHHblluCSlASCiuSCikLLkLLLLL

SBBLLKgBgKBLünooiiioüoinnnorfggnnrgaaanaafasrrrfisryyyyiyyoonn LSTSTSSTBBSBTSBnnnnoFFFiinnFiinnffgffIIInnffIDDaDaaaDrrFFrrFyyFyy LCmSTLTSLnooFoTnoFgfgIfgFIDDFF

82439339151661483394293151Ö11sÖs589191333142a30235100193320511000az013053200yz11111ye111ıeıslsllıliıikk

8789999999977778999789979999ByyB999998999897ü7915535558801767553915575898aü589755558139az,,,,,,,,,,,,,,,,,,,,,,,,,,,,şz612456881662053,,,,,,,,,,,,6254128638166şda188466626251d24342211774537a234244123127er31212742442erısısii

1NN NS1SC1SSRN1RNSNS1CRS1SNRSS1SSSSSNSR1C11RSNNNNNNVVVVVVVVVVı4FF4FFBBBBBNNNıVVVVVnF4FBn55NNNNNNMMMMMMMMMMı5NNNMMMMMıffllaannddıırrııccıı

Özellik Grubu 2G 3G LSI KK KGI KKK KGO KKHSL KKHC K2G FK Say KE KKS KKHA MDS KT

n artmış medik bir sınıflara 0’şer şiir bu köşe olanak e, köşe uruluyor öz sanatı lerde bu ını köşe in etme ik şarı ndırıcı

Özellik Grubu 2G 3G LSI KK KGI KKK KGO KKHSL KKHCL K2G FK Say KE KKS KKHAL MDS KT

yüzdeleri, rastgele başarı % 52,38

KKHAL mTFIDF 6

52,57 C45

Konfi

gürasyon sayısı yüzdesi Sınıflandırıcı

FK

K2G

48,76 RF 48,19 C45

Binary Amas1y0a1lı M. F.,9B9a,6lc2ı S., VSaVrlıME. N., Mete E., TürkçKeEMetinlerinN1Sınıflandırılm1a0 sında M4e6t,i8n6TemsilSYVöMntemlerinin

101 98,67 1NN

PerfMorDmSans Karşılaştırılması, 5C1ilt 2, Say4ı 64,,2S9yf 95-1N04B, Aralık 2012

98,1 RF

KKHSL Co

46Te,1malı DeNrlBeme Makale

KT

44,19 C45

95,62 95,43 95,24 93,52 87,62 81,14 79,24 77,33

1NN SVM C45 1NN NB SVM RF NB

Tablo 9 incelendiğinde bir filme yapılan yorumun negatif, pozitif ya da nötr olduğunu tahmin etmede en başarılı metin temsil yönteminin (özellik grubunun) kelime köklerini Kmeans ile Sınıf bilgisine göre kodlamak (KKK-Snf) olduğu görülmektedir. 3 gruba ait 35’er yorumla elde edilen sonuçlara göre bir yorumun yönü %96,38’lik doğrulukla tahmin edilebilmektedir. En başarılı 2 yöntem (KKK-Snf, 3G-Binary) arasında büyük bir fark bulunmaktadır.

mTF

76,57 SVM

4.6. Ruh Hali Veri Kümesi Denemeleri

Co

71,05 1NN

70,67 NB

N1

64,19 NB

Tablo 10’da bir yazının yazıldığı anda yazarının içinde bulunduğu ruh halini tahmin etme problemi üzerinde yaptığımız denemeler verilmiştir.

Tablo 8 incelendiğinde bir metnin yazarının cinsiyetini

Ttaahbmloin 8etminecdeeleenndibğainşdareılıbmiretminetenminsilyayzöanrtıenmıninicnin(söiyzeltliinki gtarhumbuinuent)m2egdreamenlarb’aışabriınlaı rmy eotlianratkemksoildlyaömnatekmi(n2iGn -(Böiznealrliyk) oglrduubğuunung)ör2üglrmamekltaerd’ıir.binVareyri olkarüamkeksiodliaçminaküre(2tiGle-nBintaerkyi)l 2olgdruağmulargınörsüalymıseık5tedbirn.’i Vgeeçrtiiğiknüdmenesöizeilçliikn seüçriemtiileynapıtlemkıişl v2egrabmilglairıknaszaynıcsıın5a bgiönr’ei geençtiyğiin1d0e0n öazdeeltlik2gsreaçmimmi yeatipnıllemriınş tveembsilignidekakzuanllcaınnıalmgıöştrıer. enHieyri b1ir00cinadsieytet2tegkraimyazmaerltainraleraiint 5te0m-5s5il’işnedre ykauzlılainlıelmeılşdtıer. edHilern bsironcuinçlsaiyraettgeökrieyabziarrlmareatnaiint 5ya0z-5ar5ı’nşıenr ciynasziıyeitlie%e9ld9e,62edgiilbeinyüskonseukçlbairradogğöruelubkilra mtahetmnin yedazilaerbınilımn eckintesdiyire.tiE%n 9b9aş,6a2rılgıib2i yöünktseemk b(i2rGd-oBğirnualuryk,la3Gta-hLmogin) eadraisleınbdilamkeükçteüdkirb.irEfnarbkabşaurlıulnı m2aykötandteırm. (2G-Binary, 3G-Log)

arasında küçük bir fark bulunmaktadır. 4.5. Film Yorumları Veri Kümesi Denemeleri

4T.a5b.loFil9m’dYa obriurmflialmrıeVyearpi ıKlmüımş eysoirDumenuenmedlueyrgiusal yönünü tTaahbmloin 9’edtamebir pfriolmblemyiapıülmzeırşinydoerumyaupntığdımuyıgzusadlenyeömneülneür vtaehrmilminiştiert.me problemi üzerinde yaptığımız denemeler verilmiştir.

Tablo 9: Film Yorumları veri kümesinde her bir

özeTlalibklogr9u:bFuinlumn Yenorbuamşalarrılııvoelrdiukğüumkeosninfidgeürhaesryobnir ve

özellikbgarşuarbıuynüuzndenlerbia,şraarsıtlgıeolledubğaşuakrıo%nfi2gü8r,5a7syon ve

başarı yüzdeleri, rastgele başarı % 28,57

GÖzrueblluik gKüornafsiyon sÖazyeısllıik yBüazşdaerısi Sınıflandırıcı

GKrKuKbu gSünrfasyon s4ayısı 9yü6z,3d8esi S1NınNıflandırıcı

8986,7368 N1NBN

K3GKHCL SBninfary

7858,8716 SNVBM

LKSKIHCL Snf

75,6821 RSVFM

KLSKIS

675,1642 SRVFM

KGKIS

24 1

645,7164 NSVBM

2KGGI

5694,6726 NB

TBFinary

549,8662 NB

BTFinary

54,2896 SNVBM

KKHAL mBiTnFarIDy F 623

524,5279 CSV45M

FKKKHAL LmoTgFIDF 564

4582,7567 RCF45

KFK2G

TLoFgIDF

48,1796 CR4F5

KE2G

16 0

468,8169 SCV45M

MKEDS N1

46,2896 NSVBM

KMKDHSSL Co

46,129 NB

KTKHSL BCionary

446,19 CN4B5

SKaTy

3484,4189 NC4B5

Tablo 9 incelendiğinde bir filme yapılan yorumun negatif,

pToazbiltoif 9yaindcaenleöntdr ioğlidnudğeunbuir tafihlmmien yeatpmıeladne yeonrubmaşuanrılnı emgaettiifn, tpeomzistiilf yyaödnatenmöitnrinoldu(öğzuenluliktahgmruinbuentmune)de keenlimbaeşarkılöıkmleeritnini KtemmesialnsyiölentSeımnıifnbinilgi(söinzeellgiökregkroudbluanmuank) (kKeKliKm-eSnfk)öoklldeuriğnui gKömrüelamneskitleedSirın. ıf3bilggrisuibnae gaöirte k3o5d’elarmaykoru(mKlKaK-eSldnef) oelddiulğenu sgoönrüulçmlaerkategdöirr.e 3birgryuobraumauint y3ö5n’üer %y9o6ru,3m8l’alikelddoeğruelduiklelna tsaohnmuçinlareadigleöbrielmbeikrteydoirru. mEunn byaöşanrüılı%296y,ö3n8t’elimk (dKoKğrKul-uSknlfa,

Tablo10: Ruh Hali veri kümesinde her bir özellik

grTuabbulnou1n0:eRn ubhaşHaraılliı voeldriukğüumkeosnifnigdüerhaesyr obnirvöezbelalşiakrı grubununyeünzdbealşearri,ılrıaosltdgueğleubkaoşnafriıg%üra2s5y,o4n8ve başarı

yüzdeleri, rastgele başarı % 25,48

ÖGzrueblluik Kgüornafsiyon Ösazyeısllıik Byüazşdaerısi Sınıflandırıcı

G3Grubu gBüinraasryon s1a0y1ısı y8ü5z,2d3esi SNıBnıflandırıcı

850,2637 N1NBN

KKKHCL Snf

8708,6773 1NN

KKGHI CL STnFfIDF

6778,2793 R1NFN

KLSGII

676,291 RF

LKSKI

664,2918 RNFB

64,9189 NB

BNi1nary

641,1693 NRFB

2KG2G

6516,6834 RCF45

K2KGHAL TmFTIFDF

15011

564,894 CR4F5

KKHS AL mSnTfF

5449,9743 RF

KFKKS

SNn1 f

534 498,7439 RF

FMKDS N1

5314 486,4796 RF

MKEDS Log

5118 465,7863 RF

KET

1168 451,8132 RF

KKT HSL CLog

3491,2162 RF

SKaKyHSL Co

26 0

389,026 RF

38,06 RF

Tablo 10 incelendiğinde bir blog yazarının blog yazıldığı

aTnadbaloki 1r0uhinhcaellienniditğaihnmdien beitrmbeldoeg eynazbaarışnaırnılıbmloegtinyazteılmdısğilı yaönndtaekmi irnuinh h(aölzienliliktahmgriunbuentmune)de3gernambalaşra’rıılıbimneatriyn otelmarsaikl kyöondtleamiankin (3(Göz-eBlliinkaryg)ruoblduunğuun)gö3rgürlammelkatre’dıir.biVnaeryi koülmareaski ikçoidnlaümraektilen(3Gte-Bkiilna3ryg)raomldlaurğınu gsöaryüıslmı e5ktebdiinr’.i Vgeerçitikğüinmdeesni öiçzienlliükresteiçleimn i teykapilılm3gışravmelabriılngi skaayzısaınc5ınabignö’rie geençtiğyin1d0e0n aödzeltlik3gsreaçmimimyeatipnıllemriınş vtembsiillgiindkeazaknuclılnanaılgmöırşetıre.n iy4i 1r0u0h hadaleitnin3ghraemr bimrienteinaleitrin38-t4e0m’sairlibnldoeglakuellldaenıelmdiılşetnır.son4uçlraurha yhazlianriın herruhbirinhealaiit 3%8-408’a5r,2b3l’olügkla elddoeğreudliulkenla sontauhçmlarina eydazilaerbınilmerkuthedir.haElin b%aşarı8lı5,223y’ölünktemdo(3ğGru-lBuiknlary, taKhKmKinSednifl)eabrialmsıenkdtaedbiüry. üEknbibr afşaarkrılbıu2lunymönatketmadı(r3. G-Binary, KKK-

Snf) arasında büyük bir fark bulunmaktadır. 4.7. Deneme Sonuçlarının Birlikte Değerlendirilmesi

S4.o7n.uDç etnabelmolearSıo(n5u-ç1l0a)rıennınbBaşiarrlıilkıtesıDnıeflğaenrdleırnıcdıilrairlmyöensiünden

iSnocneuleçndtaibğlionldaerı(s(ı5n-ı1f0la)ndenırıbcıalşaarrıınlıtasbınloıfllaarnındısrıocnılasrütyuönnlaürnınddena yinecrelaelnmdaiğisnadyeıla(srı)nıfTlanbdloırı1cı1l’adrıenkitasbolnoluaçrlıanr seolndesüetudnilmariışntdira. Tyearblaolm11a’dseakyiılsaaryı)ılaTrasbılnoıfl1a1n’ddıerıkciınsıonn1u0ç2lar(1e7ldöezeelldiiklmgirşutbiru. *Ta6blove1r1i ’kdüekmiessai)yılaarrffsıdnoısflyaansdıırüızceınriınd1e02ka(ç1ın7döazelnlikbagşraurbıluı a*lg6orvitemria koüldmueğsuin) uagrföfstdeormsyeaksıtedüizre.rinde kaçında en başarılı

algoritma olduğunu göstermektedir. Tablo 11: En Başarılı sınıflandırıcıların dağılımı 102

101 Taabrlfof 1d1o:syEansıBiçaişnadrıelıksaıçnıkfelarnedeınrıcbıalşaarırnılıdoalğdıluıkmlaı r1ı02 arff dosyası içinde kaç kere en başarılı oldukları Sınıflandırıcı Kaç kere

Sınıflandırıcı eKnaç başkaerırleı

yazarın edilebilm Snf) ara

4.7. Den

Sonuç t incelend yer alm Tablo 11 * 6 ver algoritm

Tab a

negatif, lı metin köklerini ) olduğu edilen ğrulukla KK-Snf, n içinde üzerinde

rzıarı r t ar ı i

Şiir Köşe yazarı Haberler Cinsiyet Film yorumları Ruh hali

Snf) arasında büyük bir fark bulunmaktadır.

4.7. Deneme Sonuçlarının Birlikte Değerlendirilmesi

Sonuç tabloları (5-10) en başarılı sınıflandırıcılar yönünden EinMceOlenBdiilğimindseel(sDıneıfrlgani,dıCrıcilıtla2r,ınSatabylıo4la,rıAnrsaolnıks2üt0u1n2larında yer alma sayıları) Tablo 11’deki sonuçlar elde edilmiştir. Tablo 11’deki sayılar sınıflandırıcının 102 (17 özellik grubu * 6 veri kümesi) arff dosyası üzerinde kaçında en başarılı algoritma olduğunu göstermektedir.

Tablo 11: En Başarılı sınıflandırıcıların dağılımı 102 arff dosyası içinde kaç kere en başarılı oldukları

Sınıflandırıcı

RF SVM NB 1NN C45

Kaç kere en başarılı olduğu 39 24 23 9 7

Tablo 11 incelendiğinde en başarılı sınıflandırıcının Random FToarbelsot 1(R1 Fin)coelldeunğduiğ, ionndueDenesbteakşaVrıelıktsöınr ıMflaankdinıreılceınriın(SRVaMnd)ovme NFoarievset (BRaFy)esold(NuğBu),’oinnutaDkeipsteekttViğeikgtöörrüMlmakeiknteldeiri. (ESnVMya)kvıne kNoamivşeu B(1aNyeNs) (vNeBk)’airnartaakğiapçlaerttıiğ(iC4g.ö5r)ülamlgeokrtietmdiar.laErınınyapkeıkn bkaoşmaşrıulı(o1lNamNa)dvıkelakraırgaörrüağlmaçelkatreıd(iCr.4.5) algoritmalarının pek başarılı olamadıkları görülmektedir.

Tablolar (5-10) Özellik gruplarının en başarılı oldukları kToanbflioglüaras(y5o-n1l0a)r yÖönzeülnlidkengirnucpellaernınmıensiyelne (bikaşilairnıilnı toalbdluolkalraırnı iklokn2figsütruansyuonndlaaryyeör naülmndaesnaiynıclaerlıe)nimlgeisliysloen(uikçlialirniTnabtalbolo1l2a’rdıne vilekri2lmsüişttuinr.unÖdranyeeğrinalm2Ga saöyzıellalriık) iglgruilbi us,on6uçvlaerriTakbülmo e1s2i’ndine üveçrüinlmdeiştNir1. Öilern, eiğkiinsin2dGe Böizneallriyk ilgerubbiuri,nd6e vieseri Lkoügmielseinein büçaşüanrdıleı oNlm1 uişlteu,r.ikisinde Binary ile birinde ise Log ile en başarılı olmuştur.

Tablo 12: Özellik gruplarının en iyi oldukları Tablo 12: Özeklloinkfgigrüurpalsayrıonnılnaren iyi oldukları konfigürasyonlar

Özellik GÖrzueblluik 2GGrubu 23GG 3FGK FKK2G KK2EG KKEGI KKGGIO KKGKO KKKKHAL KKKKHHACLL KKKKHHCSLL KKKKHKSL KKKKKS KKKT S KT

En iyi olduğu Konfigürasyon ve Sayıları 3EnNi1y,i 2olBduinğauryK, o1nLfioggürasyon ve Sayıları 33 NBi1n,a2ryB, i2naLroyg,,11LNo1g 33 BNi1n,a3ryL, o2gLog, 1 N1 35 NTF1I,D3FL, o1gBinary 54 TLoFgID, 1F,N11B, 1inTarFy 43 LBoinga, r1y,N11L, 1ogT, F1 N1, 1 TFIDF 32 BBiinnaarryy,, 12 LLoogg,, 11 NTF1,, 11 TTFFIIDDFF 25 BBiinnaarryy,, 21 LNo1g, 1 TF, 1 TFIDF 54 BmiTnFarIDy,F1, N1 1mTF, 1 Cooccurance 46 mSnTfFIDF, 1 mTF, 1 Cooccurance 64 SCnof, 2 Snf 46 CSnof, 2 Snf 63 SSnnff, 2 mTFIDF, 1 mTF 34 SLnofg,, 21 mNTorFmID1F, ,11BminTaFry 4 Log, 1 Norm1, 1 Binary

Tablo 12’ye göre K2G özellik grubunun TFIDF ile, KK Tözaebllloik 12g’ryuebugnöurne KB2inGaryözeilleik agğrıurlbıkulnaunndırTılFmIDasFı, ilke,eliKmKe ökzüemlleilkemgeruybaupnaurknenBiisnearKyKHileCLağvıerlıKkKlaKndımrıelmtoatlsaır,ınkdealiSmnef küumllaenleılmmeasyıadpaahrakeiyni issoenuKçKlaHr üCrLetmveiştKirK. K metotlarında Snf kullanılması daha iyi sonuçlar üretmiştir.

Özellik gruplarının genel olarak ne kadar başarılı oldukları Öinzcelleimk egkruiçpilnarTınaıbnlog5en-1e0l ’olalardraközneellikkadgarur bbuanşuanrılhıeorlbdiurkvlaerıi iknücmeleesminedkeiçeinnbTaaşbalroılı5k-1a0ç’ılnacrıdoalödzueklllaikrı g(r1u-b1u7naurnashıe)rybaizrılvmeırşi kveümbeusisnadyeılaernınbaoşratarıllaımkaalçaırnıcaı loınldmuıkşltaır.ı E(1ld-1e7eadrialesın) syoanzuılçmlaışr vTeabbluo 1s3ay’tıelavrıenrilomrtiaşltairm. aları alınmıştır. Elde edilen sonuçlar Tablo 13’te verilmiştir.

Tablo 13: Özellik gruplarının ortalama ve her veri

Tkaübmloes1i3n:deÖkizeblalşikargı rsuırpallaarmınaınlaorırt(a1l7amözaevlleikhegrruvbeuri kümareassiınnddeak,i6bvaeşarirıksüımraelasimndalearoırt(a1l7amözaekllaiçkıngcruı bu

102 arasında, 6 veri koülmdueksilnadrıe) ortalama kaçıncı oldukları)

Ortalama

Tablo 12’ye göre K2G özellik grubunun TFIDF ile, KK özellik grubunun Binary ile ağırlıklandırılması, kelime kümeleme yaparken ise KKHCL ve KKK metotlarında Snf kullanılması daha iyi sonuçlar üretmiştir.

Özellik gruplarıTnMın MgeOneBl oEllaerakktrinkeMkaüdharebnadşaisrlıelıriolOdudkalasrıı incelemek için Tablo 5-10’larda özellik grubunun her bir veri kümesinde en başarılı kaçıncı oldukları (1-17 arası) yazılmış ve bu sayıların ortalamaları alınmıştır. Elde edilen sonuçlar Tablo 13’te verilmiştir.

Tablo 13: Özellik gruplarının ortalama ve her veri kümesindeki başarı sıralamaları (17 özellik grubu arasında, 6 veri kümesinde ortalama kaçıncı oldukları)

Özellik Grubu

Ortalama Başarı Sıralamas ı

3,5

31 1

3G

2,2

12 5

KFK2G 1120,,35

KKE2G 1122,,53

KKGE I

512,5

KKGGOI 65,3

KKKGO 56,,73

KKKKHAL 51,27,7

KKKKHHCALL 51,28,7

KKKKHHSCLL 154,8,7

KKKKKHSL 41,47,7

KKKKSK 140,7,2

KKTKS 1150,,32

LKSTI

61,57,3

MLSDI S 162,7,8

SMaDy S 1122,,28

12,2

1171 143 1134 1101 1121 912

1127 1113 1123 1130 1132 194

612 511 412 513 613 414

76 65 34

170 36 23

1104 316 211 415 910 610

214 1106 181 915 310 310

125 1170 187 89

135 136

415 817 717 68

115 216

84 184 97

164 51

12 1

183 1154 196 1174 156 1151

913 915 1106 317 416 515

196 192 610 136 144 153

516 712 165 1126 1174 1173

5 7 15 12 17 17

Tablo 13 incelendiğinde kullanılan 6 veri kümesi için en bTaaşbalroılı13 öizneclelliekngdriuğbinudneunkusılrlasnııylalan 36G,v2erGi vkeümKeKsKi ioçlidnuğeun gböaşrüarlmılıek3teödzierl.lik grubunun sırasıyla 3G, 2G ve KKK olduğu görülmektedir.

Harf 2gramları (2G) film yorumları ve ruh hali veri kümeleri hHaarrifci2ngdreamçolakrıb(a2şGar)ılfıilsmonyuoçrluamr elaldrıeveetmruihştihra. lHi vaerfri3kgürammelaerıi (h3aGri)cinidse çohkabbearlşearrılıhasroincuinçdlaer eçlodke ebtmaşiaşrtıilrı. Hsoanrfuç3lgarramelladreı e(3tmGi)ştiirs.eFohnakbseiryloenrelhkareilciimnedleer çeonk yübkasşeakrılbı aşsaornıulaçrlıanrı keöldşe yeatmzairşltair.ınFı ontkasniıymonaedla keglöimstelremr işelnerydüirk.sekDübzaşamrıleatriınnlıerkdöeşkei üyaslzuabrluanrınbıelitralennımaedsiandegöfsotenrkmsiiyşolenredlir.kelDimüezlermineteintkleinrdebkiri şüeskluilbduen kbuelliarlneınlambeilseicnedğei fobnukrasdiyaonnelgökrüelimmeeklteerdinir.etkKienlimbier 2şegkrailmdelarıku(Klla2nGı)la, bKileelcimeğei tübrulerarida(Kn T)gövreülkmeelikmteedeirk.lerKi e(lKimEe) h2igçrbaimr lavreır(iKk2üGm),esKinedliemebatüşarlreırig(öKstTer)evmeekmeilşilmeredierk.leKriav(KraEm) gheiçnbeilrleşvteirmi eknüimn esinbdaeşarbılaışarısagyöıslatebrielmesmi işleirçdiinr. Kkaevlrimame kgeönkelellreinştdiermn e(nKiKn ) dabhaaşabrıalşıarılısasyoınlaubçillamr eüsrietmeiçsingerekkelliidmire. Bköuknlaerginödrenk(aKvrKa)mdlarhıan bbaişraürısltı ksoanvuraçmlalrarüıryeltamiefasidegeerdeikllmideisri. (BKuGnaI),göşrieir,kafvilrmamlyaorrıunmbliarrıüsvtekaruvhramhalalirıyvleari fakdüemeedleilrminedsei k(KelGimI)e, kşöiikrl,erfiinlmdenyo(rKuKm)lardıahvae iyruiyhkehna,löi zveel riisimkülemreinleirninsadne kaevlirmame ıknöakdleörninüdşteünrü(lKmKes)i (dKaGhaOi)yisyakdeenc,e öşziierl viseirmi kleürminesininsdane kealvirmame ıknöakdleörninüdşteünrüdlamheasiiy(iKsGoOnu)çsladreücreeşteiibrilvmeriiştkirü.mKeesliinmde köelkilmerei k(KökKl)erşiinirdevne fdialmhayioyriumsolnaurıçlhaarriücrinetdeebiblamşiaşrtıilrı.dıKr.elime kökleri (KK) şiir ve film yorumları haricinde başarılıdır.

Kelime kümeleme metotları (KKHAL, KKHCL, KKHSL, KKelKim, eKkKüSm)elaermaseındmaeteontlabrıaş(aKrıKlısHıAkLm, eKanKsHiCleL,küKmKeHleSmLe, (KKKKKK,) KoKlmS)uşaturar.sındTaabelno b1a2şa’drıelkısiı dkemğearlnesreilebaküılmdıeğlıenmdae K(KKKKK’n) ınolemnuiyştiuSr.nf ilTe abbirlolikt1e2ç’daelıkşitığdı egğöezrülekrmeekbtaekdıilrd.ığında KKK’nın en iyi Snf ile birlikte çalıştığı gözükmektedir.

Anlamsal uzaylarda LSI, MDS’e göre oldukça başarılı sAonnluaçmlasralürueztmayilşatirrd.a6 LvSerI,i kMümDeSs’iendeg,örMe DoSl’diunkLçaSI’bdaaşnariıyliı osoldnuuğçularsaüdreectemi1ştivre. r6i kvüemri eksiüm(heasbinedrlee,r)MbDuSlu’ninmaLkStIa’ddıarn. Biyui voeldriuğkuümsaedsiencied1iğevrelreiriknüdmenesaiyı(rhaanbeörzlelrl)iğbiuhluenr mbiarktsaıdnırfa. Baiut çvoekri skaüymıdeasöinrni edğiiğnerolleurşinudeunr. aByıurnana göözreellMiğiDhSeirlebiyr issıonnıfuaçlaairt açlomkaskayıidçainörönrenğeink osluayşuısdıunrın. Bçuonka oglödrueğMu DvSeriilekiyüimseolneuriçnlianr kalumllaknımiçıiönneörrinleebkilisra. ySıasyınılıanr (çSoaky)oölzdeulğliuk gvreurbi ukşüiimr evleerkiönşine ykauzllaarnı ıvmerıiöknüemrileelberiliihr.aSriacyinıldaer (çSoakyk)öötzüelsloiknugçrluabrualşmiiırşvtıer.köşe yazarı veri kümeleri haricinde çok kötü sonuçlar almıştır.

kavramı kelime kökleri

Kelime KKK, K (KKK) KKK’nı

Anlamsa sonuçlar olduğu veri küm çok sayı almak kullanım yazarı v

Sonuçla Tablo 14

Tab

yorumları Ruh hali

ile, KK kelime nda Snf ldukları bir veri yazılmış sonuçlar eri bu

8 1 12

(KGI), şiir, film yorumları ve ruh hali veri kümelerinde kelime köklerinden (KK) daha iyiyken, özel isimlerin insan

başarıların elde edilebildiği görülmüştür.

kavramına dönüştürülmesi (KGO) sadece şiir veri kümesinde kelime köklerinden daha iyi sonuçlar üretebilmiştir. Kelime

5. Sonuçlar ve Tartışma

kökleri (KK) şiir ve AfimlmaysyoarulımMla. rFı.,hBaarilcciınSd.e, Vbaşrlaı rEı.lıNd.ı,r.Mete E., TürkçSeınMıfleatnindlıermrinaSınuıfylagnudlaımrılmalaarsıınnddaa MöerntinekTleerminsil Ynöanstıel mlteemrinsinil Perefodrimlecaenğsi Kpaerrşfıolarmştıarınlmsaaseın, Cçioltk2,etSkaiyeı d4e, nSypfa9r5a-m10e4tr,eAdirra.lıkBu2n01u2n

Kelime kümeleme metotları (KKHAL, KKHCL, KKHSL,

doğal sonucu olarak uygun özellikleTreinmsaelçı iDmeirlesımnıeflaMnadıkramlea

KKK, KKS) arasında en başarılısı kmeans ile kümeleme

performansını arttırmaktadır. Bu çalışmada çeşitli türdeki

(KKK) olmuştur. Tablo 12’deki değerlere bakıldığında

metin sınıflandırma problemleri için özellik gruplarının

KKK’nın en iyi Snf ile birlikte çalıştığı gözükmektedir.

performansa etkileri araştırılmıştır.

Anlamsal uzaylarda LSI, MDS’e göre oldukça başarılı sonuçlar üretmiştir. 6 veri kümesinde, MDS’in LSI’dan iyi olduğu sadece 1 veri kümesi (haberler) bulunmaktadır. Bu veri kümesini diğerlerinden ayıran özelliği her bir sınıfa ait çok sayıda örneğin oluşudur. Buna göre MDS ile iyi sonuçlar almak için örnek sayısının çok olduğu veri kümelerinin kullanımı önerilebilir. Sayılar (Say) özellik grubu şiir ve köşe yazarı veri kümeleri haricinde çok kötü sonuçlar almıştır.

Sonuçlar veri kümelerinin türlerine göre incelenmesiyle Tablo 14 elde edilmiştir.

Tablo 14: Veri kümelerinde en başarılı sonuçlar alan konfigürasyonlar

Ort. KOretl.imKeeliSamyeısıSayısı Ort. COrüt.mlCeüsamlyıesısayısı RastgRelasetgBealşearıBaşarı EldeEldeedileendileenn en yükseykükbsaeşkarıbaşarı ÖzelliÖkzeslaliyıksısayısı ÖzelliÖkzellgirkubugruvbeu ve konfikgoünrfaisgyüornasuyonu

Veri kVüerimeksiümesi

Ruh hali 247,1 28,1 25,48 85,23 101 3G-

FRiulmh hali yorumları KFiölmşe

24947,3,1 34998,3,5

42,88,1 44,58,3

2285,,4578 42,87,567

9856,,3283 9963,,7388

1401 34817

Binary KB3SGniKnf-Kar-y 2KGK-KLo- g

yyaozruarmı ları yKCaiöznşaseriıyet HCianbseiryleetr HŞiairberler Şiir

337978,5

320747,8 79,5 204,8 79,5

4554,3

1574 7,4 17 7,4

45,27,638

2502,38 14,29 20 14,29

9939,,7682

9949,,5642 75,29 94,54 75,29

3180117

3160918 101 3698 101

Snf 22GG--Log Binary B32B22GGGGiinn----aaNNrryy11 3G-

Tablo 14 incelendiğinde, en yüksek başarı elde edBileinnarvyeri

kümesi yazarın cinsiyetini belirlediğimiz veri kümesidir. En Tzoarblove1r4i inkcüemleensdiniğinindşei,irelenriynükyseakzarblaaşraınrıı elbduelmeadileonldvueğrui kgöürmüelmsieykatezdarirın. Bcuinnsuiynelatinbierbaebleirrletdüimğimveirzi vkeürmi eklüemriensdiedier.n Eanz z%or 75v’elriik bkiürmbesaişnairnı eşlidierleeridnilmyiaşzaorllmaraınsıı obtoumlmaatik omldeutğinu gsıönrıüfllamnedkırtemdair. kBounnuusunnladaberçaobkerçteüşmitlivegriörkeüvmleerldeerinbdaeşaernınaınz %yaka7l5a’nldikığıbniırgöbsatşearrmı eekltdeedire.dilmiş olması otomatik metin sınıflandırma konusunda çok çeşitli görevlerde başarının

yEankablaanşadrıığlıınımgeötsitnermteemkstieldi iry.öntemlerine bakıldığında, harf

ngramlarının başarısı göze çarpmaktadır. En başarılı metin temsili yöntemlerine bakıldığında, harf

nNggrraammllaarrıınnınabğaırşlaıkrılsaıngdöırzıelmçaarspınmdaaktoalddıurk. ça popüler olan TF

ve TFIDF yerine Binary, Log ve N1 ağırlıklandırma Nyögnrtaemmllaerrıinnianğdıralhıkalabnadşaırrııllmı oalsdınudkalaroılgdöurküçlampekotpeüdlierr. olan TF ve TFIDF yerine Binary, Log ve N1 ağırlıklandırma

yMöenttienmlelreirninin dbaohyaubtlaaşraıyrlıalı oldubkalşaarrııgörüolmraenkltaerdı ir. birlikte

incelendiğinde, kısa metinlerde de uzun metinlerde de yüksek Mbaeştairnıllearriınn eldebeodyiuletlbairlıdyilğai görüblamşaürşıtür. oranları birlikte incelendiğinde, kısa metinlerde de uzun metinlerde de yüksek

başarıların elde5e.dilSeboinlduiğçilagörrüvlemTüşatürrt.ışma

Sınıflandırma 5u. ygSuloamnualçalraınrdva e Töranerktıleşrmina nasıl temsil edileceği performansa en çok etki eden parametredir. Bunun Sdoınğıafllasnodnıurmcua olauryagkuluaymgaulnaröınzdealliklöerrnineksleerçiinmi nsıansııfllantdeımrmsial epderilfeocremğainpseınrfıoramrtatınrsmaaekntaçdoırk. eBtkui eçdaelınşmpaardaameçterşeidtliir. tBürudneukni dmoeğtainl sosınnuıcfluanodlaırrmaka uypgroubnleömzelellriikleiçriinn seöçziemlliiksıngırfulapnladrıırnmına ppeerrffoorrmmaannssıaneıtkairltetrıirmaraakşttaırdıılrm. ışBtıur. çalışmada çeşitli türdeki metin sınıflandırma problemleri için özellik gruplarının pKeurlfloarnmılaannsa6etfkairlkelrıi amraeşttiınrılvmerışitıkr.ümesinin her biri için 17 özellik grubunun çeşitli konfigürasyonlarından oluşan 77 Kfaurklllaıntıelamnsi6l yföanrktelımmi edteinnenvmeriiş kvüembeusinişilnemhesronbuirciuiçoilnuş1a7n ö4z6e2ll(i6k*7g7r)ubaudneut narfçfedşiotsliyaksıon5fiagdüertassyınonıfllaarnıdnıdramna omlueştoadnuy7l7a fsaınrkıfllıantedmırısliml ıyşötınrt.emSıinıdfelannednımrmişa vpeerbfuormişlaenmslasroın5u’clui çoalupşraanz 4ge6ç2er(l6e*m7e7)ilaedöeltçüarlmffüdşotüsyr.ası 5 adet sınıflandırma metoduyla sınıflandırılmıştır. Sınıflandırma performansları 5’li çapraz

Kullanılan 6 farklı metin veri kümesinin her biri için 17 özellik grubunun çeşitli konfigürasyonlarından oluşan 77 farklı temsil yöntemi denenmiş ve bu işlem sonucu oluşan 462 (6*77) adet arff dosyası 5 adet sınıflandırma metoduyla sınıflandırılmıştır. Sınıflandırma performansları 5’li çapraz geçerleme ile ölçülmüştür.

Ayrıntıları 5.bölümde verilen sonuçlara göre genel olarak ngramların diğer metin temsil yöntemlerinden daha başarılı olduğu görülmüştür. Ngramların her türlü dile uygulanabilir olması, herhangi bir dile özel ön işlem gerektirmiyor olması ngramların diğer olumlu yanları olarak sayılabilir. Ngramların ağırlıklandırılmasında oldukça popüler olan TF ve TFIDF yerine Binary, Log ve N1 ağırlıklandırma yöntemlerinin daha başarılı oldukları görülmüştür. ve TFIDF yerine Binary, Log ve N1 ağırlıklandırma yTöanratefımmlıezrdinainn gdealhişatibrailşmariışlıoolladnukslıanrııf gböirlgüilsminüeştüdra.yalı kelime kümeleme yöntemi, Film Yorumları veri kümesinde en bTaaşraarfıılmı ıztdeamnsiglelyişötnirtielmmiidşiro.laFnilsmınıfyobriulgmislianreı dvaeyrai lıkküemliemsie, Iknütmerenleetmeüzeyröinntdeemkii, kFuillmlanıYcıoruymorluamrılavrıenri okluümmleusinydae edna oblauşmarsıluız tşeemkislidle yeötinkteetmleindmir.esiFiülzmeriynoerubmirlavreıri vkeürmi eksüidmireskii, bInutekronneut güüzneürminüdzedkei tikcaurliladneığceı riyyoürkusmeklaroılnduğoulunmdalun olydaukdçaa soılcuamksbuizr aşreakşitlıdremaetaiklaentlıednırm. esi üzerine bir veri kümesidir ki bu konu günümüzde ticari değeri yüksek olduğundan oldukça Gsıcealekcbekir açraaşlıtşırmmaalaarlanoıldaırra.k anlamsal uzayda yakınlıktan uzaklığa dönüşümde yeni yöntemlerin kullanılması ve yGöenletecmekleriçnalışmİnaglailrizcoelaramk etainnllearmsalüzeurzianyddea ydaeknıennlımkteasni duüzaşkülnıüğlamedkötendüişrü. mde yeni yöntemlerin kullanılması ve yöntemlerin İngilizce metinler üzerinde denenmesi düşünülmektedir. 6. Teşekkür

Özellik çıkarımına ve d6e.neyTleerşinekçaklüışrtırılmasına büyük emek

harcayan Feruz DAVLETOV, Arslan TORAYEW, Ümit ÖÇİzFeTllÇikİ,çıBkaurrıhmaınneattvine dİeRnMeyİlKerÇinİ’yçealıvşteırıdlmeğaesrılnia yboüryuümklaermıyelka çhaalrıcşamyaanmızFaerkuaztkıDdaAbVuLluEnTaOn VK,emAirkslDanoğaTlODRilAİYşlEemWe, GÜrumbiut (ÇwİFwTwÇ.kİ,emBiukr.hyailndeiztt.ienduİ.RtrM) İKüyÇeİl’eyreineve tedşeeğkekrülir yeodruemrizla. rıyBlua ççaallıışşmmaam, bıziar kEartikccıdsaonbuşliurkneatni KoleamnikBiDziotğeakl’iDnil31İş1l0em27e8Gnrou’bluu (TwÜwBwİT.kAeKm-iTkE.yYilDdiEz.Bedpur.otrj)esiükyaeplesarimneındtaeşdeekskteükrlenemdeirşitzir.. Bu ç. alışma, bir Ericcson şirketi olan Bizitek’in 3110278 no’lu TÜBİTAK-TEYDEB projesi kapsamında desteklenmiştir.

.

Kaynaklar

[1] Amasyalı, M. F., KDiaryi,nBak.,la“rAutomatic Turkish Text

Categorization in Terms of Author, Genre and Gender”, [1] 1A1mthasIynatelır,naMtio. nFal.,CDonirfie,reBnc.,e “oAn uAtpomplaictiactioTnusrokfisNhatTuerxalt

LCaantegguoargizeattioon IinnfoTremramtisonof SAyusttheomr,s-GNeLnDreBa2n0d06G, enLdNeCr”S, V11otlhumInete3rn9a9t9io, n2a0l0C6.onference on Applications of Natural [2] LTaünrkgouğalgue, tFo., InDfoirrmi, atBio.n, ASymsatesmyasl-ıN, LMD.B2F0.0,6,“ALuNthCoSr AVtotlruibmueti3on99o9f, T20u0rk6i.sh Texts by Feature Mining”, Third [2] ITnüterkrnoağtliuo,naFl .C, onDfierrie, ncBe.,onAInmtaesllyiagleın, t MCo.mFpu.,tin“gA, uICthIoCr 2A0tt0r7ib, uQtiionngdoafo,TCurhkiinsah, LTNexCtsSbVyoFluemateur4e68M1i,n2i0n0g”7,. Third [3] IBnetekrkneartmioannal RC.o, nRfearnencEel-oYnaInnitve,lliNgaefnttalCi oTm.p, uYtinoagd, ICWIC., “2D00is7t,riQbiuntgiodnaaol, CWhionrad, LCNlCusSteVrsoluvms.e 4W68o1rd, s200fo7r. Text [3] CBaetkekgeorrmizaantioRn”.,, JRoaunrnaEll-oYf aMniavc,hiNneafLtaelairnTi.n,gYRoeasdearWch.,, “1D-4i8s,tr2ib0u0t2i.onal Word Clusters vs. Words for Text [4] CSoantegg,oFri.z,aLtiioun,”,SJ.,ouYrnanalg,of JM.,a“cAhinceomLepaarrnaitnivgeRsetusedayrcohn, t1e-x4t8, r2e0p0r2es. entation schemes in text categorization”, [4] PSaotntger,nFA.,nLaliuA, pSp.l,icY(a8n),g1, 99J–.,20“9A, 2c0om05p.arative study on [5] tÇeixlttikr,eApr.evseenGtaütinognör,scTh.e,m“eTsimien-EftfeixctienctatSepgaomrizaEt-imona”il, FPialttteerrinngAnUasliAngppNlic-g(r8a)m, 19M9o–d2e0l9s,”,20P0a5t.tern Recognition [5] LÇeiltttiekr,s A29. (v1e), G19ü-n3g3ö,r2, 0T0.8, .“Time-Efficient Spam E-mail [6] FCiilyteariLn.g, SUhsaimngimN-Ag.r,amPauMl oDd.e,ls“”F,eaPtautrteernPreRpeacroagtinointioinn LTeetxtterCs a2t9e(g1o)r,iz1a9t-i3o3n,”,20O0r8a.cle Text Selected Papers and [6] PCrieysaenLt.a,tiSohnas,m2i0m01A. ., Paul D., “Feature Preparation in

103 [7] TÖezxetl, CBa.t,eg“Korüizraetsieolnk”,-OOrrtaalcalme aTleı xGt rSueplleacmteadYPöanpteerms iainlde PMreestiennlteartiinonvse, T20er0i1m.lerin Saklı Anlam İndekslenmeleri”, [7] AÖSzeYl,UB, .I,st“aKnbüurel,sTelurkk-eOyr,ta2la2m3-a2l2ı 7G, r2u0p0l4am. a Yöntemi ile [8] MHoeltmineles,rinDv.e TI.e,rim“Tlehrein SEavkollıuAtinolnamoİfndSektyslloemnmeterlyerii”n,

[3] Be “D Cat 1-4

[4] Son tex Pat

[5] Çil Fil Let

[6] Ciy Tex Pre

[7] Öz Me AS

[8] Ho Hu Co

[9] Am “te Ya

[10] Be Eng

e yüksek temsil . Bunun andırma türdeki plarının için 17 uşan 77 u oluşan etoduyla çapraz larak nbaşarılı anabilir r olması yılabilir. olan TF

2007, Qingdao, China, LNCS Volume 4681, 2007.

[3] Bekkerman R., Ran El-Yaniv, Naftali T., Yoad W.,

“Distributional Word Clusters vs. Words for Text

Categorization”, Journal of Machine Learning Research,

1-48, 2002. [E4M] OSoBngili,mFs.,eLl iDu,eSrg., i,YCanilgt, 2,J.S,a“yAı 4co,mApraaralıtkiv2e0s1tu2dy on

text representation schemes in text categorization”,

Pattern Anal Applic (8), 199–209, 2005.

[5] Çiltik, A. ve Güngör, T., “Time-Efficient Spam E-mail

Filtering Using N-gram Models”, Pattern Recognition

Letters 29(1), 19-33, 2008.

[6] Ciya L., Shamim A., Paul D., “Feature Preparation in

Text Categorization”, Oracle Text Selected Papers and

Presentations, 2001.

[7] Özel, B., “Küresel k-Ortalamalı Gruplama Yöntemi ile

Metinlerin ve Terimlerin Saklı Anlam İndekslenmeleri”,

[8] Holmes, D. I., “The Evolution of Stylometry in

Humanities Scholarship”, Literary and Linguistic

Computing, 13 (3): 111-117, 1998.

[9] Amasyalı, M. F., Davletov, F., Torayew, A, Çiftçi, Ü,

“text2arff: Türkçe Metinler İçin Özellik Çıkarım

Yazılımı”, SİU, Diyarbakır, 2010.

[10] Berry, M. W., Browne, M., “Understanding Search

Engines: Mathematical Modeling and Text Retrieval”,

classification of Turkish texts”, INISTA, Istanbul,

Turkey, 112 - 117, 2011.

classification of Turkish texts”, INISTA, Istanbul, Turkey, 112TM- 1M17O, 2B01E1l.ektrik Mühendisleri Odası