Bilimsel Dergi · Cilt: 4 Sayı: 1 · Haziran/2014

Geniş Metin Koleksiyonlarından İteratif Bilgi Çıkarımı Iterative Information Extraction from Large Text Collections

Gürkan Şahin, Fatih Amasyalı

Bilgisayar, yazılım ve internet Teknik / bilimsel makale

Yıl
2014
Sayfa
11
Okuma süresi
31 dk
Görüntülenme
0

Konu

Bilgisayar, yazılım ve internet

Anahtar kelimeler

  • Bilgi Çıkarımı
  • Doğal Dil İşleme
  • Şablonlar Yöntemi
  • Apache Lucene
  • WordNet
  • Morfolojik Analiz

Özet

Şablonlar yöntemi kullanılarak geniş metin koleksiyonlarından anlamsal ilişkili kelime ikililerinin (üst sınıf ve kardeş ilişkisi) otomatik olarak çıkarılmasını sağlayan bir sistem geliştirilmiş; morfolojik olarak çözümlenmiş ve çözümlenmemiş veri setleri üzerindeki deneysel sonuçlar karşılaştırılmıştır.

Tam metin

Metin PDF'ten otomatik çıkarılmıştır; tablo, şekil ve formüller eksik ya da hatalı olabilir. Özgün dizgi için PDF'e bakın.

Geniş Metin Koleksiyonlarından Yinelemeli Bilgi Çıkarımı

Iterative Information Extraction from Large Text Collections

Gürkan Şahin1, M. Fatih Amasyalı1 1Elektrik Elektronik Fakültesi, Bilgisayar Mühendisliği Bölümü

Yıldız Teknik Üniversitesi [email protected] , [email protected],

Özetçe— Geniş metinlerden bilgi çıkarımı konusunda çeşitli yöntemler bulunmaktadır. Bunlardan bir tanesi de şablonlar yöntemidir. Bu çalışmada şablonlar yöntemini kullanarak aralarında belli anlamsal ilişki bulunan ikililerin elde edilmesini sağlayan otomatik bir sistem geliştirilmiştir. Çalışma kapsamında morfolojik olarak çözümlenmiş ve çözümlenmemiş veri setleri üzerinde ayrı ayrı çalışılmıştır. Morfolojik olarak çözümlenmiş veri setinden daha iyi yapıda şablonlar elde edilmiştir. Yapılan denemeler sonucunda sürekli artan sayıda şablon kullanıldığı taktirde üretilen ikililerin doğruluklarının azaldığı görülmüştür. Sabit sayıda daha güvenilir şablonlardan büyüyen veri seti üzerinde daha iyi sonuçlar elde edilmiştir.

Anahtar Kelimeler— Doğal Dil İşleme, Bilgi Çıkarımı, Şablonlar Yöntemi, Morfolojik Analiz, Anlamsal İlişki

Abstract— There are various methods about information extraction from large texts. One of them is method of templates. We developed an automatic system that aims to produce pairs which have semantic relation between them using templates. We worked with morphological resolved and unresolved datasets. We obtained better templates from morphological resolved dataset. In our experiments, we observed that if too many templates were used for producing pairs, accuracy of produced pairs decreased. Also, we obtain better results for fixed and more reliable templates with using growing datasets.

Keywords— Natural Language Processing, Information Extraction, Templates Method, Morphological Analysis, Semantic Relation

1. GİRİŞ

Bilgi çıkarımı, bir bilgi kaynağı içerisinden çeşitli doğal dil işleme algoritmaları kullanılarak istenilen türdeki bilgilerin çıkarılması işlemidir. Bilgi kaynağı olarak hazır metin kütüphaneleri kullanılabileceği gibi web sayfalarının içerikleri de kullanılabilmektedir. Buradaki amaç sisteme dışarıdan insan müdahalesini en aza indirerek yüksek başarımlı bilgi çıkarabilen bir sistem gerçekleştirmektir.

WordNet [1] aralarında çeşitli türden ilişkilerin bulunduğu kelimelerden oluşan bir yapıdır. Günümüzde doğal dil işleme

projelerinde WordNet’in kullanımı büyük bir önem teşkil etmektedir. Bu nedenle WordNet’in otomatik olarak oluşturulması fikri doğmuştur. Literatürde WordNet’ in oluşturulmasıyla ilgili çeşitli çalışmalar ve yöntemler bulunmaktadır. Türkçe WordNet’ in otomatik olarak oluşturulması amacıvla Balkanet projesi başlatılmış, bu proje sonucunda 11.628 eş küme ve bunlar arası 17.550 ilişki içeren bir anlamsal veritabanı oluşturulmuştur [2].

Geniş metinlerden bilgi çıkarımı konusunda çeşitli yöntemler bulunmaktadır. Şablonlar yöntemi ve öğelerine ayrılmış metinlerin kullanılması bu yöntemlere örnek olarak verilebilir [3].

Bu çalışmada aralarında çeşitli türden anlamsal ilişkilerin bulunduğu ikililerin geniş metin koleksiyonları içerisinden otomatik olarak çıkarılmasını sağlayan bir sistem geliştirilmiştir. Şablon bilgisi kullanılarak geniş metin koleksiyonları içerisinden yinelemeli bilgi çıkarımı yapılması amaçlanmıştır. 2. bölümde yöntemin ayrıntıları verilmiş ve sınırları incelenmiştir. 3. bölümde literatürdeki benzer çalışmalar hakkında bilgi verilmiş, 4. bölümde kullanılan veri kümeleri anlatılmıştır. 5. bölümde deneysel sonuçlar verilmiş, son bölümde ise elde edilen sonuçlar yorumlanmıştır.

2. ŞABLONLAR YÖNTEMİ

Bu çalışmada “şablon”, aralarında anlamsal bir ilişki olan iki kelime arasında kalan, kelime ya da kelime grupları anlamında kullanılmıştır. Örneğin; elma-meyve kelimelerini üst sınıf ilişkisine (Is-A) sahip bir ikili olarak ele alalım. Burada elma varlığı, meyve ise varlığa ait üst sınıfı temsil etmektedir. Bu ikili arasında geçebilecek kelimeler ise bu ilişkiye ait şablondur. Örneğin; “… elma ve benzeri meyveler …” cümlesindeki elma ve meyve kelimeleri arasında kalan ‘ve benzeri’ kelime grubu üst sınıf ilişkisine sahip bir şablondur. Yaygın olarak kullanılan bir başka anlamsal ilişki ise aynı üst sınıfa ait ikililerden oluşan ilişki (kardeş ilişki) türüdür. Örneğin; köpek-kedi ikilisinde hem köpek hem de kedi varlıkları hayvan üst sınıfına aittir. “… köpek ya da kedi …” cümlesindeki köpek ve kedi kelimeleri arasında kalan ‘ya da’ kelime grubu kardeş ilişkiye ait şablondur.

Çalışma kapsamında yaygın olarak kullanılan, kolaylıkla ayırt edilebilecek şablonların üretilebileceği anlamsal ilişkiler kullanılmıştır. Bunlardan bir tanesi üst sınıf ilişkisi diğeri ise aynı üst sınıfa ait olan ikililerin oluşturduğu ilişkidir.

İlk önce her iki ilişki türü için doğruluğundan emin olduğumuz ikililer (pozitif ikililer) belirlenmiştir. Bu işlem bir kez yapılmıştır. Daha sonra bu ilişki türüne sahip olmayan ikililer (negatif ikililer) belirlenmiştir. Pozitif ve negatif ikilileri belirlememizdeki amaç pozitif ikililer için bulunan şablonların negatif ikililer için bulunan şablonlardan farklı olmasının sağlanmasıdır. Yani pozitif ikililer için bulunan bir şablon negatif ikililer için de bulunmuşsa aslında bu şablonun hiçbir önemi yoktur ve yeni ikililerin üretilmesinde kullanılmamalıdır.

Üzerinde çalıştığımız veri seti çok büyük olduğundan özellikle arama işlemlerinin hızlı bir şekilde yapılabilmesi için Apache Lucene [4, 5] kütüphanesi kullanılmıştır. Hazırladığımız pozitif ve negatif ikililer, üzerinde çalışacağımız veri setimizde Lucene ile aratılarak bu ikililerin birlikte geçtikleri cümleler bulunmuştur. Daha sonra bu cümleler içinde ikililerin arasında kalan kelime ya da kelime grupları (en fazla 2 kelime) bulunarak şablon olarak kaydedilmiştir. Pozitif ve negatif ikililere ait şablonlar bulunmuş ve ortak bulunan şablonlar pozitif şablonlardan çıkartılmıştır. Böylece sadece pozitif ikililere ait olan şablonlar elde edilmiştir.

Şablonlar bulunduktan sonra bu şablonlara ait ikili frekans değerleri hesaplanmıştır. Buradaki ikili frekans değeri ilgili şablonun başlangıç ikililerinden kaç tanesi için bulunduğunu gösteren bir sayı değeridir. Bir şablonun ikili frekans değeri ne kadar yüksek ise o şablonun daha fazla ikili için bulunduğu anlaşılmaktadır. Başka bir deyişle bir şablonun ikili frekans değeri ne kadar yüksek ise o şablon o kadar güvenilirdir denebilir.

3. BENZER ÇALIŞMALAR

Literatürde şablon bilgisini kullanarak bilgi çıkarımının yapıldığı bir çok çalışma bulunmaktadır. Marti A. Hearst 1998 yılında yaptığı çalışmasında WordNet ilişkilerinin belirlenmesinde şablon bilgisini kullanmıştır [6]. Benzer şekilde 1998 yılında Brin, şablonlar yöntemini kullanarak kitap-yazar ikililerini bulan bir çalışma yapmıştır [7]. Güncel ve en popüler çalışmaya örnek olarak ise NELL [8] verilebilir. NELL Ocak 2010 yılında geliştirilen ve web sayfaları içerisinden yinelemeli bilgi çıkarımı yapmayı hedefleyen bir sistemdir. NELL’in geliştirilmesinin amacı web sayfaları üzerinde sürekli çalışan, yeni bilgiler öğrenen ve geçmişte öğrendiği bilgileri gelecekte yeni bilgiler üretmede kullanan bir sistem gerçekleştirmektir [9]. Bu sistemin en belirgin özelliği bilgi çıkarımında şablon bilgilerini kullanması ve çok büyük miktardaki bir veri kümesi üzerinde çalışmasıdır. Bu sistemde ilk olarak doğruluğundan emin olunan ikililerden şablonlar üretilmektedir. Daha sonra ise üretilen bu şablonlar kullanılarak aynı anlamsal ilişkiyi sağlayan yeni ikililer üretilmektedir. Üretilen bu yeni ikililer tekrar sisteme giriş bilgileri olarak verilmekte, ikililerden şablonlar ve şablonlardan da yeni ikililer üretmektedir. Sonuçta bu sistem sayesinde web

sayfaları üzerinden yinelemeli bir şekilde bilgi çıkarımı yapılmaktadır.

4. KULLANILAN VERİ KÜMELERİ

Bilindiği üzere bilgi çıkarımı işlemi için büyük çapta veri setine ihtiyaç vardır. Gerçekleştirdiğimiz sistemde kendi oluşturduğumuz metin kütüphaneleri kullanılmıştır. Bu kısımda bilgi çıkarımında kullandığımız veri setinin nasıl elde edildiği üzerinde durulmuştur.

Veri kütüphanelerimizin oluşturulması için farklı birçok kaynak kullanılmıştır. Elimizde bulunan bazı hazır metin dosyalarının yanı sıra bilim teknik dergisinin 45 yıllık arşivindeki pdf dosyalarından ve bilim teknik çocuk dergisinin pdf dosyalarından da çeşitli metinler elde edilmiştir. Pdf dosyalarından metin bilgilerini elde etmek için Apache Tika [10] kütüphanesi kullanılmıştır. Daha sonra elde edilen bu düzensiz yapıdaki metinler ‘.’, ‘!’, ‘?’ gibi noktalama karakterlerinden bölünerek cümleler elde edilmiştir. Elde edilen bu cümleler her satıra bir cümle gelecek şekilde veri kütüphanelerimize kaydedilmiştir.

Sonuç olarak çeşitli kaynaklardan elde edilmiş yaklaşık 3.5 milyon adet cümleden oluşan 4 adet veri seti elde edilmiştir. En büyük çaptaki ‘A’ veri setimiz çoğunluğu haber metinleri [11] olan cümleleri içermektedir. Bu veri setimiz iyi yapıda bulunan cümlelerden oluşmaktadır. ‘B’ veri setimiz bilim teknik dergisinin 45 yıllık arşivinden oluşan pdf dosyalarından elde ettiğimiz cümlelerden oluşmaktadır. ‘C’ veri setimiz hikaye ve roman gibi kitap içeriklerinden oluşan ve genel olarak iyi yapıdaki cümlelerden oluşmaktadır. ‘D’ veri setimiz ise bilim teknik çocuk dergisi pdf dosyalarından elde ettiğimiz cümlelerden oluşmaktadır. ‘B’ ve ‘D’ veri setlerimiz pdf dosyalarından elde edildikleri için diğer veri setlerine göre biraz daha kötü yapıdadır ve yanlış, hatalı kelimeler içermektedir. Bu veri setleri içerisinde bulunan cümle sayıları bilgileri Tablo 1’de verilmiştir.

TABLO 1. VERİ SETİ İÇERİKLERİ VE CÜMLE SAYILARI

Veri Seti Veri seti adı ID

Sentences.txt

Bilim teknik dergisi.txt

Kitap.txt

Bilim teknik çocuk

dergisi.txt

İçeriği

Haber metinleri

Bilimsel metinler Hikaye, roman vb. kitap metinleri

Bilimsel metinler

İçerdiği cümle sayısı

2.090.162 701.523

518.414

181.285

Üst sınıf ilişkisi için şablonlar üretilmesi amacıyla kullanılan 100 adet pozitif başlangıç ikililerinden bir kısmı Tablo 2’de verilmiştir. Üst sınıf ilişkisi için şablonlar üretilirken negatif başlangıç ikilileri olarak Tablo 3’deki kardeş ilişkisine ait ikililer kullanılmıştır.

TABLO 2. ÜST SINIF (IS-A) İLİŞKİSİ İÇİN ŞABLON ÜRETMEDE KULLANILAN POZİTİF BAŞLANGIÇ İKİLİLERİNDEN ÖRNEKLER

dolar para amerika batı iran ülke esnaf meslek taş madde kan doku

türkiye devlet protein bileşen amca akraba bütçe kaynak tüfek silah ehliyet belge

boya malzeme güneş yıldız

ekmek besin kanser hastalık

bakan siyasi çatlak hasar

kapkaç suç

salon yer

incir meyve bez malzeme

antibiyotik ilaç ilaç ürün

Kardeş ilişkisi için şablonlar üretilmesi amacıyla kullanılan 100 adet pozitif başlangıç ikililerinden bir kısmı Tablo 3’de verilmiştir. Kardeş ilişkisi için şablonlar üretilirken, negatif başlangıç ikilileri olarak Tablo 2’deki üst sınıf ilişkisine ait ikililer kullanılmıştır.

TABLO 3. KARDEŞ İLİŞKİSİ İÇİN ŞABLON ÜRETMEDE KULLANILAN POZİTİF BAŞLANGIÇ İKİLİLERİNDEN ÖRNEKLER

mavi siyah kandil meşale basit karmaşık sıvı gaz kovuk mağara büyü küçül

yaprak meyve otel pansiyon kestane erguvan bitki hayvan tuz şeker ses video

kart nakit metal plastik meyve et sağ sol bitki hayvan kitap kalem

eksik yanlış emekli ssk anne baba çocuk arkadaş kardeş arkadaş amir patron

Tablo 2 ve 3’teki ikililerin tamamı Ek 1 ve Ek 2’de verilmiştir.

5. DENEYSEL SONUÇLAR

Bu kısımda morfolojik olarak çözümlenmiş ve çözümlenmemiş olan veri setleri üzerinde ayrı ayrı çalışılmış ve sonuçlar gözlemlenmiştir.

5.1. MORFOLOJİK OLARAK ÇÖZÜMLENMEMİŞ VERİ SETİ İLE ÇALIŞMA

Bu bölümde morfolojik [12] olarak çözümlenmemiş (eklerine ayrışmamış kelimelerden oluşan) olan veri setimizden şablonların üretilmesi ve üretilen şablonlardan yeni ikililerin bulunması anlatılmış, çeşitli değerlendirmeler yapılmıştır.

Eklerine ayrışmamış kelimelerden oluşan veri seti üzerinde

bilgi çıkarımı yapmanın bazı olumsuz yönleri bulunmaktadır.

Veri setimiz içinde aradığımız bir kelime kök haliyle

bulunabilirken

ekleriyle

birlikte

alındığında

bulunamayabilmektedir. Örneğin; “… elmaların ve benzeri

meyvelerin …” cümlesinin veri setimizde olduğunu düşünecek

olursak ve başlangıç ikililerimizden bir tanesi olarak elmameyve ikilisini sisteme verirsek elma ve meyve kelimeleri kök

halleriyle bu cümlede bulunamayacağı için ‘ve benzeri’

şablonu da üretilemeyecektir. Oysa elma-elmaların ya da

meyve-meyvelerin kelimeleri aynı nesneyi ifade etmektedir.

Bu kapsamda öncelikle pozitif başlangıç ikililerinden şablonlar elde edilmiş sonra bu şablonlardan yeni ikililer üretilmiştir. Bunun için elde edilen şablonlar morfolojik olarak çözümlenmemiş veri setimiz içerisinde aratılarak geçtiği cümleler belirlenmiştir. Daha sonra şablonların geçtiği bu cümlelerde şablonun sağında ve solunda kalan kelimeler ilgili

ilişkiyi sağladıkları varsayılarak yeni ikili olarak kaydedilmiştir. Sonuçta pozitif ikililerden elde edilen şablonlar kullanılarak aynı ilişki türünü sağladığı düşünülen birçok yeni ikili üretilmiştir. Daha sonra üretilen bu yeni ikililerin şablon frekans değerleri hesaplanılmıştır.

Şablon frekans değeri, ilgili ikilinin üretilen şablonlardan kaç tanesinde geçtiğini gösteren bir sayı değeridir. Bir ikilinin şablon frekans değeri ne kadar yüksek ise o ikilinin daha fazla şablon için bulunduğu anlaşılmaktadır. Başka bir deyişle bir ikilinin şablon frekans değeri ne kadar yüksek ise o ikili o kadar güvenilirdir denebilir.

Yeni ikililer üretildikten sonar, bu ikililer de sisteme pozitif ikililer olarak negatif ikililerle birlikte verilmiş, bunlardan yeni şablonlar üretilmiş, üretilen şablonlardan gerekli elemeler yapılmış ve kalan şablonlardan yeni ikililer bulunmuştur. Böylece yinelemeli bir şekilde her iki ilişki türüne ait anlamsal ikililer otomatik olarak üretilmiş ve sonuçlar gözlemlenmiştir. Bu işlem yapılırken veri setimizin tümü (A+B+C+D) kullanılmıştır.

Üst sınıf ilişkisi için başlangıç ikililerinden üretilen şablonlar, bu şablonların ikili frekans değerleri ve bu şablonların başlangıç ikililerinden hangileri için bulunduğu bilgileri Tablo 4’de verilmiştir.

TABLO 4. ÜST SINIF (IS-A) İLİŞKİSİ İÇİN BULUNAN ŞABLONLAR

Şablon ve diğer ve benzeri gibi bir

frekansı 14

[esnaf-meslek], [kan-doku], [pasaportkimlik], [işkence-kötü], [gayrimenkulmal], [silah-malzeme], [benzin-enerji], [baklava-tatlı], … [tatlı-gıda],[klor-kimyasal], [otomobilaraç], [karides-kabuklu], [faks-iletişim], [süt-ürün], [portakalnarenciye], [kiraz-meyve], … [ehliyet-belge], [çöl-yer]

benzeri

[klor-kimyasal], [güneş-yıldız]

ve çeşitli

[polis-güvenlik]

gibi doğal

[sel-afet]

dışındaki

[silah-malzeme]

gibi çeşitli ve değerli

[klor-kimyasal]

[çanta-eşya]

veya diğer

[kuş-hayvan]

gibi çok

dışında diğer

[istanbul-il]

Tablo 4’te verilen şablonların kullanılmasıyla üretilen yeni ikililerden bazıları, bu ikililerin şablon frekansı değerleri ve hangi şablonlar için bulunduğu bilgileri Tablo 5’de verilmiştir. Bilindiği gibi morfolojik analizi yapılmamış veri seti üzerinde çalıştığımız için üretilen ikililer ekli halleriyle elde edilmiştir. Bu ikililerin ekleri parantez içinde belirtilmiştir. “*” sembolü bu ikilinin sisteme başlangıç olarak verdiğimiz ikililerden bir tanesi olduğunu, başında sembol bulunmayan ikililer ise

başlangıç ikililerinden farklı olarak üretilen ikilileri temsil etmektedir.

TABLO 5. ÜST SINIF (IS-A) İLİŞKİSİ İÇİN ÜRETİLEN İKİLİLER

Üretilen ikili *dolar-para

İkilinin geçtiği şablonlar [ve diğer], [gibi bir]

çay-sıcak

tavuk-kanatlı

*pasaport-kimlik

[ve diğer], [gibi bir]

türkiye-ülke(lere)

güve(ler)-böcek(leri)

[ve benzeri]

vatoz(u)-balık (ları)

kükürt-kokulu

nane-baharat(lar)

kurtçuk-omurgasız(larla)

böcek(lerle)-küçük

tüsiad-kuruluş(lar)

tıp-alan(lar)

bakan(ı)-yetkili(lerle)

abla(sı)-akraba(lar)

dede(m)-akraba(larımız)

kitap(lara)-belge(lere)

kılıç(lar)-silah(lar)

paşa-yetkili(lere)

ayasofya-cami(ler)

üniversite(lere)-kurum(lara)

Kardeş ikililer için başlangıç ikililerinden üretilen şablonlar, bu şablonların ikili frekans değerleri ve bu şablonların başlangıç ikililerinden hangileri için bulunduğu bilgileri Tablo 6’da verilmiştir.

TABLO 6. KARDEŞ İLİŞKİSİ İÇİN BULUNAN ŞABLONLAR

ya da hem de ne de değil ve bir ile bir

frekansı 43

[basit-karmaşık], [sıvı-gaz], [balıkbalina], [kız-erkek], … [kız-erkek], [petrol-gaz], [özel-kamu], [sağ-sol], … [kuş-böcek], [kadın-erkek], [eksikyanlış], [iyi-kötü], … [iki-üç], [su-hava], [ekmek-meyve], [türk-ermeni], [sağ-sol] [kız-erkek], [bilgisayar-telefon], [kadın-erkek] [kız-erkek], [kadın-erkek]

yerine

[iki-üç], [kadın-erkek]

bir de

[kadın-erkek], [iyi-kötü]

Tablo 6’da verilen şablonların kullanılmasıyla üretilen yeni ikililerden bazıları, bu ikililerin şablon frekansı değerleri ve hangi şablonlar için bulunduğu bilgileri Tablo 7’de verilmiştir.

TABLO 7. KARDEŞ ILIŞKISI IÇIN ÜRETILEN IKILI BILGILERI

*kadın-erkek büyük-küçük yerli-yabancı

[ya da], [hem de], [ne de], [ve bir], [ile bir], [bir de] [ya da], [hem de], [ne de], [ve bir], [bir de] [ya da], [hem de], [ne de], [bir de]

gece-gündüz

[ya da], [hem de], [ne de], [ve bir]

sözlü-yazılı

kadın-çocuk

[ya da], [ve bir], [ile bir]

uzun-kısa

iktidar-muhalefet

ulusal-uluslararası

sivil-askeri

sıcak-soğuk

*sünni-şii

erkek-dişi

siyasi-ekonomik

dost-düşman

bireysel-kurumsal

[ya da], [hem de], [bir de]

türk-yunan

beraberlik-galibiyet

bakan-başbakan

altın-gümüş

sürücü-yolcu

Yapılan bu işlemler sonucunda üretilen ikililerin ekli yapıda olduğu görülmüştür. Bu durum yeni şablonlar ve ikililer üretmede verimli bir yöntem olmadığından veri setindeki kelimelerin eklerine ayrıştırılarak üzerinde işlem yapılması ve elde edilen sonuçların birbirleriyle karşılaştırılarak bir sonuç çıkartılması amaçlanmıştır.

5.2. MORFOLOJİK OLARAK ÇÖZÜMLENMİŞ VERİ SETİ İLE ÇALIŞMA

Veri setimiz içerisindeki kelimelerin morfolojik olarak çözümlenmesi için Zemberek 2 kütüphanesi kullanılmıştır. Zemberek, açık kaynak kodlu Türkçe Doğal dil işleme kütüphanesidir [13]. Tamamen Java ile geliştirilen kütüphane, yazım denetimi, hatalı kelimeler için öneri, heceleme, çözümleme gibi çeşitli işlevlere sahiptir. Zemberek’ in yapabildiği işlemleri gösteren demo uygulamaya http://zemberek-web.appspot.com/ adresinden erişilebilir. Proje kapsamında kelimelerin morfolojik olarak çözümlenmesi için

Zemberek 2’ nin “Çözümle” fonksiyonu kullanılarak kelimeler eklerine ayrıştırılmıştır.

Zemberek kelime çözümleme işlemini gerçekleştirirken birden fazla sonuç döndürebilmektedir. Bu sonuçlar genel olarak kelimenin kullanımı itibariyle doğruluğu yüksek olan çözümlemeden doğruluğu düşük olan çözümlemeye doğru sıralanmaktadır. Bu kapsamda bir kelime için birden fazla çözümleme olması durumunda bunlardan ilk olan çözümleme kullanılmıştır.

Zemberek çözümleme işlemini gerçekleştirirken kelimenin bütün eklerini (yapım ekleri ve çekim ekleri) ayrıştırmaktadır. Bilindiği üzere çekim ekleri eklendikleri kelimelerin anlamlarında bir değişiklik meydana getirmezken yapım ekleri eklendikleri kelimelerin anlamlarında ve hatta türlerinde (isim, sıfat, fiil vb…) bile değişiklikler meydana getirebilmektedir. Bu nedenle yapım ekleri büyük önem arz etmektedir ve kelimenin kökünden ayrıştırılmaması gerekmektedir. Çalışmada istenilen, kelimenin anlam ve tür bakımından hiçbir değişikliğe uğramaması için sadece çekim eklerinin ayrıştırılması yapım eklerine dokunulmamasıdır. Bu problemin düzeltilebilmesi için Türkçede sık kullanılan yapım ekleri ve bu eklerin eklendiği kelimenin türünde değişiklik yapıp yapmadığı (fiilden sıfat: yap-yap[an] , isimden isim: kitapkitap[çı], …) belirlenmiştir. Daha sonar çözümlenmiş kelimenin eklerinden bir tanesi bizim belirlediğimiz sık kullanılan yapım eklerinden bir tanesi ise bu yapım eki ya da ekleri kelimenin köküne eklenmiştir. Yapılan bu işlem sayesinde sık kullanılan yapım eklerinin kelimeden ayrıştırılması durumunun önüne geçilmiş ve veri setimizde sadece çekim ekleri ayrışmış olan kelimeler elde edilmiştir. Ayrıca yapılan bu ekleme işlemleri sonucunda gövde haline gelen kelimenin tür bilgisi de eklenen yapım eklerinin yapısı göz önüne alınarak güncellenmiştir. Proje kapsamında belirlediğimiz Türkçede en çok kullanılan yapım eklerinden bazıları aşağıda verilmiştir.

-ISIM_BULUNMA_LIK -ISIM_ANDIRMA_IMSI

-ISIM_BULUNMA_LI

-FIIL_TANIMLAMA_ICI

-ISIM_YOKLUK_SIZ

-ISIM_KUCULTME_CIK

-ISIM_ILGI_CI

-SAYI_SIRA_INCI

Eklerine ayrışmış kelimelerden oluşan veri seti üzerinde

çalışmak sayesinde daha önce bahsettiğimiz kelimenin

eklerinden kaynaklanan problemler aşılmaktadır. Örneğin; “…

elmaların ve benzeri meyvelerin …” cümlesi morfolojik olarak

çözümlendikten sonra “… elma +isim+ ISIM_COGUL_LER +

ISIM_TAMLAMA_IN

benzer+isim+

ISIM_TAMLAMA_I meyve+isim+ ISIM_COGUL_LER +

ISIM_TAMLAMA_IN …” şekline gelmektedir. Böylece

başlangıçta verilen elma-meyve ikilisi kolaylıkla veri seti

içinde bulunacak ve şablon bilgisi olarak da

“ISIM_COGUL_LER+ISIM_TAMLAMA_IN

benzer+isim+ISIM_TAMLAMA_I” elde edilmiş olunacaktır.

Ancak morfolojik olarak çözümlemenin bazı olumsuz yanları da bulunmaktadır. Üzerinde çalıştığımız veri setinin bir kısmı pdf dosyalarından elde edilen verilerden oluşmaktadır. Pdf dosyalarından bilgi çekerken verilerin düzensiz bir yapıda elde edildiği görülmüştür. Bu veri setindeki kelimeler Zemberek ile çözümlenirken önce kelimenin doğru yazılıp

yazılmadığı kontrol edilmektedir. Eğer kelime yanlış yazılmışsa yani anlamsız bir kelime ise Zemberek bu kelimeyi çözümleyememektedir. Dolayısıyla veri setimiz içindeki yanlış kelimeler elenmektedir. Yanlış ve anlamsız kelimelerden kurtulmak bir avantaj gibi görünse de aslında değildir. Çözümlenemeyip atılan bu yanlış veya hatalı kelimeler nedeniyle cümlelerin anlam yapıları bozulmaktadır. Bu da doğru şablon elde edilecekken yanlış bir şablonun elde edilmesine ya da doğru ikililer üretilecekken yanlış ikililerin üretilmesine neden olmaktadır.

Zemberek ile çözümleme yaptıktan sonra cümle sayılarında azalma olmuştur. Bilindiği gibi yabancı kelimeler ve pdf dosyalarından elde edilen bazı yanlış, bozuk kelimeler Zemberek tarafından çözümlenememektedir. Bu nedenle bazı cümlelerin içerdikleri kelime sayıları azalmaktadır. Bu cümlelerden de 3 kelimeden az kelime içerenler işimize yaramadığı için (min. cümle uzunluğu = [kelime+şablon+kelime]) veri seti içerisinden atılmıştır. Veri setimiz içerisinde Zemberek tarafından çözümlenip çözümlenemeyen kelime sayıları ve oranları Tablo 8’de verilmiştir.

TABLO 8. ZEMBEREK ILE ÇÖZÜMLENEN VE ÇÖZÜMLENEMEYEN KELIME

SAYILARI VE ORANLARI

Veri Başlanseti gıçtaki

cümle

sayısı

Çözümlendikten sonraki cümle sayısı

Çözümlenen kelime sayısı

Çözümlenemeyen kelime sayısı

Çözüm lenen kelime oranı (%)

2.090.162 2.037.827 27.578.775 3.106.492

% 89

701.523 644.100 9.177.010 2.169.712

% 80

518.414 499.799 4.833.143

449.871

% 91

181.285 173.412 1.902.072

396.916

% 82

Bu kapsamda öncelikle pozitif başlangıç ikililerinden şablonlar elde edilmiş sonra bu şablonlardan yeni ikililer üretilmiştir. Bunun için elde edilen şablonlar çözümlenmiş kelimelerden oluşan veri setimiz içerisinde aratılarak geçtiği cümleler belirlenmiştir. Daha sonra şablonların geçtiği bu cümlelerde şablonun sağında ve solunda kalan kelimeler ilgili ilişkiyi sağladıkları varsayılarak yeni ikili olarak kaydedilmiştir. Bu işlem yapılırken, her iki kelimenin tür bilgilerinin isim-isim, isim-sıfat, sıfat-sıfat, fiil-fiil, zamanzaman gibi aynı türde olanları alınmıştır. Örneğin sistem “masa” ve “mavi” kelimelerini ikili olarak bulursa, bu kelimelerin türleri aynı olmadığından bulunan ikililer listesinden silinmektedir. Böylece anlamsız ikililerinin üretilmesi ve ilerde bu anlamsız ikililerden anlamsız şablonların üretilmesi engellenmeye çalışılmıştır. Sonrasında üretilen yeni ikililerin şablon frekans değerleri hesaplanılmıştır. Yeni ikililer üretildikten sonra bunlar sisteme pozitif ikililer olarak negatif ikililerle birlikte verilmiş, bunlardan tekrar şablonlar üretilmiş, şablonlardan da ikililer üretilerek yinelemeli bir şekilde bilgi çıkarımı yapılmış ve sonuçlar gözlemlenmiştir. Bu işlem yapılırken veri setimizin tümü (A+B+C+D) kullanılmıştır.

Üst sınıf ilişkisi için başlangıç ikililerinden üretilen şablonlar, bu şablonların ikili frekans değerleri ve bu şablonların başlangıç ikililerinden hangileri için bulunduğu bilgileri Tablo 9’da verilmiştir.

TABLO 9. IS-A ILIŞKISI IÇIN ŞABLON BILGILERI

frekansı

isim_çoğul_ler+ isim_belırtme_ı ve+isim diğer+isim gibi+edat bir+sayı isim_tamlama_ın ve+isim diğer+isim

[rapor-belge], [fotoğraf-veri],

[protein-bileşen], [amca-akraba],

[ehliyet-belge], [çöl-yer], [güneşyıldız], [kanser-hastalık], [dünyagezegen]

[rapor-belge], [polis-güvenlik],

[kumar-kötü], [dünya-gezegen]

gibi+edat küçük+isim

[köpek-hayvan], [hamsi-balık],

[kuş-hayvan], [dünya-gezegen]

gibi+edat bazı+sıfat

[iran-ülke], [kan-doku],

[köpek-hayvan], [kanser-hastalık]

gibi+edat çeşitli+isim

[iran-ülke], [klor-kimyasal],

[kobalt-metal]

isim_tamlama_ı ve+isim benzer+isim+

[senet-belge], [spor-faaliyet],

[bez-malzeme]

isim_tamlama_ı

gibi+edat büyük+sıfat

[istanbul-il], [kamyon-araç]

isim_yonelme_e yakın+fiil ol+fiil+ fiil_donusum_en

[istanbul-il], [güneş-yıldız]

isim_çoğul_ler ve+isim benzer+isim+ isim_tamlama_ı

[ceket-eşya], [banka-kurum]

isim_çoğul_ler ve+isim diğer+isim isim_çoğul_ler gibi+edat birçok+isim

[banka-işveren], [kuş-hayvan]

[antibiyotik-ilaç], [kuş-hayvan]

isim_çoğul_ler veya+isim diğer+isim

[sel-felaket], [robot-mekanik]

isim_tamlama_ın ve+isim öteki+isim

[güneş-yıldız], [dünya-gezegen]

isim_yonelme_e ve+isim diğer+isim

[güneş-yıldız], [kanser-hastalık]

isim_tamlama_ı ve+isim gibi+edat

[çanta-eşya], [banka-kurum]

Tablo 9’da verilen şablonların kullanılmasıyla üretilen yeni ikililerden bazıları, bu ikililerin şablon frekansı değerleri ve hangi şablonlar için bulunduğu bilgileri Tablo 10’da verilmiştir.

TABLO 10. IS-A ILIŞKISI IÇIN ÜRETILEN IKILI BILGILERI

*güneş-yıldız

*kuş-hayvan proteinmolekül hormonmolekül böcekomurgasız satranç-spor

2 2 2

[gibi+edat bir+sayı], [isim_yonelme_e yakın+fiil ol+fiil+fiil_donusum_en], [isim_yonelme_e ve+isim diğer+isim] [gibi+edat küçük+isim], [isim_çoğul_ler ve+isim diğer+ isim], [isim_çoğul_ler gibi+edat birçok+ isim] [isim_çoğul_ler+isim_belırtme_ı ve+isim diğer+isim], [gibi+edat büyük+sıfat] [isim_tamlama_ın ve+isim diğer+isim], [isim_çoğul_ler ve+isim diğer+isim] [isim_çoğul_ler+isim_belırtme_ı ve+isim diğer+isim], [isim_çoğul_ler ve+isim diğer+isim] [gibi+edat bir+sayı], [gibi+edat bazı+sıfat]

kimya-bilim tavşanhayvan sincaphayvan güve-böcek kızamıkhastalık *kanserhastalık grip-hastalık gasp-suç akciğerorgan toplantıetkinlik eşya-mal depremfelaket hücre-yapı deprem-afet

*bankakurum

[gibi+edat bir+sayı], [gibi+edat

[gibi+edat küçük+isim], [gibi+edat

bazı+sıfat]

ve+isim diğer+isim]

[gibi+edat bazı+sıfat], [isim_yonelme_e

[gibi+edat bazı+sıfat], [isim_tamlama_ı

ve+isim benzer+ isim+isim_tamlama_ı]

[gibi+edat büyük+sıfat], [isim_yonelme_e

[isim_çoğul_ler ve+isim benzer+

isim+isim_tamlama_ı], [isim_tamlama_ı

ve+isim gibi+ edat]

İkili üretmede kullanılan pozitif ve negatif ikili sayıları, pozitif ikililerden üretilen şablon sayıları, bu şablonlardan ikili üretmek için kullanılan şablonların sayıları (en az 2 ikili için bulunan şablonlar) ve üretilen ikili sayıları hakkında bilgiler Tablo 11’de verilmiştir. Ayrıca üretilen ikililer şablon frekansı değerlerine göre incelenmiş ve doğruluk oranları hesaplanarak Tablo 12’de gösterilmiştir. Bu işlem üretilen çıkış ikililerinin tekrar sisteme giriş ikilileri olarak verilmesi suretiyle 3 iterasyon boyunca devam ettirilmiştir. Üretilen ikililerden şablon fekansına göre büyükten küçüğe doğru sıralanmış ilk 200 tanesi incelenerek bir doğruluk oranı çıkartılmıştır.

TABLO 11. IS-A ILIŞKISI IÇIN ITERASYONA GÖRE SONUÇLAR

Iteras yon no 1

Pozitif ikili sayısı 100

Negatif ikili sayısı 100

Kullanılan şablon sayısı 17

Üretilen ikili sayısı 3.771

1.359

7.909

4.823

138 33.400

isim_cıkma_den ya+isim da+isim isim_yonelme_e mi+soru yoksa+isim isim_tamlama_ı ne+isim de+fiil fiil_yetersızlık_e ya+isim da+isim

[plastik-kil], [anne-baba], [kardeşakraba]

[mavi-yeşil], [iyi-kötü]

[televizyon-radyo], [kadın-erkek]

[kız-erkek], [sağ-sol]

TABLO 12. IS-A ILIŞKISI IÇIN ŞABLON FREKANSINA GÖRE SONUÇLAR

Şablon frekansı >X olan ikililer

1.iterasyon

38 3 1 1 0

338 34 12 5 2

5.026 969 294 136 61

% 68 % 100 % 100 % 100 ___

% 30 % 70 % 91 % 100 % 100

% 25 % 25 % 25 % 30 % 33

Aynı üst sınıfa ait kardeş ikililer için başlangıç ikililerinden üretilen şablonlar, bu şablonların ikili frekans değerleri ve bu şablonların başlangıç ikililerinden hangileri için bulunduğu bilgileri Tablo 13’de verilmiştir.

TABLO 13. KARDEŞ ILIŞKISI IÇIN ŞABLON BILGILERI

ya+isim da+isim isim_tamlama_ı ya+isim da+isim isim_çoğul_ler ya+ isim da+isim mı+soru yoksa+isim bir+sayı de+fiil değil+isim de+fiil

frekansı 56

4 4 3

[balık-balina], [kız-erkek], [kediköpek], [kalp-böbrek], [ağaç-çalı], [kuş-böcek], [otel-pansiyon], … [kedi-köpek], [televizyon-radyo], [telefon-radyo] [anne-baba], [kartnakit], [tedavi-aşı] [orangutan-papağan], [bitki hayvan], [harabe-eski], [türk-ermeni], [il-ilçe] [sıvı-gaz], [sağ-sol], [kadın erkek], [iyi-kötü] [sağ-sol], [kadın-erkek], [annebaba], [iyi-kötü] [basit-karmaşık], [tek-çok], [iki-üç]

isim_çoğul_ler+ isim_kalma_de hem+isim de+fiil

[kız-erkek], [bitki-hayvan], [kadınerkek]

Tablo 13’te verilen şablonların kullanılmasıyla üretilen yeni ikililerden bazıları, bu ikililerin şablon frekansı değerleri ve hangi şablonlar için bulunduğu bilgileri Tablo 14’de verilmiştir.

TABLO 14. KARDEŞ ILIŞKISI IÇIN ÜRETILEN IKILI BILGILERI

Üretilen ikili *kadın-erkek hayvan-insan yukarı-aşağı atom-molekül

*sıvı-gaz robot-insan yıldız-gezegen kasaba-köy deniz-okyanus çocuk-yetişkin kara-deniz iktidarmuhalefet demir-tahta mercek-ayna hasta-doktor balkon-pencere

6 6 5 5 5 5 4 4 4 4 3

[ya+isim da+isim], [hem+isim de+fiil], [ne+isim de+fiil], [isim_tamlama_ı ya+isim da+isim], [isim_yonelme_e ya+isim da+isim], … [ya+isim da+isim], [hem+isim de+fiil], [ne+isim de+fiil], [isim_tamlama_ı ya+isim da+ isim], [isim_çoğul_ler ya+isim da+isim], … [ya+isim da+isim], [hem+isim de+fiil], [ne+isim de+fiil], [isim_yonelme_e ya+isim da+ isim], [isim_tamlama_ın ya+isim da+ isim], … [ya+isim da+isim], [isim_tamlama_ı ya+isim da+ isim], [isim_yonelme_e ya+isim da+ isim], [isim_çoğul_ler ya+isim da+isim], … [ya+isim da+isim], [hem+isim de+fiil], [ne+isim de+fiil], [isim_çoğul_ler+isim_tamlama_ın ya+ isim da+isim], … [ya+isim da+isim], [hem+isim de+fiil], [ne+isim de+fiil], [isim_çoğul_ler ya+isim da+isim], … [ya+isim da+isim], [ne+isim de+fiil], [isim_çoğul_ler ya+isim da+isim], … [ya+isim da+isim], [isim_yonelme_e ya+isim da+ isim], [isim_çoğul_ler ya+isim da+isim], … [ya+isim da+isim], [isim_çoğul_ler ya+isim da+isim], [isim_tamlama_ın ya+isim da+isim], … [ya+isim da+isim], [isim_çoğul_ler ya+isim da+isim], [isim_tamlama_ın ya+isim da+isim], … [ya+isim da+isim], [hem+isim de+fiil], [mı+soru yoksa+isim], … [ya+isim da+isim], [hem+isim de+fiil], [ne+isim de+fiil], … [ya+isim da+isim], [isim_yonelme_e ya+isim da+isim], [isim_tamlama_ın ya+isim da+isim], … [ya+isim da+isim], [isim_tamlama_ı ya+isim da+isim], [isim_çoğul_ler ya+isim da+isim], … [ya+isim da+isim], [hem+isim de+fiil], [ne+isim de+fiil], … [ya+isim da+isim], [isim_tamlama_ı ya+isim da+isim], [isim_kalma_de

cumhurbaşkanı-

başbakan

ya+isim da+isim], [mı+soru

yoksa+isim]

motor-piston

[ya+isim da+isim], [isim_çoğul_ler

ya+isim da+isim],

[isim_çoğul_ler+isim_belırtme_ı ya+

isim da+isim]

lise-üniversite

[ya+isim da+isim], [hem+isim de+fiil],

[isim_tamlama_ı ya+isim da+isim]

dürbün-

teleskop

ya+isim da+isim], [isim_tamlama_ın

vakıf-dernek

ya+isim da+isim], [isim_yonelme_e

Ikili üretmede kullanılan pozitif ve negatif ikili sayıları, pozitif ikililerden üretilen şablon sayıları, bu şablonlardan ikili üretmek için kullanılan şablonların sayıları (en az 2 ikili için bulunan şablonlar) ve üretilen ikili sayıları hakkında bilgiler Tablo 15’de verilmiştir. Ayrıca üretilen ikililer şablon frekansı değerlerine göre incelenmiş ve doğruluk oranları hesaplanarak Tablo 16’da gösterilmiştir. Bu işlemler üretilen çıkış ikililerinin tekrar sisteme giriş ikilileri olarak verilmesi suretiyle 3 iterasyon boyunca devam ettirilmiştir. Şablon fekansına göre büyükten küçüğe doğru sıralanmış ikililerden ilk 200 tanesi incelenerek bir doğruluk oranı çıkartılmıştır.

TABLO 15. KARDEŞ ILIŞKISI IÇIN ITERASYONA GÖRE SONUÇLAR

Pozitif ikili sayısı

Negatif ikili sayısı

1.059

Kullanılan şablon sayısı

9.492

3.492

20.601

11.443

32.350

TABLO 16. KARDEŞ ILIŞKISI IÇIN ŞABLON FREKANSINA GÖRE SONUÇLAR

Şablon frekansı >X olan ikililer 1.iterasyon

434 73 25 12 9

1.637 293 114 54 32

6.272 1.357 544 302 171

% 59 % 80 % 92 % 100 % 100

% 55 % 55 % 62 % 75 % 81

% 45 % 45 % 45 % 45 % 50

Yapılan bu işlemler sonucunda iterasyon saysı arttıkça üretilen ikililerin doğruluklarında azalma olduğu gözlemlenmiştir. Bunun nedeninin şablon sayısının sürekli artmasından kaynaklandığı düşünülmüştür. Herhangi bir anlamsal ilişki için elde edilebilecek şablon sayısı belli bir sayıdadır. Yani çok sayıda şablon üretilmesi bunların herbirinin iyi şablonlar olduğu anlamına gelmemektedir. Bu nedenle iyi yapıda şablonları elde ettikten sonra şablon sayısını daha arttırmadan mevcut şablonları kullanmak daha iyi sonuçlar üretebilir. Ayrıca bu işlemler sonucunda ikililerin şablon frekansı değeri arttıkça yani ikilinin geçtiği şablonların sayısı arttıkça bu ikililerin doğruluğunda artma olduğu ancak üretilen ikili sayısnın az olduğu görülmüştür. Aynı şekilde ikililerin şablon frekansı değeri azaldıkça yani ikilin geçtiği şablon sayısı azaldıkça da bu ikililerin doğruluğunda azalma olduğu ancak üretilen ikili sayısnın daha fazla olduğu görülmüştür.

5.3. SABIT SAYIDA ŞABLONLAR ILE BÜYÜYEN VERI SETI ÜZERINDE

ÇALIŞMA

Bu bölümde şablon sayısının sürekli artması yerine belli bir değerde sabitlenmesi sonucu elde edilen sonuçlar gözlemlenmiştir. Yeni ikililer üretmek için kullanılan bu şablonlar tüm veri setinin kullanılmasıyla 1. iterasyon sonunda elde edilen, ikili frekansı 1’den büyük olan şablonlardır. Üst sınıf ilişkisi için şablon sayısı 17, aynı üst sınıfa ait kardeş ilişkisi için ise bu şablon sayısı 37 olarak belirlenmiştir. Elde edilen bu az sayıdaki iyi şablonlar yeni ikililer üretmek amacıyla kullanılmıştır. Bu işlem yapılırken öncekinin aksine veri setinin tamamı kullanılmamış, veri seti parça parça kullanılmıştır. Bunun yapılmasındaki amaç iyi yapıda bulunan sabit sayıdaki şablonlar ile büyüyen veri seti üzerinde çalışmanın etkilerini gözlemleyebilmek ve hangi tür veri setinde nasıl sonuçlar elde edildiği görebilmektir. Şablon frekansına göre büyükten küçüğe doğru sıralanmış ikililerden ilk 200 tanesi incelenerek bir doğruluk oranı çıkartılmıştır. Her iki ilişki türü için morfolojik olarak çözümlenmiş büyüyen veri seti üzerinde elde edilen karşılaştırmalı sonuçlar Tablo 17’de verilmiştir.

TABLO 17. SABIT ŞABLON SAYISI ILE BÜYÜYEN VERI SETI IÇIN SONUÇLAR

Kullanılan veri setleri

Içerdiği cümle sayısı

Ikili doğruluk(%)

Üst sınıf ilişkisi için sonuçlar

Kardeş ilişkisi için sonuçlar

1.183 917 289 210 498

1.402 2.565

% 43 % 43 % 20 % 38 % 40 % 49 % 50

4.064 % 46

105*Üretilen ilişki sayısı / cümle sayısı

6 14 6 12 7 11 8

3.452 % 44

1.415 % 40

825 % 47

2.229 % 49

5.575 % 55

9.492 % 57

Sınırlı sayıda ve daha güvenilir şablonlar kullanılarak elde edilen ikililerin sayısının az fakat doğruluk oranlarının daha yüksek olduğu gözlemlenmiştir. Ayrıca sınırlı sayıdaki iyi şablonları kullanarak büyüyen veri seti üzerinde çalışırken üretilen ikililerin doğruluklarında artma olduğu gözlemlenmiştir.

Yukarıdaliği verilen tablo incelendiğinde üst sınıf ilişkisi için ‘A’ ve ‘B’ veri setlerinden elde edilen ikililer için yaklaşık olarak %43 ile en yüksek doğruluk oranı elde edilmiştir. Yine ‘D’ veri setinin tek başına kullanılmasıyla %38, ‘B’ veri setinin tek başına kullanılmasıyla ise %20 başarı oranı elde edilmiştir. Buradan hareketle üst sınıf ilişkisi için haber metinlerinden oluşan ‘A’ ve bilimsel içeriklerden oluşan ‘B’ veri setlerinin daha iyi içerikler olduğu görülmüştür. Aynı şekilde bilimsel içerikli cümlelerden oluşan ‘D’ veri setinden de yine ‘A’ ve ‘B’ veri setlerine yakın bir değer elde edilmiştir. En düşük doğruluk oranı ise hikaye, roman vb. cümlelerin bulunduğu ‘C’ veri setinden elde edilmiş, bu içeriğin üst sınıf ilişkisi için iyi bir veri seti olmadığı görülmüştür.

Aynı üst sınıfa ait kardeş ilişkisi için en yüksek başarı oranı %47 ile bilimsel içerikli cümlelerden oluşan ‘D’ veri setinden elde edilmiştir. ‘A’ ve ‘B’ veri setlerinden de yine buna yakın değerler elde edilmiştir. ‘C’ veri setinden ise %40 ile en düşük başarı oranı elde edilmiştir. Bu ilişki türü için de haber ve bilimsel içeriklerden oluşan veri setlerinin uygun ikililerin bulunmasında daha verimli oldukları görülmüştür.

Üretilen ikili sayılarının veri kümelerindeki cümle oranlarına bakıldığında (son sütun) en üretken veri kümelerinin bilimsel içeriğe sahip ‘B’ ve ‘D’ oldukları görülmüştür.

6. SONUÇ

Bu çalışmada aralarında belli bir anlamsal ilişki bulunan ikililerin geniş metin koleksiyonları içerisinden yinelemeli bir şekilde çıkartılmasını sağlayan bir sistem geliştirilmiştir. Çalışmamızın katkıları aşağıdaki şekilde özetlenebilir:

-Yinelemeli bilgi çıkarımı için Türkçede ilk çalışma yapılmıştır.

-Bilgi çıkarımında kullanılan metin kaynakların türlerinin sistemin verimliliğine ve doğruluğuna etkileri incelenmiştir. Bilimsel metinlerin, haber ve edebiyat metinlerine göre daha doğru ve verimli sonuçlar ürettiği görülmüştür.

-Önce şablonların bulunması, ardından bu şablonlara uygun yeni ikililerin bulunması, bu ikililerin başlangıç ikililerine dahil edilerek bu sürece devam edilmesinin, bulunan şablon sayısını ve ikili sayısını çok fazla arttırdığı ancak, doğruluk oranlarını düşürdüğü görülmüştür. Bu sonuç, literatürdeki sonuçlarla uyumludur.

-Bu probleme çözüm olarak az sayıda ve güvenilir şablonlar kullanılarak kaynak boyutunun ve çeşitliliğinin arttırılması önerilmiş ve bu sayede hem bulunan ikili sayısını hem de doğruluk oranını arttığı gözlenlenmiştir. Veri boyutu arttığında bulunan ikili sayısının artması beklenen bir sonuçtur. Ancak doğruluk oranının da artışı çalışmamızın literatüre katkısıdır.

Çalışmamızın başarısını iki yönden değerlendirmek gerekir. İlki sistemin verimliliği diğer bir ifadeyle kullandığı verilerin boyutuna göre üretebildiği ikililerin oranıdır. Sistemimizin verimliliği bu alandaki en bilinen ve en gelişmiş sistem olan NELL ile karşılaştırılmıştır. NELL’in veri kaynağı 500 milyon web sitesidir. Bir web sitesinin yaklaşık 500 kelime içermektedir [14]. Buna göre NELL’in veri kaynağında yaklaşık 500*500*106 = 25*1010 kelime bulunmaktadır. NELL 2010 yılında öalıştığı ilk 63 günde 242 bin, günümüze kadar geçen 858 günde yaklaşık 2.5 milyon ikili bulmuştur. Veri kaynağındaki kelime sayısı ile bulunan ikili sayısı oranlanırsa (25*1010) / (25*105)= 105 bulunur. Diğer bir ifadeyle veri kaynağındaki her 100 bin kelime için 1 adet ikili bulmuştur. Bizim sistemimiz (yaklaşık 45 milyon kelimeden 2500 üst sınıf, 9500 kardeş toplamda 12 bin ikili bulunmuştur) için aynı oran hesaplanırsa (45*106) / (12*103) = yaklaşık 4*103 bulunur. Diğer bir ifadeyle veri kaynağındaki her 4000 kelime için 1 ikili bulmuştur. NELL’in ve bizim sistemimiz için hesaplanan iki oran karşılaştırıldığında sistemimizin verimliliğinin NELL’den yüksek olduğu açıktır. Bu farklılık üzerinde çalışılan metin kütüphanelerinin türü ile açıklanabilir. Tablo 17’de göstermiş olduğumuz üzere farklı türdeki veri kaynaklarının verimlilikleri birbirinden farklıdır. Buna gore NELL’in üzerinde çalıştığı rastgele seçilmiş Web sayfalarının verimliliği bizim veri kaynaklarımızın verimliliğinden daha düşüktür.

Sistemin başarısını değerlendirmek için kullandığımız diğer kriter ikililerin doğruluk oranıdır. Karşılaştırma için yine NELL kullanılmıştır. Yayınlanan çalışmalara göre NELL’in ikilileri %74 oranında doğruluğa sahiptir. Ancak bu oran NELL’in çalıştığı 123 adet ilişki türünün ortalamasıdır. Her bir ilişki türü için değerler ayrı ayrı verilmemiştir. Bizim sistemimiz sadece 2 ilişki türü için çalıştırılmıştır. Elde edilen en iyi doğruluk oranları üst sınıf ilişkisi için %50, kardeş ilişkisi içinse %57’dir. Doğruluk oranındaki bu farkın temel sebebi sistemin kavramların tek kelimeden oluştuğu varsayımıdır. Sistemin yanlış olarak bulduğu ikililerde bu sorun açıkça görülmektedir. Örneğin sistem, “hemşireler ve diğer sağlık çalışanları” ifadesinden “Xler ve diğer Y” şablonuna göre “sağlık” ve “hemşire” arasında üst kavram ilişkisi bulmaktadır. Eğer önce kelime öbekleri bulunsaydı ilişki “sağlık çalışanı” ve “hemşire” arasında bulunabilecektir. Buna çözüm için, şablonlar bulunmadan önce metinler üzerinde varlık isim tanımlama çalışıtırıp (name entity recognition), tek bir kavramı ifade eden kelime öbeklerini (Taksim Meydanı, İstiklal Caddesi, Ege Bölgesi vb.) belirlemek gerekmektedir.

Mevcut çalışma kapsamında ayırt edici şablonlar elde edilebilmesi amacıyla yaygın olarak kullanılan iki anlamsal ilişki kullanılmış ve mevcut örnekler bu anlamsal ilişkiler üzerinden verilmiştir. Verilen bu iki örnek anlamsal ilişki haricinde de herhangi bir anlamsal ilişki için (zıt anlam, eş

anlam vb…) bu çalışmalar kolaylıkla gerçekleştirilebilir. Yapılması gereken sadece istenilen anlamsal ilişkiyi sağlayan pozitif ve negatif başlangıç ikililerinin belirlenmesi ve bunların sisteme giriş olarak verilmesidir.

Gelecek çalışma olarak, sistemin bulduğu iliklileri arttırmak için web sayfaları üzerinde sürekli büyüyen bir veri kaynağıyla çalışılması amaçlanmaktadır. Şablon sayısının sürekli artması yerine yine belli bir değerde sabitlenmesi ve bu şablonların kullanılması düşünülmektedir. Ayrıca tek kelime yerine kelime gruplarından (isim, sıfat tamlaması vb…) oluşan ikililerin de bulunması ve farklı ilişki türleri için de ikililerin çıkarılması amaçlanmaktadır.

KAYNAKÇA

[1] Miller, G. A., Beckwith, R., Fellbaum, C., Gross, D. and Miller, K., “Introduction to WordNet: An On-line Lexical Database”, 1993.

[2] Automatic Extraction of Semantic Relationships Using Turkish Dictionary Definitions", Emre Yazıcı, M.Fatih Amasyalı, EMO Bilimsel Dergi, Vol. 1, No. 1, pp. 1-13, 2011

[3] Amasyalı M. F., "Türkçe Wordnet'in Otomatik Olarak Oluşturulması", SIU 2005, 2005.

[4] http://lucene.apache.org/core/

[5] http://tr.wikipedia.org/wiki/Lucene

[6] Hearst, M., ``Automated Discovery of WordNet Relations,'' in WordNet: An Electronic Lexical Database, Christiane Fellbaum (ed.), MIT Press, 1998.

[7] htpp://maya.cs.depaul.edu/~classes/etc584/papers/brin.pdf

[8] http://rtw.ml.cmu.edu/rtw/

[9] Andrew Carlson1, Justin Betteridge1, Bryan Kisiel1, Burr Settles1, Estevam R. Hruschka Jr.2, and Tom M. Mitchell., “Toward an Architecture for Never-Ending Language Learning”

[10] http://tika.apache.org/

[11] http://www.kemik.yildiz.edu.tr/?id=28

[12] http://tr.wikipedia.org/wiki/Morfoloji

[13] http://tr.wikipedia.org/wiki/Zemberek_%28yaz%C4%B1l%C4 %B1m%29

[14] Levering, R., ve M. Cutler, "The Portrait of a Common HTML Web Page,", DocEng 2006, pp.198-204, 2006

EK 1. Üst sınıf (is-a) ilişkisi için şablon üretmede kullanılan pozitif başlangıç ikilileri

dolar para

türkiye devlet

boya malzeme

güneş yıldız

amerika batı iran ülke esnaf meslek taş madde kan doku pasaport kimlik saldırı suç gıda ihtiyaç dershane kurs rapor belge polis güvenlik muayene işlem köpek hayvan işkence kötü silah alet banka işveren gayrimenkul mal ilaç tıbbi fotokopi belge fotoğraf veri taş nesne istanbul il sorgu işlem rehberlik hizmet

protein bileşen amca akraba bütçe kaynak tüfek silah ehliyet belge sel afet sandalye mobilya otobüs araç tatlı gıda çavdar tahıl jimnastik spor battaniye malzeme çöl yer salon mekan silah malzeme yelken spor yoğurt madde klor kimyasal kumar kötü kamyonet araç ceket eşya senet belge spor faaliyet otomobil araç

ekmek besin bakan siyasi kapkaç suç incir meyve antibiyotik ilaç sel felaket benzin enerji plastik malzeme karides kabuklu bit küçük aspirin ilaç faks iletişim plastik madde hamsi balık naftalin madde baklava tatlı petrol sıvı laboratuvar ortam brokoli yeşil kamyon araç kobalt metal parazit canlı jeoloji alan tank araç

kanser hastalık çatlak hasar salon yer bez malzeme ilaç ürün çanta eşya süt ürün banka kurum kafeterya yer tavuk hayvan portakal narenciye fon bütçe kiraz meyve kurt vahşi robot mekanik kuş hayvan peynir ürün nane baharat kaya sert psikoloji bilim meyve besin bakır maden su madde dünya gezegen

EK 2. Kardeş ilişkisi için şablon üretmede kullanılan pozitif başlangıç ikilileri

mavi siyah

yaprak meyve

görüntü fotoğraf

eksik yanlış

kandil meşale basit karmaşık sıvı gaz kovuk mağara büyü küçül balık balina sperm kromozom kız erkek kedi köpek televizyon radyo hücre kan mavi yeşil bisküvi meyve tek çok iki üç kalp böbrek pembe mor plastik kil ağaç çalı mürekkep boya çadır sığınak dip yüzey bal şeker kuş böcek

otel pansiyon orangutan papağan bitki hayvan tuz şeker ses video yürü koş cam tavan kestane erguvan televizyon bilgisayar petrol gaz ev otel kum çakıl ayna gözlük su hava kaçak kayıp plastik cam saz bambu kum çamur akşam sabah harabe eski müze tarihi özel kamu kimyasal nükleer deterjan sabun

metal plastik meyve et sağ sol bitki hayvan kitap kalem kalem kağıt masa sandalye televizyon radyo otobüs taksi bilgisayar telefon telefon radyo rüya düş kadın erkek amca dayı fizik kimya ekmek su ekmek meyve aslan kaplan aslan kartal asker polis polis memur vatan yurt ömür yaşam cep çanta

emekli ssk anne baba çocuk arkadaş kardeş arkadaş amir patron kart nakit sünni şii ordu emniyet türk ermeni yerli ithal enerjik yorgun spor tiyatro bal pekmez mülk toprak mart nisan kardeş akraba tedavi aşı üniversite hastane fazla eksik silah bomba kişi grup il ilçe iyi kötü can mal