Jaccard Benzerliği
Jaccard benzerliği, iki kümenin ortak öğelerinin o iki kümedeki farklı öğelerin toplamına oranıdır.
İki başlık önce kelime kümesine dönüştürülür. Ortak kelime sayısı, iki kümede geçen farklı kelimelerin toplamına bölünür. Sonuç 0 ile 1 arasında bir sayıdır: 0 hiç ortak kelime yok, 1 iki küme birebir aynı demektir. Ölçüm kelimelerin sırasına bakmaz, yalnız hangi kelimelerin bulunduğuna bakar. Hesabı ucuzdur; binlerce başlık arasında çalıştırılabilir.
Örnek:
{deprem, bölge, hasar}ve{deprem, bölge, ekip}kümelerinde ortak kelime 2, toplam farklı kelime 4’tür. Jaccard = 2 / 4 = 0,50.
Derinleş
Formül: J(A,B) = |A∩B| / |A∪B|.
Ölçüm kümeler üzerinden çalıştığı için kelime sırası ve tekrar sayısı sonucu değiştirmez. “Bölgede deprem” ile “Deprem bölgede” aynı kümeyi verir.
İki bilinen sınırı vardır. Birincisi: aynı olayı bambaşka kelimelerle anlatan iki başlık düşük oran alır — ölçüm anlamı değil kelimeyi görür. İkincisi: her metinde geçen bağlaç ve edat türü kelimeler oranı yapay olarak yükseltir. İkinci sorun, karşılaştırmadan önce bu kelimelerin (stopword) ve çok kısa kelimelerin elenmesiyle azaltılır. Birincisi bu yöntemle çözülemez; kabul edilen bir sınırdır.
Naif uygulamada her başlık her başlıkla karşılaştırılır ve maliyet içerik sayısının karesiyle büyür. Ters indeks — yalnız ortak kelime taşıyan çiftleri aday alma — bu maliyeti düşürür.
1.4.1 M1: Benzerlik Laboratuvarı
M1Jaccard ölçümünün sınırlarını test edin. Kelime sırası sonucu değiştirir mi? Bağlaçlar ne yapar?