Veri & Şeffaflık
"Doğruluk ölçümlerimizi yayımlıyoruz" diyoruz; bu sayfa o sözün karşılığıdır. Modelin gerçek bir akış üzerinde ölçülmüş karnesi, ölçümün nasıl yapıldığı, etiketlerin hangi ölçütle verildiği ve karnenin nerede güvenilmemesi gerektiği burada.
Karne
Aşağıdaki sayılar, modelin eğitiminde hiç kullanılmamış 1110 başlıktan oluşan gerçek bir günlük akış üzerinde, uygulamanın gerçekten kullandığı eşiklerle ölçüldü. Değerler dile göre ayrı verilir: model her dilde farklı davranır ve ölçüm setinin %92'si Türkçe olduğu için birleşik bir tablo, Türkçenin sayılarını genel sonuç diye gösterirdi. Aynı sayıları indirilebilir veriden kendiniz de hesaplayabilirsiniz.
Türkçen = 1024
| Görev | Pozitif | P | R | F1 | TP / FP / FN |
|---|---|---|---|---|---|
| Kritik | 52 | 0.90 | 0.52 | 0.659 | 27 / 3 / 25 |
| Düşük Kalite | 150 | 0.99 | 0.61 | 0.752 | 91 / 1 / 59 |
| Duygu · negatif | 285 | 0.76 | 0.80 | 0.783 | 229 / 71 / 56 |
| Duygu · nötr | 598 | 0.83 | 0.86 | 0.845 | 516 / 107 / 82 |
| Duygu · pozitif | 141 | 0.67 | 0.48 | 0.562 | 68 / 33 / 73 |
Duygu makro-F1 0,730 · doğruluk 0,794
İngilizcen = 86
| Görev | Pozitif | P | R | F1 | TP / FP / FN |
|---|---|---|---|---|---|
| Kritik | 15 | 0.87 | 0.87 | 0.867 | 13 / 2 / 2 |
| Düşük Kalite | 7 | 0.75 | 0.43 | 0.545 | 3 / 1 / 4 |
| Duygu · negatif | 35 | 0.75 | 0.69 | 0.716 | 24 / 8 / 11 |
| Duygu · nötr | 38 | 0.68 | 0.84 | 0.753 | 32 / 15 / 6 |
| Duygu · pozitif | 13 | 0.86 | 0.46 | 0.600 | 6 / 1 / 7 |
Duygu makro-F1 0,690 · doğruluk 0,721
Ölçüm setinin yalnızca %7,7'si İngilizce. Düşük kalite satırı yedi, duygu-pozitif satırı on üç örneğe dayanıyor; tek bir içeriğin yer değiştirmesi bu oranları büyük ölçüde kaydırır. Bu bloğu güvenilir bir tahmin olarak okumayın.
P (precision) etiketlediklerimizin ne kadarının doğru olduğunu, R (recall) etiketlenmesi gerekenlerin ne kadarını yakaladığımızı, F1 ikisinin dengesini gösterir. Duygu tek bir ortalamaya sıkıştırılmadı: her sınıf kendi satırında, "o sınıf mı, değil mi" ölçümüyle verilir. Zayıf yer böylece görünür kalıyor — pozitif duygunun recall'ü belirgin biçimde düşük, yani sevindirici haberlerin yarısına yakınını nötr sayıyoruz. TP doğru yakalanan, FP yanlış etiketlenen, FN kaçırılan içerik sayısıdır.
Neden recall bu kadar düşük?
Düşük olması tercih edildi. MagPunk "yanlış etiket basmaktansa kaçırmayı yeğler" ilkesiyle ayarlanmıştır: karar eşikleri F1'i en büyük yapacak yere değil, precision belirli bir tabanın altına düşmeyecek şekilde ve o kısıt altında recall en yüksek olacak yere kalibre edilir.
Taban değerleri şunlardır: kritik için TR 0,80 · EN 0,90, düşük kalite için TR 0,90 · EN 0,90. Yani tablodaki düşük R bir başarısızlık değil, ödenen bilinçli bedeldir. Bir içeriği hatalı biçimde "kritik" göstermek, kritik bir içeriği kaçırmaktan daha çok zarar verir.
Bu tablo gerçeği olduğundan iyi gösterebilir mi?
Gösterebilirdi — bu yüzden orada ölçmüyoruz. Modelin eğitim havuzu madencilikle zenginleştirilmiştir: azınlık sınıfları doğal orandan çok daha sık bulunur. Gerçek bir akışta kritik içerik oranı yaklaşık %6'dır; eğitim havuzunda İngilizce tarafta bu oran %16,7'ye çıkar, yani gerçeğin yaklaşık 2,8 katıdır. Taban oran yükseldikçe precision kolaylaşır.
Yukarıdaki karne bu yüzden zenginleştirilmiş havuzda değil, gerçek bir akıştan ayrılmış ve eğitime hiç girmemiş 1110 başlıkta ölçülür. Zenginleştirilmiş havuzdaki sayılar daha güzel görünür; onları vitrine koymayı seçmedik.
Ölçüm nasıl yapıldı
Ölçüm kümesi gerçek bir günlük akıştan ayrıldı, 1110 başlık içeriyor ve eğitim havuzlarıyla kesişmiyor — kesişen satırlar dürüst karneden çıkarıldı.
Karar eşikleri bu kümede değil, ondan da ayrı bir doğrulama diliminde kalibre edildi; yani eşikler ölçüldükleri veriye göre ayarlanmadı.
Model yalnızca başlığı okur, içeriğin gövdesine bakmaz. Bu bilinçli bir gizlilik ve hız tercihidir ama aynı zamanda bir bilgi tavanıdır: yanıltıcı bir başlık modeli de yanıltır.
Eğitim verisi nereden geldi
Modelin eğitildiği başlıklar, araştırma amacıyla kamuya açık olarak yayımlanmış haber başlığı veri kümelerinden derlendi. Uygulamanın kendi beslemelerinden veya kullanıcıların okuma verisinden hiçbir şey kullanılmadı — zaten teknik olarak da mümkün değil, çünkü o veri cihazınızdan çıkmıyor.
Bunun karneyi okurken bir sonucu var: eğitim metni araştırma korpuslarından, ölçüm ise gerçek bir günlük akıştan geliyor. İki dağılım birebir aynı değil; model, uygulamanın her gün gördüğünden biraz farklı bir metin dünyasında eğitildi.
Bu veri kümelerinin çoğu yeniden dağıtım izni vermiyor. Eğitim havuzunu indirilebilir olarak yayımlamamamızın sebebi budur.
Bu karnenin sınırları
Yer gerçeği şu an tek bir modelden geliyor. Ölçümde "doğru cevap" olarak kullanılan etiketler bir büyük dil modeli tarafından üretildi; iki insan etiketleyicinin birbiriyle ne kadar uyuştuğu henüz ölçülmedi. Yani bu karne şimdilik "model insana ne kadar uyuyor" sorusunu değil, "model tutarlı bir öğretmene ne kadar uyuyor" sorusunu yanıtlıyor.
Bu, sayıları geçersiz kılmaz ama sınırlarını belirler. Etiket tutarlılığı üzerinde çalışma sürüyor: birkaç yüz başlığın iki bağımsız insan tarafından etiketlenmesi ve aradaki uyumun (Cohen's κ) yayımlanması planlanıyor. Ölçüm tamamlandığında sonucu — çıkan sayı ne olursa olsun — bu sayfaya eklenecek.
İkinci sınır: karne yalnız kritik, düşük kalite ve duygu etiketlerini kapsar. Skor, benzerlik eşiği ve öncelik tespiti gibi kural tabanlı bileşenler bu tabloda ölçülmez.
Etiketler hangi ölçütle veriliyor
Etiketler bir sezgiye değil, yazılı bir karar prosedürüne göre veriliyor. Prosedür sıralıdır: bir adımda karar çıkarsa sonrakine geçilmez. Bunun sebebi, önceki turlarda görülen tipik hatadır — başlıktaki tek bir kelimeye takılıp bağlamı kaçırmak.
Önce eleme: bu bir haber mi, sorgu mu?
Başlık bir soru, servis sorgusu ya da liste ise — "canlı izle", "kaç TL", "nasıl öldü", "how to", numarayla başlayan listeler — doğrudan düşük kalite sayılır ve orada durulur. Bu adım özellikle şunun için var: "Yalova'da deprem mi oldu?" bir deprem haberi değildir, sorgudur; kritik etiketi almaz.
Kritik: olay gerçekten oldu mu, toplumsal mı?
Gerçekleşmiş bir doğal afet ya da can kaybı olan kitlesel bir olay kritiktir; kitlesel ölüm her zaman kritiktir.
Kritik olmayanlar: güvenlik operasyonunun sonucu (gözaltı, ele geçirme), bireysel olaylar (tek bir trafik kazası ya da cinayet), anma ve yıldönümü haberleri (olay şu anda olmuyor) ve mecaz kullanımlar ("gol yağmuru", "sosyal medyada deprem etkisi").
Duygu: tek bir soru sorulur
Soru şudur: bu olay dünküne göre neyi değiştirdi? Duygu, kelimelerin tek tek olumlu ya da olumsuz oluşuna değil olayın sonucuna bakar. Yeni bir zarar doğuyorsa negatif, var olan zarar bitiyor ya da mağduriyet gideriliyorsa pozitif, süreç işliyor ama net bir sonuç yoksa nötrdür. Bu yüzden "hırsızlık yapıldı" negatif, "hırsız yakalandı" pozitiftir.
Suç çözümünün pozitif sayılması iki sıkı koşula bağlıdır: tehdidin evrensel bir suç olması (cinayet, uyuşturucu, kaçırma, çocuk istismarı) ve başlıkta tamamlanmış bir çözümün bulunması ("çökertildi", "kurtarıldı", "yakalandı"). Tutuklama talebi, adliyeye sevk veya soruşturma başlatma süreç demektir; nötrdür.
Siyasi tarafsızlık — en katı kural
Siyasi, jeopolitik ya da ideolojik bağlamı olan bütün operasyon ve gözaltı haberleri, evrensel suçlar dışında, katı biçimde nötr etiketlenir. Gerekçe şudur: devletin rutin işleyişine "iyi" ya da "kötü" demek, modele siyasi bir yargı öğretmek olurdu. Tek istisna, başlığın kendisinde açık yönlendirici bir dil bulunmasıdır.
Sporda rutin ile zirve ayrılır
Bir lig maçının sonucu — kim yenmiş olursa olsun — nötrdür; sıfır toplamlı rutin bir rekabettir. Şampiyonluk, madalya, kupa ve bunların kutlaması pozitiftir.
Birkaç ayrım daha
İroni çözülür: "harika, bir zam daha" negatiftir. Rekor iyi haber demek değildir; "rekor sıcak" ve "rekor zam" negatiftir. "Gözaltı", "mahkeme", "operasyon" gibi yüzey kelimeler tek başına bir duygu taşımaz. Kararsız kalınan her yerde nötr denir ve o satır düşük güvenle işaretlenir.
Hiçbir başlık kalıp eşleştirmesiyle toplu etiketlenmez; her biri tek tek okunur.
Kaldırılmış bir etiket
Önceki sürümlerde "şüpheli" adında, merak boşluğu ve tık tuzağını yakalamayı amaçlayan bir etiket vardı. Gerçek akışta ölçüldüğünde precision 0,12 çıktı: üç tık tuzağını yakalamak için yirmi dokuz masum içeriği gizliyordu. Ölçümün sonucunda tamamen kaldırıldı — bir etiketi, ölçtüğümüz için sildik.
İndirilebilirler
Karnedeki hiçbir sayıyı bize güvenerek kabul etmeniz gerekmiyor. Aşağıdaki ilk dosya tabloların tamamını yeniden hesaplatır.
- Karne verisi (CSV)35 KB · 1110 satır
Ölçüm setindeki her içerik için yer gerçeği ve modelin tahmini. Yukarıdaki tabloların tamamı yalnızca bu iki sütundan yeniden hesaplanabilir. Başlık metni içermez: P, R ve F1 karışıklık matrisinin saf fonksiyonu olduğu için doğrulama başlıklara ihtiyaç duymaz, biz de yayıncı içeriğini yeniden yayımlamamış oluruz.
Uygulamanın açılışta yüklediği dosyanın birebir aynısı — tarifi değil, kendisi. Sözlük, katsayılar, dile özel karar eşikleri ve nötr-marjlar içindedir. Başlık metni içermez; sakladığı en uzun birim iki kelimelik bir parçadır.
Her görev ve dil için kararı en çok etkileyen terimler, ağırlıklarıyla. Modelin neye baktığını okumanın en hızlı yolu.
- Kural sözlüğü (JSON)52 KB · 2718 giriş
Motorun elle yazılmış yarısı. Kritik anahtar kelimeleri ve onları engelleyen liste (tatbikat, anma, yıl dönümü, "mi oldu"), −3 ile +3 arasında ağırlıklandırılmış duygu sözcükleri, olumsuzlama ve karşıtlık bağlaçları, benzerlik hesabında elenen durak sözcükleri ve Türkçe ek listesi. Uygulamanın yüklediği dosyayla aynı içerik; yalnız okunabilsin diye satırlara bölünmüştür. Yayımlamadan önce, koddan kaldırılmış bir özellikten arta kalan ve hiçbir etikete etki etmeyen 139 giriş silindi.
Henüz yayımlanmadı
Şeffaflık, yayımlamadığımız şeyi yayımlamış gibi göstermemeyi de kapsar. Aşağıdakiler bu sayfada yok; sebepleriyle birlikte yazıyoruz.
- Eğitim havuzunun kendisi — türetildiği veri kümelerinin çoğu yeniden dağıtım izni vermiyor.
- İki insan etiketleyici arasındaki uyum ölçümü (Cohen's κ) — çalışma sürüyor, sonucu çıkan sayı ne olursa olsun buraya eklenecek.
- Kaynak bazlı hiçbir tablo — bunu ilkesel olarak yayımlamıyoruz: etiket bir kaynağa değil, tek bir başlığa verilir.