01
Hazırlama Adımları
Var olan sütunlar üzerinde alınan her kararın, model sabitken ayrılmış kümedeki sayıyı ne kadar oynattığının sayılması: temizleme kararının modele kattığı ve iki model ailesinde ters işaret alması, standartlaştırma ile normalleştirmenin hangi yordamda katkı ürettiği ve ölçeğin yalnız eğitimden öğrenilmesi, bir-sıcak, sıralı ve hedef temelli kodlamanın sütun sayısı ile sızıntısı, doldurma, eksiklik göstergesi ve satırı atmanın üç ayrı sayısı, çoğaltma, seyreltme ve sınıf ağırlığının dengesiz kümede verdiği sonuç, aynı aykırı değerin eğim temelli ve ağaç temelli yordamda zıt etkisi.
- 01 Veri Temizleme Bir temizleme kararının modele ne kattığının ayrılmış kümede ölçülmesi: ham kayıttaki üç kusur tek tek düzeltilir, model sabit tutulur ve sınama kümesindeki iki sayı yan yana basılır. Birim karışıklığının düzeltilmesi uzaklık temelli yordama on iki abone kazandırırken karar ağacına iki abone kaybettirir; üç kusur birden düzeltildiğinde ağacın sınama doğruluğu 0,7659'dan 0,7778'e, uzaklık temelli yordamınki 0,7540'tan 0,7857'ye çıkar ve taban çizgisi her ikisinde de 0,7579'dur.
- 02 Öznitelik Ölçekleme Standartlaştırma ve normalleştirme kararlarının üç model ailesinde ayrı ayrı ölçülmesi: standartlaştırma eğim temelli doğrusal modele +0,0437 katarken uzaklık temelli yordamda −0,0159 verir ve karar ağacında katkı tam olarak sıfırdır. Ölçek eğitim kümesinden öğrenilen bir nesnedir; sınama kümesine uygulandığında iki değer [0, 1] aralığının dışına çıkar ve standart puanlar 5,11'e kadar yükselir. On bir sütunun hepsi ölçeklendiğinde uzaklık temelli yordam bir abone daha kaybeder.
- 03 Kategorik Kodlama Bir kategorik alanın sayıya çevrilmesinde üç kodlamanın sütun sayısı ve katkı olarak ölçülmesi: bölgenin bir-sıcak kodlanması sınama doğruluğunu 0,7302'den 0,7778'e çıkarır, 240 kodluk okuma rotası alanı bir-sıcak kodlandığında 231 ek sütuna karşılık +0,0119, sıralı kodlandığında tek sütunla aynı +0,0119 verir. Hedef temelli kodlama eğitim doğruluğunu 0,9114'e şişirirken sınamada 0,7421'e düşürür; kat içinde hesaplandığında eğitimdeki şişme 0,0595 geri çekilir ve sınama 0,7540'a döner.
- 04 Eksik Değer Stratejileri Eksik bir sütun için üç stratejinin ayrılmış kümede ayrı ayrı ölçülmesi: ortanca ile doldurma 0,7619, doldurma ile birlikte eksiklik göstergesi eklemek 0,8333, eksik satırı eğitim kümesinden atmak 0,7659 veriyor ve göstergenin katkısı +0,0714, yani on sekiz abonedir. Gösterge, hiç eksik olmayan sütunun verdiği 0,7778 üst sınırını da 0,0555 geçiyor, çünkü eksikliğin kendisi doldurulan değerin taşımadığı bir bilgi taşıyor: anketi yanıtlamayan abonelerde şüpheli oranı 0,5276, yanıtlayanlarda 0,1383.
- 05 Dengesiz Sınıflar Sınıf dengesizliğine verilen üç yanıtın iki ölçüyle birden okunması: taban çizgisi doğrulukta 0,7579 verirken yakaladığı şüpheli sayısı sıfırdır, ham eğitim kümesiyle model 0,7778 doğruluk ve 61 şüpheliden 21'ini yakalar. Azınlığı iki kat çoğaltmak doğruluğu 0,7619'a indirip yakalananı 33'e çıkarır, çoğunluğu seyreltmek 0,7143 ve 36 verir, sınıf ağırlığı 3,5 ise 0,6349 ve 39 verir. Azınlığı iki kat çoğaltmak ile sınıf ağırlığı 2,0 sınama kümesindeki 252 abonenin hepsinde aynı tahmini üretir.
- 06 Aykırı Değer Yönetimi Tek bir kırpma kararının iki model ailesinde ters işaret verdiğinin ölçülmesi: eğitim kümesinden öğrenilen çitle kırpma, eğim temelli doğrusal modele gerçek uçlarda +0,0040, takılı sayaç kaydı da varken +0,0317 katıyor; aynı karar karar ağacında −0,0278 ve −0,0357 veriyor. Çit dışındaki 34 abonenin şüpheli oranı 0,6765 olduğu için kırpma gerçek bilgiyi de siliyor, ve hiçbir satır silinmeden 41 değer kırpılıyor.