01
Saldırı Yüzeyi
Saldırı yüzeyinin çalışan bir yük olarak değil, yapısal öznitelik profili taşıyan sınıflar olarak ayrılması ve her sınıfta savunmanın yakaladığı payın sayılması: savunmasız tabanda durdurulan zararlının ve yanlış alarmın sıfır olması, kural süzgecinin durdurduğu zararlı ile yanlışlıkla durdurduğu temiz kaydın birlikte yazılması, doğrudan ile dolaylı biçimin kaynak dağılımıyla ayrılması, eşik süpürmesinde kesinliğin artarken duyarlılığın düşmesi ve atlatmaya en açık noktanın hangi eşikte ortaya çıktığı, gizli alan adı taşıyan kayıtlarda maskelemenin çıkardığı ile süzgecin yakaladığı ve hiçbirinin yakalamadığı kalıntı, yan etkili araç adı taşıyan kayıtlarda onay kapısına gidenlerin kaçının gerçekten zararlı olduğu, kaynak sınıfı başına zararlı payı ve kaynağa göre süzmenin kattığı, çıktı tarafında gizli alan taşıyan yanıt sayısı, çekişmeli sınıfta duyarlılığın öbür sınıflara göre düştüğü nokta, kırmızı takımda kapsanan sınıf sayısı ile geçen pay ve denenmeyen sınıfın sayısının sıfır değil bilinmez olması.
- 01 İstem Enjeksiyonu Modele giren metnin bir saldırı yüzeyi olarak sayılması: kurgu kayıt kümesinde 240 kaydın 93'ü zararlı, 147'si temiz ve zararlı olma bilgisi metinde değil yapısal bir öznitelik profilinde duruyor. Savunmasız tabanda durdurulan zararlı 0, yanlış alarm 0; kural süzgeci 74 zararlı durduruyor, 23 temiz kaydı yanlışlıkla engelliyor ve 19 zararlı kaçıyor (kesinlik 0,7629, duyarlılık 0,7957, yanlış engelleme payı 0,1565). Doğrudan ile dolaylı biçim kaynak dağılımıyla ayrılıyor: 37 doğrudan zararlıda duyarlılık 0,6486, 56 dolaylı zararlıda 0,8929. İkinci koşumda aynı süzgeç 0,6988 veriyor; kümenin çözünürlüğü duyarlılıkta 0,0108, yanlış engellemede 0,0068.
- 02 Jailbreak Teknikleri Güvenlik süzgecinin atlatılmasının bir yordam olarak değil bir eşik sorusu olarak ölçülmesi: aynı 240 kayıtlık kurgu kümede eşik 0,30'dan 0,80'e çıkarken kesinlik 0,7568'den 0,9787'e yükseliyor, duyarlılık 0,9032'den 0,4946'ya düşüyor ve yanlış engelleme payı 0,1837'den 0,0068'e iniyor. Eşiği yükseltmenin değişim oranı 0,50'ye kadar bire bir (7'ye 7, 11'e 12), 0,50'nin üstünde 2,33 ve 3,25 oluyor; atlatmaya en açık bölge burasıdır. Sınıf başına duyarlılık tabloda ayrı okunuyor ve savunmanın ilk çöktüğü sınıf bozulmuş girdi (0,6842'den 0,2105'e). İkinci koşumda eşik 0,40 ve 0,60'ta duyarlılık aynı kalırken 13 ve 9 kaydın kararı değişiyor.
- 03 Veri Sızdırma Sistem yönergesi ve gizli veri ifşasının yalnız sayımla ölçülmesi: 240 kayıtlık kurgu kümede 32 kayıt gizli alan adı taşıyor (23 zararlı, 9 temiz) ve alan sınıfları erişim dizgesi 8, iletişim 10, abone kimliği 9, adres 5 diye dağılıyor. Sızdırma yüzeyi 35 kayıt, 26'sı zararlı. Tam kural süzgeci 25'ini durduruyor ve maskelemenin üstüne kattığı sıfır; gizli alan kuralı çıkarılmış dar süzgeç 16'sını durdururken maskeleme 9 kaydın alanını çıkarıyor. Her iki kurulumda hiçbirinin yakalamadığı kalıntı 1 kayıttır: hiçbir bayrak taşımayan, puanı 0,0088 olan ve en düşük eşikte bile işaretlenmeyen bir kayıt. Maskeleme tek başına bir karar gibi ölçüldüğünde kesinlik 0,7188, duyarlılık 0,2473, yanlış engelleme payı 0,0612 veriyor; ikinci koşumda kalıntı 0'a iniyor.
- 04 Araç Kötüye Kullanımı Ajan yetkisinin savunma tarafında sayılması: 240 kaydın 27'si yan etkili araç adı bayrağı taşıyor, kapısız tabanda insana giden istek 0, kapı bu 27'yi insana gönderiyor ve 24'ü gerçekten zararlı çıkıyor — kapının kesinliği 0,8889, duyarlılığı 0,2581. Kapı yetki aşımı sınıfının 10 kaydından 8'ini, gizli alan isteği sınıfının 17 kaydından 1'ini görüyor. Rol kipiyle genişleyen kapı kesinliği 0,9138'e çıkarıp duyarlılığı 0,5699'a taşıyor; kaynakla genişleyen kapı kesinliği 0,5586'ya düşürüyor ve insana 49 temiz kayıt gönderiyor. Kural süzgecinin üstüne konan kapı dört sayının hiçbirini oynatmıyor: kapıya giden 27 kaydın tamamını kural zaten işaretlemiş. İki koşumda kapının kesinliği 0,8889 ve 0,6471 çıkıyor.
- 05 Eğitim Verisi Zehirleme Zehirlemenin bir yordam olarak değil, kaynak sınıfı başına zararlı payı olarak sayılması: süzgeçsiz derlemede 240 kaydın 93'ü zararlı, pay 0,3875. Kaynak başına pay kullanıcıda 0,2701, erişilen belgede 0,5417, araç çıktısında 0,5484; ama hacim oranı tersine çeviriyor — en düşük paylı kanal 37, en yüksek paylı kanal 17 zararlı katıyor. Kaynak kapısı derlemin payını 0,2701'e indirip 47 temiz kayıt kaybettiriyor, kural kapısı 0,1329'a indirip 23 temiz kayıt kaybettiriyor. İkisini birlikte koymak payı 0,1383 yapıyor ve bu fark 94 kayıtlık derlemin 0,0106'lık adımının altında kalıyor, yani ölçülemez; buna karşılık kaybedilen temiz kayıt 23'ten 66'ya çıkıyor. Kural süzgecinin duyarlılığı kullanıcı kanalında 0,6486, erişilen belgede 0,9487. İki koşumda paylar oynuyor, sıralama oynamıyor.
- 06 Model Tersine Çevirme ve Çıkarım Saldırıları Sızıntının girdi tarafında değil çıktı tarafında sayılması: 240 yanıtın 71'i gizli alan sınıfına giren bir alan taşıyor, toplam 106 alan. Bunların 31'i istenen 32 kayıttan, 40'ı ise hiç sorulmayan 208 kayıttan geliyor — model tersine çevirme sınıfının sayısı istenenden fazla. Dört adlık çıktı süzgeci 106 alanın hepsini çıkarıyor ve kalan gizli alan 0 oluyor; ama 47 yanıt gizli alan sınıfında olmayan bir dolaylı belirteç, 57 yanıt hiçbir alan adı taşımayan bir üyelik sinyali taşımayı sürdürüyor ve iz taşıyan yanıt 137'den yalnız 94'e iniyor. Beş adlık liste dolaylı belirteci de siliyor, üyelik sinyalini silemiyor. Süzgecin çıkardığı 106 alanın 58'i temiz kayıttan geliyor ve 41 temiz yanıt alan kaybediyor. İki koşumda alan sayısı 106 ve 104 çıkıyor, süzgeçten sonra iz taşıyan yanıt her iki koşumda da 94.
- 07 Çekişmeli Örnekler Girdinin kasıtlı olarak bozulmasının ayrı bir yüzey olarak sayılması: aynı kural süzgeci dört sınıfta 1,0000 ile 0,8696 arasında duyarlılık verirken bozulmuş girdi sınıfında 0,2632'ye düşüyor ve bu sınıfta yakaladığı beş kaydın dördü başka bir sınıfın özniteliğini taşıdığı için yakalanıyor. Olağandışı damga dağılımı bayrağını kurala eklemek sınıf duyarlılığını 0,8421'e, küme duyarlılığını 0,7957'den 0,9140'a çıkarıyor; aynı adım kesinliği 0,7629'dan 0,7391'e düşürüyor ve yanlış engelleme payını 0,1565'ten 0,2041'e taşıyor. Model süzgeci aynı sınıfta 0,4737'de kalıyor, iki koşumda 0,4737 ile 0,4211 arasında oynuyor ve bu fark sınıfın çözünürlüğü olan 0,0526'ya eşit olduğu için bulgu sayılmıyor.
- 08 Yapay Zekâ Kırmızı Takım Yöntemi Kırmızı takım yönteminin bir saldırı yordamı olarak değil, kapsam ve sayım olarak ele alınması: dört sınıfı on denemeyle tarayan dar bir kampanya 40 denemede 4 geçen kayıt ve 0,1000 geçen pay bildiriyor, aynı kampanyaya beşinci sınıf eklendiğinde sayı 50 denemede 12 geçen ve 0,2400 oluyor ve eklenen sınıf tek başına 8'ini veriyor. Deneme seçimini değiştirmek aynı büyüklükte 0,1800 veriyor, tüm zararlı kayıtlar 0,2043 veriyor, genişletilmiş kural 0,0860'a indiriyor. Raporda satırı olmayan sınıfın denemesi sıfırdır ve geçen payı ölçülmemiştir; kampanyanın kapsamı dünya hakkında değil planın kendisi hakkında bir ifadedir. Ders konu kapanışıdır ve sekiz dersin savunmasının tek bir süzgeç olduğunu yazar.