İçeriğe geç
academia.sh

Kurs İleri

Pekiştirmeli Öğrenme ve Öneri Sistemleri

Bu kursun sonunda

Kursa başla

01

Pekiştirmeli Öğrenme

Sonucu ancak eylemden sonra öğrenen ve kendi verisini toplayan bir ajanın ölçülmesi: saha ziyareti kurgusunda rastgele politikanın getirisi ile öğrenen politikanınki ve hiç görülmeyen durumlar, geçişin yalnız o anki duruma bağlı olması varsayımına bir geçmiş alanı eklendiğinde getirinin değişmesi, keşif oranı süpürüldükçe biriken kaçırılan kazanç ile hep sömüren politikanın hiç denemediği eylem, zaman farkı güncellemesiyle öğrenilen çizelgenin hiç güncellenmeyen hücreleri, ardışık örneklerin ilişkili olmasının eğitimi bozması ve deneyim tekrarının kattığı fark, aynı bütçede eğim kestiriminin kaç ayrı yön vermesi ve değer çizgisinin bunu düşürmesi, üstünlük kestiriminin kattığı ile eleştirmen kötüyken aktörün gittiği yer.

  1. 01 Ajan, Ortam ve Ödül Kararın kendi verisini ürettiği bir düzende üç sayının okunması: saha ziyareti kurgusunda hiç ekip çıkarmayan politika 0,000 getiri alıyor, taban çizgisi olan rastgele eylem 10,432, gecikmesi en büyük aboneye giden el kuralı 20,621. Üçüncü sayı toplanan veridir: rastgele politika 243 durumun 234'ünü ve 1.458 durum-eylem çiftinin 1.251'ini görüyor, daha iyi getiri alan kural yalnız 103 durumu ve 103 çifti görüyor. Aynı dönemde altı eylemin vereceği ödül -2, -2, 1, -2, 1 ve 0 iken ajan bunlardan yalnız birini öğreniyor; denetimli öğrenmenin etiketi yerine geçen şey budur.
  2. 02 Karar Süreci Biçimselleştirmesi Durum, eylem, geçiş, ödül ve indirim katsayısından kurulu beşlinin yazılması ve tanımlayıcı koşulunun kurguda ölçülmesi: aynı durum-eylem hücresinde ardıl durum dört ayrı değere 0,4307, 0,2239, 0,1770 ve 0,1046 olasılıkla dağılıyor, ödül ise -2, 1 ve 7'ye 0,0516, 0,2347 ve 0,7137 ile. Geçmişten bağımsızlık sınaması koşulun tam tutmadığını gösteriyor: en çok görülen hücrede aynı durum ve aynı eylem için ortalama ödül, gecikme 3 iken 4,518, gecikme 4 ve üzeriyken 5,944; fark 1,425 ve beş hücrenin beşinde de artı yönde. Aynı el kuralı 243 durumluk tanımda 20,621, geçmiş alanı eklenmiş 1.215 durumluk tanımda 23,148, gizli kademeyi gören üst referansta 29,053 getiri alıyor.
  3. 03 Keşif ve Sömürü Dengesi Öğrenmek için denemek, kazanmak için bilineni tekrarlamak gerektiğinde ödenen bedelin sayılması: karamsar ilk değerle hiç keşif yapmayan ajan altı eylemden beşini hiç denemiyor, 243 durumun 95'ini görüyor ve -16,492 getiri alıyor, kaçırılan kazancı ise tam 0,0. Keşif oranı 0,00'dan 1,00'a süpürüldüğünde getiri -16,492, 16,716, 22,210, 23,606, 25,659, 25,997 ve 23,000; biriken kaçırılan kazanç 0,0, -76,0, 402,0, 1.210,0, 3.545,0, 8.358,0 ve 33.811,0. En iyi getirinin 0,338'i, 0,20 oranında 3.545 kaçırılan kazançla alınabiliyor. Kestirimlerin ilk değeri karamsardan iyimsere çekildiğinde hiç keşif yapmayan ajan 26,212'ye çıkıyor ve kaçırılan kazancı yine 0,0 kalıyor.
  4. 04 Değer Fonksiyonları ve Eylem Değeri Ortamın olasılıkları bilinmeden, yalnız yaşanmış dörtlülerden değer öğrenilmesi ve çizelgenin boş kalan yerinin sayılması: zaman farkı güncellemesi 9.000 adımlık iz üzerinde 40 kez süpürüldüğünde başlangıç durumlarının ortalama değeri 12,632'den 21,562'ye çıkıyor ve ölçülen 30 dönemlik getiri 20,621 ile arasındaki fark indirim katsayısının otuzuncu kuvveti olan 0,0424'lük kuyruğa oturuyor. Durum değerleri 29,060 ile 16,075 arasında dağılıyor. Kendi verisiyle beslenen eylem değeri çizelgesinin 1.458 hücresinden yalnız 103'ü güncelleniyor, 1.355'i hiç dokunulmadan kalıyor ve çizelgeden okunan politika tam olarak kendisini üreten kuralı, 20,621'i veriyor. Davranışa keşif eklendikçe dolan hücre 103'ten 1.237'ye çıkıyor ama beşten az örnekli ince hücre de 47'den 468'e çıkıyor ve getiri tek yönlü ilerlemiyor.
  5. 05 Fonksiyon Yaklaşımı ve Deneyim Tekrarı Çizelgenin yerini alan küçük bir ağın ve deneyim tekrarının sayıyla ölçülmesi: 243 durum ile 6 eylemin kurduğu 1.458 hücrenin 9.000 geçiş sonunda yalnız 780'i güncelleniyor, 37 durum hiç görülmüyor ve yalnız 60 durumda altı eylem de deneniyor. Ardışık altılı toplu iş ortalama 1,16 ayrı bölümden, tampondan çekilen altılı 5,50 ayrı bölümden geliyor. Taban çizgileri 0,000 ve 10,432, kural politikası 20,621, çizelge 24,495. 126 parametreli ağ çevrimiçi tek geçişle 23,211 ve 23,071, ardışık altılıyla 22,259 ve 20,146, tekrar tamponuyla 26,233 ve 25,302 veriyor; koşum bandı 2,113'ten 0,930'a iniyor.
  6. 06 Politika Eğimi Politikayı doğrudan parametreleştirmenin bedelinin ölçülmesi: aynı politika ve 120 bölümlük aynı bütçeyle, tek bölümden okunan 120 güncelleme yönü ortalama 86,1 derecelik açı yapıyor ve uzlaşma oranı 0,290'da kalıyor; yirmi bölümlük altı kestirimde açı 44,0 dereceye, uzlaşma 0,878'e çıkıyor. Adım adım ortalama getiriden kurulan değer çizgisi çıkarıldığında aynı sayılar 81,2 derece ile 0,389 ve 39,8 derece ile 0,892 oluyor; taban çıkarmalı iki bölüm, ham dört bölümün uzlaşmasını veriyor. 240 bölümlük eğitimde iki bölümlük kestirim ham getiriyle 15,840 ve 19,962, taban çıkarmayla 22,866 ve 22,190 veriyor; koşum bandı 4,122'den 0,675'e iniyor.
  7. 07 Aktör–Eleştirmen Yöntemleri Seçen ile değerlendiren bileşenin birlikte eğitilmesinin ve birbirini bozmasının ölçülmesi: 240 bölümlük aynı bütçede ham getiri 0,01 adımıyla 15,840 ve 19,962, sabit değer çizgisi 22,866 ve 22,190, öğrenilen eleştirmenin üstünlük kestirimi 21,154 ve 21,100 veriyor. Öğrenme adımı 0,06'ya çıkarıldığında tam getiriye dayanan iki yöntem bozuluyor — sabit değer çizgisinin bir koşumu 0,029 ile hiç ekip çıkarmama tabanına düşüyor, bandı 15,953 — üstünlük ise 23,401 ve 23,755 ile bandı 0,354'te tutuyor. Eleştirmenin öğrenme adımı 0,50'ye çıkarıldığında değerler 10 üzeri 102 mertebesine ıraksıyor, aktör tek bir eyleme yığılıyor, beş abonenin dördü hiç ziyaret edilmiyor ve getiri -18,772'ye iniyor.

02

Öneri Sistemleri

Gösterilmeyen kalemin puanlanmadığı, puanlanmayan kalemin gösterilmediği bir düzende önerinin ölçülmesi: seyrek abone-kalem dizeyinde en popüler kalemi herkese önermenin şaşırtıcı yüksekliği ve örtük ile açık geri bildirimin farkı, içerik temelli önerinin hiç öneri üretemediği abone sayısı ve önerilerin birbirine benzemesi, komşu sayısının oynattığı sıralama ile seyreklik arttıkça komşu bulunamayan abone, gözlenmeyen hücrenin sıfır sayılmasıyla atlanmasının iki ayrı sıralama vermesi, kaç abone ve kalemin soğuk olduğu ve her çözümün kaçını ısıttığı ile bedeli, çevrimdışı iyi görünen sıralamanın kendi kararlarıyla veri toplayınca başka sayı vermesi, sistem kendi önerileriyle beslendiğinde hiç gösterilmez olan kalem sayısı ve popülerlik yanlılığının büyümesi.

  1. 01 Öneri Problemi Kurgu abone-kalem etkileşim dizeyinde önerinin ölçülmesi: 360 abone ve 24 hizmet kalemi 8.640 hücrenin yalnız 577'sinde buluşur, seyreklik 0,9332'dir ve 80 abonenin hiçbir etkileşimi yoktur. Taban çizgisi eğitimde en çok seçilen kalemi herkese sunmaktır; ilk beş isabeti 0,6527, rastgele sıranınki 0,2036'dır. Aynı veri örtük okunduğunda ve açık puanla okunduğunda ilk beş kalemin yalnız biri ortaktır, ortalama puana göre öneri 0,1497 isabet verir, 24 kalemin 16'sının on taneden az puanı vardır ve hiç gösterilmemiş 5.638 hücrenin puan sayısı sıfırdır.
  2. 02 İçerik Temelli Öneri Kalemin özniteliklerinden abone profili çıkaran önerinin ölçülmesi: on bir bileşenli ikili öznitelik vektörüyle 360 abonenin 280'ine profil kurulur, 80'i için hiç öneri üretilemez. İlk beş isabet 0,4431 ile 0,6527'lik popülerlik tabanının altında kalır, ama katalog kapsaması 9 yerine 24'tür. Bedeli benzeşmedir: ilk beş listenin iç benzerliği 0,6769 ve listedeki kalemlerin 0,715'i tek bir alandan gelir. Hiç gösterilmemiş yeni bir kalem 280 abonenin tamamında sıralanır, 191'inin ilk onuna girer ve ortalama konumu 25 kalem içinde 11,55'tir; aynı kalem popülerlik sıralamasında sonuncudur.
  3. 03 İşbirlikçi Süzgeçleme Öneriyi kalemin özniteliklerinden değil abonelerin birbirine benzemesinden üretmenin ve bu benzerliğin seyreklikte kırılmasının ölçülmesi: 410 eğitim etkileşimli dizeyde en çok seçilen kalem tabanı 0,6527 isabet@5 verip 24 kalemin 9'unu gösterirken, kullanıcı temelli süzgeçleme üç komşuyla 0,6946 verip 16 kalem gösteriyor, ama ilk beşinin 4,07'si zaten taban listesinin kalemi. Komşu sayısı bir ayar değişkenidir ve yedi aday arasında 0,5988 ile 0,6946 arasında oynuyor; öğe temelli kurulum en iyi ayarında 0,6467'de kalıp tabanın altına düşüyor. Eğitim seyrekliği 0,9525'ten 0,9888'e çıkarıldığında hiç komşusu olmayan sınav abonesi 0'dan 105'e çıkıyor ve ölçünün yerinde durması yöntemden değil kataloğun sırasından geliyor.
  4. 04 Dizey Ayrıştırma Eksik girdili bir etkileşim dizeyinde gözlenmeyen hücrenin sıfır sayılmasıyla hesaba hiç alınmaması arasındaki farkın ölçülmesi: aynı yordam, tek satır değişiklikle, aynı 410 eğitim etkileşiminden iki ayrı sıralama üretiyor. Atlayan kurulum dört etkenle 0,7006 isabet@5 veriyor ve 0,6527'lik tabanı geçiyor ama 24 kalemin yalnız 9'unu gösteriyor; sıfır sayan kurulum sekiz etkenle 0,2395'e düşerken 20 kalem gösteriyor ve ilk beş listelerinin en çok gösterilen beş kaleme düşen payını 0,7868'den 0,4467'ye indiriyor. Etken sayısı ayar değişkenidir, altı aday denenmiştir ve iki kurulumun ilk beşlerinin ortak kalem sayısı 4,02'den 0,86'ya iniyor.
  5. 05 Soğuk Başlangıç Hiç etkileşimi olmayan abone ve hiç seçilmemiş kalem için önerinin kurulması: 360 abonenin 80'inin hiç, 113'ünün tek etkileşimi vardır ve tek etkileşim gizlenince 193 abone soğuk sayılır, 464 etkileşimlik eğitim kümesinde bir kalem hiç seçilmemiş ve sekiz kalem beşin altındadır. Popülerlik geri dönüşü 193 abonenin tamamını ısıtır ama hepsine aynı beş kalemi verir, öznitelik köprüsü tek soğuk kalemi 114 aboneye ulaştırır ama hiçbir soğuk aboneyi ısıtmaz, üç soruluk giriş 339 soruyla 71 aboneyi ısıtıp kapsamayı 5'ten 13 kaleme çıkarır ve ilk beş isabetini 0,5752'den 0,5487'ye düşürür.
  6. 06 Öneri Değerlendirmesi Sıralama ölçütlerinin kurulması ve aynı sıralamanın iki ayrı sayı vermesi: ilk k isabeti kesme noktasına göre üç düzenin sırasını değiştiriyor, k=3'te sonuncu olan düzen k=5'te birinci ve k=10'da üçü de ayırt edilemiyor, konum indirimi k=5'in birincisini sonuncuya düşürüyor. Çevrimdışı kayıtta 0,6886 ile birinci olan düzen, kendi kararlarıyla veri toplamaya başlayınca abone başına 1,4563 etkileşimle sonuncu ve tabanın da altında kalıyor; sınav hücrelerinin 0,6305'i hiç gösterilmemiştir, ayrılmış kalemlerin 0,5868'i beş kalemden gelir ve üç kalem ayrılmış kümede hiç görünmez.
  7. 07 Çeşitlilik ve Yankı Odası Sistem kendi önerileriyle beslendiğinde kapsamanın daralması ve popülerlik yanlılığının büyümesi: kırk sekiz dönem boyunca dar düzen sekizinci dönemden sonra her dönem 24 kalemin 8'ini hiç göstermiyor, altı kalem son yirmi dört dönemin hiçbirinde görünmüyor ve ilk beş kalemin gösterim payı 0,4711'den 0,5461'e çıkıyor. Beşinci yuvayı çeşitliliğe ayıran düzen ilk on bir dönemde abone başına 1,0000 etkileşim kaybediyor, on ikinci dönemde koşulları değişen kalemi bulup öne geçiyor, kümülatif olarak yirmi yedinci dönemde eşitleniyor ve kırk sekizinci dönemde 1,2250 önde bitiriyor.

Aramak için yazmaya başlayın.

↑↓ Esc gezin · aç · kapat