01
Pekiştirmeli Öğrenme
Sonucu ancak eylemden sonra öğrenen ve kendi verisini toplayan bir ajanın ölçülmesi: saha ziyareti kurgusunda rastgele politikanın getirisi ile öğrenen politikanınki ve hiç görülmeyen durumlar, geçişin yalnız o anki duruma bağlı olması varsayımına bir geçmiş alanı eklendiğinde getirinin değişmesi, keşif oranı süpürüldükçe biriken kaçırılan kazanç ile hep sömüren politikanın hiç denemediği eylem, zaman farkı güncellemesiyle öğrenilen çizelgenin hiç güncellenmeyen hücreleri, ardışık örneklerin ilişkili olmasının eğitimi bozması ve deneyim tekrarının kattığı fark, aynı bütçede eğim kestiriminin kaç ayrı yön vermesi ve değer çizgisinin bunu düşürmesi, üstünlük kestiriminin kattığı ile eleştirmen kötüyken aktörün gittiği yer.
- 01 Ajan, Ortam ve Ödül Kararın kendi verisini ürettiği bir düzende üç sayının okunması: saha ziyareti kurgusunda hiç ekip çıkarmayan politika 0,000 getiri alıyor, taban çizgisi olan rastgele eylem 10,432, gecikmesi en büyük aboneye giden el kuralı 20,621. Üçüncü sayı toplanan veridir: rastgele politika 243 durumun 234'ünü ve 1.458 durum-eylem çiftinin 1.251'ini görüyor, daha iyi getiri alan kural yalnız 103 durumu ve 103 çifti görüyor. Aynı dönemde altı eylemin vereceği ödül -2, -2, 1, -2, 1 ve 0 iken ajan bunlardan yalnız birini öğreniyor; denetimli öğrenmenin etiketi yerine geçen şey budur.
- 02 Karar Süreci Biçimselleştirmesi Durum, eylem, geçiş, ödül ve indirim katsayısından kurulu beşlinin yazılması ve tanımlayıcı koşulunun kurguda ölçülmesi: aynı durum-eylem hücresinde ardıl durum dört ayrı değere 0,4307, 0,2239, 0,1770 ve 0,1046 olasılıkla dağılıyor, ödül ise -2, 1 ve 7'ye 0,0516, 0,2347 ve 0,7137 ile. Geçmişten bağımsızlık sınaması koşulun tam tutmadığını gösteriyor: en çok görülen hücrede aynı durum ve aynı eylem için ortalama ödül, gecikme 3 iken 4,518, gecikme 4 ve üzeriyken 5,944; fark 1,425 ve beş hücrenin beşinde de artı yönde. Aynı el kuralı 243 durumluk tanımda 20,621, geçmiş alanı eklenmiş 1.215 durumluk tanımda 23,148, gizli kademeyi gören üst referansta 29,053 getiri alıyor.
- 03 Keşif ve Sömürü Dengesi Öğrenmek için denemek, kazanmak için bilineni tekrarlamak gerektiğinde ödenen bedelin sayılması: karamsar ilk değerle hiç keşif yapmayan ajan altı eylemden beşini hiç denemiyor, 243 durumun 95'ini görüyor ve -16,492 getiri alıyor, kaçırılan kazancı ise tam 0,0. Keşif oranı 0,00'dan 1,00'a süpürüldüğünde getiri -16,492, 16,716, 22,210, 23,606, 25,659, 25,997 ve 23,000; biriken kaçırılan kazanç 0,0, -76,0, 402,0, 1.210,0, 3.545,0, 8.358,0 ve 33.811,0. En iyi getirinin 0,338'i, 0,20 oranında 3.545 kaçırılan kazançla alınabiliyor. Kestirimlerin ilk değeri karamsardan iyimsere çekildiğinde hiç keşif yapmayan ajan 26,212'ye çıkıyor ve kaçırılan kazancı yine 0,0 kalıyor.
- 04 Değer Fonksiyonları ve Eylem Değeri Ortamın olasılıkları bilinmeden, yalnız yaşanmış dörtlülerden değer öğrenilmesi ve çizelgenin boş kalan yerinin sayılması: zaman farkı güncellemesi 9.000 adımlık iz üzerinde 40 kez süpürüldüğünde başlangıç durumlarının ortalama değeri 12,632'den 21,562'ye çıkıyor ve ölçülen 30 dönemlik getiri 20,621 ile arasındaki fark indirim katsayısının otuzuncu kuvveti olan 0,0424'lük kuyruğa oturuyor. Durum değerleri 29,060 ile 16,075 arasında dağılıyor. Kendi verisiyle beslenen eylem değeri çizelgesinin 1.458 hücresinden yalnız 103'ü güncelleniyor, 1.355'i hiç dokunulmadan kalıyor ve çizelgeden okunan politika tam olarak kendisini üreten kuralı, 20,621'i veriyor. Davranışa keşif eklendikçe dolan hücre 103'ten 1.237'ye çıkıyor ama beşten az örnekli ince hücre de 47'den 468'e çıkıyor ve getiri tek yönlü ilerlemiyor.
- 05 Fonksiyon Yaklaşımı ve Deneyim Tekrarı Çizelgenin yerini alan küçük bir ağın ve deneyim tekrarının sayıyla ölçülmesi: 243 durum ile 6 eylemin kurduğu 1.458 hücrenin 9.000 geçiş sonunda yalnız 780'i güncelleniyor, 37 durum hiç görülmüyor ve yalnız 60 durumda altı eylem de deneniyor. Ardışık altılı toplu iş ortalama 1,16 ayrı bölümden, tampondan çekilen altılı 5,50 ayrı bölümden geliyor. Taban çizgileri 0,000 ve 10,432, kural politikası 20,621, çizelge 24,495. 126 parametreli ağ çevrimiçi tek geçişle 23,211 ve 23,071, ardışık altılıyla 22,259 ve 20,146, tekrar tamponuyla 26,233 ve 25,302 veriyor; koşum bandı 2,113'ten 0,930'a iniyor.
- 06 Politika Eğimi Politikayı doğrudan parametreleştirmenin bedelinin ölçülmesi: aynı politika ve 120 bölümlük aynı bütçeyle, tek bölümden okunan 120 güncelleme yönü ortalama 86,1 derecelik açı yapıyor ve uzlaşma oranı 0,290'da kalıyor; yirmi bölümlük altı kestirimde açı 44,0 dereceye, uzlaşma 0,878'e çıkıyor. Adım adım ortalama getiriden kurulan değer çizgisi çıkarıldığında aynı sayılar 81,2 derece ile 0,389 ve 39,8 derece ile 0,892 oluyor; taban çıkarmalı iki bölüm, ham dört bölümün uzlaşmasını veriyor. 240 bölümlük eğitimde iki bölümlük kestirim ham getiriyle 15,840 ve 19,962, taban çıkarmayla 22,866 ve 22,190 veriyor; koşum bandı 4,122'den 0,675'e iniyor.
- 07 Aktör–Eleştirmen Yöntemleri Seçen ile değerlendiren bileşenin birlikte eğitilmesinin ve birbirini bozmasının ölçülmesi: 240 bölümlük aynı bütçede ham getiri 0,01 adımıyla 15,840 ve 19,962, sabit değer çizgisi 22,866 ve 22,190, öğrenilen eleştirmenin üstünlük kestirimi 21,154 ve 21,100 veriyor. Öğrenme adımı 0,06'ya çıkarıldığında tam getiriye dayanan iki yöntem bozuluyor — sabit değer çizgisinin bir koşumu 0,029 ile hiç ekip çıkarmama tabanına düşüyor, bandı 15,953 — üstünlük ise 23,401 ve 23,755 ile bandı 0,354'te tutuyor. Eleştirmenin öğrenme adımı 0,50'ye çıkarıldığında değerler 10 üzeri 102 mertebesine ıraksıyor, aktör tek bir eyleme yığılıyor, beş abonenin dördü hiç ziyaret edilmiyor ve getiri -18,772'ye iniyor.