devim-model · research
DEVİM'de neler yanlış gitti?
Araştırmanın ilerlemesini yalnız başarılı deneylerle değil, yanlış teşhisler, evaluator confound'ları, overfit ve başarısız gate'lerle birlikte kaydediyoruz.
Neden hataları yayınlıyoruz?
Bir araştırma programını yalnız başarılı sonuçlarla anlatmak, gerçek öğrenme sürecini gizler. DEVİM'de yanlış çıkan hipotezleri, işe yaramayan evaluator'ları ve reddedilen child modelleri araştırma kaydının parçası tutuyoruz.
1. CE iyileşmesini capability sanabilirdik
110M run'da held-out CE güçlü biçimde iyileşti, fakat capability ölçümü neredeyse değişmedi. "Model daha iyi dil modelliyor" ile "ölçtüğümüz ilişkisel işi daha iyi yapıyor" aynı iddia değil.
2. Bozuk konuşmayı kapasite eksikliği sanabilirdik
İlk model EOS üretmiyor ve ağır repetition yapıyordu. FORM Rescue aynı parametre ölçeğinde bu davranışı büyük ölçüde düzeltti. Sorunun önemli bir kısmı supervision register idi.
3. QA evaluator bizi yanıltabilirdi
v0.1 child'da bazı skorlar yükseldi. v0.2 kontrolünde mekanik copy baseline'lar neural child'ı 42–54 puan geçti. Görev capability yerine kopyalamayı ödüllendiriyordu.
4. Diagnostic child'ı ana modele çevirmedik
QA child daha iyi EOS üretmesine rağmen held-out CE yaklaşık 0.55 nats kötüleşti. Child future parent olarak reddedildi. Tek metrikte iyileşme lineage promotion için yeterli sayılmadı.
5. 336M'i otomatik çözüm ilan etmedik
336M Gate-A bazı readout'larda güçlü gelişme gösterdi, fakat preregistered breadth-delta eşiğini geçmedi. Bu yüzden capacity_effect_supported=false kaldı.
Araştırma ilkesi
Hata saklanacak bir şey değil; doğru neden ayrımını kurmanın ana malzemesi. Bu sayfa yeni önemli negatif sonuçlar geldikçe sürümlenecek.
- Sürüm
- v1
- Kanıt
- 4
- Kaynak
- Git · tr/research/devimde-neler-yanlis-gitti.md
DEVİM yayınları sürüm geçmişini korur; kamusal kanıtı internal çalışmadan ayırır.