DEVİMDEVİM
← Geri

devim-model · research

DEVİM'de neler yanlış gitti?

Araştırmanın ilerlemesini yalnız başarılı deneylerle değil, yanlış teşhisler, evaluator confound'ları, overfit ve başarısız gate'lerle birlikte kaydediyoruz.

Durum KamusalYayın 1 dk okuma199 kelimev1
Sesli dinleBu tarayıcı desteklemiyor

Neden hataları yayınlıyoruz?

Bir araştırma programını yalnız başarılı sonuçlarla anlatmak, gerçek öğrenme sürecini gizler. DEVİM'de yanlış çıkan hipotezleri, işe yaramayan evaluator'ları ve reddedilen child modelleri araştırma kaydının parçası tutuyoruz.

1. CE iyileşmesini capability sanabilirdik

110M run'da held-out CE güçlü biçimde iyileşti, fakat capability ölçümü neredeyse değişmedi. "Model daha iyi dil modelliyor" ile "ölçtüğümüz ilişkisel işi daha iyi yapıyor" aynı iddia değil.

2. Bozuk konuşmayı kapasite eksikliği sanabilirdik

İlk model EOS üretmiyor ve ağır repetition yapıyordu. FORM Rescue aynı parametre ölçeğinde bu davranışı büyük ölçüde düzeltti. Sorunun önemli bir kısmı supervision register idi.

3. QA evaluator bizi yanıltabilirdi

v0.1 child'da bazı skorlar yükseldi. v0.2 kontrolünde mekanik copy baseline'lar neural child'ı 42–54 puan geçti. Görev capability yerine kopyalamayı ödüllendiriyordu.

4. Diagnostic child'ı ana modele çevirmedik

QA child daha iyi EOS üretmesine rağmen held-out CE yaklaşık 0.55 nats kötüleşti. Child future parent olarak reddedildi. Tek metrikte iyileşme lineage promotion için yeterli sayılmadı.

5. 336M'i otomatik çözüm ilan etmedik

336M Gate-A bazı readout'larda güçlü gelişme gösterdi, fakat preregistered breadth-delta eşiğini geçmedi. Bu yüzden capacity_effect_supported=false kaldı.

Araştırma ilkesi

Hata saklanacak bir şey değil; doğru neden ayrımını kurmanın ana malzemesi. Bu sayfa yeni önemli negatif sonuçlar geldikçe sürümlenecek.

YAYIN KAYDIdevim-errors-v1
Sürüm
v1
Kanıt
4
Kaynak
Git · tr/research/devimde-neler-yanlis-gitti.md

DEVİM yayınları sürüm geçmişini korur; kamusal kanıtı internal çalışmadan ayırır.

failuresnegative resultsmethodologylessons