DEVİMDEVİM
← Geri

devim-model · report

110M'de dil öğrenimi neden ölçülen yeteneğe dönüşmedi?

~110M düz Transformer 500M'den 1.2B supervised tokena ilerlerken held-out dil modelleme belirgin iyileşti; donmuş capability ölçümü ise neredeyse yerinde kaldı.

Durum DoğrulandıYayın 1 dk okuma180 kelimev1
Sesli dinleBu tarayıcı desteklemiyor

Problem

Daha fazla doğal Türkçe eğitimi gerçekten daha geniş ölçülen yeteneğe dönüşüyor muydu, yoksa yalnızca dil modelleme kaybını mı düşürüyordu?

Deney

Aynı ~110M düz nedensel Transformer, önceden belirlenmiş iki ölçüm kapısında değerlendirildi. Capability ölçümü deney sırasında değiştirilmedi.

ÖlçümGate AGate BDeğişim
Supervised token500,019,5971,200,012,349+699,992,752
Held-out CE4.07344273.6260754−0.4473673
V1.8 macro0.3800000.385625+0.5625 puan
Şans üstü competency2/82/80

Sonuç

Dil modelleme açık biçimde iyileşti. Buna karşılık donmuş capability ölçümü geniş bir yetenek artışı kaydetmedi. Resmî karar INCONCLUSIVE_AT_B oldu ve Stage C açılmadı.

Bu neyi kanıtlamadı?

Bu sonuç 110M'in kesin kapasite tavanına ulaştığını, Transformer'ın yetersiz olduğunu veya yeni bir mimarinin zorunlu olduğunu göstermedi. Veri, cevap arayüzü ve evaluator ayrımını daha ciddi incelememiz gerektiğini gösterdi.

Karar

Ölçek büyütmeyi otomatik çözüm kabul etmek yerine FORM, CONTENT ve evaluator sorunlarını ayrı deneylerle teşhis etmeye geçtik. Bu ayrım sonraki QA, FORM Rescue ve matched-scale çalışmalarının temelini oluşturdu.

YAYIN KAYDIdevim-110m-capability-dissociation
Sürüm
v1
Kanıt
2
Kaynak
Git · tr/reports/110m-dil-ogrenimi-ve-yetenek-ayrismasi.md

DEVİM yayınları sürüm geçmişini korur; kamusal kanıtı internal çalışmadan ayırır.

110Mnegative resultevaluationTurkish