devim-model · report
110M'de dil öğrenimi neden ölçülen yeteneğe dönüşmedi?
~110M düz Transformer 500M'den 1.2B supervised tokena ilerlerken held-out dil modelleme belirgin iyileşti; donmuş capability ölçümü ise neredeyse yerinde kaldı.
Problem
Daha fazla doğal Türkçe eğitimi gerçekten daha geniş ölçülen yeteneğe dönüşüyor muydu, yoksa yalnızca dil modelleme kaybını mı düşürüyordu?
Deney
Aynı ~110M düz nedensel Transformer, önceden belirlenmiş iki ölçüm kapısında değerlendirildi. Capability ölçümü deney sırasında değiştirilmedi.
| Ölçüm | Gate A | Gate B | Değişim |
|---|---|---|---|
| Supervised token | 500,019,597 | 1,200,012,349 | +699,992,752 |
| Held-out CE | 4.0734427 | 3.6260754 | −0.4473673 |
| V1.8 macro | 0.380000 | 0.385625 | +0.5625 puan |
| Şans üstü competency | 2/8 | 2/8 | 0 |
Sonuç
Dil modelleme açık biçimde iyileşti. Buna karşılık donmuş capability ölçümü geniş bir yetenek artışı kaydetmedi. Resmî karar INCONCLUSIVE_AT_B oldu ve Stage C açılmadı.
Bu neyi kanıtlamadı?
Bu sonuç 110M'in kesin kapasite tavanına ulaştığını, Transformer'ın yetersiz olduğunu veya yeni bir mimarinin zorunlu olduğunu göstermedi. Veri, cevap arayüzü ve evaluator ayrımını daha ciddi incelememiz gerektiğini gösterdi.
Karar
Ölçek büyütmeyi otomatik çözüm kabul etmek yerine FORM, CONTENT ve evaluator sorunlarını ayrı deneylerle teşhis etmeye geçtik. Bu ayrım sonraki QA, FORM Rescue ve matched-scale çalışmalarının temelini oluşturdu.
- Sürüm
- v1
- Kanıt
- 2
- Kaynak
- Git · tr/reports/110m-dil-ogrenimi-ve-yetenek-ayrismasi.md
DEVİM yayınları sürüm geçmişini korur; kamusal kanıtı internal çalışmadan ayırır.