devim-model · experiment
FORM Rescue: aynı ölçekte konuşma davranışını düzeltebilir miyiz?
Parametre sayısını artırmadan, dengeli cevap-register supervision ile EOS ve repetition davranışında büyük iyileşme elde edildi.
Soru
İlk 110M modelin bozuk konuşması gerçekten kapasite eksikliği miydi, yoksa model cevap verme biçimini hiç öğrenmemiş miydi?
Müdahale
Aynı semantik içeriği farklı cevap yüzeylerinde dengeleyen bir FORM curriculum uygulandı. Amaç reasoning iddiası üretmek değil; cevap bitirme, tekrar kontrolü ve kullanılabilir output formunu ayrı ölçmekti.
Sonuç
96 maddelik treatment değerlendirmesinde:
| Ölçüm | Sonuç |
|---|---|
| EOS rate | 0.8541667 |
| Repetition rate | 0.1458333 |
| Empty rate | 0 |
| Ortalama üretilen kelime | 14.99 |
V1.8 için daha geniş tarihsel sonuç kaydı ayrıca doğrulanıyor; bu sayfada yalnız doğrudan trained evaluation artifact'ıyla doğrulanan FORM ölçümlerini yayınlıyoruz.
Ne öğrendik?
İlk konuşma/arayüz arızası yalnız parametre sayısıyla açıklanamıyordu. Aynı ölçek, supervision register değiştiğinde çok daha kullanılabilir cevap davranışı öğrenebildi.
Sınır
Bu sonuç CONTENT veya reasoning çözülmüş demek değildir. FORM'un düzelmesi, doğru içeriğin seçildiğini veya yeni ilişkilere genellendiğini tek başına göstermez.
- Sürüm
- v1
- Kanıt
- 1
- Kaynak
- Git · tr/experiments/form-rescue.md
DEVİM yayınları sürüm geçmişini korur; kamusal kanıtı internal çalışmadan ayırır.