devim-model · experiment
Başarısız bir QA deneyi bize ne öğretti?
Cevap verme davranışı kısmen düzeldi, fakat CE geriledi ve sonraki kontrolde görevin basit kopyalama ile büyük ölçüde çözülebildiği ortaya çıktı.
Problem
110M parent doğal metin modellemeyi öğrenmişti ama doğrudan cevap vermekte, durmakta ve tekrarları kontrol etmekte zorlanıyordu. Bunun capability eksikliği mi yoksa cevap arayüzü eksikliği mi olduğunu ayırmak istedik.
Hipotez
Küçük, kaynak-bağlı bir QA dozu cevap formunu öğretirse EOS ve tekrar davranışı iyileşebilirdi. Eğer ölçüm de temizse bunun content tarafına etkisini ayrıca görebilirdik.
v0.1 sonucu
| Ölçüm | Parent | Child |
|---|---|---|
| Exact-span | 0.0000 | 0.0150 |
| EOS | 0.0725 | 0.5150 |
| Repetition | 0.8725 | 0.3800 |
| V1.8 macro | 0.385625 | 0.411875 |
| Held-out CE | 3.62607545 | 4.17608298 |
Cevap formu belirgin biçimde iyileşti, fakat başarı eşiği geçilmedi ve doğal dil modelleme geriledi. Child gelecekteki deneyler için parent olmaya uygun görülmedi.
v0.2 kontrolü: kopyalama problemi
| Aile | Mekanik copy baseline | Neural child | Fark |
|---|---|---|---|
| F1 | 0.78 | 0.24 | −54 puan |
| F2 | 0.94 | 0.52 | −42 puan |
Görevin önemli bir kısmı trivial copying ile çözülebiliyordu. Böylece yüksek bir extractive skorun tek başına ilişki anlama kanıtı sayılamayacağı ortaya çıktı.
Karar
Bu deneyi başarı diye saklamadık. Evaluator/task confound araştırma sonucunun kendisi oldu. Bundan sonra negatif kontroller ve copy-solvable görev ayrımı evaluator tasarımının zorunlu parçası haline geldi.
- Sürüm
- v1
- Kanıt
- 2
- Kaynak
- Git · tr/experiments/qa-arayuz-ve-kopyalama-karmasasi.md
DEVİM yayınları sürüm geçmişini korur; kamusal kanıtı internal çalışmadan ayırır.