DEVİMDEVİM
← Geri

devim-model · experiment

Başarısız bir QA deneyi bize ne öğretti?

Cevap verme davranışı kısmen düzeldi, fakat CE geriledi ve sonraki kontrolde görevin basit kopyalama ile büyük ölçüde çözülebildiği ortaya çıktı.

Durum DoğrulandıYayın 1 dk okuma211 kelimev1
Sesli dinleBu tarayıcı desteklemiyor

Problem

110M parent doğal metin modellemeyi öğrenmişti ama doğrudan cevap vermekte, durmakta ve tekrarları kontrol etmekte zorlanıyordu. Bunun capability eksikliği mi yoksa cevap arayüzü eksikliği mi olduğunu ayırmak istedik.

Hipotez

Küçük, kaynak-bağlı bir QA dozu cevap formunu öğretirse EOS ve tekrar davranışı iyileşebilirdi. Eğer ölçüm de temizse bunun content tarafına etkisini ayrıca görebilirdik.

v0.1 sonucu

ÖlçümParentChild
Exact-span0.00000.0150
EOS0.07250.5150
Repetition0.87250.3800
V1.8 macro0.3856250.411875
Held-out CE3.626075454.17608298

Cevap formu belirgin biçimde iyileşti, fakat başarı eşiği geçilmedi ve doğal dil modelleme geriledi. Child gelecekteki deneyler için parent olmaya uygun görülmedi.

v0.2 kontrolü: kopyalama problemi

AileMekanik copy baselineNeural childFark
F10.780.24−54 puan
F20.940.52−42 puan

Görevin önemli bir kısmı trivial copying ile çözülebiliyordu. Böylece yüksek bir extractive skorun tek başına ilişki anlama kanıtı sayılamayacağı ortaya çıktı.

Karar

Bu deneyi başarı diye saklamadık. Evaluator/task confound araştırma sonucunun kendisi oldu. Bundan sonra negatif kontroller ve copy-solvable görev ayrımı evaluator tasarımının zorunlu parçası haline geldi.

YAYIN KAYDIqa-interface-copy-confound
Sürüm
v1
Kanıt
2
Kaynak
Git · tr/experiments/qa-arayuz-ve-kopyalama-karmasasi.md

DEVİM yayınları sürüm geçmişini korur; kamusal kanıtı internal çalışmadan ayırır.

failureevaluatorQAcopy confound