पाठ 15 / 25
आपका Score कितना पक्का है?
Confidence intervals बताएँ ताकि छोटे test sets झूठा विश्वास न दें।
Score एक अनुमान है
20 में से 18 मामले पास होना 90% है, पर सिर्फ़ 20 मामलों से असली गुणवत्ता संभवतः लगभग 70% से 97% के बीच कहीं भी हो सकती है। Confidence interval वह सीमा दिखाता है। अनुपातों के लिए Wilson interval अच्छा विकल्प है। ज़्यादा test मामले interval को संकरा करते हैं: 200 में से 180 भी 90% है पर सीमा लगभग 85% से 93% तक कस जाती है। यह निष्कर्ष निकालने से पहले उपयोग करें कि version B, version A से बेहतर है।
Wilson interval, चलाकर
मैंने यह चलाया। वही 90% n = 20 पर (0.699, 0.972) और n = 200 पर (0.851, 0.934) देता है।
import math
def wilson(k, n, z=1.96):
p = k / n
d = 1 + z * z / n
centre = (p + z * z / (2 * n)) / d
half = z * math.sqrt(p * (1 - p) / n + z * z / (4 * n * n)) / d
return round(centre - half, 3), round(centre + half, 3)
print(wilson(18, 20), wilson(180, 200))
Output:
(0.699, 0.972) (0.851, 0.934)
ओवरलैपिंग सीमाओं का मतलब "पक्का नहीं"
यदि version A का स्कोर 88% से 96% और version B का 85% से 94% है, तो एक के बेहतर होने का कोई असली प्रमाण नहीं। ज़्यादा मामले इकट्ठा करें या मानें कि वे समान हैं और ख़र्च या गति पर चुनें।
त्वरित जाँच: एक ही 90% score के लिए कौन-सा ज़्यादा कसा confidence interval देता है?
- 200 test मामले
- 20 test मामले
- दोनों एक-जैसे हैं
- किसी का interval नहीं
Answer
200 test मामले — ज़्यादा डेटा अनिश्चितता घटाता है और संभावित सीमा को संकरा करता है।