पाठ 15 / 25

आपका Score कितना पक्का है?

Confidence intervals बताएँ ताकि छोटे test sets झूठा विश्वास न दें।

Score एक अनुमान है

20 में से 18 मामले पास होना 90% है, पर सिर्फ़ 20 मामलों से असली गुणवत्ता संभवतः लगभग 70% से 97% के बीच कहीं भी हो सकती है। Confidence interval वह सीमा दिखाता है। अनुपातों के लिए Wilson interval अच्छा विकल्प है। ज़्यादा test मामले interval को संकरा करते हैं: 200 में से 180 भी 90% है पर सीमा लगभग 85% से 93% तक कस जाती है। यह निष्कर्ष निकालने से पहले उपयोग करें कि version B, version A से बेहतर है।

Wilson interval, चलाकर

मैंने यह चलाया। वही 90% n = 20 पर (0.699, 0.972) और n = 200 पर (0.851, 0.934) देता है।

import math

def wilson(k, n, z=1.96):
    p = k / n
    d = 1 + z * z / n
    centre = (p + z * z / (2 * n)) / d
    half = z * math.sqrt(p * (1 - p) / n + z * z / (4 * n * n)) / d
    return round(centre - half, 3), round(centre + half, 3)

print(wilson(18, 20), wilson(180, 200))

Output:

(0.699, 0.972) (0.851, 0.934)

ओवरलैपिंग सीमाओं का मतलब "पक्का नहीं"

यदि version A का स्कोर 88% से 96% और version B का 85% से 94% है, तो एक के बेहतर होने का कोई असली प्रमाण नहीं। ज़्यादा मामले इकट्ठा करें या मानें कि वे समान हैं और ख़र्च या गति पर चुनें।

त्वरित जाँच: एक ही 90% score के लिए कौन-सा ज़्यादा कसा confidence interval देता है?

  • 200 test मामले
  • 20 test मामले
  • दोनों एक-जैसे हैं
  • किसी का interval नहीं
Answer

200 test मामले — ज़्यादा डेटा अनिश्चितता घटाता है और संभावित सीमा को संकरा करता है।