# आपका Score कितना पक्का है? — AI Safety, Evaluation और Cost Control

Source: https://www.geekswithgeeks.com/hi/ai-safety/eval-uncertainty

> Confidence intervals बताएँ ताकि छोटे test sets झूठा विश्वास न दें।

## Score एक अनुमान है

20 में से 18 मामले पास होना 90% है, पर सिर्फ़ 20 मामलों से असली गुणवत्ता संभवतः लगभग 70% से 97% के बीच कहीं भी हो सकती है। **Confidence interval** वह सीमा दिखाता है। अनुपातों के लिए **Wilson interval** अच्छा विकल्प है। ज़्यादा test मामले interval को संकरा करते हैं: 200 में से 180 भी 90% है पर सीमा लगभग 85% से 93% तक कस जाती है। यह निष्कर्ष निकालने से पहले उपयोग करें कि version B, version A से बेहतर है।

## Wilson interval, चलाकर

मैंने यह चलाया। वही 90% n = 20 पर (0.699, 0.972) और n = 200 पर (0.851, 0.934) देता है।

```python
import math

def wilson(k, n, z=1.96):
    p = k / n
    d = 1 + z * z / n
    centre = (p + z * z / (2 * n)) / d
    half = z * math.sqrt(p * (1 - p) / n + z * z / (4 * n * n)) / d
    return round(centre - half, 3), round(centre + half, 3)

print(wilson(18, 20), wilson(180, 200))
```

Output:

```
(0.699, 0.972) (0.851, 0.934)
```

## ओवरलैपिंग सीमाओं का मतलब "पक्का नहीं"

यदि version A का स्कोर 88% से 96% और version B का 85% से 94% है, तो एक के बेहतर होने का कोई असली प्रमाण नहीं। ज़्यादा मामले इकट्ठा करें या मानें कि वे समान हैं और ख़र्च या गति पर चुनें।

**Quiz:** एक ही 90% score के लिए कौन-सा ज़्यादा कसा confidence interval देता है?

- [x] 200 test मामले
- [ ] 20 test मामले
- [ ] दोनों एक-जैसे हैं
- [ ] किसी का interval नहीं

*Answer:* 200 test मामले. ज़्यादा डेटा अनिश्चितता घटाता है और संभावित सीमा को संकरा करता है।
