# Multi-Vector, बहुभाषी और Multimodal Embeddings — Embeddings और Vector Search

Source: https://www.geekswithgeeks.com/hi/embeddings/a-multi

> विस्तार जानें: प्रति item कई vectors, कई भाषाएँ, कई माध्यम।

## अंग्रेज़ी पाठ से अधिक के लिए एक space

**बहुभाषी** embedding models कई भाषाओं के वाक्यों को एक साझा space में रखते हैं, इसलिए अंग्रेज़ी query हिंदी दस्तावेज़ retrieve कर सकती है और उलटा; हिंदी, अंग्रेज़ी और मिश्रित Hinglish परखें, क्योंकि गुणवत्ता भाषा और लिपि के अनुसार बदलती है। **Multimodal** मॉडल (जैसे CLIP-शैली) images और पाठ को साथ embed करते हैं, जिससे "पाठ से images खोजना" और समान-image खोज संभव होती है। ColBERT जैसे **multi-vector (late-interaction)** तरीक़े प्रति token एक vector रखकर vectors के समूहों की तुलना करते हैं, अक्सर ज़्यादा सटीक पर ज़्यादा भंडारण और विशेष indexes चाहिए। **Parent-child** डिज़ाइन सटीक मिलान के लिए छोटे chunks embed करता है पर बड़ा parent अनुभाग लौटाता है। अपनी समस्या से मेल खाने वाला विस्तार चुनें; एकल-vector baseline मापे जाने से पहले जटिलता न जोड़ें।

## Hinglish queries परखें

Users लैटिन अक्षरों में हिंदी लिखते हैं और भाषाएँ मिलाते हैं। ऐसी queries अपने golden set में रखें।

**Quiz:** बहुभाषी embedding model क्या संभव करता है?

- [ ] Chunking की ज़रूरत हटाना
- [ ] पाठ का शब्दशः अनुवाद
- [x] एक भाषा की query को दूसरी भाषा के दस्तावेज़ों से मिलाना
- [ ] पाठ encrypt करना

*Answer:* एक भाषा की query को दूसरी भाषा के दस्तावेज़ों से मिलाना. साझा space अर्थ को भाषाओं के पार मिलने देता है।
