पाठ 16 / 28

Multi-Vector, बहुभाषी और Multimodal Embeddings

विस्तार जानें: प्रति item कई vectors, कई भाषाएँ, कई माध्यम।

अंग्रेज़ी पाठ से अधिक के लिए एक space

बहुभाषी embedding models कई भाषाओं के वाक्यों को एक साझा space में रखते हैं, इसलिए अंग्रेज़ी query हिंदी दस्तावेज़ retrieve कर सकती है और उलटा; हिंदी, अंग्रेज़ी और मिश्रित Hinglish परखें, क्योंकि गुणवत्ता भाषा और लिपि के अनुसार बदलती है। Multimodal मॉडल (जैसे CLIP-शैली) images और पाठ को साथ embed करते हैं, जिससे "पाठ से images खोजना" और समान-image खोज संभव होती है। ColBERT जैसे multi-vector (late-interaction) तरीक़े प्रति token एक vector रखकर vectors के समूहों की तुलना करते हैं, अक्सर ज़्यादा सटीक पर ज़्यादा भंडारण और विशेष indexes चाहिए। Parent-child डिज़ाइन सटीक मिलान के लिए छोटे chunks embed करता है पर बड़ा parent अनुभाग लौटाता है। अपनी समस्या से मेल खाने वाला विस्तार चुनें; एकल-vector baseline मापे जाने से पहले जटिलता न जोड़ें।

Hinglish queries परखें

Users लैटिन अक्षरों में हिंदी लिखते हैं और भाषाएँ मिलाते हैं। ऐसी queries अपने golden set में रखें।

त्वरित जाँच: बहुभाषी embedding model क्या संभव करता है?

  • Chunking की ज़रूरत हटाना
  • पाठ का शब्दशः अनुवाद
  • एक भाषा की query को दूसरी भाषा के दस्तावेज़ों से मिलाना
  • पाठ encrypt करना
Answer

एक भाषा की query को दूसरी भाषा के दस्तावेज़ों से मिलाना — साझा space अर्थ को भाषाओं के पार मिलने देता है।