पाठ 1 / 28

Vectors को Database क्यों चाहिए

देखें library क्या नहीं देती और database क्या देता है।

Search index अभी system नहीं है

FAISS जैसी index library निकटतम पड़ोसी बहुत तेज़ी से खोज सकती है, पर production application को और चाहिए: restarts में बचने वाला टिकाऊ भंडारण, दस्तावेज़ बदलने पर अद्यतन और deletes, metadata और filters ("सिर्फ़ यह tenant", "सिर्फ़ 2025"), समवर्ती पाठक और लेखक, backups, access control, उपलब्धता के लिए replication, मशीनों में scaling और monitoring। Vector database (या vector समर्थन वाला database) इन सबको एक या अधिक ANN indexes के आसपास जोड़ता है। इसकी मूल इकाई record है जिसमें ID, vector और payload/metadata (और अक्सर मूल पाठ) होते हैं। Queries similarity ("इस vector के सबसे पास") को filters ("जहाँ tenant = acme") के साथ मिलाती हैं, और scores सहित शीर्ष परिणाम लौटाती हैं। Embeddings स्वयं पिछले कोर्स में हैं; यह कोर्स उन्हें रखने, खोजने और चलाने के बारे में है।

Vectors और उनके आसपास सब कुछ

Vector database vectors को उनके डेटा के साथ रखता है और तेज़ similarity खोज, filtering, अद्यतन और संचालन देता है।

चार हिस्से: store, index, filter, संचालन।
चित्र 1.1 — Store, index, filter और संचालन।

पुस्तकालय बनाम गोदाम

Search index बहुत अच्छा card catalogue है। Vector database पूरा गोदाम है: shelves, स्टाफ़, सुरक्षा, back-office और delivery, अंदर catalogue के साथ।

Record, अवधारणात्मक रूप से

हर engine के अपने नाम हैं, पर रूप वही है।

{
  "id": "leave-policy-2025#chunk-3",
  "vector": [0.12, -0.08, 0.33, "... 768 numbers ..."],
  "payload": {
    "text": "Unused leave up to 5 days can be carried over.",
    "tenant": "acme", "year": 2025, "source": "hr-policy.pdf", "page": 4
  }
}

त्वरित जाँच: ANN index library के अलावा vector database क्या जोड़ता है?

  • मुफ़्त GPUs
  • नया embedding model
  • टिकाऊपन, अद्यतन, filters, access control, replication और संचालन
  • हमेशा पूर्ण recall
Answer

टिकाऊपन, अद्यतन, filters, access control, replication और संचालन — Database तेज़ index को भरोसेमंद system बनाता है।