पाठ 2 / 29

LLM सुविधा की संदर्भ Architecture

मॉडल call के आसपास के घटकों के नाम बताएँ।

मॉडल call छोटा हिस्सा है

Production LLM सुविधा के भीतर देखें तो मॉडल call साधारण सॉफ़्टवेयर से घिरी है। इनपुट सँभाल: authentication, rate limits, आकार सीमाएँ, सफ़ाई, भाषा पहचान। Context निर्माण: prompt templates, retrieval (RAG), बातचीत की स्मृति, access control सहित user व tenant डेटा। मॉडल परत: provider SDK या self-hosted server, मॉडल चुनाव या routing, timeouts, retries, fallbacks, caching। आउटपुट सँभाल: parsing, schema validation, repair या retry, सुरक्षा जाँचें, formatting, citations। Tools और कार्रवाइयाँ: नीति engine, अनुमोदन, audit log। Observability: traces, metrics, लागत ट्रैकिंग, user प्रतिक्रिया। मूल्यांकन और release: test sets, CI द्वार, prompt registry, चरणबद्ध rollout। इसे अपनी सुविधा के लिए एक पन्ने पर खींचने से दिखता है कि पिछला हर कोर्स कहाँ फ़िट होता है, और कमियाँ कहाँ हैं।

मॉडल call के आसपास के हिस्से

अनुरोध के रास्ते पर बाएँ से दाएँ पढ़ें।

request -> [auth, rate limit, size limit] -> [build context: template + retrieval + memory + ACL]
        -> [model layer: route, cache, timeout, retry, fallback] -> [parse + validate + repair]
        -> [safety checks, policy for tool calls, approvals] -> response

alongside:  traces + metrics + cost  |  feedback  |  eval sets + CI gate  |  prompt/model registry  |  staged rollout

बनाने से पहले खींचें

प्रवेश-बिंदुओं, मॉडल परत और निकासों का एक-पन्ने का चित्र ग़ायब नियंत्रण जल्दी उजागर करता है।

त्वरित जाँच: कौन-सा घटक मॉडल call के बाद और user के उत्तर देखने से पहले आता है?

  • Parsing, validation और सुरक्षा जाँचें
  • Base model प्रशिक्षित करना
  • GPU चुनना
  • System prompt लिखना
Answer

Parsing, validation और सुरक्षा जाँचें — आउटपुट सँभाल कच्चे पाठ को सुरक्षित और उपयोगी रूप में बदलता है।