पाठ 1 / 27
Large Language Model क्या है
LLM को परिभाषित करें और बताएँ कि वह हर चरण पर वास्तव में क्या करता है।
अगला-token अनुमानक
Large language model (LLM) अरबों संख्यात्मक parameters वाला neural network है, जिसे विशाल पाठ पर एक काम के लिए प्रशिक्षित किया जाता है: अब तक के पाठ को देखकर हर संभावित अगले token की संभावना देना। फिर प्रोग्राम एक token चुनता है (नियम या random draw से), उसे जोड़ता है और दोहराता है। Chat, अनुवाद, सार और कोड इसी एक लूप से आते हैं। मॉडल तथ्यों के database में खोज नहीं करता; जो "जानता" है वह परोक्ष रूप से उसके parameters में संचित है, इसीलिए वह धाराप्रवाह होकर भी ग़लत हो सकता है।
अगला token अनुमानित करें
LLM बहुत बड़ा neural network है जो अगला पाठ-खंड अनुमानित करने के लिए प्रशिक्षित है।
Phone autocomplete, बहुत बड़ा
आपका phone आपके लिखे से अगला शब्द सुझाता है। LLM वही विचार है, भाषा की कहीं बड़ी स्मृति और अब तक के पाठ के कहीं लंबे दृश्य के साथ।
Parameters सीखी हुई संख्याएँ हैं
"7B" का अर्थ सात अरब सीखी हुई संख्याएँ। ज़्यादा parameters आम तौर पर ज़्यादा क्षमता पर साथ में ज़्यादा स्मृति और लागत।
त्वरित जाँच: LLM किस बुनियादी कार्य के लिए प्रशिक्षित होता है?
- SQL queries चलाना
- तथ्य database में उत्तर खोजना
- पिछले tokens को देखकर अगला token अनुमानित करना
- Images compress करना
Answer
पिछले tokens को देखकर अगला token अनुमानित करना — LLM जो भी बनाता है वह बार-बार अगला-token अनुमान लगाकर बनता है।