2025-11-16T12:07:12.311543

Chunk-Distilled Language Modeling

Li, Livescu, Zhou

We introduce Chunk-Distilled Language Modeling (CD-LM), an approach to text generation that addresses two challenges in current large language models (LLMs): the inefficiency of token-level generation, and the difficulty of adapting to new data and knowledge. Our method combines deep network-based LLMs with a straightforward retrieval module, which allows the generation of multi-token text chunks at a single decoding step. Our retrieval framework enables flexible construction of model- or domain-specific datastores, either leveraging the internal knowledge of existing models, or incorporating expert insights from human-annotated corpora. This adaptability allows for enhanced control over the language model's distribution without necessitating additional training. We present the CD-LM formulation along with performance metrics demonstrating its ability to improve language model performance and efficiency across a diverse set of downstream tasks. Code and data will be made publicly available.

academic

खंड-आसवित भाषा मॉडलिंग

मूल जानकारी

पेपर ID: 2501.00343
शीर्षक: Chunk-Distilled Language Modeling
लेखक: Yanhong Li (University of Chicago & TTIC), Karen Livescu (Toyota Technological Institute at Chicago), Jiawei Zhou (TTIC & Stony Brook University)
वर्गीकरण: cs.CL cs.AI
प्रकाशन तिथि: 31 दिसंबर 2024 (arXiv प्रीप्रिंट)
पेपर लिंक: https://arxiv.org/abs/2501.00343

सारांश

यह पेपर खंड-आसवित भाषा मॉडलिंग (Chunk-Distilled Language Modeling, CD-LM) प्रस्तावित करता है, जो वर्तमान बड़े भाषा मॉडल की दो मुख्य चुनौतियों को संबोधित करने वाली एक पाठ पीढ़ी विधि है: टोकन-स्तरीय पीढ़ी की अक्षमता और नए डेटा तथा ज्ञान के अनुकूलन की कठिनाई। यह विधि गहन नेटवर्क-आधारित LLM को सरल पुनः प्राप्ति मॉड्यूल के साथ जोड़ती है, जो एकल डिकोडिंग चरण में बहु-टोकन पाठ खंड उत्पन्न करने की अनुमति देती है। इसका पुनः प्राप्ति ढांचा मॉडल या डोमेन-विशिष्ट डेटा स्टोर के लचीले निर्माण का समर्थन करता है, जो मौजूदा मॉडल के आंतरिक ज्ञान का उपयोग कर सकता है और मानव-टिप्पणीकृत कॉर्पस के विशेषज्ञ अंतर्दृष्टि को भी शामिल कर सकता है। यह अनुकूलनशीलता अतिरिक्त प्रशिक्षण के बिना भाषा मॉडल वितरण पर नियंत्रण को बढ़ाने की अनुमति देती है।

अनुसंधान पृष्ठभूमि और प्रेरणा

मुख्य समस्याएं

पीढ़ी दक्षता समस्या: वर्तमान LLM स्वप्रतिगामी Transformer आर्किटेक्चर पर आधारित हैं, जो पाठ को क्रमिक रूप से टोकन-दर-टोकन उत्पन्न करते हैं, जिससे अनुमान दक्षता सीमित होती है
ज्ञान अनुकूलन कठिनाई: प्रशिक्षण के बाद मॉडल पैरामीटर को अपडेट करने के लिए महंगे डेटा और कम्प्यूटेशनल संसाधनों की आवश्यकता होती है, जिससे नए ज्ञान को गतिशील रूप से एकीकृत करना मुश्किल होता है

समस्या की महत्ता

मौजूदा समाधानों में सीमाएं हैं: अनुमानित डिकोडिंग (speculative decoding) गति में सुधार कर सकती है लेकिन निश्चित मॉडल वितरण बनाए रखती है; पुनः प्राप्ति-संवर्धित पीढ़ी (RAG) अनुकूलनशीलता में सुधार कर सकती है लेकिन आमतौर पर दक्षता लाभ नहीं देती है
दक्षता और प्रदर्शन दोनों समस्याओं को एक साथ हल करने वाले एकीकृत समाधान की आवश्यकता है

मुख्य अंतर्दृष्टि

पेपर यह देखता है कि LLM समान संदर्भ में अक्सर दोहराए जाने वाले पाठ खंड उत्पन्न करते हैं, ये खंड टोकन अनुक्रम पर उच्च संभाव्यता पठार प्रदर्शित करते हैं, जो दर्शाता है कि मॉडल को कुछ बहु-टोकन संयोजनों की मजबूत स्मृति है।

मुख्य योगदान

CD-LM ढांचा प्रस्तावित करना: पीढ़ी दक्षता और मॉडलिंग प्रदर्शन दोनों को बढ़ाने वाली पहली पुनः प्राप्ति-संवर्धित भाषा मॉडलिंग विधि
लचीली खंड निष्कर्षण तंत्र डिजाइन करना: तीन अनुप्रयोग परिदृश्यों का समर्थन करता है (ज्ञान आसवन, स्व-आसवन, विशेषज्ञ आसवन)
कुशल पुनः प्राप्ति आर्किटेक्चर का निर्माण: trie संरचना-आधारित डेटा स्टोरेज और संदर्भ मिलान तंत्र
संभाव्यता गणना एल्गोरिथ्म प्राप्त करना: पूर्ण अनुक्रम संभाव्यता गणना के लिए गतिशील प्रोग्रामिंग एल्गोरिथ्म प्रदान करना
व्यापक प्रायोगिक सत्यापन: कई कार्यों पर दक्षता और प्रदर्शन के दोहरे सुधार का प्रदर्शन

विधि विवरण

कार्य परिभाषा

पूर्वसर्ग अनुक्रम $x_{<n}$ दिया गया है, CD-LM प्रत्येक पीढ़ी चरण में निम्नलिखित में से चुनता है:

पुनः प्राप्त पाठ खंड $c_n$ को स्वीकार करना (कई टोकन पीढ़ी चरणों को छोड़ना)
खंड को अस्वीकार करना और आधार LM का उपयोग करके एकल टोकन उत्पन्न करना

मॉडल आर्किटेक्चर

1. संभाव्यता पीढ़ी मॉडल

CD-LM द्विआधारी यादृच्छिक चर $z_n$ प्रस्तुत करता है जो नियंत्रित करता है कि क्या स्थिति $n$ पर पुनः प्राप्त खंड का उपयोग किया जाए:

$p(z_n = 1) = q_n$

पीढ़ी प्रक्रिया इस प्रकार है:

यदि $z_n = 1$ : खंड $c_n$ स्वीकार करें, लंबाई $\tau_n$ के साथ
यदि $z_n = 0$ : आधार LM का उपयोग करके एकल टोकन उत्पन्न करें

2. खंड डेटा स्टोर निर्माण

डेटा स्टोर $D = \{(r_i, s_i)\}_{i=1}^{|D|}$ , जहां:

$r_i = (u_i, v_i)$ : $u_i$ पूर्ववर्ती संदर्भ है, $v_i$ प्रवेश टोकन है
$s_i$ : पाठ खंड
trie संरचना $\{T_{w_1}, T_{w_2}, ..., T_{w_{|V|}}\}$ का उपयोग करके संग्रहीत, प्रत्येक $T_w$ टोकन $w$ से शुरू होने वाले सभी खंडों को संग्रहीत करता है

3. अनुकूली खंड पुनः प्राप्ति

खंड प्रस्ताव मॉडल $G(x_{<n}) \rightarrow (c_n, q_n)$ :