2025-11-18T10:58:12.748063

LLM Prompt Duel Optimizer: Efficient Label-Free Prompt Optimization

Wu, Verma, Lee et al.

Large language models (LLMs) are highly sensitive to their input prompts, making prompt design a central challenge. While automatic prompt optimization (APO) reduces manual engineering, most approaches assume access to ground-truth references such as labeled validation data. In practice, however, collecting high-quality labels is costly and slow. We propose the Prompt Duel Optimizer (PDO), a sample-efficient framework for label-free prompt optimization. PDO formulates the problem as a dueling-bandit setting, where supervision signal comes from pairwise preference feedback provided by an LLM judge. The framework combines Double Thompson Sampling (D-TS), which prioritizes informative prompt comparisons, with Top-Performer Guided Mutation, which expands the candidate pool by mutating high-performing prompts. PDO naturally operates in label-free settings and can also incorporate partial labels to mitigate judge noise. Experiments on BIG-bench Hard (BBH) and MS MARCO show that PDO consistently outperforms baseline methods. Ablation studies further demonstrate the effectiveness of both D-TS and prompt mutation.

academic

LLM प्रॉम्प्ट ड्यूएल ऑप्टिमाइज़र: कुशल लेबल-मुक्त प्रॉम्प्ट अनुकूलन

मूल जानकारी

पेपर ID: 2510.13907
शीर्षक: LLM Prompt Duel Optimizer: Efficient Label-Free Prompt Optimization
लेखक: Yuanchen Wu, Saurabh Verma, Justin Lee, Fangzhou Xiong, Poppy Zhang, Amel Awadelkarim, Xu Chen, Yubai Yuan, Shawndra Hill
वर्गीकरण: cs.CL (कम्प्यूटेशनल भाषाविज्ञान), stat.ML (मशीन लर्निंग)
प्रकाशन तिथि: 14 अक्टूबर 2025 (arXiv प्रीप्रिंट)
पेपर लिंक: https://arxiv.org/abs/2510.13907

सारांश

बड़े भाषा मॉडल (LLMs) इनपुट प्रॉम्प्ट के प्रति अत्यधिक संवेदनशील हैं, जिससे प्रॉम्प्ट डिज़ाइन एक मुख्य चुनौती बन जाती है। हालांकि स्वचालित प्रॉम्प्ट अनुकूलन (APO) मानव इंजीनियरिंग को कम करता है, लेकिन अधिकांश विधियां लेबल किए गए सत्यापन डेटा जैसे वास्तविक लेबल तक पहुंच मानती हैं। हालांकि, व्यावहारिक रूप से उच्च-गुणवत्ता वाले लेबल एकत्र करना महंगा और समय-सापेक्ष दोनों है। यह पेपर प्रॉम्प्ट ड्यूएल ऑप्टिमाइज़र (PDO) प्रस्तावित करता है, जो लेबल-मुक्त प्रॉम्प्ट अनुकूलन के लिए एक नमूना-कुशल ढांचा है। PDO समस्या को ड्यूएल बैंडिट सेटिंग के रूप में मॉडल करता है, जहां निरीक्षण संकेत LLM रेफरी द्वारा प्रदान किए गए युग्मित वरीयता प्रतिक्रिया से आते हैं। यह ढांचा दोहरे थॉम्पसन सैंपलिंग (D-TS) और शीर्ष प्रदर्शनकारी-निर्देशित उत्परिवर्तन को जोड़ता है, जहां पूर्वकाल सूचनापूर्ण प्रॉम्प्ट तुलनाओं को प्राथमिकता देता है और बाद वाला उच्च-प्रदर्शन प्रॉम्प्ट्स को उत्परिवर्तित करके उम्मीदवार पूल का विस्तार करता है। PDO स्वाभाविक रूप से लेबल-मुक्त सेटिंग के लिए उपयुक्त है, और रेफरी शोर को कम करने के लिए आंशिक लेबल के साथ भी संयोजित किया जा सकता है। BIG-bench Hard (BBH) और MS MARCO पर प्रयोग दर्शाते हैं कि PDO सभी कार्यों में लगातार आधारभूत विधियों से बेहतर प्रदर्शन करता है।

अनुसंधान पृष्ठभूमि और प्रेरणा

समस्या परिभाषा

बड़े भाषा मॉडल का प्रदर्शन काफी हद तक सावधानीपूर्वक डिज़ाइन किए गए प्रॉम्प्ट्स पर निर्भर करता है, लेकिन प्रभावी प्रॉम्प्ट्स को हाथ से तैयार करने के लिए आमतौर पर बड़ी मात्रा में परीक्षण-और-त्रुटि की आवश्यकता होती है। मौजूदा स्वचालित प्रॉम्प्ट अनुकूलन (APO) विधियां, हालांकि मानव इंजीनियरिंग को कम कर सकती हैं, निम्नलिखित मुख्य समस्याओं का सामना करती हैं:

लेबल निर्भरता: अधिकांश APO विधियां उम्मीदवार प्रॉम्प्ट्स के प्रदर्शन का मूल्यांकन करने के लिए लेबल किए गए सत्यापन डेटा पर निर्भर करती हैं
एनोटेशन लागत: व्यावहारिक अनुप्रयोगों में, उच्च-गुणवत्ता वाले एनोटेट किए गए डेटा प्राप्त करना महंगा और समय-सापेक्ष दोनों है
तैनाती में देरी: औद्योगिक परिदृश्यों में, बड़े पैमाने पर मानव एनोटेशन डेटा उपलब्ध होने से पहले उचित प्रॉम्प्ट्स तैनात करने की आवश्यकता है

अनुसंधान प्रेरणा

पेपर का मुख्य अनुसंधान प्रश्न है: क्या वास्तविक लेबल संदर्भ के बिना प्रॉम्प्ट्स को अनुकूलित किया जा सकता है?

इस समस्या को हल करने के लिए, लेखक LLM को रेफरी के रूप में उपयोग करने का प्रस्ताव करते हैं ताकि प्रॉम्प्ट गुणवत्ता का मूल्यांकन किया जा सके, स्वतंत्र स्कोरिंग के बजाय युग्मित तुलना के माध्यम से अधिक विश्वसनीय निरीक्षण संकेत प्राप्त किए जा सकें। यह विधि दो मुख्य चुनौतियों का सामना करती है:

LLM रेफरी शोर: LLM निर्णय में अनिश्चितता, स्थिति पूर्वाग्रह और वर्बोसिटी पूर्वाग्रह होते हैं
द्विघात जटिलता: युग्मित तुलनाओं की संख्या उम्मीदवार प्रॉम्प्ट्स की संख्या के साथ द्विघात रूप से बढ़ती है

मुख्य योगदान

समस्या मॉडलिंग नवाचार: पहली बार वरीयता-आधारित प्रॉम्प्ट अनुकूलन को ड्यूएल बैंडिट समस्या के रूप में मॉडल किया, LLM रेफरी की युग्मित तुलनाओं को निरीक्षण संकेत के रूप में उपयोग किया
एल्गोरिथ्म ढांचा डिज़ाइन: PDO ढांचा प्रस्तावित किया, जो कुशल प्रॉम्प्ट चयन के लिए दोहरे थॉम्पसन सैंपलिंग (D-TS) और खोज स्थान विस्तार के लिए शीर्ष प्रदर्शनकारी-निर्देशित उत्परिवर्तन को जोड़ता है
सैद्धांतिक गारंटी: Copeland पश्चाताप सीमा का सैद्धांतिक विश्लेषण प्रदान किया, यह साबित किया कि PDO Copeland इष्टतम प्रॉम्प्ट में स्पर्शोन्मुख रूप से परिवर्तित होता है
प्रायोगिक सत्यापन: BBH और MS MARCO डेटासेट पर PDO की प्रभावशीलता को सत्यापित किया, और विलोपन प्रयोगों के माध्यम से प्रत्येक घटक के योगदान को साबित किया
लचीलापन: PDO शुद्ध लेबल-मुक्त सेटिंग में काम कर सकता है, या रेफरी शोर को कम करने के लिए आंशिक लेबल के साथ संयोजित किया जा सकता है

विधि विवरण

कार्य परिभाषा

X को इनपुट स्पेस मानें, P = {p1, ..., pK} को परिमित उम्मीदवार प्रॉम्प्ट्स का सेट मानें। प्रॉम्प्ट pi, pj ∈ P और समान इनपुट x के लिए, LLM रेफरी के माध्यम से बाइनरी वरीयता प्राप्त करें:

Judgex(pi, pj) = {
    1, यदि fpi(x) ≻ fpj(x)
    0, अन्यथा
}

लक्ष्य सीमित तुलना बजट के तहत Condorcet विजेता (यदि मौजूद हो) या Copeland विजेता की पहचान करना है।

मॉडल आर्किटेक्चर

1. दोहरा थॉम्पसन सैंपलिंग (D-TS)

D-TS थॉम्पसन सैंपलिंग को ड्यूएल बैंडिट सेटिंग में विस्तारित करता है, प्रत्येक राउंड में सूचनापूर्ण ड्यूएल्स चुनने के लिए दो स्वतंत्र थॉम्पसन नमूने का उपयोग करता है:

प्रत्येक राउंड की प्रक्रिया:

पहला प्रॉम्प्ट चयन: आशावादी Copeland स्कोर की गणना करें, सर्वोच्च स्कोर वाले प्रॉम्प्ट्स का सेट रखें, थॉम्पसन सैंपलिंग के माध्यम से उम्मीदवार चुनें
दूसरा प्रॉम्प्ट चयन: अनिश्चित प्रतिद्वंद्वी सेट तक सीमित करें, थॉम्पसन सैंपलिंग के माध्यम से ड्यूएल प्रतिद्वंद्वी चुनें
ड्यूएल और अपडेट: रेफरी तुलना निष्पादित करें और जीत-हार आंकड़े अपडेट करें

2. शीर्ष प्रदर्शनकारी-निर्देशित उत्परिवर्तन

खोज स्थान का विस्तार करने के लिए, PDO नियमित रूप से सर्वश्रेष्ठ-प्रदर्शन करने वाले प्रॉम्प्ट्स को उत्परिवर्तित करता है:

उत्परिवर्तन प्रक्रिया:

चयन: वर्तमान Copeland स्कोर सर्वोच्च प्रॉम्प्ट चुनें
उत्परिवर्तन: टेम्पलेट संपादन, पाठ ढाल-निर्देशित, या LLM-सहायता प्राप्त पुनर्लेखन के माध्यम से वेरिएंट उत्पन्न करें
विस्तार: नए वेरिएंट को उम्मीदवार पूल में जोड़ें

तकनीकी नवाचार बिंदु

सैद्धांतिक आधार: Lipschitz बैंडिट सिद्धांत पर आधारित, शीर्ष प्रदर्शनकारी के पास केंद्रित उत्परिवर्तन लगभग इष्टतम क्षेत्र में खोज को "ज़ूम इन" करने के बराबर है
शोर प्रबंधन: भारित वरीयता मैट्रिक्स अपडेट अपनाएं, तर्क-आधारित निर्णयों को (उत्तर-आधारित निर्णयों की तुलना में अधिक शोरगुल) कम वजन दें
दक्षता अनुकूलन: कैशिंग तंत्र और अनुकूली प्रूनिंग के माध्यम से कम्प्यूटेशनल ओवरहेड को कम करें

प्रायोगिक सेटअप

डेटासेट

BIG-bench Hard (BBH): 16 बहु-विकल्प तर्क कार्य चुनें, सटीकता को मूल्यांकन मेट्रिक के रूप में उपयोग करें
MS MARCO: चार खुले-अंत QA कार्य श्रेणियां (विवरणात्मक, इकाई, संख्यात्मक, स्थान), 1-5 अंकों की LLM मूल्यांकन का उपयोग करें

मूल्यांकन मेट्रिक्स

BBH कार्य: सटीकता
MS MARCO कार्य: LLM रेफरी द्वारा दिए गए 1-5 अंकों की पूर्णांक रेटिंग

तुलनात्मक विधियां

लेबल-मुक्त आधारभूत:

SPO (Self-Supervised Prompt Optimization)
CoT (Chain-of-Thought)
PoS (Plan-and-Solve)

पर्यवेक्षित आधारभूत:

APE (Automatic Prompt Engineer)
OPRO (Optimization by PROmpting)
Breeder (Prompt Evolution)

कार्यान्वयन विवरण

BBH: 20 प्रारंभिक उम्मीदवार प्रॉम्प्ट्स, 30 राउंड, प्रति राउंड 50 ड्यूएल्स
MS MARCO: 50 प्रारंभिक उम्मीदवार प्रॉम्प्ट्स, 30 राउंड, प्रति राउंड 50 ड्यूएल्स
Llama-3.3-70B-Instruct को जनरेशन, रेफरी और मूल्यांकन मॉडल के रूप में उपयोग करें
D-TS पैरामीटर α = 1.2

प्रायोगिक परिणाम

मुख्य परिणाम

BBH कार्य प्रदर्शन (लेबल-मुक्त सेटिंग)

PDO 16 कार्यों में से 13 पर सर्वश्रेष्ठ प्रदर्शन प्राप्त करता है, महत्वपूर्ण सुधार में शामिल हैं:

Tracking-7: 0.641 बनाम 0.543 (+9.8 प्रतिशत अंक)
Web of Lies: 0.942 बनाम 0.861 (+8.1 प्रतिशत अंक)

MS MARCO कार्य प्रदर्शन

सभी 4 कार्यों पर, D-TS के साथ PDO लगातार RUCB और यादृच्छिक सैंपलिंग से बेहतर प्रदर्शन करता है, और कुछ राउंड में SPO आधारभूत से आगे निकल जाता है।

विलोपन प्रयोग

D-TS बनाम अन्य सैंपलिंग रणनीतियां: D-TS नमूना दक्षता में यादृच्छिक सैंपलिंग और RUCB से महत्वपूर्ण रूप से बेहतर है
उत्परिवर्तन प्रभाव: शीर्ष प्रदर्शनकारी-निर्देशित उत्परिवर्तन Web of Lies और Tracking-7 कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार करता है
युग्मित वरीयता बनाम बिंदु-वार मूल्यांकन: 8 मॉडल-कार्य संयोजनों में से 7 मामलों में, युग्मित वरीयता बिंदु-वार मूल्यांकन से बेहतर है

LLM रेफरी विश्लेषण

कार्य-संबंधित शोर स्तर: विभिन्न कार्यों में रेफरी विश्वसनीयता में महत्वपूर्ण अंतर है, जैसे Geometric कार्य में बड़ी निर्णय त्रुटि है
आंशिक लेबल की भूमिका: 30%-50% वास्तविक लेबल का परिचय निर्णय शोर को महत्वपूर्ण रूप से कम कर सकता है
मॉडल आकार प्रभाव: 70B और 8B मॉडल रेफरी के रूप में समग्र प्रदर्शन समान हैं

निष्कर्ष और चर्चा

मुख्य निष्कर्ष

PDO लेबल-मुक्त प्रॉम्प्ट अनुकूलन समस्या को सफलतापूर्वक हल करता है, ड्यूएल बैंडिट ढांचे के माध्यम से नमूना-कुशल खोज प्राप्त करता है
D-TS यादृच्छिक सैंपलिंग और अन्य ड्यूएल बैंडिट विधियों की तुलना में उच्च-गुणवत्ता प्रॉम्प्ट्स की पहचान करने में तेजी से और अधिक विश्वसनीय है
शीर्ष प्रदर्शनकारी-निर्देशित उत्परिवर्तन प्रभावी रूप से खोज को मजबूत क्षेत्रों की ओर निर्देशित करता है
युग्मित वरीयता बिंदु-वार मूल्यांकन की तुलना में अधिक स्थिर निरीक्षण संकेत प्रदान करती है

सीमाएं

रेफरी निर्भरता: अनुकूलन गुणवत्ता LLM रेफरी की क्षमता और मेटा-प्रॉम्प्ट डिज़ाइन पर निर्भर करती है
शैली वरीयता जोखिम: एल्गोरिथ्म वास्तविक कार्य मेट्रिक्स के बजाय रेफरी द्वारा पसंद किए जाने वाले शैली पैटर्न की ओर पूर्वाग्रहित हो सकता है
कम्प्यूटेशनल संसाधन सीमा: संसाधन बाधाओं के कारण, अधिक मॉडल पर व्यापक प्रयोग नहीं किए जा सके

भविष्य की दिशाएं

LLM रेफरी को कार्य उद्देश्यों के साथ संरेखित करने में सुधार
निर्णय विश्वसनीयता को प्रतिबिंबित करने के लिए अनुकूली समायोजन तंत्र विकसित करें
अधिक जटिल अनिश्चितता कैप्चर तंत्र का अन्वेषण करें

गहन मूल्यांकन

शक्तियां

समस्या मॉडलिंग नवाचार: प्रॉम्प्ट अनुकूलन को ड्यूएल बैंडिट समस्या के रूप में मॉडल करना सैद्धांतिक आधार और व्यावहारिक मूल्य दोनों रखता है
विधि पूर्णता: कुशल चयन रणनीति और खोज स्थान विस्तार को जोड़ता है, एक पूर्ण अनुकूलन ढांचा बनाता है
पर्याप्त प्रयोग: कई डेटासेट पर व्यापक मूल्यांकन, विलोपन प्रयोग और रेफरी विश्लेषण सहित
सैद्धांतिक गारंटी: Copeland पश्चाताप सीमा का सैद्धांतिक विश्लेषण प्रदान करता है

कमियां

रेफरी शोर प्रबंधन: हालांकि रेफरी शोर समस्या का विश्लेषण किया गया है, समाधान अपेक्षाकृत सरल है
स्केलेबिलिटी: बड़े पैमाने पर उम्मीदवार प्रॉम्प्ट सेट पर प्रदर्शन पर्याप्त रूप से सत्यापित नहीं है
कार्य सामान्यीकरण: मुख्य रूप से तर्क और QA कार्यों पर सत्यापित, अन्य प्रकार के कार्यों पर प्रयोज्यता अस्पष्ट है

प्रभाव

शैक्षणिक योगदान: लेबल-मुक्त प्रॉम्प्ट अनुकूलन के लिए नया सैद्धांतिक ढांचा और व्यावहारिक विधि प्रदान करता है
व्यावहारिक मूल्य: औद्योगिक परिदृश्यों में सीधे अनुप्रयोग मूल्य है, विशेष रूप से एनोटेशन डेटा दुर्लभ होने पर
पुनरुत्पादनीयता: लेखक कोड को खुला-स्रोत करने का वचन देते हैं, विधि के पुनरुत्पादन और आगे के अनुसंधान को सुविधाजनक बनाता है

लागू परिदृश्य

एनोटेशन डेटा दुर्लभ: नए डोमेन या कार्य जहां बड़ी मात्रा में एनोटेट डेटा नहीं है
तीव्र तैनाती आवश्यकता: कम समय में उचित प्रॉम्प्ट्स प्राप्त करने की आवश्यकता वाले औद्योगिक अनुप्रयोग
लागत-संवेदनशील अनुप्रयोग: एनोटेशन लागत अधिक होने वाले परिदृश्य
बहु-कार्य अनुकूलन: एक साथ कई संबंधित कार्यों के लिए प्रॉम्प्ट्स को अनुकूलित करने की आवश्यकता

संदर्भ

पेपर कई महत्वपूर्ण संबंधित कार्यों का हवाला देता है, जिनमें शामिल हैं:

Zhou et al. (2022) - APE विधि
Yang et al. (2024) - OPRO विधि
Fernando et al. (2023) - Breeder विधि
Wu and Liu (2016) - दोहरे थॉम्पसन सैंपलिंग सिद्धांत
Zheng et al. (2023) - LLM को रेफरी के रूप में उपयोग करने पर संबंधित अनुसंधान

समग्र मूल्यांकन: यह प्रॉम्प्ट अनुकूलन क्षेत्र में महत्वपूर्ण योगदान वाला एक पेपर है, जो नवीन समस्या मॉडलिंग और सैद्धांतिक ढांचे के माध्यम से लेबल-मुक्त प्रॉम्प्ट अनुकूलन की व्यावहारिक आवश्यकता को प्रभावी ढंग से हल करता है। विधि डिज़ाइन तर्कसंगत है, प्रायोगिक सत्यापन पर्याप्त है, और इसमें मजबूत सैद्धांतिक आधार और व्यावहारिक मूल्य है।