2025-11-16T15:07:12.519849

Data or Language Supervision: What Makes CLIP Better than DINO?

Liu, Zhang, Ghosh et al.

CLIP outperforms self-supervised models like DINO as vision encoders for vision-language models (VLMs), but it remains unclear whether this advantage stems from CLIP's language supervision or its much larger training data. To disentangle these factors, we pre-train CLIP and DINO under controlled settings -- using the same architecture, dataset, and training configuration -- achieving similar ImageNet accuracy. Embedding analysis shows that CLIP captures high-level semantics (e.g., object categories, text), while DINO is more responsive to low-level features like colors and styles. When integrated into VLMs and evaluated on 20 VQA benchmarks, CLIP excels at text-intensive tasks, while DINO slightly outperforms on vision-centric ones. Variants of language supervision (e.g., sigmoid loss, pre-trained language encoders) yield limited gains. Our findings provide scientific insights into vision encoder design and its impact on VLM performance.

academic

डेटा या भाषा पर्यवेक्षण: CLIP को DINO से बेहतर क्या बनाता है?

मूल जानकारी

पेपर ID: 2510.11835
शीर्षक: डेटा या भाषा पर्यवेक्षण: CLIP को DINO से बेहतर क्या बनाता है?
लेखक: Yiming Liu, Yuhui Zhang, Dhruba Ghosh, Ludwig Schmidt, Serena Yeung-Levy (Stanford University, Tsinghua University)
वर्गीकरण: cs.CV cs.AI cs.CL cs.LG cs.MM
प्रकाशन तिथि: 13 अक्टूबर 2025
पेपर लिंक: https://arxiv.org/abs/2510.11835

सारांश

CLIP दृश्य-भाषा मॉडल (VLMs) में दृश्य एन्कोडर के रूप में DINO जैसे स्व-पर्यवेक्षित मॉडल से बेहतर प्रदर्शन करता है, लेकिन यह लाभ भाषा पर्यवेक्षण से आता है या बड़े पैमाने पर प्रशिक्षण डेटा से यह स्पष्ट नहीं है। इन कारकों को अलग करने के लिए, शोधकर्ताओं ने नियंत्रित सेटिंग में CLIP और DINO को पूर्व-प्रशिक्षित किया—समान आर्किटेक्चर, डेटासेट और प्रशिक्षण कॉन्फ़िगरेशन का उपयोग करके—समान ImageNet सटीकता प्राप्त की। एम्बेडिंग विश्लेषण से पता चलता है कि CLIP उच्च-स्तरीय शब्दार्थ (जैसे वस्तु वर्ग, पाठ) को कैप्चर करता है, जबकि DINO रंग और शैली जैसी निम्न-स्तरीय विशेषताओं के प्रति अधिक प्रतिक्रियाशील है। जब VLMs में एकीकृत किया जाता है और 20 VQA बेंचमार्क पर मूल्यांकन किया जाता है, तो CLIP पाठ-घने कार्यों पर उत्कृष्ट प्रदर्शन करता है, जबकि DINO दृश्य-केंद्रित कार्यों पर मामूली लाभ दिखाता है। भाषा पर्यवेक्षण के वेरिएंट (जैसे sigmoid हानि, पूर्व-प्रशिक्षित भाषा एन्कोडर) सीमित लाभ देते हैं।

अनुसंधान पृष्ठभूमि और प्रेरणा

मूल समस्या

यह अनुसंधान जो मूल समस्या हल करना चाहता है: VLMs में DINO की तुलना में CLIP की श्रेष्ठ कार्यक्षमता भाषा पर्यवेक्षण से आती है या बड़े पैमाने पर प्रशिक्षण डेटा से?

समस्या की महत्ता

व्यावहारिक महत्व: दृश्य एन्कोडर VLMs की "आंखें" हैं, इसकी कार्यक्षमता पूरे सिस्टम की दृश्य समझ क्षमता को सीधे प्रभावित करती है
सैद्धांतिक मूल्य: विभिन्न पर्यवेक्षण संकेतों के दृश्य प्रतिनिधित्व सीखने पर प्रभाव को समझना, बेहतर दृश्य एन्कोडर डिजाइन के लिए वैज्ञानिक मार्गदर्शन प्रदान करता है
संसाधन अनुकूलन: मुख्य कारकों को स्पष्ट करना सीमित संसाधनों में बेहतर डिजाइन विकल्प बनाने में मदद करता है

मौजूदा विधियों की सीमाएं

मिश्रित कारक: मौजूदा CLIP और DINO मॉडल प्रशिक्षण डेटा स्केल में 100 गुना तक भिन्न होते हैं, जिससे पर्यवेक्षण प्रकार और डेटा स्केल के प्रभाव को अलग करना कठिन हो जाता है
नियंत्रित प्रयोगों की कमी: पिछले तुलनात्मक अध्ययन विभिन्न प्रशिक्षण सेटिंग्स के पूर्व-प्रशिक्षित मॉडल पर आधारित थे, निष्पक्ष तुलना संभव नहीं थी
तंत्र समझ अपर्याप्त: भाषा पर्यवेक्षण दृश्य प्रतिनिधित्व स्थान को कैसे बदलता है इसके बारे में गहन विश्लेषण की कमी है

अनुसंधान प्रेरणा

कठोर नियंत्रित प्रयोगात्मक डिजाइन के माध्यम से, समान परिस्थितियों में CLIP और DINO को प्रशिक्षित करके, दृश्य एन्कोडर कार्यक्षमता पर भाषा पर्यवेक्षण के वास्तविक प्रभाव का वैज्ञानिक विश्लेषण करना।

मुख्य योगदान

पहला नियंत्रित प्रयोग: समान आर्किटेक्चर (ViT-B/16), डेटासेट (DataComp 10M सबसेट) और प्रशिक्षण कॉन्फ़िगरेशन के तहत CLIP और DINO को प्रशिक्षित करना, निष्पक्ष तुलना प्राप्त करना
एम्बेडिंग स्पेस विश्लेषण: भाषा पर्यवेक्षण दृश्य प्रतिनिधित्व को कैसे बदलता है इसका गहन विश्लेषण, CLIP उच्च-स्तरीय शब्दार्थ पर अधिक ध्यान देता है, DINO निम्न-स्तरीय दृश्य विशेषताओं के प्रति अधिक संवेदनशील है
VLM कार्यक्षमता मूल्यांकन: 20 VQA बेंचमार्क पर दोनों एन्कोडर का व्यवस्थित मूल्यांकन, CLIP को OCR कार्यों पर DINO से काफी बेहतर (7.5% सुधार) पाया
पर्यवेक्षण वेरिएंट अन्वेषण: विभिन्न भाषा पर्यवेक्षण रूपों (SigLIP हानि, पूर्व-प्रशिक्षित भाषा मॉडल) के सीमित लाभ को सत्यापित किया
वैज्ञानिक अंतर्दृष्टि: दृश्य एन्कोडर डिजाइन के लिए अनुभवजन्य-आधारित मार्गदर्शन सिद्धांत प्रदान किए

विधि विवरण

कार्य परिभाषा

इनपुट: छवि डेटासेट, वैकल्पिक रूप से युग्मित पाठ विवरण आउटपुट: दृश्य एन्कोडर, जो छवियों को शब्दार्थ प्रतिनिधित्व स्थान में मैप कर सकता है बाधाएं: अन्य सभी चर को नियंत्रित करने की शर्त पर, केवल पर्यवेक्षण संकेत प्रकार को बदलना

नियंत्रित प्रयोग डिजाइन

आर्किटेक्चर एकीकरण

बैकबोन नेटवर्क: ViT-B/16 दोनों मॉडल के लिए सामान्य आर्किटेक्चर के रूप में
पैरामीटर स्केल: मॉडल जटिलता सुनिश्चित करना समान है

डेटासेट एकीकरण

डेटा स्रोत: DataComp डेटासेट का 10M छवि सबसेट
पूर्व-प्रसंस्करण: एकीकृत केंद्र क्रॉप और 224×224 आकार समायोजन
पर्यवेक्षण अंतर: CLIP छवि-पाठ जोड़े का उपयोग करता है, DINO केवल छवियों का उपयोग करता है

प्रशिक्षण कॉन्फ़िगरेशन एकीकरण

ऑप्टिमाइज़र: AdamW
सीखने की दर: 1e-3, कोसाइन क्षय
प्रशिक्षण युग: 20 epochs
हार्डवेयर: 4 A100 GPU, 3 दिन की प्रशिक्षण

एम्बेडिंग विश्लेषण विधि

विभेदक छवि जोड़ी पहचान

दो वर्गों की छवि जोड़ियों को परिभाषित करना मॉडल मतभेद विश्लेषण के लिए:

g1 = (clip_sim > 0.8) ∧ (dino_sim < 0.5)  # CLIP उच्च समानता, DINO निम्न समानता
g2 = (dino_sim > 0.8) ∧ (clip_sim < 0.5)  # DINO उच्च समानता, CLIP निम्न समानता

मात्रात्मक सत्यापन प्रयोग

शब्दार्थ संवेदनशीलता परीक्षण: विभिन्न अक्षर/संख्या वाली छवियों का उपयोग करके शब्दार्थ विभेद क्षमता का परीक्षण
दृश्य पैटर्न संवेदनशीलता परीक्षण: सरल दोहराए गए दृश्य पैटर्न का उपयोग करके निम्न-स्तरीय विशेषता संवेदनशीलता का परीक्षण

VLM एकीकरण योजना

ढांचा चयन

आधार आर्किटेक्चर: LLaVA-1.5
प्रतिस्थापन घटक: केवल दृश्य एन्कोडर भाग
प्रशिक्षण प्रवाह: पूर्व-प्रशिक्षण + दृश्य निर्देश सूक्ष्म-ट्यूनिंग

मूल्यांकन बेंचमार्क

VMCBench: 20 डेटासेट युक्त एकीकृत बहु-विकल्प दृश्य प्रश्न उत्तर बेंचमार्क
कार्य प्रकार: सामान्य VQA, तर्क, दस्तावेज़ चार्ट समझ, OCR आदि

प्रयोगात्मक सेटअप

डेटासेट

प्रशिक्षण डेटा: DataComp 10M सबसेट
- स्केल: 10 मिलियन छवि-पाठ जोड़े
- पूर्व-प्रसंस्करण: केंद्र क्रॉप, 224×224 रिज़ॉल्यूशन
मूल्यांकन डेटासेट:
- वर्गीकरण कार्य: ImageNet, CIFAR-10, Stanford Cars, Flowers, CUB, ImageNetV2, CIFAR-10.1
- VQA कार्य: VMCBench के 20 सबसेट, OCRVQA, TextVQA आदि सहित

मूल्यांकन मेट्रिक्स

रैखिक जांच सटीकता: दृश्य एन्कोडर गुणवत्ता का मूल्यांकन करने की मानक विधि
VQA सटीकता: बहु-विकल्प प्रश्न उत्तर की सही दर
कोसाइन समानता: एम्बेडिंग स्पेस विश्लेषण मेट्रिक

तुलनात्मक विधियां

आधिकारिक मॉडल: आधिकारिक रूप से जारी CLIP और DINO पूर्व-प्रशिक्षित मॉडल
नियंत्रण मॉडल: समान परिस्थितियों में प्रशिक्षित CLIP और DINO
पर्यवेक्षण वेरिएंट: SigLIP हानि संस्करण, पूर्व-प्रशिक्षित भाषा मॉडल संस्करण

कार्यान्वयन विवरण

चेकपॉइंट चयन: सत्यापन सेट कार्यक्षमता के आधार पर सर्वोत्तम चेकपॉइंट चुनना
मूल्यांकन आवृत्ति: हर 500 कदम पर सहेजना और मूल्यांकन करना
सांख्यिकीय महत्व: कई यादृच्छिक बीजों के तहत परिणाम स्थिरता सत्यापित करना

प्रयोगात्मक परिणाम

मुख्य परिणाम

वर्गीकरण कार्य कार्यक्षमता

मॉडल	ImageNet	CIFAR-10	Stanford Cars	Flowers	CUB
नियंत्रण CLIP	65.8%	90.7%	74.7%	78.7%	52.3%
नियंत्रण DINO	66.4%	92.1%	54.1%	80.7%	43.0%

मुख्य निष्कर्ष:

सामान्य वर्गीकरण कार्यों पर कार्यक्षमता तुलनीय है
CLIP सूक्ष्म-अनाज वर्गीकरण कार्यों पर DINO से काफी बेहतर है (Stanford Cars: +20.6%, CUB: +9.3%)

VLM कार्य कार्यक्षमता

कार्य प्रकार	LLaVA-CLIP	LLaVA-DINO	अंतर
सामान्य VQA	46.2%	46.0%	+0.2%
तर्क	41.2%	41.5%	-0.3%
दस्तावेज़ चार्ट	33.2%	33.1%	+0.1%
OCR कार्य	47.5%	40.0%	+7.5%

मुख्य निष्कर्ष:

अधिकांश कार्यों पर कार्यक्षमता तुलनीय है
CLIP OCR संबंधित कार्यों पर DINO से काफी बेहतर है

एम्बेडिंग विश्लेषण परिणाम

मात्रात्मक सत्यापन

शब्दार्थ सामग्री संवेदनशीलता:
- DINO औसत समानता: 0.877
- CLIP औसत समानता: 0.713 (कम, शब्दार्थ विभेद बेहतर दर्शाता है)
दृश्य पैटर्न संवेदनशीलता:
- DINO औसत समानता: 0.478 (कम, दृश्य विवरण विभेद बेहतर दर्शाता है)
- CLIP औसत समानता: 0.497

गुणात्मक विश्लेषण

CLIP लाभ: वस्तु वर्ग और एम्बेडेड पाठ जैसी उच्च-स्तरीय शब्दार्थ को बेहतर तरीके से कैप्चर करता है
DINO लाभ: रंग, शैली आदि निम्न-स्तरीय दृश्य विशेषताओं के प्रति अधिक संवेदनशील है

पर्यवेक्षण वेरिएंट प्रयोग

वेरिएंट	VMCBench औसत सटीकता
मानक CLIP	41.4%
SigLIP हानि	40.8%
पूर्व-प्रशिक्षित भाषा मॉडल	40.5%

निष्कर्ष: भाषा पर्यवेक्षण के विभिन्न रूप सीमित सुधार देते हैं।

भाषा मॉडल बैकबोन प्रयोग

Vicuna-7B की जगह Qwen2-7B का उपयोग करने के परिणाम:

मॉडल संयोजन	सामान्य VQA	OCR	औसत
CLIP + Qwen2	57.90%	51.40%	49.69%
DINO + Qwen2	54.02%	47.59%	47.72%

निष्कर्ष और चर्चा

मुख्य निष्कर्ष

डेटा स्केल बनाम पर्यवेक्षण प्रकार: डेटा स्केल को नियंत्रित करने की स्थिति में, भाषा पर्यवेक्षण वास्तव में विशिष्ट लाभ लाता है
प्रतिनिधित्व अंतर: CLIP उच्च-स्तरीय शब्दार्थ प्रतिनिधित्व सीखता है, DINO निम्न-स्तरीय दृश्य विशेषताओं पर ध्यान केंद्रित करता है
कार्य विशिष्टता: CLIP पाठ-घने कार्यों पर स्पष्ट लाभ दिखाता है, दृश्य-केंद्रित कार्यों पर दोनों तुलनीय हैं
पर्यवेक्षण रूप: भाषा पर्यवेक्षण के विभिन्न वेरिएंट सीमित सुधार देते हैं

सीमाएं

डेटा स्केल सीमा: प्रयोग केवल 10M छवि सबसेट पर किए गए, अरब-स्तरीय डेटा पर सत्यापन की आवश्यकता है
आर्किटेक्चर एकल: केवल ViT-B/16 का परीक्षण किया गया, अन्य आर्किटेक्चर के निष्कर्ष भिन्न हो सकते हैं
कार्य कवरेज: मुख्य रूप से VQA कार्यों पर ध्यान केंद्रित, अन्य दृश्य-भाषा कार्यों के निष्कर्ष सत्यापन की प्रतीक्षा में हैं

भविष्य की दिशाएं

बड़े पैमाने पर सत्यापन: अरब-स्तरीय डेटा पर नियंत्रित प्रयोग दोहराना
मिश्रित विधियां: स्व-पर्यवेक्षित और भाषा पर्यवेक्षण को जोड़ने वाली मिश्रित प्रशिक्षण रणनीति का अन्वेषण
आर्किटेक्चर अन्वेषण: विभिन्न दृश्य आर्किटेक्चर पर निष्कर्षों की सार्वभौमिकता सत्यापित करना

गहन मूल्यांकन

शक्तियां

कठोर प्रयोगात्मक डिजाइन: पहली बार वास्तविक नियंत्रित प्रयोग, मिश्रित कारकों को समाप्त करना
गहन व्यापक विश्लेषण: एम्बेडिंग स्पेस से डाउनस्ट्रीम कार्यों तक बहु-स्तरीय विश्लेषण
उच्च वैज्ञानिक मूल्य: क्षेत्र को अनुभवजन्य-आधारित डिजाइन मार्गदर्शन प्रदान करता है
मजबूत पुनरुत्पादनीयता: विस्तृत प्रयोगात्मक सेटअप और खुला स्रोत कोड
स्पष्ट लेखन: तार्किक संरचना स्पष्ट, निष्कर्ष सटीक रूप से व्यक्त किए गए

कमियां

स्केल सीमा: 10M डेटासेट अपेक्षाकृत छोटा है, बड़े पैमाने पर प्रशिक्षण की स्थिति को पूरी तरह प्रतिबिंबित नहीं कर सकता है
कार्य सीमा: मुख्य रूप से VQA कार्यों पर ध्यान केंद्रित, अन्य दृश्य-भाषा कार्यों के लिए सामान्यीकरण पूरी तरह सत्यापित नहीं है
सैद्धांतिक विश्लेषण अपर्याप्त: भाषा पर्यवेक्षण इन अंतरों का कारण क्यों बनता है इसके लिए सैद्धांतिक व्याख्या की कमी है

प्रभाव

शैक्षणिक योगदान: दृश्य एन्कोडर डिजाइन के लिए वैज्ञानिक आधार प्रदान करता है, क्षेत्र में रिक्ति भरता है
व्यावहारिक मूल्य: वास्तविक VLM सिस्टम के दृश्य एन्कोडर चयन को निर्देशित करता है
पद्धति योगदान: नियंत्रित प्रयोग डिजाइन विचार अन्य तुलनात्मक अनुसंधान पर लागू किए जा सकते हैं

लागू परिदृश्य

VLM विकास: उपयुक्त दृश्य एन्कोडर चुनने के लिए आधार प्रदान करता है
अनुसंधान मार्गदर्शन: दृश्य प्रतिनिधित्व सीखने के अनुसंधान के लिए दिशा प्रदान करता है
संसाधन अनुकूलन: सीमित संसाधनों में बेहतर डिजाइन विकल्प बनाने में मदद करता है

संदर्भ

यह पेपर दृश्य-भाषा मॉडल, दृश्य प्रतिनिधित्व सीखने आदि क्षेत्रों के महत्वपूर्ण कार्यों का हवाला देता है, जिसमें शामिल हैं:

CLIP (Radford et al., 2021)
DINO (Caron et al., 2021)
LLaVA (Liu et al., 2023)
SigLIP (Zhai et al., 2023)
DataComp (Gadre et al., 2023)

समग्र मूल्यांकन: यह एक उच्च-गुणवत्ता वाला अनुभवजन्य अनुसंधान पेपर है जो कठोर नियंत्रित प्रयोगात्मक डिजाइन के माध्यम से क्षेत्र के महत्वपूर्ण वैज्ञानिक प्रश्न का उत्तर देता है। अनुसंधान विधि वैज्ञानिक रूप से कठोर है, निष्कर्ष महत्वपूर्ण सैद्धांतिक और व्यावहारिक मूल्य रखते हैं, दृश्य-भाषा मॉडल के विकास के लिए मूल्यवान मार्गदर्शन प्रदान करते हैं।