2025-11-21T07:40:15.798625

Artificial Impressions: Evaluating Large Language Model Behavior Through the Lens of Trait Impressions

Deas, McKeown

We introduce and study artificial impressions--patterns in LLMs' internal representations of prompts that resemble human impressions and stereotypes based on language. We fit linear probes on generated prompts to predict impressions according to the two-dimensional Stereotype Content Model (SCM). Using these probes, we study the relationship between impressions and downstream model behavior as well as prompt features that may inform such impressions. We find that LLMs inconsistently report impressions when prompted, but also that impressions are more consistently linearly decodable from their hidden representations. Additionally, we show that artificial impressions of prompts are predictive of the quality and use of hedging in model responses. We also investigate how particular content, stylistic, and dialectal features in prompts impact LLM impressions.

academic

कृत्रिम प्रभाव: विशेषता प्रभावों के माध्यम से बड़े भाषा मॉडल व्यवहार का मूल्यांकन

मूल जानकारी

पेपर ID: 2510.08915
शीर्षक: कृत्रिम प्रभाव: विशेषता प्रभावों के माध्यम से बड़े भाषा मॉडल व्यवहार का मूल्यांकन
लेखक: निकोलस डीस, कैथलीन मैककिओन (कोलंबिया विश्वविद्यालय)
वर्गीकरण: cs.CL (कम्प्यूटेशनल भाषाविज्ञान)
प्रकाशन समय: 10 अक्टूबर 2025 (arXiv प्रीप्रिंट)
पेपर लिंक: https://arxiv.org/abs/2510.08915

सारांश

यह पेपर "कृत्रिम प्रभाव" (artificial impressions) की अवधारणा को प्रस्तुत और अध्ययन करता है — बड़े भाषा मॉडल (LLMs) के आंतरिक प्रतिनिधित्व में पैटर्न जो मानव द्वारा भाषा के आधार पर बनाए गए प्रभावों और रूढ़ियों के समान हैं। शोधकर्ताओं ने द्विआयामी रूढ़िवादी सामग्री मॉडल (Stereotype Content Model, SCM) के अनुसार प्रभावों की भविष्यवाणी करने के लिए उत्पन्न संकेतों पर प्रशिक्षित रैखिक जांच का उपयोग किया। इन जांचों के माध्यम से, प्रभावों और डाउनस्ट्रीम मॉडल व्यवहार के बीच संबंध, साथ ही इन प्रभावों को प्रभावित करने वाली संकेत विशेषताओं का अध्ययन किया गया। शोध से पता चलता है कि LLMs जब संकेत दिए जाते हैं तो असंगत प्रभाव रिपोर्ट करते हैं, लेकिन प्रभावों को इसके छिपे हुए प्रतिनिधित्व से अधिक सुसंगत रूप से रैखिक रूप से डिकोड किया जा सकता है। इसके अलावा, संकेतों के कृत्रिम प्रभाव मॉडल प्रतिक्रिया की गुणवत्ता और सावधानी भाषा के उपयोग की भविष्यवाणी कर सकते हैं।

अनुसंधान पृष्ठभूमि और प्रेरणा

समस्या परिभाषा

मनुष्य बातचीत में दूसरों के बारे में तेजी से प्रारंभिक प्रभाव बनाते हैं, जो दृष्टिकोण और व्यवहार पर स्थायी प्रभाव डालते हैं। इसी तरह, बड़े भाषा मॉडल प्रशिक्षण के दौरान विभिन्न लेखकों के विशाल पाठ के संपर्क में आते हैं, और भाषाई विशेषताओं के आधार पर समान "प्रभाव" बना सकते हैं।

अनुसंधान का महत्व

पूर्वाग्रह और निष्पक्षता: LLMs कैसे भाषाई विशेषताओं के आधार पर प्रभाव बनाते हैं, यह समझना पूर्वाग्रह की पहचान और कम करने के लिए महत्वपूर्ण है
मॉडल व्यवहार पूर्वानुमान: कृत्रिम प्रभाव प्रतिक्रिया गुणवत्ता और भाषा उपयोग जैसे डाउनस्ट्रीम प्रदर्शन को प्रभावित कर सकते हैं
सामाजिक भाषाविज्ञान प्रभाव: विभिन्न बोलियां और भाषाई रूप विभिन्न प्रभाव ट्रिगर कर सकते हैं, जो हाशिए पर रहने वाले समूहों के उपयोग अनुभव को प्रभावित करते हैं

मौजूदा विधियों की सीमाएं

LLMs से सीधे संकेत देकर प्रभाव रिपोर्ट करने में असंगतता और सकारात्मक पूर्वाग्रह
LLMs के आंतरिक प्रभावों को परिमाणित और विश्लेषण करने के लिए व्यवस्थित विधि की कमी
प्रभाव कैसे डाउनस्ट्रीम व्यवहार को प्रभावित करते हैं इसकी सीमित समझ

मुख्य योगदान

"कृत्रिम प्रभाव" अवधारणा प्रस्तुत करना: LLMs द्वारा संकेतों के आधार पर बनाए गए आंतरिक प्रभावों का पहला व्यवस्थित अध्ययन
रैखिक जांच विधि विकसित करना: SCM ढांचे का उपयोग करके छिपे हुए अवस्थाओं से प्रभावों को डिकोड करने के लिए जांच प्रशिक्षित करना
प्रभाव-व्यवहार संबंध स्थापित करना: यह साबित करना कि कृत्रिम प्रभाव प्रतिक्रिया गुणवत्ता और सावधानी भाषा उपयोग की भविष्यवाणी कर सकते हैं
प्रभावशाली कारकों की पहचान करना: LLM प्रभाव गठन को प्रभावित करने वाली सामग्री, शैली और बोली विशेषताओं का विश्लेषण
बोली पूर्वाग्रह का खुलासा करना: LLMs अफ्रीकी-अमेरिकी भाषा (AAL) के प्रति अधिक नकारात्मक प्रभाव रखते हैं

विधि विवरण

कार्य परिभाषा

उपयोगकर्ता संकेत दिए गए, लक्ष्य है:

LLM छिपे हुए प्रतिनिधित्व से SCM-आधारित प्रभाव स्कोर निकालना
प्रभावों और मॉडल व्यवहार के बीच संबंध का विश्लेषण करना
प्रभाव गठन को प्रभावित करने वाली संकेत विशेषताओं की पहचान करना

रूढ़िवादी सामग्री मॉडल (SCM)

SCM में दो आयाम शामिल हैं:

गर्मजोशी (Warmth): लक्ष्य के इरादों की कथित (जैसे मित्रता, आक्रामकता)
क्षमता (Competence): लक्ष्य के इरादों को सफलतापूर्वक निष्पादित करने की क्षमता (जैसे बुद्धिमत्ता, शक्ति)

डेटा उत्पादन प्रवाह

1. संश्लेषित डेटा उत्पादन

चरण 1: विशेषता शब्दावली → प्रभाव विनिर्देश (जैसे "मित्रवत और विस्तृत")
चरण 2: प्रभाव विनिर्देश के आधार पर संश्लेषित उपयोगकर्ता संकेत उत्पन्न करना
चरण 3: LLM छिपे हुए प्रतिनिधित्व निकालना
चरण 4: जांच प्रशिक्षण डेटा निर्माण (प्रतिनिधित्व-लेबल जोड़े)

2. जांच प्रशिक्षण

बहु-परत परसेप्ट्रॉन (MLP) सक्रियण को इनपुट विशेषताओं के रूप में उपयोग करना
स्वतंत्र गर्मजोशी और क्षमता जांच प्रशिक्षित करना
5-गुना क्रॉस-सत्यापन मूल्यांकन का उपयोग करना
विभिन्न प्रशिक्षण डेटा अनुपात (100%, 10%, 1%) का उपयोग करना

तकनीकी नवाचार बिंदु

मनोविज्ञान सिद्धांत द्वारा निर्देशित: LLM विश्लेषण के लिए मनोविज्ञान के SCM ढांचे को लागू करना
जांच बनाम संकेत तुलना: जांच विधि और सीधे संकेत की विश्वसनीयता की व्यवस्थित तुलना
बहु-परत विश्लेषण: विभिन्न मॉडल परतों में प्रभाव जानकारी के वितरण का विश्लेषण
व्यवहार पूर्वानुमान सत्यापन: डाउनस्ट्रीम कार्यों के माध्यम से प्रभाव की प्रभावकारिता को सत्यापित करना

प्रयोग सेटअप

मॉडल

Llama-3.1 (8B): 32 परत, 4096 छिपी हुई आयाम
Llama-3.2 (1B): 16 परत, 2048 छिपी हुई आयाम
OLMo-2 (7B): 32 परत, 4096 छिपी हुई आयाम

डेटासेट

संश्लेषित डेटा

131 गर्मजोशी विशेषताओं और 104 क्षमता विशेषताओं के आधार पर
प्रत्येक प्रभाव विनिर्देश के लिए 10 नमूने उत्पन्न करना (तापमान=0.9)
कुल 274,830 संकेत/मॉडल

वास्तविक डेटा

LMSysChat: 1 मिलियन वास्तविक बातचीत से 2000 पहले दौर के संकेत नमूना
TwitterAAE: 400 ट्वीट (200 AAL, 200 WME)
Counterparts डेटासेट: अन्य चर को नियंत्रित करने वाली समानांतर कॉर्पस

मूल्यांकन मेट्रिक्स

जांच प्रदर्शन: F1 स्कोर, सटीकता
आत्म-संगति: रिपोर्ट किए गए प्रभाव और प्रदान की गई विशेषताओं का मिलान
मानव मूल्यांकन: 4-बिंदु Likert पैमाना, Krippendorff's α = 0.71

प्रयोग परिणाम

मुख्य निष्कर्ष

निष्कर्ष 1: संकेत विधि की सीमाएं

LLM द्वारा रिपोर्ट किए गए प्रभाव आमतौर पर सकारात्मक विशेषताओं की ओर पक्षपाती होते हैं (गर्मजोशी/क्षमता), विशेष रूप से प्रथम-व्यक्ति परिस्थितियों में:

Llama-3.1 (8B) प्रथम-व्यक्ति गर्मजोशी आत्म-संगति केवल 51.67%
तीसरे व्यक्ति की परिस्थितियां कुछ सुधार दिखाती हैं लेकिन अभी भी सीमित हैं (अधिकतम 80.77%)

निष्कर्ष 2: मानव-मॉडल प्रभाव संगति

मानव एनोटेशन और मूल विशेषताओं की संगति:

कुल Cohen's κ = 0.68, Spearman r = 0.68
विशेषता शब्दावली और SCM लेबल की प्रभावकारिता को सत्यापित करता है

निष्कर्ष 3: जांच विधि की प्रभावकारिता

रैखिक जांच छिपे हुए प्रतिनिधित्व से प्रभावों को सफलतापूर्वक डिकोड करते हैं:

गर्मजोशी जांच F1 स्कोर: 75-90%
क्षमता जांच F1 स्कोर: 75-85%
प्रदर्शन मॉडल के मध्य परतों में शीर्ष पर पहुंचता है

निष्कर्ष 4: गर्मजोशी लाभ प्रभाव

मॉडल गर्मजोशी आयाम में बेहतर प्रदर्शन करते हैं:

गर्मजोशी जांच प्रदर्शन क्षमता जांच से लगातार अधिक है
मानव प्रभाव गठन के "गर्मजोशी-पहले प्रभाव" की नकल करना

प्रभाव-व्यवहार संबंध प्रयोग

प्रतिक्रिया गुणवत्ता पूर्वानुमान

प्रतिक्रिया गुणवत्ता पर प्रभाव के प्रभाव का विश्लेषण करने के लिए क्रमबद्ध लॉजिस्टिक प्रतिगमन का उपयोग:

मॉडल	गर्मजोशी गुणांक	क्षमता गुणांक
Llama-3.2-1B	1.07**	0.90**
Llama-3.1-8B	0.49*	0.39*
OLMo-2-7B	0.76**	0.35*

निष्कर्ष 5: गर्मजोशी और क्षमता प्रभाव प्रतिक्रिया गुणवत्ता की महत्वपूर्ण भविष्यवाणी करते हैं

सावधानी भाषा विश्लेषण

प्रभाव पर सावधानी भाषा उपयोग के प्रभाव का विश्लेषण करने के लिए नकारात्मक द्विपद प्रतिगमन का उपयोग:

मॉडल	गर्मजोशी गुणांक	क्षमता गुणांक
Llama-3.2-1B	-0.46*	-1.06**
Llama-3.1-8B	-0.14	-1.18**
OLMo-2-7B	0.40**	-0.69**

निष्कर्ष 6: कम क्षमता प्रभाव अधिक सावधानी भाषा उपयोग की महत्वपूर्ण भविष्यवाणी करते हैं

प्रभावशाली कारक विश्लेषण

सामग्री और शैली विशेषताएं

LIWC और IDP विश्लेषण का उपयोग करके निष्कर्ष:

उच्च गर्मजोशी विशेषताएं:

परीक्षणात्मक शब्दावली ("wondering", "might", "seem")
अंतर शब्दावली ("would", "could", "hope")
शिष्टाचार और मानसिक दूरी को मूर्त रूप देना

कम गर्मजोशी विशेषताएं:

प्रश्न शब्द ("what", "how")
कारण शब्दावली ("because", "effect")

उच्च क्षमता विशेषताएं:

अंतर्दृष्टि शब्दावली ("rethink", "know", "informed")
औपचारिक भाषा संरचना

कम क्षमता विशेषताएं:

अनौपचारिक चिह्न ("yeah", "sure", इमोजी)
नेट भाषा ("aight", "gonna")

बोली पूर्वाग्रह विश्लेषण

निष्कर्ष 8: मॉडल AAL पाठ के प्रति अधिक नकारात्मक प्रभाव रखते हैं

AAL बनाम WME गर्मजोशी सहसंबंध: r = -0.32 (p ≤ 0.001)
AAL बनाम WME क्षमता सहसंबंध: r = -0.52 (p ≤ 0.001)
समानांतर कॉर्पस ने समान प्रवृत्ति को सत्यापित किया

निष्कर्ष और चर्चा

मुख्य निष्कर्ष

विधि प्रभावकारिता: रैखिक जांच सीधे संकेत की तुलना में LLM प्रभावों को अधिक विश्वसनीय रूप से निकालते हैं
व्यवहार पूर्वानुमान शक्ति: कृत्रिम प्रभाव प्रतिक्रिया गुणवत्ता और भाषा उपयोग पैटर्न की भविष्यवाणी कर सकते हैं
पूर्वाग्रह पहचान: विशिष्ट बोलियों और समूहों के प्रति व्यवस्थित रूप से पूर्वाग्रह की खोज की गई
गर्मजोशी लाभ: LLMs मानव-जैसे गर्मजोशी-पहले प्रभाव दिखाते हैं

सीमाएं

दायरा प्रतिबंध: केवल अंग्रेजी बातचीत के पहले दौर के संदेशों पर ध्यान केंद्रित
मॉडल आकार: 8B पैरामीटर से नीचे के ओपन-सोर्स मॉडल तक सीमित
सैद्धांतिक ढांचा: केवल SCM का उपयोग, अन्य रूढ़िवादी मॉडल की खोज नहीं की गई
सांस्कृतिक अंतर: प्रभाव गठन में सांस्कृतिक अंतर पर विचार नहीं किया गया

नैतिक विचार

मानवीकरण जोखिम: LLMs के अत्यधिक मानवीकरण से बचने के लिए सावधानी की आवश्यकता
पूर्वाग्रह प्रवर्धन: पहचाने गए पूर्वाग्रह हाशिए पर रहने वाले समूहों को नुकसान पहुंचा सकते हैं
अनुप्रयोग सीमाएं: स्पष्ट करने की आवश्यकता है कि किन परिस्थितियों में भेदभावपूर्ण व्यवहार उचित है

भविष्य की दिशाएं

बहु-दौर बातचीत: बातचीत के दौरान प्रभावों के विकास का अध्ययन करना
क्रॉस-सांस्कृतिक अनुसंधान: विभिन्न सांस्कृतिक पृष्ठभूमि में प्रभाव गठन की खोज
शमन रणनीतियां: हानिकारक पूर्वाग्रहों को कम करने के लिए तकनीकी विधियां विकसित करना
सैद्धांतिक विस्तार: अधिक जटिल प्रभाव गठन मॉडल लागू करना

गहन मूल्यांकन

शक्तियां

मजबूत नवाचार: LLM विश्लेषण के लिए मनोविज्ञान प्रभाव सिद्धांत को लागू करने वाला पहला व्यवस्थित कार्य
कठोर विधि: संश्लेषित डेटा उत्पादन, जांच तकनीक और मानव मूल्यांकन का संयोजन
उच्च व्यावहारिक मूल्य: LLM पूर्वाग्रह को समझने और कम करने के लिए नए उपकरण प्रदान करता है
व्यापक प्रयोग: बहु-मॉडल, बहु-कार्य व्यापक सत्यापन
सामाजिक महत्व: महत्वपूर्ण निष्पक्षता समस्याओं का खुलासा करता है

कमियां

सैद्धांतिक सीमा: SCM सभी प्रासंगिक प्रभाव आयामों को पकड़ने में विफल हो सकता है
डेटा पूर्वाग्रह: संश्लेषित डेटा वास्तविक उपयोग परिदृश्यों को पूरी तरह से प्रतिबिंबित नहीं कर सकता है
कारण संबंध: प्रभाव और व्यवहार के बीच संबंध में भ्रामक चर हो सकते हैं
सामान्यीकरण: बड़े मॉडल और विभिन्न प्रशिक्षण प्रतिमानों में परिणामों की सामान्यीकरण क्षमता अज्ञात है

प्रभाव

शैक्षणिक योगदान: LLM पूर्वाग्रह अनुसंधान के लिए नया सैद्धांतिक ढांचा और विधि प्रदान करता है
व्यावहारिक मूल्य: मॉडल मूल्यांकन और पूर्वाग्रह पहचान के लिए उपयोग किया जा सकता है
नीति महत्व: AI निष्पक्षता नीति निर्माण के लिए वैज्ञानिक साक्ष्य प्रदान करता है
अंतर-विषय प्रभाव: मनोविज्ञान, सामाजिक भाषाविज्ञान और AI सुरक्षा क्षेत्रों को जोड़ता है

लागू परिदृश्य

मॉडल मूल्यांकन: मॉडल विकास प्रक्रिया में संभावित पूर्वाग्रहों का पता लगाना
अनुप्रयोग लेखा परीक्षा: तैनात मॉडल के निष्पक्षता प्रदर्शन का मूल्यांकन
अनुसंधान उपकरण: संबंधित क्षेत्र अनुसंधान के लिए विश्लेषण ढांचा प्रदान करता है
शैक्षणिक उद्देश्य: AI प्रणालियों के सामाजिक प्रभाव को समझने में सहायता करता है

संदर्भ

यह पेपर मनोविज्ञान, सामाजिक भाषाविज्ञान और कम्प्यूटेशनल भाषाविज्ञान सहित कई क्षेत्रों के महत्वपूर्ण कार्यों का संदर्भ देता है, विशेष रूप से:

Fiske et al. (2002) का रूढ़िवादी सामग्री मॉडल
Blodgett et al. (2016) का बोली अनुसंधान डेटासेट
LLM पूर्वाग्रह और निष्पक्षता पर हाल के अनुसंधान

समग्र मूल्यांकन: यह एक उच्च-गुणवत्ता वाला अनुसंधान पेपर है जो विधि नवाचार, प्रयोग डिजाइन और सामाजिक महत्व के संदर्भ में महत्वपूर्ण योगदान देता है। "कृत्रिम प्रभाव" अवधारणा को प्रस्तुत करके, यह LLM व्यवहार को समझने के लिए एक नया दृष्टिकोण प्रदान करता है, और AI निष्पक्षता अनुसंधान को आगे बढ़ाने में महत्वपूर्ण मूल्य रखता है।