Artificial Impressions: Evaluating Large Language Model Behavior Through the Lens of Trait Impressions
Deas, McKeown
We introduce and study artificial impressions--patterns in LLMs' internal representations of prompts that resemble human impressions and stereotypes based on language. We fit linear probes on generated prompts to predict impressions according to the two-dimensional Stereotype Content Model (SCM). Using these probes, we study the relationship between impressions and downstream model behavior as well as prompt features that may inform such impressions. We find that LLMs inconsistently report impressions when prompted, but also that impressions are more consistently linearly decodable from their hidden representations. Additionally, we show that artificial impressions of prompts are predictive of the quality and use of hedging in model responses. We also investigate how particular content, stylistic, and dialectal features in prompts impact LLM impressions.
academic
कृत्रिम प्रभाव: विशेषता प्रभावों के माध्यम से बड़े भाषा मॉडल व्यवहार का मूल्यांकन
यह पेपर "कृत्रिम प्रभाव" (artificial impressions) की अवधारणा को प्रस्तुत और अध्ययन करता है — बड़े भाषा मॉडल (LLMs) के आंतरिक प्रतिनिधित्व में पैटर्न जो मानव द्वारा भाषा के आधार पर बनाए गए प्रभावों और रूढ़ियों के समान हैं। शोधकर्ताओं ने द्विआयामी रूढ़िवादी सामग्री मॉडल (Stereotype Content Model, SCM) के अनुसार प्रभावों की भविष्यवाणी करने के लिए उत्पन्न संकेतों पर प्रशिक्षित रैखिक जांच का उपयोग किया। इन जांचों के माध्यम से, प्रभावों और डाउनस्ट्रीम मॉडल व्यवहार के बीच संबंध, साथ ही इन प्रभावों को प्रभावित करने वाली संकेत विशेषताओं का अध्ययन किया गया। शोध से पता चलता है कि LLMs जब संकेत दिए जाते हैं तो असंगत प्रभाव रिपोर्ट करते हैं, लेकिन प्रभावों को इसके छिपे हुए प्रतिनिधित्व से अधिक सुसंगत रूप से रैखिक रूप से डिकोड किया जा सकता है। इसके अलावा, संकेतों के कृत्रिम प्रभाव मॉडल प्रतिक्रिया की गुणवत्ता और सावधानी भाषा के उपयोग की भविष्यवाणी कर सकते हैं।
मनुष्य बातचीत में दूसरों के बारे में तेजी से प्रारंभिक प्रभाव बनाते हैं, जो दृष्टिकोण और व्यवहार पर स्थायी प्रभाव डालते हैं। इसी तरह, बड़े भाषा मॉडल प्रशिक्षण के दौरान विभिन्न लेखकों के विशाल पाठ के संपर्क में आते हैं, और भाषाई विशेषताओं के आधार पर समान "प्रभाव" बना सकते हैं।
पूर्वाग्रह और निष्पक्षता: LLMs कैसे भाषाई विशेषताओं के आधार पर प्रभाव बनाते हैं, यह समझना पूर्वाग्रह की पहचान और कम करने के लिए महत्वपूर्ण है
मॉडल व्यवहार पूर्वानुमान: कृत्रिम प्रभाव प्रतिक्रिया गुणवत्ता और भाषा उपयोग जैसे डाउनस्ट्रीम प्रदर्शन को प्रभावित कर सकते हैं
सामाजिक भाषाविज्ञान प्रभाव: विभिन्न बोलियां और भाषाई रूप विभिन्न प्रभाव ट्रिगर कर सकते हैं, जो हाशिए पर रहने वाले समूहों के उपयोग अनुभव को प्रभावित करते हैं
चरण 1: विशेषता शब्दावली → प्रभाव विनिर्देश (जैसे "मित्रवत और विस्तृत")
चरण 2: प्रभाव विनिर्देश के आधार पर संश्लेषित उपयोगकर्ता संकेत उत्पन्न करना
चरण 3: LLM छिपे हुए प्रतिनिधित्व निकालना
चरण 4: जांच प्रशिक्षण डेटा निर्माण (प्रतिनिधित्व-लेबल जोड़े)
यह पेपर मनोविज्ञान, सामाजिक भाषाविज्ञान और कम्प्यूटेशनल भाषाविज्ञान सहित कई क्षेत्रों के महत्वपूर्ण कार्यों का संदर्भ देता है, विशेष रूप से:
Fiske et al. (2002) का रूढ़िवादी सामग्री मॉडल
Blodgett et al. (2016) का बोली अनुसंधान डेटासेट
LLM पूर्वाग्रह और निष्पक्षता पर हाल के अनुसंधान
समग्र मूल्यांकन: यह एक उच्च-गुणवत्ता वाला अनुसंधान पेपर है जो विधि नवाचार, प्रयोग डिजाइन और सामाजिक महत्व के संदर्भ में महत्वपूर्ण योगदान देता है। "कृत्रिम प्रभाव" अवधारणा को प्रस्तुत करके, यह LLM व्यवहार को समझने के लिए एक नया दृष्टिकोण प्रदान करता है, और AI निष्पक्षता अनुसंधान को आगे बढ़ाने में महत्वपूर्ण मूल्य रखता है।