論文の概要: Not What, But How: A Communicative Audit of LLM Response Framing
- arxiv url: http://arxiv.org/abs/2606.02493v1
- Date: Mon, 01 Jun 2026 17:01:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:32.522909
- Title: Not What, But How: A Communicative Audit of LLM Response Framing
- Title(参考訳): LLMのレスポンス・フレイムに関するコミュニケート・オーディション
- Abstract要約: 大規模言語モデル(LLM)は、主観的、情報探索的な疑問に答えるためにますます使われている。
既存の主観的文化的クエリの評価は、応答のフレーム化を無視して、事実の正しさに重点を置いている。
FRANZ(FRAmework for respoNse characteriZation)を導入し、4次元のLLM応答のコミュニケーション監査を行う。
- 参考スコア(独自算出の注目度): 54.31707479192195
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are being increasingly used to answer subjective, information-seeking questions, where users are sensitive to how responses are communicated, not just whether the answers are correct. Existing LLM evaluations for subjective cultural queries largely focus on factual correctness, ignoring how the response is framed. To this end, we introduce FRANZ, an automated FRAmework for respoNse characteriZation to conduct communicative audit of LLM responses along four dimensions: cultural positioning, use of generalizing language, anthropomorphic cues, and adherence to conversational maxims. To enable this evaluation, we contribute SQUARE - a corpus of 376k subjective questions sourced from 57 subreddits, and mapped to 7 countries and 19 question categories. We demonstrate FRANZ's applicability by scoring responses from three open-weight LLMs. We observe that LLMs show statistically significant differences in the frequency with which they employ each response characteristic. Unlike single-dimensional audits, FRANZ reveals that insider positioning and anthropomorphism are positively coupled, with the degree of coupling varying by country, providing a diagnostic lens for identifying framing divergences.
- Abstract(参考訳): 大規模言語モデル(LLM)は、回答が正しいかどうかだけでなく、ユーザがどのように反応が通信されるかに敏感である主観的、情報探索的な質問に回答するために、ますます使われてきている。
主観的文化的クエリに対する既存のLCM評価は、応答のフレーム化を無視して、事実的正確性に重点を置いている。
この目的のために、FRANZは、文化的な位置決め、一般化言語の使用、人為的な手がかり、会話の最大化への固執の4つの側面に沿って、LLM応答のコミュニケーション監査を行うための、レポーズ・キャラクタリゼーションのための自動FRAmeworkである。
この評価を実現するため、57のサブレディットから得られた376万の主観的質問のコーパスであるSQUAREを7つの国と19の質問カテゴリにマッピングした。
オープンウェイトLLMの3つの応答をスコアリングすることで,FRANZの適用性を示す。
我々は,LLMが各応答特性の周波数に統計的に有意な差を示すことを観察した。
単次元の監査とは異なり、FRANZは内在位置と人為準同型が、国によって異なる結合度と正に結合していることを明らかにし、フレーミングの発散を識別するための診断レンズを提供する。
関連論文リスト
- Confirming Our Biases? Evaluating the Capabilities, Risks, and Societal Impact of Large Language Models [5.5881263948644175]
本研究は,大規模言語モデルが,プロンプトで表されるユーザのバイアスをいかに強化するかを考察する。
我々は、モデルが特定のポジションをサポートすることや、挑戦することを奨励する直接的かつ示唆的なプロンプトに対して、LLMがいかに影響を受けやすいかを評価する。
論文 参考訳(メタデータ) (2026-08-07T08:54:27Z) - An Analysis of Large Language Models for Simulating User Responses in Surveys [8.614942349812429]
ユーザ意見をシミュレートするためにLarge Language Modelsを使用することが注目されている。
LLMは、支配的な視点に対する偏見を示すことで知られており、多様な人口統計学的、文化的背景からユーザーを表現する能力に対する懸念を提起している。
論文 参考訳(メタデータ) (2025-12-07T15:03:09Z) - Amulet: Putting Complex Multi-Turn Conversations on the Stand with LLM Juries [30.095571420819912]
アミュレット(Amulet)は、LLM-judgesの精度を向上させるために、ダイアログアクトと最大値という関連する言語概念を活用するフレームワークである。
Amulet は、単一の LLM にフレームワークを適用することで審査員として、あるいは異なる LLM の審査員と陪審員に統合することで、使用することができる。
論文 参考訳(メタデータ) (2025-05-26T18:46:38Z) - Quantifying depressive mental states with large language models [0.0]
大規模言語モデル(LLM)はメンタルヘルスにおいて重要な役割を担っている。
3つの臨界試験におけるLLM性能の概要と評価を行った。
論文 参考訳(メタデータ) (2025-02-13T16:52:06Z) - Fostering Appropriate Reliance on Large Language Models: The Role of Explanations, Sources, and Inconsistencies [66.30619782227173]
大規模言語モデル(LLMs)は、流動的で説得力のある誤った応答を生成することができる。
ユーザの信頼を形作るLCM応答のいくつかの特徴を同定する。
説明は正しい応答と誤応答の両方に依存することが判明した。
情報源が提供された場合や説明が矛盾している場合の誤った応答への依存度は低い。
論文 参考訳(メタデータ) (2025-02-12T16:35:41Z) - Do LLMs Understand Ambiguity in Text? A Case Study in Open-world Question Answering [15.342415325821063]
自然言語の曖昧さは、オープンドメインの質問応答に使用される大規模言語モデル(LLM)に重大な課題をもたらす。
我々は,明示的曖昧化戦略の効果を計測することに集中して,市販のLLM性能と数発のLLM性能を比較した。
本研究では, 難解な問合せタスクにおいて, LLM性能を向上させるために, 簡単な, トレーニング不要, トークンレベルの曖昧さを効果的に活用できることを実証する。
論文 参考訳(メタデータ) (2024-11-19T10:27:26Z) - Hate Personified: Investigating the role of LLMs in content moderation [64.26243779985393]
ヘイト検出などの主観的タスクでは,人々が嫌悪感を知覚する場合には,多様なグループを表現できるLarge Language Model(LLM)の能力は不明確である。
追加の文脈をプロンプトに含めることで、LLMの地理的プライミングに対する感受性、ペルソナ属性、数値情報を分析し、様々なグループのニーズがどの程度反映されているかを評価する。
論文 参考訳(メタデータ) (2024-10-03T16:43:17Z) - Évaluation des capacités de réponse de larges modèles de langage (LLM) pour des questions d'historiens [0.0]
ChatGPTやBardのような大規模言語モデル(LLM)は情報検索に革命をもたらした。
我々は,フランス語における歴史的事実に関する信頼性,包括的,かつ十分に関連する応答を生み出す上で,様々なLLMの能力を評価する。
論文 参考訳(メタデータ) (2024-06-21T14:19:57Z) - Exploring the Factual Consistency in Dialogue Comprehension of Large Language Models [51.75805497456226]
本研究は,対話要約タスクの助けを借りて,事実整合性の問題に焦点を当てる。
評価の結果,LLMが生成する要約の26.8%が事実整合性を含んでいることがわかった。
LLMの対話理解能力を高めるために,自動構築マルチタスクデータを用いた微調整パラダイムを提案する。
論文 参考訳(メタデータ) (2023-11-13T09:32:12Z) - Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves [57.974103113675795]
本稿では,Rephrase and Respond'(RaR)という手法を提案する。
RaRは、パフォーマンスを改善するためのシンプルだが効果的なプロンプト方法として機能する。
また,RaRは理論的にも経験的にも,一般的なChain-of-Thought(CoT)法と相補的であることを示す。
論文 参考訳(メタデータ) (2023-11-07T18:43:34Z) - Using Natural Language Explanations to Rescale Human Judgments [81.66697572357477]
大規模言語モデル(LLM)を用いて順序付けアノテーションと説明を再スケールする手法を提案する。
我々は、アノテータのLikert評価とそれに対応する説明をLLMに入力し、スコア付けルーリックに固定された数値スコアを生成する。
提案手法は,合意に影響を及ぼさずに生の判断を再スケールし,そのスコアを同一のスコア付けルーリックに接する人間の判断に近づける。
論文 参考訳(メタデータ) (2023-05-24T06:19:14Z) - Cue-CoT: Chain-of-thought Prompting for Responding to In-depth Dialogue
Questions with LLMs [59.74002011562726]
我々は、よりパーソナライズされ魅力的な応答を提供するために、新しい言語的キューに基づく思考の連鎖(textitCue-CoT)を提案する。
中国語と英語の6つのデータセットからなる詳細な対話質問を用いたベンチマークを構築した。
実験により,提案手法は,すべてのデータセットにおいて,テクステルパーフルネスとテクスチタアクセプタビリティの両方の観点から,標準的プロンプト法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-05-19T16:27:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。