論文の概要: Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation
- arxiv url: http://arxiv.org/abs/2607.05554v1
- Date: Mon, 06 Jul 2026 18:47:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.303841
- Title: Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation
- Title(参考訳): Prompt Robustness is Task-Dependent: compareding Objective and Belief-Style Questions in LLM Evaluation
- Abstract要約: 我々は,主観的質問と主観的質問との間に,素早い頑健さが相違するかどうかを問う。
3つの目的データセットと3つの主観的データセットから4つの命令調整モデルファミリを評価する。
二項一般化推定方程式を用いて、モデル、データセット、プロンプトカテゴリ、およびそれらの相互作用の有意な影響を見出す。
- 参考スコア(独自算出の注目度): 1.7613484075466104
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Survey-style evaluations of large language models often treat a prompted response as a measure of a model's values or beliefs. This assumption is particularly fragile when responses are read as evidence of political values, social attitudes, or beliefs. We ask whether prompt robustness differs between objective questions with fixed answers and subjective questions that ask for opinions or values. We evaluate four instruction-tuned model families on three objective datasets (MMLU, ARC, and CulturalBench) and three subjective datasets (Political Compass Test, ValueBench, and World Values Survey). For each question/statement, we apply multiple types of prompt changes, such as variations in wording, framing, and format, and measure whether the model gives the same answer across variants. Using a binomial generalized estimating equation, we find significant effects of model, dataset, prompt category, and their interactions. The dataset type effect is also significant, and the interaction between dataset type and prompt category is large. These results show that prompt robustness depends on the question type, the prompt change, and the model.
- Abstract(参考訳): 大規模言語モデルのサーベイスタイルの評価は、しばしばモデルの価値や信念の尺度として、刺激された応答を扱います。
この仮定は、反応が政治的価値観、社会的態度、信念の証拠として読まれるときに特に脆弱である。
我々は,主観的質問と主観的質問との間に,素早い頑健さが相違するかどうかを問う。
本研究では,3つの目標データセット(MMLU,ARC,CulturalBench)と3つの主観的データセット(Political Compass Test,ValueBench,World Values Survey)の4つのモデルファミリーを評価した。
各質問/文章に対して、単語のバリエーション、フレーミング、フォーマットなど、複数のタイプのプロンプト変更を適用し、モデルが変種間で同じ答えを与えるかどうかを測定する。
二項一般化推定方程式を用いて、モデル、データセット、プロンプトカテゴリ、およびそれらの相互作用の有意な影響を見出す。
データセット型の効果も重要であり、データセット型とプロンプトカテゴリの相互作用が大きい。
これらの結果から, 素早い頑健性は質問タイプ, 素早い変化, モデルに依存することが明らかとなった。
関連論文リスト
- Effects of Answer Format Variation on Gender Bias in Large Language Models [5.457386921498268]
回答形式の変化が、大きな言語モデルにおける性別バイアスの測定に与える影響について検討する。
回答形式は, 順位の逆転を含む, 測定結果を大きく変化させることがわかった。
論文 参考訳(メタデータ) (2026-08-18T08:41:05Z) - ViTaB-A: Evaluating Multimodal Large Language Models on Visual Table Attribution [37.049064455196486]
マルチモーダル大言語モデル (mLLMs) は構造化データの疑問に答えるためにしばしば用いられる。
モデルが解答をサポートする特定の行や列を指し示す能力である構造化データ属性/引用について検討する。
論文 参考訳(メタデータ) (2026-02-17T18:01:35Z) - On the Credibility of Evaluating LLMs using Survey Questions [0.42061757959666934]
近年,大規模言語モデル(LLM)の価値指向を適応型社会調査を用いて評価している。
本稿では, 正確な設定に依存して, 値配向の類似性を過小評価し, 過度に見積もることの限界を明らかにする。
5か国3ヶ国における世界価値調査(World Value Survey)を用いて、直接対思考の連鎖(direct vs. chain-of-thinkt)と復号戦略(greedy vs. sample)が結果に有意な影響を及ぼすことを示した。
論文 参考訳(メタデータ) (2026-02-03T21:45:43Z) - Survey-to-Behavior: Downstream Alignment of Human Values in LLMs via Survey Questions [11.962443965910486]
大規模言語モデルは、人間の価値観よりも好みを暗黙的にエンコードする。
モデルの価値体系を下流の行動に確実に変更して、それに応じて価値調査の質問に答えるようにトレーニングできるだろうか?
我々の単純なアプローチは、ドメイン内調査の質問に対するモデルの回答を変えるだけでなく、暗黙の下流タスクの振る舞いにおいて大きな変化(バリューアライメント)をもたらすことも示しています。
論文 参考訳(メタデータ) (2025-08-15T11:36:17Z) - Revisiting LLM Value Probing Strategies: Are They Robust and Expressive? [81.49470136653665]
広範に利用されている3つの探索戦略における値表現の頑健さと表現性を評価する。
人口統計学的文脈は自由テキスト生成にはほとんど影響を与えず、モデルの値は値に基づく行動の好みと弱い相関しか示さない。
論文 参考訳(メタデータ) (2025-07-17T18:56:41Z) - MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs [15.278241998033822]
大規模言語モデル(LLM)の能力を評価する上で,QA(Open-ended Question answering)が重要な課題である。
オープンな質問をまず識別し,候補回答をランク付けする新しい評価手法である textbfMinosEval を提案する。
論文 参考訳(メタデータ) (2025-06-18T07:49:13Z) - Pointwise Mutual Information as a Performance Gauge for Retrieval-Augmented Generation [78.28197013467157]
文脈と問合せの間のポイントワイドな相互情報は,言語モデルの性能向上に有効な指標であることを示す。
本稿では,文書と質問のポイントワイドな相互情報を利用する2つの手法を提案する。
論文 参考訳(メタデータ) (2024-11-12T13:14:09Z) - Contextualized Evaluations: Judging Language Model Responses to Underspecified Queries [85.81295563405433]
本稿では,不特定クエリを取り巻くコンテキストを合成的に構築し,評価中にそれを提供するプロトコルを提案する。
その結果,1) 評価から得られた結論の変更,2) モデルペア間のベンチマークランキングの反転,2) スタイルのような表面レベルの基準に基づいて判断を下すナッジ評価,3) 多様なコンテキスト間でのモデル行動に関する新たな洞察の提供,などが確認できた。
論文 参考訳(メタデータ) (2024-11-11T18:58:38Z) - Political Compass or Spinning Arrow? Towards More Meaningful Evaluations for Values and Opinions in Large Language Models [61.45529177682614]
我々は,大規模言語モデルにおける価値と意見の制約評価パラダイムに挑戦する。
強制されない場合、モデルが実質的に異なる答えを与えることを示す。
我々はこれらの知見をLLMの価値と意見を評価するための推奨とオープンな課題に抽出する。
論文 参考訳(メタデータ) (2024-02-26T18:00:49Z) - Answering Ambiguous Questions via Iterative Prompting [84.3426020642704]
オープンドメインの質問応答では、質問のあいまいさのため、複数の妥当な回答が存在する可能性がある。
ひとつのアプローチは、すべての有効な回答を直接予測することですが、これは、妥当性と多様性のバランスに苦労する可能性があります。
本稿では,あいまいな疑問に答える既存手法の欠陥に対処するため,AmbigPromptを提案する。
論文 参考訳(メタデータ) (2023-07-08T04:32:17Z) - A Revised Generative Evaluation of Visual Dialogue [80.17353102854405]
本稿では,VisDialデータセットの改訂評価手法を提案する。
モデルが生成した回答と関連する回答の集合のコンセンサスを測定する。
DenseVisDialとして改訂された評価スキームのこれらのセットとコードをリリースする。
論文 参考訳(メタデータ) (2020-04-20T13:26:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。