論文の概要: Persona Non Grata: LLM Persona-Driven Generations in MCQA are Unstable in Distinct Dimensions
- arxiv url: http://arxiv.org/abs/2607.00937v1
- Date: Wed, 01 Jul 2026 13:40:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.917267
- Title: Persona Non Grata: LLM Persona-Driven Generations in MCQA are Unstable in Distinct Dimensions
- Title(参考訳): Persona Non Grata: LLM Persona-Driven Generations in MCQA is Unstable in Distinct Dimensions
- Abstract要約: ペルソナ駆動世代(PDG)は、研究や産業用途で多用されている。
自由形式のテキスト(対話のような)で表されるペルソナは、安定性や一貫性を調査する実質的な仕事を持っているが、非テキスト重出力で表されるペルソナはしばしば見過ごされる。
我々は,3つの異なる次元を評価することで,性能,結果,疑問の正しさの安定性を調査する3つの指標を開発した。
- 参考スコア(独自算出の注目度): 3.9226964697266253
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Persona-driven generations (PDGs) have seen prolific use in research and industry applications, where a large language model (LLM) takes on a 'persona' while completing some task. While persona expressed through free-form text (like dialogue) has substantial work investigating stability or consistency, relatively, persona expressed in non-text-heavy outputs (like in multiple-choice question answering, or MCQA) is often overlooked. We work to address this gap, seeking to understand the instability of LLM PDGs in MCQA tasks. We develop three metrics investigating the performance, outcome, and question correctness stability, evaluating three distinct dimensions. Using these metrics, we find that instability varies consistently between model families and model size, and across question domains, with math/commonsense questions leading to greater instability. We also find task prompt format introduces more prediction instability than other hyperparameters, like temperature. Finally, we find that instability is related to task accuracy, and using our instability metrics, find different experimental settings that result in different best and worst personas for tasks, despite their similarity. This reveals the importance of checking hyperparameter instability in PDGs.
- Abstract(参考訳): パーソナ駆動世代(PDG)は、あるタスクを完了しながら大きな言語モデル(LLM)が"ペルソナ"を取る研究や産業アプリケーションで多用されている。
自由形式のテキスト(対話のような)で表されるペルソナは、安定性や一貫性を調査するかなりの作業があるが、相対的に、非テキスト重大なアウトプット(多重選択質問応答やMCQAなど)で表されるペルソナは見過ごされがちである。
MCQAタスクにおけるLCM PDGの不安定性を理解するために,このギャップに対処する。
我々は,3つの異なる次元を評価することで,性能,結果,疑問の正しさの安定性を調査する3つの指標を開発した。
これらの指標を用いて、不安定性はモデルファミリとモデルサイズ、および問題領域間で一貫して変化し、数学や常識的な疑問がより不安定になる。
また、タスクプロンプトフォーマットは温度などの他のハイパーパラメータよりも不安定な予測をもたらす。
最後に、不安定性はタスクの正確性に関係しており、不安定度を使用して異なる実験的な設定を見つけ、その類似性にもかかわらず、タスクの最高のペルソナと最悪のペルソナが異なることに気付きます。
これはPDGにおけるハイパーパラメータ不安定性をチェックすることの重要性を明らかにする。
関連論文リスト
- The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context [76.36635039699112]
大規模言語モデル(LLM)は、タスク入力に長く、部分的には関係のないコンテキストが伴うような、コンテキストに富んだ環境にますますデプロイされる。
現状のモデルはしばしば、集合レベルでのタスク非関連コンテキストに対して頑健に見える。
しかし、この集合安定性は、指数当たりの不安定性を著しくマスクする。
論文 参考訳(メタデータ) (2026-07-14T17:01:12Z) - EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents [75.01735520608075]
既存のベンチマークは、直観的信念を問うことで、主にリテラル・オブ・マインド(ToM)をテストする。
EnactToMは, 3D 家庭で設定された300個のマルチエージェントタスクの進化ベンチマークである。
ハードスプリットでは、7つの評価されたフロンティアモデルすべてが機能的なタスク完了時に0.0%のPass3を獲得し、リテラルな信念プローブでは平均45.0%であった。
論文 参考訳(メタデータ) (2026-05-11T00:04:19Z) - Testing Question Answering Software with Context-Driven Question Generation [19.83376005515088]
質問応答システムをテストするための文脈駆動型質問生成手法であるCQ2Aを紹介する。
CQ2Aは文脈から実体と関係を抽出し、根拠となる真理の答えを形成する。
CQ2Aは、バグ検出能力、生成された質問の自然さ、コンテキストのカバレッジにおいて、最先端のアプローチよりも優れています。
論文 参考訳(メタデータ) (2025-11-11T07:22:58Z) - Can Large Language Models Always Solve Easy Problems if They Can Solve Harder Ones? [65.43882564649721]
大きな言語モデル(LLM)は印象的な機能を示しているが、それでも矛盾する問題に悩まされている。
我々はConsisEvalベンチマークを開発し、各エントリは厳密な難易度で2つの質問から構成される。
相対的整合性スコアによる整合性向上の可能性を分析する。
論文 参考訳(メタデータ) (2024-06-18T17:25:47Z) - Test-Time Self-Adaptive Small Language Models for Question Answering [63.91013329169796]
ラベルのないテストデータのみを用いて、より小さな自己適応型LMの能力を示し、検討する。
提案した自己適応戦略は,ベンチマークQAデータセットの大幅な性能向上を示す。
論文 参考訳(メタデータ) (2023-10-20T06:49:32Z) - Exposing and Addressing Cross-Task Inconsistency in Unified
Vision-Language Models [80.23791222509644]
一貫性のないAIモデルは、人間のユーザーによって不安定で信頼できないと見なされている。
最先端のビジョン言語モデルは、タスク間の驚くほど高い一貫性のない振る舞いに悩まされている。
本稿では,大規模で自動生成されるクロスタスクコントラスト集合上で計算されたランク相関に基づく補助訓練目標を提案する。
論文 参考訳(メタデータ) (2023-03-28T16:57:12Z) - Towards QD-suite: developing a set of benchmarks for Quality-Diversity
algorithms [0.0]
既存のベンチマークは標準化されておらず、現在、品質多様性(QD)に匹敵するMNISTはない。
我々は、QD手法が直面する課題の特定と、目標とする、挑戦的でスケーラブルなベンチマークの開発が重要なステップであると主張している。
論文 参考訳(メタデータ) (2022-05-06T13:33:50Z) - ASQA: Factoid Questions Meet Long-Form Answers [35.11889930792675]
この研究は、解釈によって異なる正しい答えを持つ、あいまいな事実型問題に焦点を当てている。
曖昧な質問に対する回答は、複数の情報源からの事実情報を長文の要約にまとめるべきである。
我々は、この正確性の概念を用いて、ASQAのパフォーマンスの自動測定基準を定義します。
論文 参考訳(メタデータ) (2022-04-12T21:58:44Z) - External Stability Auditing to Test the Validity of Personality
Prediction in AI Hiring [4.837064018590988]
本稿では,アルゴリズムによる人格検査による予測の安定性の外部監査のための方法論を開発する。
我々は、この方法論をHumantic AIとCrystalの2つのシステムの監査でインスタンス化する。
両システムとも,測定の重要面に関してかなりの不安定性を示すことがわかった。
論文 参考訳(メタデータ) (2022-01-23T00:44:56Z) - The Curse of Performance Instability in Analysis Datasets: Consequences,
Source, and Suggestions [93.62888099134028]
自然言語推論(NLI)および読み込み(RC)解析/ストレスセットにおける最先端モデルの性能は極めて不安定であることがわかった。
このことは、(1)不安定さがこれらの分析セットに基づいて引き出された結論の信頼性にどのように影響するかという3つの疑問を提起する。
不安定の原因に関する理論的説明と実証的証拠の両方を提示する。
論文 参考訳(メタデータ) (2020-04-28T15:41:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。