論文の概要: PICon: A Multi-Turn Interrogation Framework for Evaluating Persona Agent Consistency
- arxiv url: http://arxiv.org/abs/2603.25620v1
- Date: Thu, 26 Mar 2026 16:34:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.378719
- Title: PICon: A Multi-Turn Interrogation Framework for Evaluating Persona Agent Consistency
- Title(参考訳): PICon:Persona Agent Consistencyの評価のためのマルチTurnインターロゲーションフレームワーク
- Abstract要約: 大規模言語モデル(LLM)に基づくペルソナエージェントは、ヒトの参加者にスケーラブルなプロキシとして急速に採用されている。
論理的連鎖型マルチターン質問を通じてペルソナエージェントを探索する評価フレームワークPIConを提案する。
- 参考スコア(独自算出の注目度): 13.864376043056387
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM)-based persona agents are rapidly being adopted as scalable proxies for human participants across diverse domains. Yet there is no systematic method for verifying whether a persona agent's responses remain free of contradictions and factual inaccuracies throughout an interaction. A principle from interrogation methodology offers a lens: no matter how elaborate a fabricated identity, systematic interrogation will expose its contradictions. We apply this principle to propose PICon, an evaluation framework that probes persona agents through logically chained multi-turn questioning. PICon evaluates consistency along three core dimensions: internal consistency (freedom from self-contradiction), external consistency (alignment with real-world facts), and retest consistency (stability under repetition). Evaluating seven groups of persona agents alongside 63 real human participants, we find that even systems previously reported as highly consistent fail to meet the human baseline across all three dimensions, revealing contradictions and evasive responses under chained questioning. This work provides both a conceptual foundation and a practical methodology for evaluating persona agents before trusting them as substitutes for human participants. We provide the source code and an interactive demo at: https://kaist-edlab.github.io/picon/
- Abstract(参考訳): 大規模言語モデル(LLM)ベースのペルソナエージェントは、さまざまなドメインにわたる人間の参加者に対して、スケーラブルなプロキシとして急速に採用されている。
しかし、対話を通して人格エージェントの応答が矛盾や事実的不正確さを伴わないかどうかを検証するための体系的な方法はない。
尋問の方法論の原則は、どんなに精巧に作られたアイデンティティであっても、体系的な尋問はその矛盾を露呈する。
この原理を適用し、論理的連鎖型マルチターン質問を通してペルソナエージェントを探索する評価フレームワークPIConを提案する。
PIConは、内部整合性(自己矛盾から解放される)、外部整合性(現実の事実との整合性)、再テスト整合性(繰り返しの安定性)の3つの中核的な側面に沿って整合性を評価する。
実際の63人の被験者とともに7つのペルソナエージェントを評価したところ、従来報告されたシステムでさえ3次元全てにわたって人間のベースラインを満たさないことが判明した。
この研究は、人間の参加者の代用として信頼する前に、ペルソナエージェントを評価するための概念的基礎と実践的方法論の両方を提供する。
ソースコードとインタラクティブなデモは、https://kaist-edlab.github.io/picon/で公開しています。
関連論文リスト
- AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility [104.46861849039357]
エージェントシステムはドメイン間で急速に進歩しているが、その評価は断片化されている。
根本的問題は、オープンでエージェントに依存しないアセスメントインタフェースがないことである。
我々は、審査員が評価を行い、すべての参加者が標準化されたプロトコルを介して対話するエージェントエージェントアセスメント(AAA)を提唱する。
論文 参考訳(メタデータ) (2026-06-11T17:23:54Z) - The Governance of Human-LLM Interaction: Safety Gating, Civility Steering, and Affective Default Lock-In [0.9558392439655014]
大規模言語モデル (LLMs) は、金融、医療、精神保健支援における高額な相互作用をますます仲介する。
プロバイダ側のアライメントは有害なコンテンツをブロックしますが、通信上のデフォルトを安定化します。
通信形態に対するプロバイダ制御の観測可能な指標として,迅速なステアビリティとレグレッション・トゥ・デフォルト(regressive-to-default)が示されている。
論文 参考訳(メタデータ) (2026-06-06T13:36:37Z) - The Deliberative Illusion: Diagnosing Factual Attrition and Stance Homogenization in Multi-Agent LLM Deliberation [68.98390038721963]
問題クリティカルな事実の最大72%を,マルチエージェントによる議論で消し去ることを示す。
保持された証拠は誤解を招くことなく問題を再構築し、最終的なスタンスをベースモデルに固定し、単一の悪意のあるエージェントが誤った情報を共有コンテキストに注入することができる。
我々は、どの事実、不確実性、正当な不一致が相互作用を生き残るかを測定する評価を求める。
論文 参考訳(メタデータ) (2026-06-02T02:15:40Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Dual Optimal: Make Your LLM Peer-like with Dignity [35.58723842086038]
現在のアライメント言語モデルは、Evasive Servantと呼ばれる二重障害モードを示す。
我々は,抗梅毒と信頼性の両面からサーボネスに対処するDignified Peerフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-01T14:48:44Z) - Beyond Preset Identities: How Agents Form Stances and Boundaries in Generative Societies [28.436766185842767]
本稿では,計算仮想エスノグラフィーと定量的社会認知プロファイリングを組み合わせた新しい混合メソドックスフレームワークを提案する。
Innate Value Bias (IVB)、Persuasion Sensitivity、Trust-Action Decoupling (TAD)の3つの新しいメトリクスを形式化する。
発見は静的なプロンプトエンジニアリングの脆弱さを明らかにし、人間とエージェントのハイブリッド社会における動的アライメントの方法論的かつ定量的基盤を提供する。
論文 参考訳(メタデータ) (2026-03-24T16:38:46Z) - Simulating and Understanding Deceptive Behaviors in Long-Horizon Interactions [18.182800471968132]
大規模言語モデルにおける偽造の探索と評価のための最初のシミュレーションフレームワークを紹介する。
11のフロンティアモデルで実験を行い、クローズドシステムとオープンソースシステムの両方にまたがっています。
詐欺はモデルに依存しており、イベントプレッシャーの増加とともに増加し、常に監督的信頼を損なう。
論文 参考訳(メタデータ) (2025-10-05T02:18:23Z) - Can an Individual Manipulate the Collective Decisions of Multi-Agents? [53.01767232004823]
M-Spoilerは、マルチエージェントシステム内のエージェントインタラクションをシミュレートして、対向サンプルを生成するフレームワークである。
M-スポイラーは、敵対的サンプルの最適化を積極的に支援するスタブボーン剤を導入した。
本研究は,マルチエージェントシステムにおける個々のエージェントの知識によって引き起こされるリスクを検証した。
論文 参考訳(メタデータ) (2025-09-20T01:54:20Z) - The Traitors: Deception and Trust in Multi-Agent Language Model Simulations [0.0]
ソーシャル・デダクション・ゲームに触発されたマルチエージェント・シミュレーション・フレームワークであるThe Traitorsを紹介した。
我々は,詐欺の成功,信頼ダイナミクス,集団推論品質を計測する評価指標のスイートを開発する。
DeepSeek-V3, GPT-4o-mini, GPT-4o(モデル毎に10回の走行)による実験では, 顕著な非対称性が示された。
論文 参考訳(メタデータ) (2025-05-19T10:01:35Z) - Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models [75.85319609088354]
SAGE(Sentient Agent as a Judge)は、大規模言語モデルの評価フレームワークである。
SAGEは人間のような感情の変化や内的思考をシミュレートするSentient Agentをインスタンス化する。
SAGEは、真に共感的で社会的に適応的な言語エージェントへの進捗を追跡するための、原則付き、スケーラブルで解釈可能なツールを提供する。
論文 参考訳(メタデータ) (2025-05-01T19:06:10Z) - Rel-A.I.: An Interaction-Centered Approach To Measuring Human-LM Reliance [73.19687314438133]
インタラクションの文脈的特徴が依存に与える影響について検討する。
文脈特性が人間の信頼行動に大きく影響していることが判明した。
これらの結果から,キャリブレーションと言語品質だけでは人間とLMの相互作用のリスクを評価するには不十分であることが示唆された。
論文 参考訳(メタデータ) (2024-07-10T18:00:05Z) - Online Decision Mediation [72.80902932543474]
意思決定支援アシスタントを学習し、(好奇心)専門家の行動と(不完全)人間の行動の仲介役として機能することを検討する。
臨床診断では、完全に自律的な機械行動は倫理的余裕を超えることが多い。
論文 参考訳(メタデータ) (2023-10-28T05:59:43Z) - ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMs [61.07130026622437]
大規模言語モデル(LLM)は、まだ自然言語推論タスクに苦戦している。
心の社会に動機づけられて、我々はReConcileを提案する。
LLMエージェント間のラウンドテーブル会議として設計されたマルチモデルマルチエージェントフレームワーク。
論文 参考訳(メタデータ) (2023-09-22T17:12:45Z) - Interrogating the Black Box: Transparency through Information-Seeking
Dialogues [9.281671380673306]
本稿では,倫理政策の遵守を調査するために,学習エージェントに質問する調査エージェントを構築することを提案する。
この形式的対話フレームワークが本論文の主な貢献である。
形式的な対話フレームワークは、コンプライアンスチェックの分野と不透明なシステムの特性の分析の両方において、多くの道を開きます。
論文 参考訳(メタデータ) (2021-02-09T09:14:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。