論文の概要: AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval
- arxiv url: http://arxiv.org/abs/2608.24076v2
- Date: Wed, 26 Aug 2026 06:11:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.141495
- Title: AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval
- Title(参考訳): AgentWorld:エージェント情報検索のための個人性を考慮した信頼性評価
- Authors: Gunja Agarwal, Arup Kumar Das, Arun Menon, Jitesh Chandra Mishra, Vignesh Divakaran,
- Abstract要約: AgentWorldは、パーソナリティ駆動のユーザ人口とステートフルなツール使用環境を組み合わせたシミュレーションフレームワークである。
10のOCEANペルソナにわたる会話分析エージェント(240の評価者判断)、5つのタスクにわたるカスタマーサポートエージェント($times$4のペルソナ変種)、既存のトラジェクタの不安定さを示す5つのタスクの逆ストレステストである。
- 参考スコア(独自算出の注目度): 1.1647715835517187
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evaluation of agentic information retrieval remains limited to scripted interactions with uniform users, missing both natural personality diversity and adversarial brittleness. We present AgentWorld, a simulation framework combining (i)Big Five (OCEAN) personality-driven user populations with stateful tool-use environments; (ii)the pass$^k$ consistency metric with structured fault classification, partial-credit scoring, and dual-control handoff verification; (iii)score-thresholded training-data export in six fine-tuning formats; and (iv)an adversarial Risk Analyser that snapshots required-intermediate-state spines, branches Monte-Carlo rollouts under four task-aware perturbation types, and quantifies risk via $ΔP / ΔT$ scoring, Dempster--Shafer evidence fusion, and Shapley attack-category attribution. Three experiments demonstrate the framework: a conversational analytics agent across 10 OCEAN personas (240 evaluator judgments); a customer-support agent across 5 tasks $\times$ 4 persona variants; and adversarial stress-testing of 5 tasks revealing pre-existing trajectory brittleness ($V_{\min}=0.375$ without perturbation) and tool/infrastructure-layer attack dominance (Shapley: 46% system, 38% action). Personality variation surfaces failure modes uniform testing cannot expose---cross-domain leakage, contextual drift, a 0.27-point quality gap, and 50% vs. 100% pass-rate across personas on the same task---while the Risk Analyser quantifies trajectory-level brittleness that pass$^k$ alone cannot measure.
- Abstract(参考訳): エージェント情報検索の評価は、自然な個性の多様性と敵の脆さの両方を欠いている、一様ユーザとのスクリプトによるインタラクションに限られている。
我々はAgentWorldというシミュレーションフレームワークについて紹介する。
(i)太い5人(OCEAN)は、ステートフルなツール利用環境を持つ人格主体のユーザ人口。
(ii) 構造的断層分類,部分クレディットスコア,二重制御ハンドオフ検証を伴うパス$^k$整合度測定
(iii)6種類の微調整形式の訓練用データ輸出
(iv)必要中間状態のスピンをスナップショット化し、モンテカルロロールアウトを4つのタスク対応の摂動タイプに分割し、$ΔP / ΔT$スコア、Dempster-Shaferエビデンス融合、Shapleyアタックカテゴリ属性によるリスクの定量化を行う。
10のOCEANペルソナにわたる会話分析エージェント(240の評価対象判断)、5つのタスクにわたるカスタマーサポートエージェント($\times$4のペルソナ変種)、既存のトラジェクティブ脆さ(V_{\min}=0.375$)とツール/インフラストラクチャー層攻撃優位(Shapley:46%のシステム、38%のアクション)を示す5タスクの対向的ストレステスト(v_{\min}=0.375$)である。
個人性の変化 フェールモード 均一なテストでは、ドメイン間のリーク、コンテキストドリフト、0.27ポイントの品質ギャップ、同じタスクでペルソナをまたいで50%対100%のパスレートが公開できない。
関連論文リスト
- Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations [0.0]
3つのオープンエージェントトレースベンチマークで、エージェントのメインエフェクトが各データセットとチェックタイプにおける全分散の3%未満を占めていることを示す。
3つの推定器に適合する4面の一般化可能性理論の分散分解を通してこれを達成する。
これをデプロイ決定信頼性(DDR:Deployment Decision Reliability)という,分散コンポーネントテーブルを企業購入者が防御できる5つの決定に変換する,ワンページレポートの規律にパッケージ化します。
論文 参考訳(メタデータ) (2026-08-11T18:16:51Z) - BRiG-AFA: Bellman Risk-to-Go Learning for Non-Myopic Active Feature Acquisition [8.363536351727978]
アクティブな機能取得は、予算の下で各テストインスタンスの次を計測する観測されていない機能を要求する。
本稿では,残予算毎に個別の候補条件付きリスク・ツー・ゴー関数を学習する,デプロイ可能な教師付き代替手段であるメソッドを導入する。
論文 参考訳(メタデータ) (2026-08-03T14:30:44Z) - Persona-Model Collapse in Emergent Misalignment [0.0]
有害な内容を持つ狭いデータに対する微調整された大きな言語モデルは、無関係なプロンプトに対して広範囲に不整合な振る舞いをもたらす。
モラル・サセプティビリティ(S)とモラル・ロバストネス(R)の2つの指標を用いてこの仮説を検証する。
これらのメトリクスは、与えられた文字(S)と、与えられた文字(R)をシミュレートするときにその一貫性を識別するモデルの能力を形式化する。
論文 参考訳(メタデータ) (2026-05-13T00:48:57Z) - Proteus: A Self-Evolving Red Team for Agent Skill Ecosystems [0.0]
エージェントスキルは実行可能な振る舞いとコンテキスト設定ドキュメンテーションの両方を公開する。
現実的な攻撃者は、監査と実行時のフィードバックを使って、繰り返しスキルを書き直すことができる。
Proteusは形式化された5軸スキルアタックスペースを検索する。
論文 参考訳(メタデータ) (2026-05-12T10:05:54Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators [0.0]
AgentCollabBenchは、ソフトウェアエンジニアリング、DevOps、データエンジニアリングにまたがる900の人為的なタスクの診断ベンチマークです。
各タスクは、4つの行動リスクのうちの1つを分離する。
GPT 4.1 mini, Gemini 2.5 Flash Lite, Qwen-3.5-35B-A3B, Llama 3.1 8B の4つの近代LCMの評価を行った。
通信トポロジは、マルチホップ情報サバイバルにおけるばらつきの7-40%を説明する主要なリスクファクターとして現れる。
論文 参考訳(メタデータ) (2026-05-09T03:35:09Z) - TRUST: A Framework for Decentralized AI Service v.0.1 [47.384270414446604]
大規模推論モデル (LRM) とマルチエージェントシステム (MAS) は, 信頼性の高い検証を必要とする。
TRUST(Transparent, Robust, and Unified Services for Trustworthy AI)は,3つのイノベーションを備えた分散フレームワークである。
我々は、悪質な俳優が損失を被っている間、正直な監査人の利益を確実に確保する安全利益理論を証明する。
論文 参考訳(メタデータ) (2026-04-29T19:32:58Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - On the Resilience of LLM-Based Multi-Agent Collaboration with Faulty Agents [58.79302663733703]
大規模言語モデルに基づくマルチエージェントシステムは、専門家エージェントの協力により、様々なタスクにまたがる優れた能力を示している。
不器用なエージェントや悪意のあるエージェントが与える影響 - システム全体のパフォーマンスにおいて、頻繁にタスクでエラーを犯すものは、いまだに過小評価されていない。
本稿では,下流タスクにおける障害要因下での各種システム構造のレジリエンスについて検討する。
論文 参考訳(メタデータ) (2024-08-02T03:25:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。