論文の概要: AdvPlan-Bench: Adversarial Evaluation of Structured Plan-Generation Agents
- arxiv url: http://arxiv.org/abs/2608.00832v1
- Date: Sat, 01 Aug 2026 19:17:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.953058
- Title: AdvPlan-Bench: Adversarial Evaluation of Structured Plan-Generation Agents
- Title(参考訳): AdvPlan-Bench:構造化計画生成剤の逆評価
- Abstract要約: 本稿では,構造化計画生成エージェントの逆評価のためのオフラインベンチマークであるAdvPlan-Benchを紹介する。
コントリビューションは、タイプされた計画、反対応答セット、セレクタ診断、トレーサブルな候補-フロンティアメトリクスといった一般的な評価対象である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Structured plan-generation agents are often evaluated as if a plan has quality in isolation, yet many realistic planning tasks require asking how a candidate behaves when another agent can search for responses. We introduce AdvPlan-Bench, an offline benchmark for adversarial evaluation of structured plan-generation agents. The contribution is a general evaluation object: a typed plan, an adversarial response set, selector diagnostics, and traceable candidate-frontier metrics. AdvPlan-Bench represents plans as typed action chains with optional branches, assigns synthetic quality scores, compares opposing plans with BLUE-vs-RED advantage and Nash-gap diagnostics, and evaluates qualitative constraint coherence with a transparent heuristic rubric. In 150 synthetic scenarios spanning five planning templates, a sampled best-response policy that draws eight response candidates reduces BLUE advantage from .518 to .486 and BLUE win rate from .900 to .820 relative to a single-sample response. An offline LLM-policy contract baseline reaches .496 BLUE advantage and .700 BLUE win rate, while a two-stage multi-agent council obtains .509 BLUE advantage and .813 BLUE win rate. A three-rater rubric-sensitivity study over 600 rating records yields .978 inter-rater agreement. AdvPlan-Bench is not an operational planner and provides no evidence about real-world decision quality; it is a reproducible benchmark artifact for studying adversarial plan evaluation, response-budget sensitivity, candidate frontiers, and multi-agent critique-and-revision traces.
- Abstract(参考訳): 構造化された計画生成エージェントは、しばしば、計画が独立した品質を持つかのように評価されるが、多くの現実的な計画タスクは、他のエージェントが応答を検索できるときに、候補者がどのように振る舞うかを尋ねる必要がある。
本稿では,構造化計画生成エージェントの逆評価のためのオフラインベンチマークであるAdvPlan-Benchを紹介する。
コントリビューションは、タイプされた計画、反対応答セット、セレクタ診断、トレーサブルな候補-フロンティアメトリクスといった一般的な評価対象である。
AdvPlan-Benchは、任意の分岐を持つタイプドアクションチェーンとして計画を表し、合成品質スコアを割り当て、反対プランをBLUE-vs-REDの利点とナッシュギャップの診断と比較し、透明なヒューリスティックルーリックで定性的制約コヒーレンスを評価する。
5つの計画テンプレートにまたがる150の合成シナリオでは、8つの応答候補を引き出すベストレスポンスポリシーにより、BLUEの利点は.518から.486に減少し、BLUEの勝利率は.900から.820に減少する。
オフラインのLLM-policy契約ベースラインは.496BLUEの優位と.700BLUEの勝利率に到達し、2段階のマルチエージェント協議会は.509BLUEの優位と.813BLUEの勝利率を得る。
600以上のレーティング記録に対する3レータルーリック感度の研究は、レータ間合意が.978である。
AdvPlan-Benchはオペレーショナルプランナーではなく、現実世界の意思決定の質に関する証拠を提供していない。
関連論文リスト
- CARRE: Counterfactual Action Retrieval and Reason Evaluation for Explainable Churn Prescription [5.823033362443801]
CARREは,検索強化候補生成,費用対効果評価,大規模言語モデル(LLM)推論を組み合わせた3段階のフレームワークである。
IBM Telco Customer Churnデータセットでは、CARREは通常のSHAPベースラインよりも79.8%高い平均モデル予測リスク削減を実現している。
論文 参考訳(メタデータ) (2026-09-09T06:08:02Z) - From Proxy Learning to Driving Decisions: A Transfer-Based Framework for Evaluating Future-Aware Autonomous Driving Planners [0.34519649635864585]
Proxy-to-Decision Transfer Frameworkは、学習後の情報が信頼性の高い駆動性能改善要求をサポートするときに評価する。
Decision-Transfer Decomposition Moduleはスコアマージン、スイッチ条件付きユーティリティ、サポート対選択後悔を通じて値損失をローカライズする。
論文 参考訳(メタデータ) (2026-09-02T14:55:14Z) - Strategic Evaluation of Planning Strategies for LLM Agents in Cyber-Physical Systems [0.0]
計画誘導制御トラジェクトリを中心に構築されたベンチマークを導入する。
スマートグリッドの需要応答システムにシーケンシャルで階層的で検索エグゼクティブを実装している。
強制探索は5つの基本種子のオラクルであることを示す。
論文 参考訳(メタデータ) (2026-08-04T22:52:21Z) - TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning [40.69228585271066]
本稿では,TREK (Travel Reasoning Evaluation Kit) について紹介する。
TREKは800のマルチ制約タスク - 533が実現可能で、267が型付き/エンタリティ/予算的原因で実行不可能である。
完全に再現可能なベンチマークとして、データセット、ツールサンドボックス評価器、エージェントコードをリリースします。
論文 参考訳(メタデータ) (2026-07-29T14:35:29Z) - PACE: A Proxy for Agentic Capability Evaluation [60.3743414796937]
PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
論文 参考訳(メタデータ) (2026-07-02T10:59:03Z) - Plan Right, Then Plan Tight: Symbolic RL for Efficient Embodied Reasoning [8.807543162466557]
身体的なタスクプランニングは、エージェントに自然言語の命令を物理的なシーンで実行可能なアクションのシーケンスに変換するように要求する。
近年のプロンプトベースおよび強化学習プランナーは、流動的なアクションテキストを生成するが、ターゲットの世界において、生成したプランが有効であるという安価な決定論的チェックは欠落している。
データ構築、検証、報酬設計のための共有インターフェースとして、1つのBDDLが機能することを示します。
論文 参考訳(メタデータ) (2026-06-30T07:37:21Z) - Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents [40.17728515217378]
エージェント計画ベンチマーク(APB: Agent Planning Benchmark)は、22のドメインに4,209のマルチモーダルケースと5つの設定を持つ、計画固有の診断ベンチマークである。
APBは、長期計画、ツールノイズの堅牢性、校正された拒絶、推論時間改善の体系的な弱点を明らかにしている。
APBは、実行ベンチマークの上流診断補完として機能する。
論文 参考訳(メタデータ) (2026-06-03T13:37:47Z) - PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments [59.07829883257003]
5つの集合住宅の上に建設され、PRISMは300の人間認証タスクを3つの能力レベルに構成する。
PRISMはエージェントに依存しない実行可能なアクションAPIを公開し、任意のエージェントをエンドツーエンドで評価できるようにする。
論文 参考訳(メタデータ) (2026-05-12T04:59:47Z) - FUSE : Failure-aware Usage of Subagent Evidence for MultiModal Search and Recommendation [1.3618516245643617]
マルチモーダルなクリエイティブアシスタントは、ユーザ目標を分解し、レイアウト、スタイリング、検索、生成のためのサブエージェントにタスクをルーティングする。
FUSEはコンテキスト圧縮、連鎖推論、ミニショット最適化、検索拡張コンテキスト、2段階処理、ゼロショット最小化という7つのコンテキスト予算戦略を実装している。
論文 参考訳(メタデータ) (2025-11-15T07:55:51Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge [78.28188747489769]
そこで我々は,Thinking-LLM-as-a-Judgeの優先最適化アルゴリズムであるEvalPlannerを提案する。
自己学習ループでは、EvalPlannerは、合成的に構築された評価計画と実行よりも反復的に最適化する。
提案手法はRewardBenchにおける生成報酬モデルのための新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2025-01-30T02:21:59Z) - OpenKBP-Opt: An international and reproducible evaluation of 76
knowledge-based planning pipelines [48.547200649819615]
放射線治療における知識ベース計画(KBP)のための計画最適化モデルを開発するためのオープンフレームワークを構築した。
当フレームワークは, 頭頸部癌100例の基準計画と, 19KBPモデルによる高用量予測を含む。
論文 参考訳(メタデータ) (2022-02-16T19:18:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。