論文の概要: SovereignNegotiation-Bench: Evaluating User-Owned Personal Agents In Delegated Bargaining Under Privacy, Consent, Evidence, And Institutional Pressure
- arxiv url: http://arxiv.org/abs/2607.02814v1
- Date: Thu, 02 Jul 2026 23:03:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.42862
- Title: SovereignNegotiation-Bench: Evaluating User-Owned Personal Agents In Delegated Bargaining Under Privacy, Consent, Evidence, And Institutional Pressure
- Title(参考訳): SovereignNegotiation-Bench:プライバシ、コンセント、エビデンス、インスティテュートプレッシャーの下での偏見による個人エージェントの評価
- Abstract要約: SovereignNegotiation-Benchは民間企業による個人エージェント交渉のためのトレースレベルベンチマークである。
本報告では,240以上のシナリオ,4つのモデルファミリー,13,440個の凍結した生トラック,61,135個の解析されたアクション行,300項目以上の盲目3点検の検証を行った。
最強の合意最大化ベースラインは、合意率が最も高いが、ユーザユーティリティが低く、プライバシ/コンテンツリスクが高い。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Personal agents will increasingly negotiate on behalf of users: splitting costs with other personal agents, appealing platform decisions, escalating support disputes, requesting refunds, changing subscriptions, and negotiating deadlines or reimbursements. Existing negotiation benchmarks emphasize agreement, surplus, or strategic competence, but a user-owned agent can reach an agreement while harming the user through privacy leakage, consent violation, unsupported advocacy, over-concession, failed escalation, or poor auditability. We introduce SovereignNegotiation-Bench, a trace-level multi-turn benchmark for delegated personal-agent negotiation under private utilities, disclosure constraints, evidence requirements, and institutional asymmetry. The benchmark separates agent-visible observable state from evaluator-only labels and evaluates agreement success jointly with user utility, privacy, consent, evidence grounding, concession discipline, escalation, and auditability. We report an artifact-backed validation over 240 scenarios, 4 model families, 14 baselines, 13,440 frozen-prompt live trajectories, 61,135 parsed action rows, and a blinded 3-annotator audit over 300 items. The strongest agreement-maximizing baseline achieves the highest agreement rate but low user utility and high privacy/consent risk; FullSovereign does not maximize agreement, but obtains the best sovereign negotiation score by preserving utility, minimizing leakage, grounding claims, and reducing unauthorized commitments. The results show that agreement success is insufficient for user-owned negotiation agents.
- Abstract(参考訳): 個人エージェントは、他の個人エージェントとのコスト分割、プラットフォーム決定のアピール、サポート上の論争のエスカレート、返金の要求、サブスクリプションの変更、期限の交渉、あるいは再支払いなど、ユーザーに代わって交渉を行う。
既存のベンチマークベンチマークでは、合意、余剰、戦略的能力が強調されているが、ユーザが所有するエージェントは、プライバシーの漏洩、同意違反、禁止された擁護、過度な譲歩、エスカレーションの失敗、あるいは監査容易性の低下によってユーザを傷つけながら、合意に達することができる。
SovereignNegotiation-Benchは、私有ユーティリティ、開示制約、エビデンス要件、制度的非対称性に基づく委任個人エージェント交渉のためのトレースレベルのマルチターンベンチマークである。
このベンチマークは、エージェント可視の可観測状態と評価者のみのラベルを区別し、ユーザユーティリティ、プライバシ、同意、証拠根拠、譲歩規律、エスカレーション、監査可能性と共同で合意の成功を評価する。
本報告では,240以上のシナリオ,4つのモデルファミリー,14のベースライン,13,440の凍結した生トラック,61,135のパースされたアクション行,盲目な3つのアノテーション監査を報告した。
FullSovereignは合意を最大化せず、ユーティリティの保存、リークの最小化、クレームの根拠化、無許可のコミットメントの削減によって、最高の主権交渉スコアを得る。
その結果,ユーザ所有の交渉エージェントには合意が不十分であることが示唆された。
関連論文リスト
- Sharding Prevents LLM Oversight Failures and Adversarial Exploitation [45.380649793616705]
シャーディングは要求を小さなグループに分割し、各グループを別の呼び出しに割り当て、評決を集約する。
シャードの弱い裁判官は、より有能な総合的な裁判官よりも優れており、後者がパネルの全予算を受け取ったとしても、その裁判官と一致することができる。
論文 参考訳(メタデータ) (2026-08-05T18:21:21Z) - Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies [0.0]
本稿では,マルチラウンド交渉プロトコルにおける行動差分プライバシーについて検討する。
我々は、$(varepsilon, )$-differential privacyを共同で保証する適応交渉政策を設計する。
本機構は,交渉成功率と有効性を90%以上維持しながら,敵の推測精度を43~50%削減する。
論文 参考訳(メタデータ) (2026-07-07T21:22:28Z) - SovereignPA-Bench: Evaluating User-Owned Personal Agents under Evolving Intent, Platform Mediation, and Consent Constraints [0.0]
SovereignPA-Benchは、ユーザ所有の個人エージェントを評価するための実行可能なベンチマークである。
4つのモデルファミリーと8つのポリシーベースラインにまたがる120の主権ストレスシナリオを評価した。
論文 参考訳(メタデータ) (2026-07-06T17:39:05Z) - What Benchmarks Don't Measure: The Case for Evaluating Abstention Competence in Autonomous Agents [2.8340200313563773]
自律エージェントのベンチマークは、エージェントがタスクを完了したかどうかを計測するが、このフレーミングはエージェントが進むべきだったかどうかを体系的に見えない。
ヒューマンフィードバックの目的の下で訓練されたエージェントは、入力、証拠、あるいは安全に行動する許可がなくても、進行する構造的な傾向を発達させる。
本稿では,要求される情報が欠落している仕様ギャップ,世界国家が確認できない検証ギャップ,明示的な承認が与えられていない権限ギャップについて紹介する。
論文 参考訳(メタデータ) (2026-06-01T23:52:56Z) - TERMS-Bench: Diagnosing LLM Negotiation Agents Beyond Deal Rate [34.67393151003599]
交渉はエージェント言語モデルのための標準的なテストベッドである。
数学やコードとは異なり、本質的な検証がない。
本稿では,環境自体を検証対象とするベイズゲームフレームワークであるTerms-Benchを紹介する。
論文 参考訳(メタデータ) (2026-05-13T06:22:50Z) - PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments [59.07829883257003]
5つの集合住宅の上に建設され、PRISMは300の人間認証タスクを3つの能力レベルに構成する。
PRISMはエージェントに依存しない実行可能なアクションAPIを公開し、任意のエージェントをエンドツーエンドで評価できるようにする。
論文 参考訳(メタデータ) (2026-05-12T04:59:47Z) - From Overload to Convergence: Supporting Multi-Issue Human-AI Negotiation with Bayesian Visualization [4.511923587827302]
我々は現実的な不動産レンタルシナリオにおける人間とAIの交渉ケーススタディを設計する。
経験的所見では、パフォーマンスは3つの問題まで安定しているが、追加の問題が認知負荷を増加させるにつれて低下する。
本稿では,ベイズ推定による新たな不確実性に基づく可視化手法を提案する。
論文 参考訳(メタデータ) (2026-03-24T03:49:21Z) - Fairness Dynamics in Digital Economy Platforms with Biased Ratings [50.29721091981893]
我々は、デジタルプラットフォームが格付けに基づく差別を永続的に、あるいは対処する方法について研究する。
この結果から,ユーザエクスペリエンスと公平性の根本的なトレードオフが示される。
また,検索結果の人口動態を調整して介入することが,不公平を抑えるための極めて効果的な方法であることを示す。
論文 参考訳(メタデータ) (2026-02-18T18:41:16Z) - From Sycophancy to Sensemaking: Premise Governance for Human-AI Decision Making [0.0]
低フリクションアシスタントはサイコファンになり、暗黙の仮定を叩き、検証コストを専門家に押し付ける。
我々は、信頼できる人間とAIのパートナーシップには、回答生成から共同前提ガバナンスへの移行が必要であると主張している。
論文 参考訳(メタデータ) (2026-02-02T17:42:54Z) - EQ-Negotiator: Dynamic Emotional Personas Empower Small Language Models for Edge-Deployable Credit Negotiation [66.09161596959771]
小型言語モデル (SLM) は実用的な代替手段を提供するが、大規模言語モデル (LLM) と比較して大きな性能差がある。
本稿では,感情的ペルソナを用いて,この能力ギャップを橋渡しする新しいフレームワークであるEQ-Negotiatorを紹介する。
EQ-Negotiator を用いた 7B パラメータ言語モデルは,ベースライン LLM の 10 倍以上の大きさで,債務回復と交渉効率が向上することを示す。
論文 参考訳(メタデータ) (2025-11-05T11:25:07Z) - MAGPIE: A benchmark for Multi-AGent contextual PrIvacy Evaluation [61.92403071137653]
既存のプライバシベンチマークは、タスクの結果に影響を与えることなく、プライベート情報を簡単に省略できる、単純化されたシングルターンインタラクションにのみフォーカスする。
我々は,多エージェント協調型非競合シナリオにおけるプライバシ理解と保存性を評価するための新しいベンチマークであるMAGPIEを紹介する。
評価の結果,GPT-5やGemini 2.5-Proを含む最先端のエージェントは,重大なプライバシー侵害を示すことが明らかとなった。
論文 参考訳(メタデータ) (2025-10-16T23:12:12Z) - Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement [49.15348173246146]
人間の合意を厳格に保証したLCMに基づく評価を提供するための原則的アプローチを提案する。
まず、信頼度評価手法は、ペア評価にモデル選好を不クリティカルに頼ってはならないことを提案する。
そして、この選択的な評価枠組みの下で、人的合意が確実に保証されることを示す。
論文 参考訳(メタデータ) (2024-07-25T20:04:59Z) - Assistive Large Language Model Agents for Socially-Aware Negotiation Dialogues [47.977032883078664]
我々は,ビジネス交渉における対話者を支援する大規模言語モデル(LLM)に基づく支援エージェントを開発する。
第3のLLMは、交渉結果を改善するための基準に違反した発話を書き換える仲介役として機能する。
3つの異なる交渉トピックにわたる交渉において,その効果を示すための実証的証拠を豊富に提供する。
論文 参考訳(メタデータ) (2024-01-29T09:07:40Z) - Learnable Strategies for Bilateral Agent Negotiation over Multiple
Issues [6.12762193927784]
本稿では,利己的なエージェントが複数の問題に対する交渉の仕方を学ぶことのできる,新たな二国間交渉モデルを提案する。
このモデルは、交渉中にエージェントが使うべき戦術を表す解釈可能な戦略テンプレートに依存している。
テンプレートパラメータを学習し、複数の交渉で受け取った平均効用を最大化し、最適な入札受理と生成をもたらす。
論文 参考訳(メタデータ) (2020-09-17T13:52:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。