論文の概要: A Benchmark for Multi-Party Negotiation Games from Real Negotiation Data
- arxiv url: http://arxiv.org/abs/2603.14066v1
- Date: Sat, 14 Mar 2026 18:12:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-17 16:19:35.577628
- Title: A Benchmark for Multi-Party Negotiation Games from Real Negotiation Data
- Title(参考訳): 実数ネゴシエーションデータを用いた多人数ネゴシエーションゲームのベンチマーク
- Abstract要約: 複数政党の交渉はしばしば、単一の最終結果ではなく、束縛の順序、行動レベルのコミットメントとして展開される。
本稿では、インセンティブアライメント、ゴール複雑性、ペイオフ分布などの重要な構造特性を網羅するゲームジェネレータを特徴とする、未研究のシステムに対するベンチマークを紹介する。
我々は3つの値関数近似(筋力報酬、楽観的な上界、悲観的な下界)をテストし、取引評価においてバイアスレンズとして機能する。
- 参考スコア(独自算出の注目度): 13.621543549302466
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many real-world multi-party negotiations unfold as sequences of binding, action-level commitments rather than a single final outcome. We introduce a benchmark for this under-studied regime featuring a configurable game generator that sweeps key structural properties such as incentive alignment, goal complexity, and payoff distribution. To evaluate decision-making, we test three value-function approximations - myopic reward, an optimistic upper bound, and a pessimistic lower bound - that act as biased lenses on deal evaluation. Through exact evaluation on small games and comparative evaluation on large, document-grounded instances derived from the Harvard Negotiation Challenge, we map the strategic regimes where each approximation succeeds or fails. We observe that different game structures demand different valuation strategies, motivating agents that learn robust state values and plan effectively over long horizons under binding commitments and terminal only rewards.
- Abstract(参考訳): 多くの実世界のマルチパーティ交渉は、単一の最終結果ではなく、バインディングのシーケンス、アクションレベルのコミットメントとして展開する。
本稿では, インセンティブアライメント, ゴール複雑性, ペイオフ分布などの重要な構造特性を網羅する構成可能なゲームジェネレータを特徴とする, 未研究のシステムに対するベンチマークを紹介する。
意思決定を評価するために,3つの値関数近似(筋力報酬,楽観的上界,悲観的下界)を,取引評価においてバイアスレンズとして機能する。
ハーバード・ネゴシエーション・チャレンジ(Harvard Negotiation Challenge)から得られた,小規模なゲームに対する正確な評価と,大規模で文書化されたインスタンスの比較評価を通じて,各近似が成功するか失敗するかの戦略体制をマップする。
我々は、異なるゲーム構造が異なる評価戦略を必要とし、ロバストな状態の値を学習し、バインドコミットメントと端末のみの報酬の下で効果的に長い地平線を計画するエージェントを動機付けていることを観察する。
関連論文リスト
- CABAL: Multi-Agent Simulacra for Tracing the Effects of Collusive Bidding in Peer Review [20.449658717520876]
algは、レビュアーの割り当ての整合性を研究するための、エンドツーエンドのマルチエージェント・シミュラクラフレームワークである。
我々は,相互レビュアと紙の親和性を利用して共役環を構築する親和性誘導型共役入札戦略を開発した。
論文 参考訳(メタデータ) (2026-09-04T14:55:33Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs [54.81359054218573]
大規模言語モデル(LLM)のためのマルチゲームアリーナと評価プラットフォームであるMindgamesを紹介する。
Mindgamesは、統合されたインタラクションインターフェース、TrueSkillベースの評価、および4つのゲーム環境にわたる完全な軌跡ログを提供する。
我々は,決定論的オフライントーナメントプロトコルMG-Refとともに,ターンレベルの観察,アクション,報酬を含む29,571個のマルチエージェントゲームを分析した。
論文 参考訳(メタデータ) (2026-05-28T07:33:47Z) - SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution [82.31558282651811]
複雑な対人相互作用をナビゲートするソーシャルインテリジェンスは、言語エージェントに根本的な課題を提示する。
既存のアプローチでは、言語モデルを直接使用してエピソードレベルの報酬を分配する。
協調ゲーム理論に基づく新しい原理的枠組みであるSAVOIRを提案する。
論文 参考訳(メタデータ) (2026-04-21T02:08:25Z) - Training Language Models for Bilateral Trade with Private Information [47.25254982913256]
貿易の利益を達成するためには、個人、戦略的余剰の合理性、協力が必要である。
本研究では,大規模言語モデルがイベント駆動シミュレータ内のツールコールを介して交渉する構造化交渉環境を開発する。
この環境は、フロンティアモデルのベンチマークと、強化学習によるオープンウェイトモデルのトレーニング環境という2つの目的を果たす。
論文 参考訳(メタデータ) (2026-04-10T03:04:20Z) - Is Softmax Loss All You Need? A Principled Analysis of Softmax-family Loss [91.61796429377041]
ソフトマックスの損失は、分類とランキングのタスクにおいて最も広く使用されるサロゲートの目標の1つである。
本研究では,異なるサロゲートが分類とランキングの指標との整合性を達成するかどうかを考察し,それらの勾配ダイナミクスを分析して,異なる収束挙動を明らかにする。
本研究は,大規模機械学習アプリケーションにおける損失選択の実践的ガイダンスとして,原則的基礎を確立した。
論文 参考訳(メタデータ) (2026-01-30T09:24:52Z) - Reducing Optimism Bias in Incomplete Cooperative Games [0.0]
協調ゲームにおける連立価値を明らかにするためのシーケンスの最適化を目的としたフレームワークを提案する。
筆者らのコントリビューションは3つある: (i) 個々のプレイヤーの楽観的な連立価値の達成と、より効率的な最適化を促進するための分析的特性について検討し、 (ii) オフライン・オンライン両方の方法で追加連立価値を開示し、このギャップを最小限に抑える方法、 (iii) 実践シナリオにおけるアルゴリズムの性能を実証的に示す。
論文 参考訳(メタデータ) (2024-02-02T21:58:26Z) - Evaluating Language Model Agency through Negotiations [39.87262815823634]
ネゴシエーションゲームにより、マルチターン、クロスモデル相互作用、複雑性の変調、およびサイドステップの偶発的データ漏洩を研究できる。
提案手法は,広く使用されている6つのLMをテストし,セルフプレイとクロスプレイの両方で性能とアライメントを評価する。
論文 参考訳(メタデータ) (2024-01-09T13:19:37Z) - Cooperation, Competition, and Maliciousness: LLM-Stakeholders Interactive Negotiation [52.930183136111864]
我々は,大言語モデル(LLM)を評価するためにスコーラブルネゴシエーション(scorable negotiations)を提案する。
合意に達するには、エージェントは強力な算術、推論、探索、計画能力を持つ必要がある。
我々は、新しいゲームを作成し、進化するベンチマークを持つことの難しさを増大させる手順を提供する。
論文 参考訳(メタデータ) (2023-09-29T13:33:06Z) - Cooperation or Competition: Avoiding Player Domination for Multi-Target
Robustness via Adaptive Budgets [76.20705291443208]
我々は、敵攻撃を、異なるプレイヤーがパラメータ更新の合同方向で合意に達するために交渉する交渉ゲームであると見なしている。
我々は、プレイヤーの優位性を避けるために、異なる敵の予算を調整する新しいフレームワークを設計する。
標準ベンチマークの実験では、提案したフレームワークを既存のアプローチに適用することで、マルチターゲットロバスト性が大幅に向上することが示された。
論文 参考訳(メタデータ) (2023-06-27T14:02:10Z) - Provably Efficient Fictitious Play Policy Optimization for Zero-Sum
Markov Games with Structured Transitions [145.54544979467872]
本研究では,ゼロサムマルコフゲームに対して,構造的だが未知の遷移を伴う架空のプレイポリシー最適化アルゴリズムを提案し,解析する。
我々は、2年制の競争ゲームシナリオで、$K$のエピソードに続き、$widetildemathcalO(sqrtK)$ regret boundsを証明した。
提案アルゴリズムは,アッパー信頼境界(UCB)型最適化と,同時政策最適化の範囲内での架空のプレイの組み合わせを特徴とする。
論文 参考訳(メタデータ) (2022-07-25T18:29:16Z) - Energy-Based Learning for Cooperative Games, with Applications to
Feature/Data/Model Valuations [91.36803653600667]
本稿では, 最大エントロピーフレームワークによる理論的正当性を備えた, 協調ゲームのための新しいエネルギーベース処理法を提案する。
驚くべきことに、エネルギーベースモデルの変分推論を行うことで、Shapley値やBanzhafインデックスといった様々なゲーム理論の評価基準を復元する。
提案する変分指数は,特定の合成および実世界のバリュエーション問題において,興味深い特性を享受できることを実験的に実証した。
論文 参考訳(メタデータ) (2021-06-05T17:39:04Z) - Multi-Stage Decentralized Matching Markets: Uncertain Preferences and
Strategic Behaviors [91.3755431537592]
本稿では、現実世界のマッチング市場で最適な戦略を学ぶためのフレームワークを開発する。
我々は,不確実性レベルが特徴の福祉対フェアネストレードオフが存在することを示す。
シングルステージマッチングと比較して、マルチステージマッチングで参加者がより良くなることを証明します。
論文 参考訳(メタデータ) (2021-02-13T19:25:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。