論文の概要: Moral Hazard in Multi-Agent Language Models
- arxiv url: http://arxiv.org/abs/2607.23982v2
- Date: Tue, 28 Jul 2026 08:51:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 14:13:57.675496
- Title: Moral Hazard in Multi-Agent Language Models
- Title(参考訳): マルチエージェント言語モデルにおけるモラルハザード
- Authors: Dane Malenfant,
- Abstract要約: 社会的に価値のある努力がコストがかかり、弱く観察可能で、主に他人に利益をもたらす場合、協力は失敗する。
本稿では,対話型モラル・ハザードゲームについて紹介する。
各エピソードにおいて、エージェントは即時ローカル報酬を保存したり、クエリコストを支払って隠れた安全事実を明らかにすることができる。
- 参考スコア(独自算出の注目度): 0.5801621787540268
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cooperation can fail when socially valuable effort is costly, weakly observable, and mainly benefits others. Drawing on Holmström's team moral-hazard model, we introduce the Dialogue Moral Hazard Game, a controlled textual game that operationalizes this hidden-action structure for language agents. In each episode, an agent can preserve an immediate local reward or pay a query cost to reveal a hidden safety fact that primarily helps another agent's downstream decision. We evaluate seven open-weight language models and one frontier API model, decomposing behavior into query use, realized information transfer, local-reward preservation, unsafe choice, format validity, and team success. Base open-weight models commonly preserve local reward without team success or query without communicating information that changes the final decision. GPT-5.6 Sol reaches ceiling behavior in the primary setting, and autonomous sweeps respond strongly to query cost and team reward. In a 3,015-decision incentive-isolation experiment with scripted partners, its empirical query threshold tracks the Holmström-derived private-share boundary across nine query costs with mean absolute error 0.013. We then use supervised fine-tuning, RLOO, sequential SFT+RLOO, and GEPA prompt optimization as diagnostic update mechanisms where coverage permits. Their effects are heterogeneous: OLMo-7B shows the clearest mechanism-consistent weight-level improvement, whereas GEPA sometimes improves team success while reducing or eliminating costly queries. Thus, optimization can shift aggregate reward without recovering the intended cooperative mechanism, motivating evaluations that report mechanism-level behavior rather than team success alone.
- Abstract(参考訳): 社会的に価値のある努力がコストがかかり、弱く観察可能で、主に他人に利益をもたらす場合、協力は失敗する。
ホルムストロームのチームモラルハザードモデルに基づいて、言語エージェントの隠れアクション構造を運用する制御されたテキストゲームであるダイアログモラルハザードゲームを導入する。
各エピソードでは、エージェントが即時ローカル報酬を保存したり、クエリコストを支払ったりして、他のエージェントの下流決定に主に役立つ隠れた安全事実を明らかにすることができる。
我々は、7つのオープンウェイト言語モデルと1つのフロンティアAPIモデルを評価し、クエリ使用への振る舞いの分解、情報転送の実現、ローカルリワード保存、安全でない選択、フォーマットの妥当性、チームの成功について検討した。
ベースとなるオープンウェイトモデルは、チームの成功やクエリなしに、最終的な決定を変える情報を伝えることなく、ローカルな報酬を保存するのが一般的です。
GPT-5.6 ソルは一次設定で天井の挙動に到達し、自律的なスイープはクエリコストとチーム報酬に強く反応する。
スクリプト付きパートナーによる3,015のインセンティブ・アイソレーション実験において、実験的なクエリしきい値は、平均絶対誤差0.013で、ホルムストローム由来のプライベートシェア境界を9つのクエリコストで追跡する。
次に、教師付き微調整、RLOO、シーケンシャルSFT+RLOO、GEPAの最適化を、カバレッジが許容する診断更新メカニズムとして利用する。
OLMo-7Bは、最も明確なメカニズム一貫性のあるウェイトレベル改善を示し、GEPAは、コストのかかるクエリを削減または削除しながら、チームの成功を改善する。
したがって、最適化は、意図した協調メカニズムを回復することなく、アグリゲーション報酬をシフトさせ、チームの成功単独ではなく、メカニズムレベルの振る舞いを報告する評価を動機付けることができる。
関連論文リスト
- A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism [11.543353599329675]
検証可能な報酬を伴う強化学習は、より強力なエージェントを生み出すことを期待して、監督されたチェックポイントで日常的に実行される。
4Bから8Bのスケールで、小さな言語とビジョン言語モデルWebエージェントにスキルを追加するかどうかを問う。
エージェントがほとんどマスターしたタスクに対して、強力な教師付きベースラインの成功率を確実に改善する構成は存在しない。
論文 参考訳(メタデータ) (2026-07-14T11:17:35Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Robust Multi-Agent LLMs under Byzantine Faults [12.778788735297288]
大規模言語モデル(LLM)エージェントは、信頼性を向上させるためにピアツーピアネットワークを介して協力する傾向にある。
信頼性の低いエージェントやビザンティンのエージェントは、近隣のエージェントを誤った結論へと誘導し、システム全体の性能を低下させる可能性がある。
既存の手法は、リーダーベースの調整や自己報告された信頼に依存しており、どちらも敵の操作に影響を受けやすい。
論文 参考訳(メタデータ) (2026-05-09T17:37:43Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - The Oversight Game: Learning to Cooperatively Balance an AI Agent's Safety and Autonomy [9.553819152637493]
エージェントが自律的に行動するか(プレイ)それとも延期するかを選択できる最小限の制御インタフェースについて検討する。
エージェントがフェールした場合、人間の選択によって結果が決定され、修正アクションやシステム停止につながる可能性がある。
本分析では,アライメント保証を提供するゲームクラスであるMarkov Potential Game (MPG) として,このゲームが適するケースに着目した。
論文 参考訳(メタデータ) (2025-10-30T17:46:49Z) - Stochastic Self-Organization in Multi-Agent Systems [28.70691568233268]
LLM(Large Language Models)に基づくマルチエージェントシステム(MAS)は、単一のLLMの範囲を超えているタスクを解く可能性がある。
通信をオンザフライで適応する応答条件付きフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-01T09:08:04Z) - When Disagreements Elicit Robustness: Investigating Self-Repair Capabilities under LLM Multi-Agent Disagreements [56.29265568399648]
我々は、不一致が早期のコンセンサスを防ぎ、探索されたソリューション空間を拡張することを主張する。
タスククリティカルなステップの相違は、ソリューションパスのトポロジによってコラボレーションを損なう可能性がある。
論文 参考訳(メタデータ) (2025-02-21T02:24:43Z) - Preventing Rogue Agents Improves Multi-Agent Collaboration [21.955058255432974]
本稿では,アクション予測中にエージェントを監視し,将来エラーが発生する可能性がある場合に介入することを提案する。
WhoDunitEnv、コード生成タスク、そしてリソース持続可能性のためのGovSim環境の実験は、我々のアプローチがパフォーマンスを大幅に向上させることを示している。
論文 参考訳(メタデータ) (2025-02-09T18:35:08Z) - Jailbreaking as a Reward Misspecification Problem [80.52431374743998]
本稿では,この脆弱性をアライメントプロセス中に不特定性に対処する新たな視点を提案する。
本稿では,報酬の相違の程度を定量化し,その有効性を実証する指標ReGapを紹介する。
ReMissは、報酬ミスの空間で敵のプロンプトを生成する自動レッドチームリングシステムである。
論文 参考訳(メタデータ) (2024-06-20T15:12:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。