論文の概要: Moral Hazard in Multi-Agent Language Models
- arxiv url: http://arxiv.org/abs/2607.23982v1
- Date: Mon, 27 Jul 2026 04:13:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.305387
- Title: Moral Hazard in Multi-Agent Language Models
- Title(参考訳): マルチエージェント言語モデルにおけるモラルハザード
- Abstract要約: 社会的に価値のある努力がコストがかかり、弱く観察可能で、主に他人に利益をもたらす場合、協力は失敗する。
本稿では,対話型モラル・ハザードゲームについて紹介する。
我々は、7つのオープンウェイト言語モデルを評価し、クエリ使用、実現された情報伝達、ローカルリワード保存、安全でない選択、フォーマットの妥当性、チームの成功に振る舞いを分解する。
- 参考スコア(独自算出の注目度): 0.5801621787540268
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cooperation can fail when socially valuable effort is costly, weakly observable, and mainly benefits others. Drawing on Holmström's team moral-hazard model, we introduce the Dialogue Moral Hazard Game, a controlled textual game that operationalizes this hidden-action structure for language agents. In each episode, an agent can preserve an immediate local reward or pay a query cost to reveal a hidden safety fact that primarily helps another agent's downstream decision. We evaluate seven open-weight language models and decompose behavior into query use, realized information transfer, local-reward preservation, unsafe choice, format validity, and team success. Base models commonly preserve local reward without team success or query without communicating information that changes the final decision. We then use supervised fine-tuning, RLOO, sequential SFT+RLOO, and GEPA prompt optimization as diagnostic update mechanisms. Their effects are heterogeneous: OLMo-7B shows the clearest mechanism-consistent weight-level improvement, whereas GEPA sometimes improves team success while reducing or eliminating costly queries. Thus, optimization can shift aggregate reward without recovering the intended cooperative mechanism, motivating evaluations that report mechanism-level behavior rather than team success alone.
- Abstract(参考訳): 社会的に価値のある努力がコストがかかり、弱く観察可能で、主に他人に利益をもたらす場合、協力は失敗する。
ホルムストロームのチームのモラル・ハザードモデルに基づいて、言語エージェントのこの隠れアクション構造を運用する制御されたテキストゲームであるダイアログ・モラル・ハザードゲームを導入する。
各エピソードでは、エージェントが即時ローカル報酬を保存したり、クエリコストを支払ったりして、他のエージェントの下流決定に主に役立つ隠れた安全事実を明らかにすることができる。
我々は、7つのオープンウェイト言語モデルを評価し、クエリ使用、実現された情報伝達、ローカルリワード保存、安全でない選択、フォーマットの妥当性、チームの成功に振る舞いを分解する。
ベースモデルは、チームの成功やクエリなしに、最終的な決定を変える情報を伝えることなく、ローカルな報酬を保存するのが一般的です。
次に、教師付き微調整、RLOO、シーケンシャルSFT+RLOO、GEPAを診断更新機構として利用する。
OLMo-7Bは、最も明確なメカニズム一貫性のあるウェイトレベル改善を示し、GEPAは、コストのかかるクエリを削減または削除しながら、チームの成功を改善する。
したがって、最適化は、意図した協調メカニズムを回復することなく、アグリゲーション報酬をシフトさせ、チームの成功単独ではなく、メカニズムレベルの振る舞いを報告する評価を動機付けることができる。
関連論文リスト
- Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems [40.47928908205563]
マルチエージェントLLMシステムは、一般的にオーケストレータを使用して、労働者のチームのためにタスクを分解し、テキストリフレクションによって改善する。
強い実証結果にもかかわらず、これらのシステムには調整、メモリ改善、外部検証の役割の統一的な説明が欠けている。
我々は,評価のための信頼ゲーティングと,断片的な静止環境に対する保証の再集計を行う。
実験では、これらのオブジェクトを環境条件付きメトリクスでインスタンス化し、予測調整法則とドリフト法則をテストする。
論文 参考訳(メタデータ) (2026-09-02T15:50:10Z) - Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization [13.354353071601379]
我々は、特権付き監督を成果ベースアクションクレジットに変換するTASPOを紹介する。
3つのエージェントベンチマークで、TASPOはGRPOよりも10.6%改善し、目に見えないタスクを一般化する。
論文 参考訳(メタデータ) (2026-08-31T16:51:50Z) - Safety Invariants for Agents Orchestrating Irreversible State Transitions: A Four-Dimensional Formalism Evaluated on Public Ledgers [0.0]
フォーマリズムを使って、実行忠実性( executionfidelity)と呼ばれる保証を記述し、証明します。
7つの安全不変量は、経験から数えられるのではなく、忠実性条件に由来するもので、保証を解除する。
システムはデプロイされ、8つのチェーンにまたがる108のプロダクション書き込み操作によって、障害分類が復活する。
論文 参考訳(メタデータ) (2026-08-01T17:29:42Z) - Rolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational Interviewing [0.6372261626436676]
モチベーション・インタヴュー(MI)では、クライアントの持続的なトーク(現状に関する議論)が、カウンセラーに抵抗を伴って展開するよう呼びかけるが、これは2つの方法で失敗する可能性がある。
モチベーション型面接処理統合 (MITI) コード, ゴールパーシスタンス (GP) およびアテンション (RA) のカウンセラー応答の2軸評価を導入する。
優先最適化によって1つの障害を罰することは、転がり抵抗の反作用を引き起こすかどうかを問う。
論文 参考訳(メタデータ) (2026-07-30T20:16:03Z) - A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism [11.543353599329675]
検証可能な報酬を伴う強化学習は、より強力なエージェントを生み出すことを期待して、監督されたチェックポイントで日常的に実行される。
4Bから8Bのスケールで、小さな言語とビジョン言語モデルWebエージェントにスキルを追加するかどうかを問う。
エージェントがほとんどマスターしたタスクに対して、強力な教師付きベースラインの成功率を確実に改善する構成は存在しない。
論文 参考訳(メタデータ) (2026-07-14T11:17:35Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Robust Multi-Agent LLMs under Byzantine Faults [12.778788735297288]
大規模言語モデル(LLM)エージェントは、信頼性を向上させるためにピアツーピアネットワークを介して協力する傾向にある。
信頼性の低いエージェントやビザンティンのエージェントは、近隣のエージェントを誤った結論へと誘導し、システム全体の性能を低下させる可能性がある。
既存の手法は、リーダーベースの調整や自己報告された信頼に依存しており、どちらも敵の操作に影響を受けやすい。
論文 参考訳(メタデータ) (2026-05-09T17:37:43Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning [52.48243762705385]
Chain of Uncertain Rewards (CoUR)は、大きな言語モデル(LLM)を統合して報酬関数の設計と評価を効率化する新しいフレームワークである。
我々は、CoURがより良い性能を実現し、報酬評価のコストを大幅に削減できることを示します。
論文 参考訳(メタデータ) (2026-04-15T05:44:14Z) - Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation [50.696688705287755]
我々は、強化学習におけるスパース報酬課題を克服するために、相互情報自己評価を提案する。
MISEにより、エージェントは、疎外的信号を補う高密度な内部報酬から自律的に学習することができる。
我々は、後見自己評価報酬を利用することは、政策と代行報酬政策の間のKL分散項と相互情報を組み合わせた目的を最小化することと等価であることを示す。
論文 参考訳(メタデータ) (2026-04-13T15:18:51Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - A Blueprint for Self-Evolving Coding Agents in Vehicle Aerodynamic Drag Prediction [9.020568132598827]
本稿では, 産業制約下でのドラッグ係数$C_d$を予測するために, 実行可能サロゲートパイプラインを検出する自己進化型符号化エージェントの契約中心の青写真を提案する。
この方法は、静的モデルインスタンスではなく、プログラム上の制約付き最適化としてサロゲート発見を定式化する。
厳しい評価契約は、任意の候補が承認される前に、漏洩防止、決定論的リプレイ、マルチシード、ロバスト性、資源予算を強制する。
論文 参考訳(メタデータ) (2026-03-23T08:36:57Z) - Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models [68.45272703833209]
現状のPRMは、逆最適化圧力下で体系的に利用可能であることを示す。
これらの脆弱性を定量化するために、敵の圧力を増大させる3段階の診断フレームワークを導入する。
我々は、PRM-BiasBenchと診断ツールキットをリリースし、デプロイ前にロバストネスの評価を可能にする。
論文 参考訳(メタデータ) (2026-02-20T23:38:03Z) - The Oversight Game: Learning to Cooperatively Balance an AI Agent's Safety and Autonomy [9.553819152637493]
エージェントが自律的に行動するか(プレイ)それとも延期するかを選択できる最小限の制御インタフェースについて検討する。
エージェントがフェールした場合、人間の選択によって結果が決定され、修正アクションやシステム停止につながる可能性がある。
本分析では,アライメント保証を提供するゲームクラスであるMarkov Potential Game (MPG) として,このゲームが適するケースに着目した。
論文 参考訳(メタデータ) (2025-10-30T17:46:49Z) - Stochastic Self-Organization in Multi-Agent Systems [28.70691568233268]
LLM(Large Language Models)に基づくマルチエージェントシステム(MAS)は、単一のLLMの範囲を超えているタスクを解く可能性がある。
通信をオンザフライで適応する応答条件付きフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-01T09:08:04Z) - When Disagreements Elicit Robustness: Investigating Self-Repair Capabilities under LLM Multi-Agent Disagreements [56.29265568399648]
我々は、不一致が早期のコンセンサスを防ぎ、探索されたソリューション空間を拡張することを主張する。
タスククリティカルなステップの相違は、ソリューションパスのトポロジによってコラボレーションを損なう可能性がある。
論文 参考訳(メタデータ) (2025-02-21T02:24:43Z) - Preventing Rogue Agents Improves Multi-Agent Collaboration [21.955058255432974]
本稿では,アクション予測中にエージェントを監視し,将来エラーが発生する可能性がある場合に介入することを提案する。
WhoDunitEnv、コード生成タスク、そしてリソース持続可能性のためのGovSim環境の実験は、我々のアプローチがパフォーマンスを大幅に向上させることを示している。
論文 参考訳(メタデータ) (2025-02-09T18:35:08Z) - Jailbreaking as a Reward Misspecification Problem [80.52431374743998]
本稿では,この脆弱性をアライメントプロセス中に不特定性に対処する新たな視点を提案する。
本稿では,報酬の相違の程度を定量化し,その有効性を実証する指標ReGapを紹介する。
ReMissは、報酬ミスの空間で敵のプロンプトを生成する自動レッドチームリングシステムである。
論文 参考訳(メタデータ) (2024-06-20T15:12:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。