論文の概要: Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2607.26120v1
- Date: Tue, 28 Jul 2026 17:48:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.435375
- Title: Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems
- Title(参考訳): さらに誤解: 混合移動型LLMマルチエージェントシステムにおける目的的ミスアライメント
- Abstract要約: LLM(Large Language Models)を利用したマルチエージェントシステムは、混合モチベーション環境にますます多くデプロイされている。
本稿では,ソーシャル推論ゲームWerewolfを用いて,客観的なミスアライメントを評価するための新しいフレームワークを提案する。
以上の結果から, 客観的な不適応は, 本質的に敵対的な環境下での結果を損なうことが示唆された。
- 参考スコア(独自算出の注目度): 13.111181135818184
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs)-powered multi-agent systems are increasingly deployed in mixed-motive environments, where agents operate under asymmetric information and strategic deception due to conflicting or hidden objectives. In these settings, misalignment with collective goals becomes a central concern. We propose a novel framework for evaluating objective misalignment using the social deduction game Werewolf, modifying the objective of a single agent while preserving its assigned role. Across LLMs from four different model families and sizes, four player roles, and three objective formulations, we introduce a dual analysis of the agents' internal reasoning and their public cheap-talk behavior (i.e costless, non-binding communication that does not directly affect the agents' utilities), complemented by an analysis of game outcomes. Our results show that objective misalignment undermines outcomes in inherently adversarial environments, an effect exacerbated by asymmetric information and specialized roles. While compromised agents consistently develop distinct objective-dependent reasoning strategies, these adaptations remain largely invisible in their public behavior. More broadly, our findings suggest that even subtle objective misalignment can profoundly affect collective decision-making, highlighting the need for effective mitigation strategies for LLM-based multi-agent systems.
- Abstract(参考訳): LLM(Large Language Models)を利用したマルチエージェントシステムは、エージェントが非対称な情報の下で動作し、競合や隠された目的のために戦略的な騙しを行う混合モチベーション環境において、ますます多くデプロイされている。
これらの設定では、集合的目標との相違が中心的な関心事となる。
本稿では,社会的推論ゲームWerewolfを用いて,目的の相違を評価するための新しいフレームワークを提案する。
4種類のモデルファミリー,サイズ,4つのプレイヤーロール,および3つの客観的な定式化から,エージェントの内部推論と,エージェントの公然の安上がりな振る舞い(コストレスで,エージェントのユーティリティに直接影響しない非結合通信)の二重解析を導入し,ゲーム結果の分析を補完する。
以上の結果から,非対称的な情報や専門的な役割によってさらに悪化する要因である,本質的に敵対的な環境において,客観的な不適応が成果を損なうことが示唆された。
妥協されたエージェントは、客観的に依存した推論戦略を一貫して開発するが、これらの適応は公共の行動においてほとんど見えないままである。
より広い範囲で見れば、微妙な客観的なミスアライメントが集団的な意思決定に深く影響し、LSMベースのマルチエージェントシステムに対する効果的な緩和戦略の必要性が浮かび上がっている。
関連論文リスト
- Persuasive and Compliant Tendencies Predict Group Decision-Making in Humans and Language Models [65.21691850622413]
大規模言語モデル(LLM)は、人間との集団意思決定にますます関与している。
本稿では,各モデルの説得性およびコンプライアンス傾向を測定するための質問紙ベースのフレームワークであるDecisionQEを紹介する。
より強い説得傾向はグループの結果を著しく改善しないが、コンプライアンス指向モデルは協調においてより安定した優位性を示す。
論文 参考訳(メタデータ) (2026-08-08T15:50:56Z) - Fair Agents: Balancing Multistakeholder Alignment in Multi-Agent Personalization Systems [3.2672011446202656]
本稿では,公正なマルチエージェント多人数パーソナライズシステムを設計するための概念的枠組みを提案する。
この枠組みは、(i)利害関係者の目的とLLMエージェントを整合させる手法、(ii)社会的選択理論に基づく集約戦略を統合し、公正な集団決定を形成する。
我々は,観光利用事例を通じて,我々の枠組みを紹介し,教育や医療など他の分野の応用の可能性について論じる。
論文 参考訳(メタデータ) (2026-05-04T09:18:38Z) - FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments [60.3427704389541]
大規模言語モデルは、自律エージェントの意思決定コアとして、ますます多くデプロイされている。
しかし、会話のベンチマークでは、誤った意思決定のカスケード効果のために、これらのエージェントは頻繁に失敗する。
これらの課題に対処するために、Failure-Aware Meta-Agenticフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-28T02:21:53Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Framing Effects in Independent-Agent Large Language Models: A Cross-Family Behavioral Analysis [5.9342526365947625]
本研究では,個別グループ間の利害対立を含むしきい値投票課題において,迅速なフレーミングが意思決定にどのように影響するかを検討する。
その結果、迅速なフレーミングは選択分布に大きく影響し、しばしばリスク-逆オプションに切り替えることが示された。
論文 参考訳(メタデータ) (2026-03-02T16:10:34Z) - A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents [8.007212170802807]
本稿では,行動評価と解釈可能性に基づくモデルの内部表現の分析を統合した目標指向性評価フレームワークを提案する。
我々は,様々なグリッドサイズ,障害物密度,目標構造にまたがる最適政策に対するエージェントの評価を行った。
次に、エージェントの内部表現の環境状態とマルチステップアクション計画のデコードにプローブ法を用いる。
論文 参考訳(メタデータ) (2026-02-09T18:00:28Z) - Understanding LLM Agent Behaviours via Game Theory: Strategy Recognition, Biases and Multi-Agent Dynamics [1.6487772637295166]
我々はFAIRGAMEフレームワークを拡張し、繰り返しの社会的ジレンマにおける大規模言語モデル(LLM)の振る舞いを評価する。
LLMは、言語フレーミングが建築的差異に匹敵する効果を発揮することを示し、体系的、モデル的、言語に依存した行動意図を示す。
論文 参考訳(メタデータ) (2025-12-08T11:40:03Z) - Can an Individual Manipulate the Collective Decisions of Multi-Agents? [53.01767232004823]
M-Spoilerは、マルチエージェントシステム内のエージェントインタラクションをシミュレートして、対向サンプルを生成するフレームワークである。
M-スポイラーは、敵対的サンプルの最適化を積極的に支援するスタブボーン剤を導入した。
本研究は,マルチエージェントシステムにおける個々のエージェントの知識によって引き起こされるリスクを検証した。
論文 参考訳(メタデータ) (2025-09-20T01:54:20Z) - AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents [0.0]
大規模言語モデル (LLM) エージェントはより広く普及し、関連するミスアライメントリスクが増加する。
本研究では,モデルが追求する内部目標と,デプロイ者の意図する目標との相反として,不整合にアプローチする。
現実的なシナリオにおいて,LLMエージェントの適合性を評価するためのベンチマークスイートであるtextscAgentMisalignmentを導入する。
論文 参考訳(メタデータ) (2025-06-04T14:46:47Z) - ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning [53.817538122688944]
Reinforced Meta-thinking Agents (ReMA) を導入し,Large Language Models (LLMs) の推論からメタ思考行動を求める。
ReMAは、推論プロセスを2つの階層的なエージェントに分解する。戦略上の監視と計画を生成するハイレベルなメタ思考エージェントと、詳細な実行のための低レベルな推論エージェントである。
単ターン実験による実験結果から、ReMAは複雑な推論タスクにおいて単エージェントRLベースラインよりも優れることが示された。
論文 参考訳(メタデータ) (2025-03-12T16:05:31Z) - Generative multitask learning mitigates target-causing confounding [61.21582323566118]
マルチタスク学習のための因果表現学習のためのシンプルでスケーラブルなアプローチを提案する。
改善は、目標を狙うが入力はしない、観測されていない共同ファウンダーを緩和することによる。
人の属性とタスクノミーのデータセットに対する我々の結果は、事前の確率シフトに対するロバストネスの概念的改善を反映している。
論文 参考訳(メタデータ) (2022-02-08T20:42:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。