論文の概要: When Agents Lie: Premeditation, Persistence, and Exploitation in Repeated Games
- arxiv url: http://arxiv.org/abs/2607.05132v2
- Date: Tue, 07 Jul 2026 13:17:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.333648
- Title: When Agents Lie: Premeditation, Persistence, and Exploitation in Repeated Games
- Title(参考訳): エージェントが嘘をつくとき : 繰り返し競技における予防・忍耐・爆発
- Authors: Jerick Shi, Terry Jingcheng Zhang, Bernhard Schölkopf, Vincent Conitzer, Zhijing Jin,
- Abstract要約: 10ラウンドにわたる同質群と異質群の6つのゲームにおけるフロンティアモデルの評価を行った。
異なるモデルは発表を無矛盾に解釈し、いくつかはバインディングのコミットメントとして、もうひとつは安価なトークとして解釈する。
- 参考スコア(独自算出の注目度): 69.060029640261
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As large language models are deployed as autonomous agents that communicate intentions before acting, a critical safety question is whether agents that publicly commit to actions will honor those commitments. We place LLM agents in repeated $n$-player games with a three-stage protocol that separates private intent, public announcement, and final action, allowing us to identify whether each deviation from a stated announcement was already planned during private deliberation. Evaluating three frontier models across six games in homogeneous and heterogeneous groups over 10 rounds, we report two findings. First, when agents deviate from their announcements, the deviation is predominantly already stated in their private plan (exceeding 90% in the highest-deception conditions), yet this is not a fixed model property: the same model ranges from perfect honesty to near-total deviation across games. Second, different models interpret announcements incompatibly, some as binding commitments and others as cheap talk, producing payoff gaps that emerge in Round~0 and persist across all 10 rounds. Systems that combine models from different providers therefore cannot assume shared announcement semantics and require empirical testing of model interactions before deployment.
- Abstract(参考訳): 大きな言語モデルは行動する前に意図を伝える自律的なエージェントとしてデプロイされるため、行動に公にコミットするエージェントがこれらのコミットメントを尊重するかどうかが重要な安全上の問題である。
LLMエージェントを3段階のプロトコルで繰り返し$n$-playerゲームに配置し、プライベートインテント、パブリック発表、ファイナルアクションを分離し、公開発表からの逸脱が、すでにプライベートディベート中に計画されているかどうかを判断する。
10ラウンドで同種群と異種群で6つのゲームにまたがる3つのフロンティアモデルを評価し,2つの知見を報告する。
第一に、エージェントが発表から逸脱するとき、その逸脱は、主にプライベートプラン(最も高い着想条件で90%以上)で既に述べられているが、これは固定されたモデル特性ではない。
第2に、さまざまなモデルでは、発表を相反する形で解釈し、バインディングのコミットメントなど、安易な講演として解釈し、ラウンド~0で発生し、10ラウンドすべてにわたって継続するペイオフギャップを生じさせます。
したがって、異なるプロバイダのモデルを組み合わせるシステムは、共有された発表セマンティクスを前提とせず、デプロイ前にモデルインタラクションの実証的なテストを必要とします。
関連論文リスト
- Agent Island: A Saturation- and Contamination-Resistant Benchmark from Multiagent Games [0.0]
我々は,言語モデルエージェントが相互協力,対立,説得のゲームで競うマルチプレイヤーシミュレーション環境であるエージェントアイランドを紹介した。
ベイズプラケット・ルーキーモデルでプレイヤーをランク付けし、プレイヤースキルの不確実性を定量化する。
49のユニークなモデルを含む999のゲームでは、openai/gpt-5.5が5.64で、第2位のモデルであるopenai/gpt-5.2と第3位のモデルであるopenai/gpt-5.3-codexの2.86と、ピアを圧倒している。
論文 参考訳(メタデータ) (2026-05-05T21:24:58Z) - Cheap Talk, Empty Promise: Frontier LLMs easily break public promises for self-interest [32.09232866919422]
単発のノーマルフォームゲームにおいて、公に発表されたアクションから逸脱した偽装について検討する。
偏差タイプごとにすべての機会を特定し、エージェントがそれらを利用する頻度を測定する。
論文 参考訳(メタデータ) (2026-04-06T15:54:16Z) - Robust Planning for Autonomous Driving via Mixed Adversarial Diffusion Predictions [51.88828388720111]
本稿では、通常と逆のエージェント予測を混合した自律運転のロバストな計画手法について述べる。
本研究では,実験時の拡散モデルに偏りを生じさせ,候補計画と衝突する可能性のある予測を生成することにより,逆予測の分布を生成する。
本手法が単エージェントおよび多エージェントジェイウォーキングシナリオおよび赤信号違反シナリオに与える影響について述べる。
論文 参考訳(メタデータ) (2025-05-18T09:44:57Z) - On Corrigibility and Alignment in Multi Agent Games [0.0]
自律エージェントの信頼性はシステム設計の未調査部分である。
人間の嗜好に対する不確実性は、人間の不合理性に直面した場合でも、エージェントを矯正するために働くことが示唆されている。
本稿では,エージェントが常に人間に監督を依頼できる2人プレイヤゲームとして,マルチエージェント設定でコーリライザをモデル化するための一般的な枠組みを提案する。
論文 参考訳(メタデータ) (2025-01-09T16:44:38Z) - Generative Agents for Multi-Agent Autoformalization of Interaction Scenarios [3.5083201638203154]
本稿では,GAMA(Generative Agents for Multi-Agent Autoformalization)フレームワークを紹介する。
GAMAは大規模言語モデル(LLM)を付加したエージェントを用いたシミュレーションにおける相互作用シナリオの形式化を自動化する
5つの2x2同時移動ゲームにおける110の自然言語記述の実験では、GAMAは100%構文的、76.5%の意味的正当性を達成している。
論文 参考訳(メタデータ) (2024-12-11T22:37:45Z) - Safe Exploitative Play with Untrusted Type Beliefs [21.177698937011183]
本研究では,複数のエージェントからなるシステムにおいて,一つのエージェントを制御するという考え方について検討する。
この種の信念は、しばしば過去の行動から学び、誤りである可能性が高い。
リスクと機会のトレードオフを定義し、最適のペイオフに対して得られるペイオフを比較します。
論文 参考訳(メタデータ) (2024-11-12T09:49:16Z) - Bandit Social Learning: Exploration under Myopic Behavior [54.767961587919075]
オンラインプラットフォーム上でのレビューによって動機付けられた社会学習のダイナミクスについて検討する。
エージェントはまとめて単純なマルチアームのバンディットプロトコルに従うが、各エージェントは探索を伴わずにミオプティカルに振る舞う。
このような振る舞いに対して,スターク学習の失敗を導出し,好意的な結果を提供する。
論文 参考訳(メタデータ) (2023-02-15T01:57:57Z) - Cooperative Online Learning in Stochastic and Adversarial MDPs [50.62439652257712]
我々は、協調的オンライン学習と敵対的マルコフ決定過程(MDP)について研究する。
各エピソードでは、$m$エージェントが同時にMDPと対話し、個人の後悔を最小限に抑えるために情報を共有する。
協調強化学習(RL)を非フレッシュランダム性, あるいは敵対的MDPで検討したのは, 初めてである。
論文 参考訳(メタデータ) (2022-01-31T12:32:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。