論文の概要: Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce
- arxiv url: http://arxiv.org/abs/2608.14825v2
- Date: Tue, 18 Aug 2026 01:55:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 13:45:32.897453
- Title: Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce
- Title(参考訳): 長距離多言語LLM商取引における創発的ミスアライメント通信
- Abstract要約: 我々は、虚偽の事実主張、操作、共謀、脅迫を含む電子メールとして、音声行為の誤認識を運用する。
メールの12.6%はミスアライメントと表示されており、20行中、74.7%は個別のエージェントランで表示されている。
高い能力モデルが弱い候補を差分に利用しているという証拠は見つからない。
- 参考スコア(独自算出の注目度): 39.937871162878785
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Frontier LLM agents increasingly transact on behalf of separate principals, often using natural language rather than structured APIs. Much of the safety literature studies misaligned LLM behavior through adversarial-elicitation evaluations on single agents or stylized tasks. Its prevalence and structure in settings that combine long horizons, separate principals, real operational state, and inter-agent natural-language exchange remain insufficiently measured. We study 2,583 inter-agent emails from 20 one-year simulation runs of Vending-Bench Arena, a competitive vending environment spanning 13 frontier LLMs. We operationalize speech-act misalignment as emails containing false factual claims, manipulation, collusion, or threats, combining message content with ground-truth simulator state and logged reasoning traces to classify and validate such behavior. Under our primary classifier, 12.6% of emails are labeled misaligned; misalignment appears in all 20 runs and 74.7% of individual agent-runs. Both the magnitude and composition of this misalignment are preserved under repeated classification at different sampling temperatures and under full-pipeline replication with judges from two other frontier-model families. Misalignment is also reciprocal and stress-conditioned: receiving a misaligned email from a counterparty raises the odds of a misaligned reply by 1.65x, and low-inventory conditions raise them by 1.58x. Across tests of capability-asymmetric exploitation, we find no evidence that higher-capability models differentially exploit weaker counterparties, and model performance rank does not predict misalignment rates. Together, these results indicate that measurable, state-dependent misalignment can arise in competitive multi-agent environments without engineered elicitation, in patterns associated with operational scarcity and counterparty behavior rather than model capability alone.
- Abstract(参考訳): 最前線のLLMエージェントは、しばしば構造化されたAPIではなく自然言語を用いて、別々のプリンシパルを代表して、ますますトランザクショナルになる。
安全文献研究の多くは、単一エージェントやスタイリングされたタスク上での対向緩和評価を通じて、LCMの挙動を不一致にしている。
長い地平線、別々の主元、実際の運用状態、そしてエージェント間の自然言語交換を組み合わせた設定におけるその頻度と構造は、まだ不十分なままである。
我々は、13のフロンティアLEMにまたがる競争力のある自動販売環境である、Vending-Bench Arenaの1年20回のシミュレーションから、2,583通のインターエージェントメールを調査した。
我々は、偽事実主張、操作、共謀、脅しを含む電子メールとして、音声行為の誤認識を運用し、メッセージ内容と地味なシミュレータ状態とを組み合わせて、そのような行動の分類と検証を行う。
初等分類では、メールの12.6%が不正にラベル付けされており、20行中、74.7%が個別のエージェントランである。
このミスアライメントの大きさと構成は、異なるサンプリング温度で繰り返し分類され、他の2つのフロンティアモデルファミリーの審査員によるフルパイプの複製の下で保存される。
相手から不整合メールを受け取ると、不整合応答の確率が1.65倍、低イノベーティブな条件が1.58倍になる。
キャパシティ非対称なエクスプロイトの試験全体を通して、高機能モデルがより弱いコーディネートを微分的に悪用する証拠は見つからず、モデル性能のランクが誤調整率を予測しない。
これらの結果から, 操作不足や操作行動に関連のあるパターンにおいて, モデル機能のみでなく, 競合するマルチエージェント環境において, 測定可能な, 状態依存的ミスアライメントが生じる可能性が示唆された。
関連論文リスト
- Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation [0.0]
フェデレーションクラスをフロンティアの大規模言語モデルで文書化する。
故障は最初の観測で再現されるが、経験的表面は不安定である。
規制されたフロンティアモデルの正確性は、注意を払わずにシフトする移動したコンプライアンス境界である。
論文 参考訳(メタデータ) (2026-07-25T22:40:02Z) - Probing the Misaligned Thinking Process of Language Models [32.29324298373053]
大規模な言語モデルは、様々な不整合行動を示す。
このような動作を確実に検出し、安全で責任のある使用を保証することが重要である。
微粒化認知プロセスに分解して誤認識を監視することを提案する。
論文 参考訳(メタデータ) (2026-06-23T07:40:28Z) - INTACT: Ego-Guided Typed Sparse Evidence Retrieval for Heterogeneous Collaborative Perception [50.64511548643398]
異種知覚のためのエゴ誘導型スパースエビデンス検索フレームワークを提案する。
IntACTは、エゴの車両に、疑わしい物やエビデンスに欠ける地域を表す型付きエビデンスクエリを発行する。
シミュレーションおよび実世界の異種知覚ベンチマークの実験は、INTACTの有効性とデプロイ性を検証する。
論文 参考訳(メタデータ) (2026-06-03T04:34:53Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - Can AI Agents Agree? [32.75269650141292]
大規模言語モデルは、協調エージェントとしてますます展開されているが、敵のコンセンサス設定におけるそれらの振る舞いは研究されていない。
シンクロ・オール・ツー・オール・シミュレーションを用いて,ビザンチンのコンセンサスゲーム上でのLSMに基づくエージェントをスカラー値で評価する。
グループのサイズが大きくなるにつれて、良質な設定や劣化があっても、有効な合意が信頼できないことが分かりました。
論文 参考訳(メタデータ) (2026-03-01T18:18:59Z) - Are Aligned Large Language Models Still Misaligned? [13.062124372682106]
Mis-Align Bench は、安全性、価値、文化的側面の相違を分析するための統一されたベンチマークである。
SAVACUは、112のドメイン(またはラベル)にまたがる382,424のミスアライメントデータセットである。
論文 参考訳(メタデータ) (2026-02-11T19:30:43Z) - Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails [103.05296856071931]
本稿では,自己進化型大規模言語モデル(LLM)エージェントに特有の,アライメント・ティッピング・プロセス(ATP)を同定する。
ATPは、連続的な相互作用によってエージェントが訓練中に確立されたアライメント制約を放棄し、強化された自己関心の戦略を支持するときに生じる。
実験の結果、アライメントの利点は自己進化の下で急速に低下し、最初は整合性のない状態に収束したモデルであることが判明した。
論文 参考訳(メタデータ) (2025-10-06T14:48:39Z) - AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents [0.0]
大規模言語モデル (LLM) エージェントはより広く普及し、関連するミスアライメントリスクが増加する。
本研究では,モデルが追求する内部目標と,デプロイ者の意図する目標との相反として,不整合にアプローチする。
現実的なシナリオにおいて,LLMエージェントの適合性を評価するためのベンチマークスイートであるtextscAgentMisalignmentを導入する。
論文 参考訳(メタデータ) (2025-06-04T14:46:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。