論文の概要: Evolving in the Agent Jungle via History-Informed Opponent Awareness
- arxiv url: http://arxiv.org/abs/2608.02005v1
- Date: Mon, 03 Aug 2026 10:06:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 21:56:46.380368
- Title: Evolving in the Agent Jungle via History-Informed Opponent Awareness
- Title(参考訳): 履歴インフォームド・ポンポント・アウェアネスによるエージェント・ジャングルの進化
- Abstract要約: OASEは、動的マルチエージェント環境で真に有益なスキルリビジョンを特定し、採用する。
我々はOASEを2つの意思決定シナリオで評価する: 第一価格オークションと民間のCournotコンペティション。
- 参考スコア(独自算出の注目度): 12.282686233879012
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Learning to adapt strategies through interaction is a key step toward more general and autonomous LLM agents. Existing approaches typically achieve behavioral adaptation by revising skill libraries. However, in multi-agent environments, opponents may simultaneously update their strategies, causing the environment itself to evolve continuously. Applying skill-revision methods designed for static environments in such settings therefore amounts to updating against an obsolete reference. To address this challenge, we introduce OASE (Opponent-Aware Selective Evolution), which identifies and adopts genuinely beneficial skill revisions in dynamic multi-agent environments. Specifically, OASE conducts paired comparisons between a candidate skill and the incumbent under identical conditions anchored by historical snapshots of opponent strategies, and adopts the candidate only when its estimated payoff gain exceeds an acceptance threshold. We evaluate OASE in two decision-making scenarios: first-price auctions and private-cost Cournot competition. Experimental results show that, compared with a Reflexion-style baseline, OASE achieves a lower final equilibrium distance in both environments while accepting substantially fewer skill revisions, thereby suppressing strategy changes that lack sufficient payoff support. OASE therefore replaces blind updating with evidence-anchored selection, allowing agents to adapt stably and efficiently even as opponents continuously evolve.
- Abstract(参考訳): 対話を通じて戦略を適用することを学ぶことは、より汎用的で自律的なLLMエージェントへの重要なステップである。
既存のアプローチは、通常、スキルライブラリを改訂することで行動適応を実現する。
しかし、マルチエージェント環境では、対戦相手は戦略を同時に更新し、環境自体が継続的に進化する。
このような設定で静的環境用に設計されたスキルリビジョンメソッドを適用すると、古い参照に対して更新することになります。
この課題に対処するために、動的マルチエージェント環境で真に有益なスキルリビジョンを特定し、採用するOASE(Opponent-Aware Selective Evolution)を紹介する。
具体的には、OASEは、相手戦略の歴史的スナップショットに固定された同一条件下で、候補スキルと現職者のペア比較を行い、その推定ペイオフゲインが受容閾値を超えた場合に限り、その候補を採用する。
我々はOASEを2つの意思決定シナリオで評価する: 第一価格オークションと民間のCournotコンペティション。
実験の結果,OASEはリフレクション型ベースラインと比較して,両環境間の最終平衡距離が低く,スキルリビジョンが著しく少ないため,十分なペイオフ支援が不十分な戦略変更が抑制されることがわかった。
したがって、OASEはブラインド更新をエビデンスアンコールされた選択に置き換え、対戦相手が継続的に進化しても、エージェントは安定して効率的に適応できる。
関連論文リスト
- Self-Improving Large Language Models via Progressive Experience Evolution [52.03479747358687]
textbfSPEE(textbfSelf-textbfProgressive textbfExperience textbfEvolution)を提案する。
5つの数学的推論ベンチマークの実験は、SPEEが3つのモデルスケールでテスト時間とトレーニング時間の両方の自己進化ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-08-03T12:27:32Z) - DeepBias: Adaptive In-depth Probing of Social Biases in LVLMs [71.85279836937578]
我々は、注意深く設計されたエージェントを用いたLVLMにおける社会バイアスの奥行き探索のための適応的フレームワークDeepBiasを紹介する。
私たちは、私たちのフレームワークを使ってDeepBiasBenchという名のベンチマークを構築します。5つの異なる最先端のLVLMをアンカーとして使用することで、このベンチマークはアーキテクチャ間で共有される脆弱性をキャプチャします。
論文 参考訳(メタデータ) (2026-07-13T08:19:09Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - Beyond One Path: Evaluating and Enhancing Divergent Thinking in Interactive LLM Agents [12.548701965443373]
MUTATEはエージェントの発散思考を2つのレベルで評価するインタラクティブなベンチマークである。
成功のみの評価とは異なり、MUTATEは完了したパスとオフパスの両方をスコアする。
本稿では,非制約分岐候補生成を収束制約選択から分離するReDNAを提案する。
論文 参考訳(メタデータ) (2026-05-27T13:33:23Z) - SEAL: Synergistic Co-Evolution of Agents and Learning Environments [11.720414165425256]
大きな言語モデル(LLM)エージェントは、インタラクションによってますます改善されている。
ほとんどの自己進化的手法は、政策または学習環境を独立に適応させる。
対話型ツール利用エージェントのためのクローズドループ共進化フレームワークSEALを提案する。
論文 参考訳(メタデータ) (2026-05-23T06:41:31Z) - OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents [74.20327254615854]
大規模言語モデルエージェントは、シーケンシャルな意思決定タスクを解決するために、推論、行動選択、観察をインターリーブする。
LLMエージェントの既存の推論時間適応法は、主にプロンプトや検索に依存している。
提案するOLIVIAは,ReAct型エージェントのための推論時行動適応フレームワークである。
論文 参考訳(メタデータ) (2026-05-11T19:28:20Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - NAAMSE: Framework for Evolutionary Security Evaluation of Agents [1.0131895986034316]
我々は,エージェントのセキュリティ評価をフィードバック駆動最適化問題として再編成する進化的フレームワークであるNAAMSEを提案する。
本システムでは,遺伝子プロンプト変異,階層的コーパス探索,非対称的行動スコアリングのライフサイクルを編成する単一自律エージェントを用いている。
Gemini 2.5 Flashの実験では、進化的突然変異がワンショットメソッドによって欠落した脆弱性を体系的に増幅することを示した。
論文 参考訳(メタデータ) (2026-02-07T06:13:02Z) - Unleashing the Potential of Differential Evolution through Individual-Level Strategy Diversity [6.921493684518839]
個人レベルの戦略多様性が差分進化の探索力学と性能に与える影響について検討する。
iStratDEは、突然変異とクロスオーバー戦略を個別に割り当てる最小限の変種である。
CEC2022ベンチマークスイートとロボット制御タスクの実験は、iStratDEが確立された適応Dの変種と一致するか、あるいは超えることを示した。
論文 参考訳(メタデータ) (2026-02-01T10:45:44Z) - Active Test-time Vision-Language Navigation [60.69722522420299]
ATENAは、不確実なナビゲーション結果に対するエピソードフィードバックを通じて、実用的な人間とロボットのインタラクションを可能にする、テスト時のアクティブな学習フレームワークである。
特にATENAは、成功エピソードにおける確実性を高め、失敗エピソードにおいてそれを減らすことを学び、不確実性の校正を改善している。
さらに,自信ある予測に基づいて,エージェントがナビゲーション結果を評価することができる自己学習戦略を提案する。
論文 参考訳(メタデータ) (2025-06-07T02:24:44Z) - Unsupervised Domain Adaptation in Person re-ID via k-Reciprocal
Clustering and Large-Scale Heterogeneous Environment Synthesis [76.46004354572956]
個人再識別のための教師なし領域適応手法を提案する。
実験結果から,ktCUDA法とSHRED法は,再同定性能において,+5.7 mAPの平均的改善を実現することがわかった。
論文 参考訳(メタデータ) (2020-01-14T17:43:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。