論文の概要: SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon CivRealm Strategy Planning
- arxiv url: http://arxiv.org/abs/2606.29932v2
- Date: Thu, 02 Jul 2026 08:58:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.493963
- Title: SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon CivRealm Strategy Planning
- Title(参考訳): SAGA:長期戦略立案のためのシーン対応・ゴール進化型エージェント
- Authors: Tianyu Jin, Shuo Chen, Yida Wang, Liuyu Xiang, Yingzhuo Liu, Zhiyao Jiang, Yexin Li, Zhaofeng He,
- Abstract要約: 複雑な戦略ゲームにおける長期戦略計画では、不完全な情報とまばらな報酬の下での同時推論が要求される。
本稿では,1種類の障害を直接対象とする3つのメカニズムを持つLLMマルチエージェントフレームワークであるSAGAについて述べる。
2つの最強の基準線よりも低いばらつきで、環境の唯一の希薄な客観的報酬である文明の最高点に達する。
- 参考スコア(独自算出の注目度): 17.107639191978496
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon strategic planning in complex strategy games demands concurrent reasoning across multiple decision domains under imperfect information and sparse reward. Existing LLM-based agents suffer from three systematic failures: scene blindness from raw tile coordinates, context overflow and domain coupling from monolithic state dumps, and shallow cross-game learning that treats each episode in isolation. We present SAGA, an LLM multi-agent framework with three mechanisms each directly targeting one class of failure: (i) a Map-Semantic Scene Graph that encodes typed spatial relations among game entities into per-unit natural-language context, resolving spatial blindness without global token inflation; (ii) a Tool-Augmented Planner that pulls fine-grained domain state on demand and dispatches per-domain directives to dedicated specialist controllers, eliminating context overflow, domain coupling, and mechanical constraint violations; and (iii) a Dual-Horizon Feedback Loop that combines periodic within-game goal generation with structured cross-game causal post-mortem, enabling principled strategic evolution without manual reward engineering. Evaluated on FreeCiv, SAGA attains the highest mean civilization score -- the environment's sole sparse objective reward -- with lower variance than the two strongest baselines, and is the only method that significantly surpasses every baseline on infrastructure construction, the resource axis most readily sacrificed under multi-objective conflict. It outscores the two strongest baselines in most head-to-head games while cutting output tokens (the dominant decoding cost) by 27%. Equipped with the cross-game evolution module, SAGA reaches the highest end-of-chain score across five successive episodes. Ablation studies confirm that each architectural component contributes independently to this advantage.
- Abstract(参考訳): 複雑な戦略ゲームにおける長期戦略計画では、不完全な情報とまばらな報酬の下で複数の決定領域を同時に推論する必要がある。
既存のLCMベースのエージェントは、生のタイル座標からのシーンブラインド、モノリシックな状態ダンプからのコンテキストオーバーフローとドメイン結合、各エピソードを個別に扱う浅いクロスゲーム学習という3つの体系的な障害に悩まされている。
3つのメカニズムがそれぞれ1つの障害を直接対象とするLLMマルチエージェントフレームワークであるSAGAについて述べる。
一 ゲームエンティティ間の型付き空間関係を単位ごとの自然言語文脈にエンコードし、グローバルトークンのインフレーションなしで空間盲意を解消するマップ・セマンティック・シーングラフ
i) 要求に応じてきめ細かいドメイン状態を取り出し、ドメインごとのディレクティブを専用のスペシャリストにディスパッチし、コンテキストオーバーフロー、ドメイン結合、機械的制約違反を排除したツール拡張プランナー
3) 周期的なゲーム内ゴール生成と構造化されたゲーム間因果後モーテムを組み合わせ、手動報酬工学を使わずに戦略的な進化を可能にするデュアルホライゾンフィードバックループ。
FreeCivで評価されたSAGAは,2つの最強ベースラインよりも分散度が低く,かつインフラストラクチャ構築のすべてのベースラインを大幅に上回る唯一の方法であり,資源軸は多目的の対立の下で最も容易に犠牲にされる。
ほとんどのヘッドツーヘッドゲームでは2つの最強のベースラインを上回り、出力トークン(主要なデコードコスト)を27%削減した。
クロスゲーム進化モジュールを備えたSAGAは,5回連続して,チェーンの最高スコアに達した。
アブレーション研究は、各アーキテクチャコンポーネントがこの利点に独立して寄与することを確認した。
関連論文リスト
- Reinforcing Dual-Path Reasoning in Spatial Vision Language Models [113.86271063627782]
本稿では,空間的VLMにLOR(Language-Only Reasoning)とDTR(Detect-Then-Reason)の2つの相補的推論経路を持つ統一的なフレームワークを提案する。
様々な空間ベンチマークにおいて、SR-REALは空間的VLMベースラインを著しく上回る。
論文 参考訳(メタデータ) (2026-06-16T05:32:39Z) - GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver [107.6554560318856]
GenEraserは、一般化された高忠実度ビデオオブジェクトとエフェクト除去のための新しいフレームワークである。
拡散変換器のマルチモーダル先行をフル活用するために,バイパートテキストガイダンスと組み合わせたMC-MoE(Multi-Conditional Mixture-of-Experts)を導入する。
また、マスクとテキスト条件の相対的優位性を適応的にバランスさせるための学習可能なDeep C'FGのFusion機構を提案する。
論文 参考訳(メタデータ) (2026-05-28T14:58:36Z) - MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs [54.81359054218573]
大規模言語モデル(LLM)のためのマルチゲームアリーナと評価プラットフォームであるMindgamesを紹介する。
Mindgamesは、統合されたインタラクションインターフェース、TrueSkillベースの評価、および4つのゲーム環境にわたる完全な軌跡ログを提供する。
我々は,決定論的オフライントーナメントプロトコルMG-Refとともに,ターンレベルの観察,アクション,報酬を含む29,571個のマルチエージェントゲームを分析した。
論文 参考訳(メタデータ) (2026-05-28T07:33:47Z) - Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation [32.02017382315305]
Vision-Language Navigation (VLN) は、エンボディエージェントが言語命令に従うことで、見えない環境でターゲットの場所に到達することを可能にする。
近年の視覚言語モデル(VLM)の進歩にもかかわらず、重要な意味幾何学的ギャップが残っている。
本稿では3次元幾何学情報をVLMと互換性のある構造化表現に変換する階層型意味幾何学マップ(HSGM)を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:53:21Z) - PC-CrossDiff: Point-Cluster Dual-Level Cross-Modal Differential Attention for Unified 3D Referring and Segmentation [40.5034963034718]
3Dビジュアルグラウンディングは2つのコアタスクを通して自然言語参照表現をローカライズすることを目的としている: Referring Expression (3DREC)とReferring Expression (3DRES)
既存の手法は、暗黙の局所化キューの不十分な解析と、共起物体からの動的空間干渉の非効率な抑制という、複雑な多目的シーンにおいて2つの重要な課題に直面している。
PC-CrossDiffは3DRECと3DRESのための2レベルクロスモーダルアテンションアーキテクチャを備えた統合デュアルタスクフレームワークである。
論文 参考訳(メタデータ) (2026-03-18T14:16:48Z) - GoalSwarm: Multi-UAV Semantic Coordination for Open-Vocabulary Object Navigation [0.0]
GoalSwarmは、ゼロショットセマンティックなオブジェクトゴールナビゲーションのための、完全に分散化されたマルチUAVフレームワークである。
それぞれのUAVは、共有された軽量な2Dトップダウンセマンティック占有マップを共同で構築する。
GoalSwarmのコアコントリビューションは,(1)ゼロショット基盤モデルの統合 – オープン語彙検出とピクセルレベルのセグメンテーションのためのSAM3,(2)複数視点検出の信頼性を画素ごとのゴール関連分布に融合するベイズ値マップである。
論文 参考訳(メタデータ) (2026-03-13T11:23:53Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - Hierarchical Entity-centric Reinforcement Learning with Factored Subgoal Diffusion [36.28452252200851]
オフラインゴールコンディション強化学習(GCRL)のための階層型エンティティ中心フレームワークを提案する。
このフレームワークは、サブゴール分解と因子構造を組み合わせることで、ドメイン内の長い水平タスクを複数のエンティティで解決する。
本手法は画像ベース長軸タスクにおけるRLエージェントの性能を一定に向上することを示す。
論文 参考訳(メタデータ) (2026-02-02T19:40:54Z) - From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors [54.84863164684646]
既存の視覚言語アクション(VLA)モデルは3Dの現実世界で機能するが、通常は2Dエンコーダ上に構築される。
本研究では,アクションヘッドにリッチな3次元空間トークンを注入する新しいパラダイムであるFALCONを紹介する。
論文 参考訳(メタデータ) (2025-10-20T11:26:45Z) - Hierarchical Disentanglement-Alignment Network for Robust SAR Vehicle
Recognition [18.38295403066007]
HDANetは機能障害とアライメントを統合フレームワークに統合する。
提案手法は,MSTARデータセットにおいて,9つの動作条件にまたがる顕著なロバスト性を示す。
論文 参考訳(メタデータ) (2023-04-07T09:11:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。