論文の概要: RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation
- arxiv url: http://arxiv.org/abs/2607.24772v1
- Date: Thu, 11 Jun 2026 04:23:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.057671
- Title: RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation
- Title(参考訳): RSMeM:システム評価によるリモートセンシングエージェントの知識向上メモリ進化
- Abstract要約: RSMeMは、RSエージェントを事前に蒸留されたドメイン知識でブートストラップする知識強化メモリ進化機構である。
堅牢なマルチステップツール実行のために、オンラインエクスペリエンスを反復的に統合する。
EarthBenchの実験では、RSMeMはツール使用のパフォーマンスとエンドツーエンドの回答を一貫して改善している。
- 参考スコア(独自算出の注目度): 55.87826829616171
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Geoscience research requires complex analysis and domain expertise, with remote sensing (RS) observations as a key foundation. However, existing RS agents built on general-purpose LLMs remain largely domain-agnostic, resulting in brittle and error-prone workflows. Moreover, these failures are seldom consolidated into a reusable experience for subsequent analyses. To address this issue, we introduce RSMeM, a knowledge-enhanced memory evolution mechanism that bootstraps RS agents with pre-distilled domain knowledge and iteratively integrates online experience for robust multi-step tool execution. RSMeM is composed of two components: (i) Hierarchical Knowledge Grounding, which performs taxonomy-aware retrieval over a hierarchical domain corpus to guide planning and tool selection; and (ii) Failure-Aware Experience Refinement, which distills failure-annotated tool-use traces into reusable constraints for next-round tool execution. By iteratively employing these two processes, RS agents can evolve to absorb task-level domain knowledge and effectively translate it into instance-level execution experience. Extensive experiments on EarthBench demonstrate that RSMeM consistently improves tool-use performance and end-to-end answer across a diverse set of LLM backbones. Notably, RSMeM achieves a 6% accuracy improvement on DeepSeek-V3.2 with less than 1% additional experience tokens, demonstrating the strong knowledge density of our distilled experience. Our code is available at https://github.com/AI9Stars/RSMeM
- Abstract(参考訳): 地球科学の研究には複雑な分析と領域の専門知識が必要であり、リモートセンシング(RS)観測が重要な基礎となっている。
しかし、汎用LLM上に構築された既存のRSエージェントはドメインに依存しないままであり、不安定でエラーを起こしやすいワークフローをもたらす。
さらに、これらの失敗は、その後の分析のために再利用可能な体験に統合されることはめったにない。
この問題に対処するため,我々は,RSエージェントを事前のドメイン知識でブートストラップし,堅牢なマルチステップツール実行のためのオンラインエクスペリエンスを反復的に統合する知識強化メモリ進化機構であるRSMeMを紹介した。
RSMeMは2つのコンポーネントから構成されています。
一 階層的知識基盤であって、計画及びツールの選択を指導するための階層的ドメインコーパス上で分類学的に認識した検索を行うもの
フェイル・アウェア・エクスペリエンス・リファインメント(Failure-Aware Experience Refinement)は、フェールアノテートされたツール使用のトレースを、次のラウンドのツール実行のための再利用可能な制約に蒸留する。
これら2つのプロセスを反復的に採用することにより、RSエージェントはタスクレベルのドメイン知識を吸収し、インスタンスレベルの実行エクスペリエンスに効果的に変換することができる。
EarthBenchでの大規模な実験では、RSMeMは多種多様なLLMバックボーンをまたいだツール使用性能とエンドツーエンドの回答を一貫して改善している。
特に、RSMeMはDeepSeek-V3.2の6%の精度向上を実現し、1%以上の経験トークンを追加し、蒸留経験の強い知識密度を実証した。
私たちのコードはhttps://github.com/AI9Stars/RSMeMで利用可能です。
関連論文リスト
- Multi-Agent Systems for Root Cause Analysis in Microservices [58.95503998127531]
LATS-RCAはMSSの根本原因分析のためのマルチエージェントフレームワークである。
リフレクションスコアは、最も可能性が高い根本原因への探索を導くために使用される。
我々は,オープンソースの産業MSSであるLight-OAuth2上でLATS-RCAを評価する。
論文 参考訳(メタデータ) (2026-05-05T08:39:42Z) - Structurally Aligned Subtask-Level Memory for Software Engineering Agents [15.239652771593663]
大規模言語モデル(LLM)は、自律ソフトウェア工学(SWE)エージェントとして大きな可能性を示している。
最近の研究は、これらのエージェントを長期的推論をサポートするメモリ機構で強化することを検討した。
本稿では,メモリの記憶,検索,更新をエージェントの機能的分解と整合させる構造アライメントされたサブタスク・レベルメモリを提案する。
論文 参考訳(メタデータ) (2026-02-25T06:13:25Z) - ML-Tool-Bench: Tool-Augmented Planning for ML Tasks [23.54937738755734]
ツール強化機械学習エージェントの評価のためのベンチマークを導入する。
私たちのベンチマークは、インメモリ名のオブジェクト管理を組み込むことで、従来のツール使用の評価を超えています。
我々のアプローチはReActよりも16.2%向上し、すべてのKaggle課題の中央値を取ります。
論文 参考訳(メタデータ) (2025-11-29T23:59:40Z) - A Benchmark for Procedural Memory Retrieval in Language Agents [0.023227405857540805]
現在のAIエージェントは、慣れ親しんだ設定で優れていますが、目に見えないProcで新しいタスクに直面したとき、急激に失敗します。
タスク実行から手続き的メモリ検索を分離する最初のベンチマークを示す。
埋め込み型手法は、慣れ親しんだ文脈で強く機能するが、新規な手法では著しく劣化する。
論文 参考訳(メタデータ) (2025-11-21T08:08:53Z) - Learning to Route Queries Across Knowledge Bases for Step-wise Retrieval-Augmented Reasoning [60.84901522792042]
Multimodal Retrieval-Augmented Generation (MRAG)は、マルチモーダル大言語モデル(MLLM)における幻覚の緩和を約束している。
進化する推論状態に基づいて知識をいつどこで取得するかを学習する新しいMRAGフレームワークであるR1を提案する。
R1-は多種多様なKBを適応的かつ効果的に利用でき、不要な検索を減らし、効率と精度を向上させる。
論文 参考訳(メタデータ) (2025-05-28T08:17:57Z) - R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models [51.468732121824125]
大規模言語モデルは一般的なNLPタスクにおいて顕著な成功を収めてきたが、ドメイン固有の問題には不足する可能性がある。
既存の評価ツールは、ドメイン知識の深さを掘り下げることなく、いくつかのベースラインを提供し、様々なドメインで評価するのみである。
本稿では、R-Evalツールキット(R-Evalツールキット)を導入し、異なるRAGの評価を合理化することによるALLMの評価の課題に対処する。
論文 参考訳(メタデータ) (2024-06-17T15:59:49Z) - RS-Agent: Automating Remote Sensing Tasks through Intelligent Agent [15.836845304125436]
RS-Agentは、人間のユーザーと対話し、専門的なモデルを自律的に活用するように設計されたAIエージェントである。
RS-Agentは、大きな言語モデルに基づく中央コントローラ、ツール実行のための動的ツールキット、タスク固有のエキスパートガイダンスのためのソリューションスペース、ドメインレベルの推論のための知識スペースの4つの重要なコンポーネントを統合している。
9つのデータセットと18のリモートセンシングタスクにわたる大規模な実験により、RS-Agentは最先端のMLLMよりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2024-06-11T09:30:02Z) - Enhancing Open-Domain Task-Solving Capability of LLMs via Autonomous Tool Integration from GitHub [79.31134731122462]
オープンドメインのタスク解決能力を評価するためにOpenActベンチマークを導入します。
我々は,オープンドメインの進化するクエリに,GitHubから専門ツールを自律的に統合することで対処できる,新しいLLMベースのエージェントシステムであるOpenAgentを紹介する。
論文 参考訳(メタデータ) (2023-12-28T15:47:30Z) - On Taking Advantage of Opportunistic Meta-knowledge to Reduce
Configuration Spaces for Automated Machine Learning [11.670797168818773]
主要な研究課題は、パフォーマンスの悪いMLパイプラインのコスト評価を事前に回避できるかどうかである。
AutoWeka4MCPSパッケージによる多くの実験は、オポチュニティ/システムメタ知識がMLの結果を改善することを示唆している。
我々は、データセットの「チャレンジ」に対する強い感度、すなわち、予測子の選択における特異性によってパフォーマンスが著しく向上するかどうかを観察する。
論文 参考訳(メタデータ) (2022-08-08T19:22:24Z) - Retrieval-Augmented Reinforcement Learning [63.32076191982944]
過去の経験のデータセットを最適な行動にマップするために、ネットワークをトレーニングします。
検索プロセスは、現在のコンテキストで有用なデータセットから情報を取得するために訓練される。
検索強化R2D2はベースラインR2D2エージェントよりもかなり高速に学習し,より高いスコアを得ることを示す。
論文 参考訳(メタデータ) (2022-02-17T02:44:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。