論文の概要: RSure-Agent: Reliable Use of Tool Observations for Remote Sensing Agents
- arxiv url: http://arxiv.org/abs/2610.04836v1
- Date: Sun, 04 Oct 2026 00:43:12 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:33:43.896453
- Title: RSure-Agent: Reliable Use of Tool Observations for Remote Sensing Agents
- Title(参考訳): RSure-Agent:リモートセンシングエージェントにおけるツール観察の信頼性
- Abstract要約: 我々は3つのリモートセンシングエージェントベンチマークで1,229個の実行軌跡を解析した。
各ベンチマークでは、少なくとも88.1%のタスクがツールの観察に依存している。
これらのタスクの中で、少なくとも22.7%は、ツールの実行が成功したにもかかわらず、誤った観察を含んでいる。
- 参考スコア(独自算出の注目度): 26.708914386259263
- License:
- Abstract: Remote sensing agents rely on perception, measurement, and raster analysis tools to solve Earth observation tasks. We refer to their judgments and quantitative results about ground objects as tool observations. However, these observations are subject to substantial uncertainty and may be incorrect even when the tools execute successfully. When agents accept incorrect observations, the errors can propagate through subsequent reasoning and cause task failure. We analyze 1,229 execution trajectories across three remote sensing agent benchmarks. On each benchmark, at least 88.1% of tasks depend on tool observations. Among these tasks, at least 22.7% contain incorrect observations despite successful tool execution. These errors propagate to the final answer in at least 82.0% of affected tasks on each benchmark. To address this problem, we propose RSure-Agent, a framework for verifying tool observations and limiting error propagation. We introduce a verifiable observation protocol that requires tools to return process evidence for the agent to verify their observations. We also construct a task-tool reliability prior from offline task feedback. The prior summarizes each tool configuration's past performance across task types and provides a task-specific reference for verification. Using process evidence and this prior, RSure-Agent decides whether to accept an observation, request additional evidence, or reject it. We evaluate RSure-Agent on EarthBench, ThinkGeo, TerraLogic, and CHOICE-420. Across the three agent benchmarks, RSure-Agent reduces the error propagation rate by 21.3 to 25.9 percentage points relative to the base configuration with verification and the prior disabled. On CHOICE-420, it improves overall accuracy over direct answering by 5.71 percentage points on average across 11 backbone models. On EarthBench, it reduces the tool-call ratio by 25.9% relative to Earth-Agent.
- Abstract(参考訳): リモートセンシングエージェントは、地球観測タスクを解決するために知覚、測定、ラスタ分析ツールに依存している。
地中物に関する判断と定量的な結果について,ツール・オブザーバとして言及する。
しかし、これらの観察は相当な不確実性に直面しており、ツールが正常に実行されたとしても正しくない可能性がある。
エージェントが誤った観察を受け入れると、エラーはその後の推論を通じて伝播し、タスクの失敗を引き起こす。
我々は3つのリモートセンシングエージェントベンチマークで1,229個の実行軌跡を解析した。
各ベンチマークでは、少なくとも88.1%のタスクがツールの観察に依存している。
これらのタスクの中で、少なくとも22.7%は、ツールの実行が成功したにもかかわらず、誤った観察を含んでいる。
これらのエラーは、各ベンチマークで影響を受けるタスクの少なくとも82.0%で最終回答に伝播する。
この問題に対処するために,ツールの観察を検証し,エラーの伝搬を制限するフレームワークであるRSure-Agentを提案する。
我々は,エージェントが観察を検証するためにプロセス証拠を返却するツールを必要とする検証可能な観察プロトコルを導入する。
また、オフラインのタスクフィードバックからタスクツールの信頼性も構築する。
前者は、各ツール構成の過去のパフォーマンスをタスクタイプ間で要約し、検証のためのタスク固有の参照を提供する。
プロセスエビデンスとそれ以前にRSure-Agentは、観察を受け入れ、追加のエビデンスを要求するか、拒否するかを決定する。
Sure-Agent on EarthBench, ThinkGeo, TerraLogic, CHOICE-420。
3つのエージェントベンチマーク全体で、RSure-Agentは、検証と事前無効化によるベース構成に対するエラー伝播率を21.3から25.9ポイント削減する。
CHOICE-420では、11のバックボーンモデルの平均5.71ポイントの直接応答よりも全体的な精度を向上させる。
EarthBenchでは、Earth-Agentと比較してツールコール比を25.9%削減している。
関連論文リスト
- Agents Are Systems, Not Models: Rethinking Agentic Evaluation [80.87068485535677]
エージェントの構成の5つの部分(タスク情報、推論、自己検証、時間予算、バックボーンモデル)について検討する。
結果の約54%は、変更ではなく、同じ構成を繰り返すことによるものです。
ベンチマークと18,000以上のエージェントトラジェクトリをリリースする。
論文 参考訳(メタデータ) (2026-10-01T12:55:07Z) - Do Agent Benchmarks Do What They Say? An Executable-Contract Audit of Tool-Using Agent Environments [8.904042335790534]
34回にわたって、4つのベンチマークで変更ツールを監査し、7つのツール欠陥と1つの評価器特性をピン付きコミットで確認した。
注入された欠陥について、チェッカーは25個のフラグに偽陽性を示さず、5つの負のコントロールのうち2つにフラグを付け、最も多くを逃した。
さらに12のAgentDojoツール、6つのホールドアウトツールと、最初に監査された7つのツールによって、25のツール変更サーフェスが完了した。
論文 参考訳(メタデータ) (2026-09-29T11:50:55Z) - When Tools Silently Lie: Evaluating and Mitigating Blind Compliance in Tool-Augmented Data Agents [0.4665390376528909]
ToxicBenchを導入し、数値、ラベル、スキーマ、検索エラーのチェックと適用を計測する。
3つのアダプタの118タスクのGPT評価では、中毒はタスク成功率を26~39ポイント低下させる。
スコアラーを凍結した後、200の軌道上の人間のアノテーションと比較し、96%のタスク・サクセス・アグリーメントが得られた。
論文 参考訳(メタデータ) (2026-09-29T09:45:17Z) - TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces [49.561879967469714]
TraceDanceは、ユーザが指定した望ましくない振る舞いのデプロイメントトレースからターゲットベンチマークを構築するエージェントシステムである。
効率的な構築のために、Anchor-and-Confirmはプログラム可能な検索と、Flash大言語モデルによる候補レベルの確認を組み合わせる。
コーディングと一般的なツールの実験では、252,557のセッションで描画され、ビルドターゲット要求の95.3%を満たす4,125のインスタンスで107のベンチマークを生成する。
論文 参考訳(メタデータ) (2026-09-27T06:58:39Z) - Fail Loudly: An Auditable Runtime for Agentic Data Analysis [5.552367153808067]
我々は、エージェントの分析的選択を検査可能とし、実行フィードバックを通じてそれらのリビジョンをサポートする監査可能なランタイムRADARを提案する。
RADARは3つのコアメカニズムを通じて動作している。まず、エビデンス保存探索モジュールは、ソース位置と観測範囲を保持しながら、タスク関連コンテンツを検索する。
次に、ランタイムは型付き演算子を使用して、エージェントの宣言された入力、操作引数、結果の観察を記録する。
競合が検出されると、ランタイムは操作を拒否するか、診断フィードバックを提供し、エラーが伝播する前にエージェントが選択を修正できる。
論文 参考訳(メタデータ) (2026-09-26T12:11:39Z) - AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks [0.0]
他のエージェントやエンジニアが残した部分的な状態からタスクを中断し、再割り当てし、レビューし、再開するからです。
前任者の作業が不透明あるいは不完全である場合に課される再検討コスト。
我々の乗っ取りプロトコルは、決定論的ハンドオフポイントで符号化エージェントを中断し、リポジトリを凍結し、4つのハンドオフビューで後継エージェントを評価する。
論文 参考訳(メタデータ) (2026-06-01T20:40:38Z) - Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories [51.22051230894794]
最終回答に基づく評価は、エージェントが成功するかどうかを示すが、どの部分の軌道が答えを信頼できないかを示すものではない。
2つのエージェントフレームワーク、3つのバックボーンモデル、3つのベンチマークから2,790の実際のトラジェクトリを収集し、生ログをセマンティックスパンに変換し、エキスパートレビューを通じて有害なエラースパンを注釈付けします。
我々は,エージェントの主張を追跡するクレーム中心の監査フレームワークであるDRIFTを提案する。
論文 参考訳(メタデータ) (2026-06-01T10:50:26Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - RIVA: Leveraging LLM Agents for Reliable Configuration Drift Detection [3.494935876363005]
既存のエージェントシステムは、彼らが呼び出すツールが常に正しい出力を返すと暗黙的に仮定している。
我々は,ツールが誤りや誤解を招く出力を生成する場合でも,堅牢なIaC検証を行う,新しいマルチエージェントシステムであるRIVAを紹介する。
この結果から,多種多様なツールコールの相互検証により,実運用環境におけるより信頼性の高い自律的インフラストラクチャ検証が可能であることが示唆された。
論文 参考訳(メタデータ) (2026-03-02T19:28:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。