論文の概要: GeoNatureAgent (GNA): A Framework and Benchmark for Pre-Production Evaluation of Tool-Using Agents on Geospatial and Environmental Tasks
- arxiv url: http://arxiv.org/abs/2610.09112v1
- Date: Tue, 06 Oct 2026 21:03:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.605089
- Title: GeoNatureAgent (GNA): A Framework and Benchmark for Pre-Production Evaluation of Tool-Using Agents on Geospatial and Environmental Tasks
- Title(参考訳): GeoNatureAgent (GNA): 地理空間・環境課題におけるツール利用エージェントの事前生産評価のためのフレームワークとベンチマーク
- Abstract要約: ツール使用エージェントの事前生産評価のためのフレームワークであるGeoNatureAgentを紹介する。
そのフラッグシップインスタンスは、オープンで自己ホスト可能な地理空間APIに対して評価された103タスクのベンチマークである。
温度1.0の種子3種, 報告能力, ケースごとのコストを軸として評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Before tool-using LLM agents are deployed in environmental and geospatial workflows, teams need evidence that an agent reliably selects the right operations against real APIs. We introduce GeoNatureAgent (GNA), a framework for pre-production evaluation of tool-using agents: a fixed sixteen-tool geospatial interface published as a Model Context Protocol (MCP) server, so the agent under test is the only variable, scored against an identical tool layer, task suite, and deterministic scorer. Its flagship instance is a 103-task benchmark (a 93-task main suite across 18 categories plus a ten-task comparison expansion) evaluated against an open, self-hostable geospatial API serving three environmental indicators across Spain and Portugal. We evaluate nine LLMs under three temperature-1.0 seeds, reporting capability and per-case cost as orthogonal axes. (1) Claude Sonnet 4 achieves the highest capability (61.7% +/- 0.7% on all 103 tasks; 60.8% on the main suite), followed closely by DeepSeek V3.2 (57.9%), while no other model exceeds 53%; (2) the cost-accuracy Pareto frontier is mostly open-weight, with DeepSeek V3.2 offering 93% of Claude's capability at 11.3x lower list-price cost; (3) under strict all-checks scoring the best model sits 24-36 points below the 85-97% reported on general-purpose GIS benchmarks, whereas per-check partial credit for the top four models (86-90%) is comparable, so much of that gap reflects scoring strictness rather than task difficulty alone. The MCP server, evaluation harness, benchmark, and API are publicly available; swapping the tool executors and task suite instantiates an equivalent benchmark for any geospatial domain.
- Abstract(参考訳): ツールを使用するLLMエージェントが環境および地理空間ワークフローにデプロイされる前に、エージェントが実際のAPIに対して適切な操作を確実に選択する証拠が必要である。
ツール使用エージェントを事前に評価するためのフレームワークであるGeoNatureAgent(GNA)を,モデルコンテキストプロトコル(MCP)サーバとして公開する固定16ツール地理空間インタフェースとして紹介する。
その代表例は、103タスクベンチマーク(18のカテゴリにわたる93タスクのメインスイートと10タスクの比較拡張)で、スペインとポルトガルの3つの環境指標を提供する、オープンで自己ホスト可能な地理空間APIに対して評価されている。
温度1.0の種子を9個, 報告能力, ケースごとのコストを直交軸として評価した。
1) クロード・ソネット4は最高性能(61.7%+/-0.7%、メインスイートは60.8%)を達成し、続いてDeepSeek V3.2(57.9%)が続くが、他のモデルも53%を超えない。(2) コスト精度のParetoフロンティアは、主にオープンウェイトであり、DeepSeek V3.2はクロードの能力の93%を11.3倍低い価格で提供する。
MCPサーバ、評価ハーネス、ベンチマーク、APIが公開されており、ツールエグゼキュータとタスクスイートの交換は、任意の地理空間領域で同等のベンチマークをインスタンス化する。
関連論文リスト
- AgentOmnia: Scaling Agentic Models for Full-Scenario Applications [36.656762500581216]
大規模言語モデルエージェントは急速に進歩しているが、ドメイン、機能、タスクの難しさ、インタラクション設定にはまだ進歩が断片化されている。
これはTo-Consumer(ToC)、To-Business(ToB)、To-Employee(ToE)アプリケーション間でタスク空間の定義、データ合成、ポストトレーニング、評価、改善を調整するフレームワークです。
論文 参考訳(メタデータ) (2026-07-25T09:58:24Z) - PACE: A Proxy for Agentic Capability Evaluation [60.3743414796937]
PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
論文 参考訳(メタデータ) (2026-07-02T10:59:03Z) - Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent [98.33217711280383]
本稿では,エージェント水平線をスケーリングすることで,パラメータレベルの性能を1兆倍に向上する35B混在エージェントモデルであるAgens-A1を紹介する。
我々は、外部の知識、行動、観察、検証結果を接続する長期の知識-行動基盤を構築します。
Agents-A1は、ロングホライゾンエージェントベンチマークに対して強力で幅広いパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-29T17:50:54Z) - GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis Across Frontier and Open-Weight Foundation Models [0.0]
環境分析エージェントのための最初のベンチマークであるGeoNatureAgent Benchmarkを導入する。
18のカテゴリーにわたる93のタスクで構成されており、自治体分析、マルチターン会話、空間推論、クロスインジケータ合成、エラーハンドリングとリカバリ、ランキング、比較、多言語理解、居住地分析、タスク拒否をカバーしている。
タスクは、16のツールを通じてスペインとポルトガルの3つの環境指標を提供するオープンで自己ホスト可能なAPIに対して評価される。
論文 参考訳(メタデータ) (2026-06-11T02:35:20Z) - Do More Agents Help? Controlled and Protocol-Aligned Evaluation of LLM Agent Workflows [8.909548943361637]
BenchAgentは、単一エージェント、固定マルチエージェント(MAS)、および1つの正規化された実行およびロギングプロトコルの下でMASを進化させる。
BenchAgentは、GPT-4.1で10の推論、コーディング、ツール使用ベンチマークでこれらの基質内部を評価する。
PAE GAIAスナップショットでは、Claude-Codeスタイルのランタイムワークフローが全体の66.72%、Level 3では69.23%に達した。
論文 参考訳(メタデータ) (2026-06-04T03:50:47Z) - Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice [0.0]
実行サンドボックス(L1)、意図検証(L2)、ゼロトラスト間認証(L3)、不変監査ロギング(L4)からなる4層フレームワークであるレイヤガバナンスアーキテクチャ(LGA)を提案する。
LGAを評価するために、1,081のツールコールサンプル(インジェクション、RAG中毒、悪意のあるスキルプラグインなど)のベンチマーク(中国語のオリジナル、機械翻訳による英語)を構築し、それをオープンソースの代表的なエージェントフレームワークであるOpenClawに適用する。
論文 参考訳(メタデータ) (2026-03-07T13:05:14Z) - RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository [52.98970048197381]
RepoGenesisは、リポジトリレベルのエンドツーエンドWebマイクロサービス生成のための、最初の多言語ベンチマークである。
18のドメインと11のフレームワークに106のリポジトリ(60のPython、46のJava)があり、1,258のAPIエンドポイントと2,335のテストケースが検証されている。
その結果、高いAC(最大73.91%)とDSR(最大100%)にもかかわらず、最高のパフォーマンスのシステムはPythonで23.67%のPass@1、Javaで21.45%しか達成していないことが明らかになった。
論文 参考訳(メタデータ) (2026-01-20T13:19:20Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。