論文の概要: GISAgentBench: A Practitioner-Sourced Benchmark for Evaluating LLM Agents on GIS Tasks
- arxiv url: http://arxiv.org/abs/2608.01645v1
- Date: Mon, 03 Aug 2026 03:31:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.313762
- Title: GISAgentBench: A Practitioner-Sourced Benchmark for Evaluating LLM Agents on GIS Tasks
- Title(参考訳): GISAgentBench: GISタスク上でLLMエージェントを評価するための実践的ベンチマーク
- Authors: Abhinav Pothuri, Zhe Jiang, Zelin Xu, Di Yang,
- Abstract要約: GISの専門家は、都市計画、災害対応、環境モニタリングにおける意思決定を支援するために、多段階の空間分析に頼っている。
最近の大規模言語モデル (LLM) エージェントは地理空間解析を自動化できる可能性があるが、現実的なGISの実行能力は明らかにされていない。
GISAgentBenchは、GIS Stack Exchangeの349の多段階GISタスクのベンチマークであり、6つの選択された地理的領域にわたる実際の公開データに基づいてインスタンス化されている。
- 参考スコア(独自算出の注目度): 5.600795069077048
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Geographic Information System (GIS) professionals rely on multi-step spatial analysis workflows to support decision-making in urban planning, disaster response, and environmental monitoring. The process is tedious, time-consuming, and error-prone. While recent large language model (LLM) agents equipped with external tools have the potential to automate geospatial analysis, their ability to perform realistic GIS workflows remains largely unexplored. Existing GIS agent benchmarking datasets are mostly drawn from textbooks, tutorials, or LLM-generated seeds and remain limited in size and trajectory depth. More importantly, none provides ground truth outputs. They therefore rely on surrogate signals such as code similarity, trajectory matching, or LLM and VLM judges, which can conflate workflow resemblance with task correctness. To address this gap, we introduce GISAgentBench, a benchmark of 349 multi-step GIS tasks curated from GIS Stack Exchange and instantiated on real public data across six selected geographic areas of interest. Each task ships with an executable reference trajectory and an exact ground truth output file, enabling strict, deterministic, tolerance-aware output matching beyond LLM judging. Evaluations of six LLM models reveal that realistic GIS workflows remain challenging: the best agent completes only 32.7% of tasks under strict tolerance-aware scoring, although most models produce outputs that are close to the ground truth.
- Abstract(参考訳): 地理情報システム(GIS)の専門家は、都市計画、災害対応、環境モニタリングにおける意思決定を支援するために、多段階の空間分析ワークフローに依存している。
プロセスは退屈で、時間がかかり、エラーが発生します。
最近の大規模言語モデル(LLM)エージェントは地理空間解析を自動化できる可能性があるが、現実的なGISワークフローの実行能力はほとんど探索されていない。
既存のGISエージェントベンチマークデータセットは、主に教科書、チュートリアル、LLM生成種子から作成されており、サイズと軌道深度に制限がある。
さらに重要なことは、誰も真実のアウトプットを提供していません。
そのため、コード類似性、軌道整合性、LLMおよびVLMの判定などのサロゲート信号に依存しており、タスクの正しさとワークフローの類似性を説明できる。
GISAgentBenchは、GIS Stack Exchangeから算出された349の多段階GISタスクのベンチマークであり、6つの選択された地理的領域にわたる実際の公開データに基づいてインスタンス化されている。
各タスクは実行可能な参照軌跡と正確な基底真理出力ファイルを持ち、LSM判定を超える厳密で決定論的で寛容な出力マッチングを可能にする。
6つのLCMモデルの評価は、現実的なGISワークフローが依然として困難なままであることを示している: 最高のエージェントは厳密な寛容を意識したスコアリングの下でのタスクの32.7%しか完了しないが、ほとんどのモデルは、基礎的な真実に近いアウトプットを生成する。
関連論文リスト
- GISclaw: An Open-Source LLM-Powered Agent System for Full-Stack Geospatial Analysis [1.1417805445492082]
GISclawは、LLM推論コアと永続的なPythonサンドボックスを統合する、オープンソースのエージェントシステムである。
GISclawは、Single Agent ReActとDual Agent Plan-Replanパイプラインという、2つのプラグイン可能なエージェントアーキテクチャを実装している。
システムは50タスクGeoAnalystBenchベンチマークで最大96%のタスク成功を達成する。
論文 参考訳(メタデータ) (2026-03-27T09:46:59Z) - GeoAnalystBench: A GeoAI benchmark for assessing large language models for spatial analysis workflow and code generation [32.22754624992446]
実世界の地理空間問題から派生したPythonベースのタスク50のベンチマークであるGeoAnalystBenchを紹介する。
このベンチマークを用いて、プロプライエタリモデルとオープンソースモデルの両方を評価します。
ChatGPT-4o-miniのようなプロプライエタリなモデルは95%の妥当性とより強力なコードアライメントを実現します。
論文 参考訳(メタデータ) (2025-09-07T00:51:57Z) - ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks [64.86209459039313]
ThinkGeoは、構造化ツールの使用とマルチステップ計画を通じて、リモートセンシングタスクにおけるツール拡張エージェントを評価するために設計されたエージェントベンチマークである。
我々はReActスタイルの対話ループを実装し,486 個の構造化エージェントタスク上でのオープンソース LLM とクローズドソース LLM の両方を1,773 個の専門家が検証した推論ステップで評価する。
分析の結果、ツールの精度とモデル間の計画整合性に顕著な相違が明らかになった。
論文 参考訳(メタデータ) (2025-05-29T17:59:38Z) - Enhancing the Geometric Problem-Solving Ability of Multimodal LLMs via Symbolic-Neural Integration [57.95306827012784]
幾何学図のステップワイズ推論パスを自動的に生成するパイプラインであるGeoGenを提案する。
正確なシンボリック推論を活用することで、textbfGeoGenは大規模で高品質な質問応答ペアを生成する。
GeoGen が生成した合成データを用いて,Large Language Model (LLM) である textbfGeoLogic を訓練する。
論文 参考訳(メタデータ) (2025-04-17T09:13:46Z) - OmniGeo: Towards a Multimodal Large Language Models for Geospatial Artificial Intelligence [51.0456395687016]
マルチモーダル大言語モデル(LLM)が人工知能の新しいフロンティアをオープンした。
地理空間応用に適したMLLM(OmniGeo)を提案する。
自然言語理解の長所と空間的推論の長所を組み合わせることで,GeoAIシステムの指示追従能力と精度を高めることができる。
論文 参考訳(メタデータ) (2025-03-20T16:45:48Z) - GIS Copilot: Towards an Autonomous GIS Agent for Spatial Analysis [0.0]
ジェネレーティブAIは、空間分析に有望な機能を提供する。
これらの可能性にもかかわらず、ジェネレーティブAIと確立されたGISプラットフォームの統合はいまだ検討されていない。
GIS Copilot" はGISユーザが自然言語コマンドを使ってQGISと対話して空間分析を行うことを可能にする。
論文 参考訳(メタデータ) (2024-11-05T15:53:59Z) - An LLM Agent for Automatic Geospatial Data Analysis [5.842462214442362]
大規模言語モデル(LLM)は、データサイエンスコード生成タスクで使われている。
複雑なデータ構造と空間的制約を組み込むのが困難であるため,空間空間データ処理への応用は困難である。
ジオアジェント(GeoAgent)は,LLMが地理空間データ処理をより効率的に処理できるように設計された対話型フレームワークである。
論文 参考訳(メタデータ) (2024-10-24T14:47:25Z) - GeoLLM: Extracting Geospatial Knowledge from Large Language Models [49.20315582673223]
大規模言語モデルから地理空間的知識を効果的に抽出する新しい手法であるGeoLLMを提案する。
我々は、人口密度や経済生活の計測など、国際社会への関心の中心となる複数の課題にまたがるアプローチの有用性を実証する。
実験の結果, LLMは試料効率が高く, 地理空間情報に富み, 世界中のロバストであることがわかった。
論文 参考訳(メタデータ) (2023-10-10T00:03:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。