論文の概要: AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs
- arxiv url: http://arxiv.org/abs/2607.20498v1
- Date: Tue, 16 Jun 2026 07:59:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.202893
- Title: AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs
- Title(参考訳): AISE-Bench - 学術知識グラフに基づく情報検索のためのフルサイクルキュレーションベンチマーク
- Abstract要約: AISE-Benchは、学術知識グラフに基づく情報検索のための実世界のフルサイクルアノテートベンチマークである。
AISE-Benchリリースには1,133のQAペアが含まれている。クエリ、完全なAPI実行、検証されたパラメータ、リファレンスリンクによるソースグラウンドの回答などだ。
我々は,回答の品質,参照基盤,API計画の正確性,実行成功を総合的に評価するプロトコルを開発した。
- 参考スコア(独自算出の注目度): 55.8213573429699
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) augmented with tools are emerging as autonomous agents capable of using Web engine, APIs, and code to solve complex, long-horizon tasks. Current tool-using benchmarks for information seeking on academic graphs rely on synthetic templates, simplified solution spaces, or narrow tasks such as paper-centric tasks, leaving key challenges underexplored - realistic user intent, complex multi-step API planning, rich parameter filling for APIs, grounded answers with references, and comprehensive evaluation of both the process and the outcome. We introduce AISE-Bench, a real-world, full-cycle annotated benchmark for information seeking on academic knowledge graphs. AISE-Bench release contains 1,133 QA pairs, including query taxonomies, full API execution trajectories, validated parameters, and source-grounded answers with reference links. To support high-quality annotation, we design a customized agent workflow to enable annotators to plan, execute, and revise complex API workflows efficiently. We develop a comprehensive evaluation protocol measuring answer quality, reference grounding, API-planning correctness, and execution success. Among the 14 evaluated methods, even the strongest model (PLAY2PROMPT with Gemini-3-Pro) achieves only moderate performance and often struggles with API planning and execution. AISE-Bench establishes a challenging new testbed for quantitatively evaluating and improving the stepwise correctness, grounded summarization, and traceable reasoning of multi-step API-using LLM agents. Our code and data are available at https://aise-bench.github.io/.
- Abstract(参考訳): ツールを付加した大規模言語モデル(LLM)は、複雑な長期タスクを解決するためにWebエンジン、API、コードを使用する自律エージェントとして出現している。
一般的なユーザ意図、複雑なマルチステップAPI計画、APIの豊富なパラメータフィリング、参照によるグラウンドド回答、プロセスと結果の両方の包括的な評価といった、未解決の課題が残されている。
我々は,学術知識グラフに基づく情報検索のための実世界のフルサイクルアノテートベンチマークであるAISE-Benchを紹介する。
AISE-Benchリリースには1,133のQAペアが含まれている。クエリ分類、完全なAPI実行トラジェクトリ、検証されたパラメータ、リファレンスリンクによるソースグラウンドの回答などだ。
高品質なアノテーションをサポートするため、アノテータが複雑なAPIワークフローを効率的に計画、実行、修正できるように、カスタマイズされたエージェントワークフローを設計する。
我々は,回答の品質,参照基盤,API計画の正確性,実行成功を総合的に評価するプロトコルを開発した。
14の評価手法のうち、最強のモデル(PLAY2PROMPTとGemini-3-Pro)でさえ中程度のパフォーマンスしか達成せず、APIの計画と実行に苦労することが多い。
AISE-Benchは、ステップワイドの正確性、基底的な要約、多段階APIを使用するLLMエージェントのトレース可能な推論を定量的に評価し改善するための、挑戦的な新しいテストベッドを確立する。
私たちのコードとデータはhttps://aise-bench.github.io/で公開されています。
関連論文リスト
- Environment-free Synthetic Data Generation for API-Calling Agents [68.95520739708304]
API呼び出し大型言語モデル(LLM)エージェントの訓練には、大量の高品質なトラジェクトリが必要である。
本研究では,LLMをオンザフライデジタルワールドモデルとして活用する環境不要な合成データ生成手法を提案する。
我々は,情報検索タスクと状態変更タスクの両方を含む,挑戦的なAppWorldとOfficeBenchベンチマークに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-07-18T17:36:44Z) - AIDABench: AI Data Analytics Benchmark [62.45908988324612]
AIDABenchは、複雑なデータ分析タスクのAIシステムをエンドツーエンドで評価するためのベンチマークである。
AIDABenchは、質問応答、データビジュアライゼーション、ファイル生成という3つのコア機能ディメンションにまたがる600以上の多様なドキュメント分析タスクを含んでいる。
AIDABenchの11の最先端モデルを評価し、プロプライエタリ(Claude Sonnet 4.5、Gemini 3 Pro Previewなど)とオープンソース(Qwen3-Max-2026-01-23-Thinkingなど)の両方を対象とする。
論文 参考訳(メタデータ) (2026-02-27T08:58:05Z) - GOAT: A Training Framework for Goal-Oriented Agent with Tools [16.5275883251462]
大規模言語モデル(LLM)は、インタラクティブエージェントとして機能するために、最近、従来のテキスト生成を超えて拡張されている。
本研究では,人間のアノテーションを含まない環境下でのLDMエージェントの微調整を可能にする新しいトレーニングフレームワークGOATを提案する。
広範な実験により,GOAT学習エージェントは,複数の既存の目標指向ベンチマークにおいて最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2025-10-14T07:14:50Z) - DrafterBench: Benchmarking Large Language Models for Tasks Automation in Civil Engineering [7.264718073839472]
大規模言語モデル(LLM)エージェントは、現実世界の問題を解決する大きな可能性を示し、業界におけるタスク自動化のソリューションになることを約束しています。
技術図面修正の文脈におけるLLMエージェントの総合評価のためのDrafterBenchを提案する。
DrafterBenchは、AIエージェントが複雑な長文の命令を解釈する習熟度を厳格にテストするオープンソースのベンチマークである。
論文 参考訳(メタデータ) (2025-07-15T17:56:04Z) - What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities [56.646832992178105]
我々は、制御可能な複雑性のタスクを合成するための自動パイプラインを備えたクロスプラットフォームグラフベースのベンチマークであるOmniBenchを紹介した。
OmniEvalは、サブタスクレベルの評価、グラフベースのメトリクス、および10機能にわたる包括的なテストを含む多次元評価フレームワークである。
我々のデータセットには、20のシナリオにわたる36万のグラフ構造化タスクが含まれており、人間の受け入れ率は91%に達する。
論文 参考訳(メタデータ) (2025-06-10T15:59:38Z) - Scaling Autonomous Agents via Automatic Reward Modeling And Planning [52.39395405893965]
大規模言語モデル(LLM)は、様々なタスクにまたがる顕著な機能を示している。
しかし、彼らは多段階の意思決定と環境フィードバックを必要とする問題に苦戦している。
人間のアノテーションを使わずに環境から報酬モデルを自動的に学習できるフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-17T18:49:25Z) - ExploraCoder: Advancing code generation for multiple unseen APIs via planning and chained exploration [70.26807758443675]
ExploraCoderはトレーニング不要のフレームワークで、大規模な言語モデルにコードソリューションで見えないAPIを呼び出す権限を与える。
実験の結果、ExploreaCoderは、事前のAPI知識に欠けるモデルのパフォーマンスを大幅に改善することが示された。
論文 参考訳(メタデータ) (2024-12-06T19:00:15Z) - ShortcutsBench: A Large-Scale Real-world Benchmark for API-based Agents [7.166156709980112]
textscShortcutsBenchは、実世界の複雑なタスクを解決するためのAPIベースのエージェントの包括的な評価のためのベンチマークである。
textscShortcutsBenchには、Apple Inc.の豊富な実際のAPI、洗練されたユーザクエリ、人間のアノテーションによる高品質なアクションシーケンス、詳細なパラメータフィリング値、システムやユーザから必要な入力を要求するパラメータが含まれている。
論文 参考訳(メタデータ) (2024-06-28T08:45:02Z) - SoAy: A Solution-based LLM API-using Methodology for Academic Information Seeking [59.59923482238048]
SoAyは学術情報検索のためのソリューションベースのLLM API利用方法論である。
ソリューションが事前に構築されたAPI呼び出しシーケンスである場合、推論メソッドとしてソリューションを備えたコードを使用する。
その結果、最先端のLLM APIベースのベースラインと比較して34.58-75.99%のパフォーマンス改善が見られた。
論文 参考訳(メタデータ) (2024-05-24T02:44:14Z) - API-BLEND: A Comprehensive Corpora for Training and Benchmarking API LLMs [28.840207102132286]
既存のデータセットを特定し、キュレーションし、変換するタスクに重点を置いています。
ツール拡張LDMのトレーニングと体系的なテストを行うための大規模なコーパスであるAPI-BLENDを紹介する。
トレーニングとベンチマークの両方の目的で,API-BLENDデータセットの有用性を実証する。
論文 参考訳(メタデータ) (2024-02-23T18:30:49Z) - MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation [96.71370747681078]
我々は,CIFAR-10におけるモデル性能の改善から,BabyLMのような最近の研究課題まで,13のタスクからなるMLAgentBenchを紹介した。
各タスクに対して、エージェントはファイルの読み書き、コードの実行、出力の検査などのアクションを実行することができる。
我々は、Claude v1.0、Claude v2.1、Claude v3 Opus、GPT-4、GPT-4-turbo、Gemini-Pro、Mixtralに基づいてベンチマークエージェントをベンチマークし、Claude v3 Opusエージェントが成功率の点で最高であることを示す。
論文 参考訳(メタデータ) (2023-10-05T04:06:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。