論文の概要: ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management
- arxiv url: http://arxiv.org/abs/2607.20764v1
- Date: Wed, 22 Jul 2026 22:30:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.227652
- Title: ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management
- Title(参考訳): ArbiGraph: コンテキスト管理を評価するための任意に拡張可能なタスクグラフ
- Abstract要約: ARBIGRAPHは、ツールアシスト言語エージェントが拡張推論を越えてタスク関連コンテキストを保持し、更新し、構成し、破棄できるかどうかを評価するためのベンチマークジェネレータである。
我々は,数学,GSMスタイルのワードプロブレム,PythonトレーシングタスクのカテゴリでARBIGRAPHをインスタンス化し,Qwen3.5-27Bツールアシストエージェントを4つのトポロジで評価する。
その結果、孤立タスクでは高い精度を示すが、より複雑な依存タスクでは著しく劣化することがわかった。
- 参考スコア(独自算出の注目度): 2.622879924644665
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce ARBIGRAPH, a benchmark generator for evaluating whether tool-assisted language agents can retain, update, compose, and discard task-relevant context across extended reasoning workflows. ARBIGRAPH represents each task as a natural-language problem with an executable Python solver, and composes tasks through typed intermediate states, instantiated here as scalar and list values. This design enables controllable task graphs whose length, dependency structure, distractor count, and value type can be varied while preserving exact automatic verification. We instantiate ARBIGRAPH with math, GSM-style word-problems, and Python-tracing task categories, and evaluate a Qwen3.5-27B tool-assisted agent across four topologies. The results show high accuracy on isolated tasks but substantial degradation on more complex dependent tasks: accuracy drops by up to 33.3% on branching chains of dependent math tasks. This shows that ARBIGRAPH exposes failures that are not visible from single-task evaluation alone. Our code, generated datasets, and evaluation results are available at https://github.com/pavelgolikov/ArbiGraph.git
- Abstract(参考訳): 我々は、ツール支援言語エージェントが拡張推論ワークフロー全体にわたってタスク関連コンテキストを保持し、更新し、構成し、破棄できるかどうかを評価するベンチマークジェネレータであるARBIGRAPHを紹介する。
ARBIGRAPHは、各タスクを実行可能なPythonソルバで自然言語の問題として表現し、型付き中間状態を通じてタスクを構成する。
この設計により、正確な自動検証を保ちながら、長さ、依存関係構造、乱数、値タイプを変更できる制御可能なタスクグラフが実現される。
我々は,数学,GSMスタイルのワードプロブレム,PythonトレーシングタスクのカテゴリでARBIGRAPHをインスタンス化し,Qwen3.5-27Bツールアシストエージェントを4つのトポロジで評価する。
結果は、孤立したタスクでは高い精度を示すが、より複雑な依存タスクでは顕著な劣化を示す:精度は、依存するタスクの分岐チェーンでは最大33.3%低下する。
これは、単一タスク評価だけでは見えない障害をARBIGRAPHが公開していることを示している。
私たちのコード、生成されたデータセット、評価結果はhttps://github.com/pavelgolikov/ArbiGraph.gitで公開されています。
関連論文リスト
- Atomic Task Graph: A Unified Framework for Agentic Planning and Execution [13.978062792065215]
Atomic Task Graph (ATG) は、計画と実行のための統一された制御フレームワークである。
ATGは依存関係を公開するための明示的なグラフを維持し、再利用をサポートする。
ATGは、成功率と実行効率の強いベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-02T09:34:20Z) - GTA: Generating Long-Horizon Tasks for Web Agents at Scale [82.43869456830664]
我々は、クローリング、検索ベースのシード、コンテキスト内生成、自動品質管理を統合したスケーラブルなフレームワーク、GTAを導入する。
eコマース、政府、フォーラム、ニュースをカバーする50以上のウェブサイトでパイプラインをインスタンス化し、マルチリンガルとマルチホップをカバーしています。
i) マルチホップWebエージェントタスク生成の形式化、(ii) 自動データ生成のための効率的で検証されたパイプラインの提案、(iii) 再現可能な評価を伴う動的ベンチマークのリリースである。
論文 参考訳(メタデータ) (2026-05-28T01:05:50Z) - GUIDE: Interpretable GUI Agent Evaluation via Hierarchical Diagnosis [17.279226216630065]
軌道評価を3段階に分解するGUIDE(GUI Understanding and Interpretable Assessment Evaluation)を導入する。
サブタスク診断は、各ユニットを文脈で評価し、完了判定を割り当て、修正レコメンデーションで構造化されたエラー解析を生成する。
我々はGUIDEを,932トラジェクトリの産業用Eコマースデータセット,1302トラジェクトリの5つのWebエージェントタスクを対象としたAgentREWARDBENCH,モバイルデバイス制御用のAndroidBenchの3つのベンチマークで検証した。
論文 参考訳(メタデータ) (2026-04-06T03:58:43Z) - TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework [62.66056331998838]
TeaRAGは、検索内容と推論ステップの両方を圧縮できるトークン効率のエージェントRAGフレームワークである。
報奨関数は,過剰な推論ステップをペナルティ化しながら,知識マッチング機構によって知識満足度を評価する。
論文 参考訳(メタデータ) (2025-11-07T16:08:34Z) - Enrich-on-Graph: Query-Graph Alignment for Complex Reasoning with LLM Enriching [61.824094419641575]
大言語モデル(LLM)は知識グラフ質問応答(KGQA)のような知識集約的なシナリオにおける幻覚と事実的誤りに苦しむ
これは、構造化知識グラフ(KG)と非構造化クエリのセマンティックギャップによるもので、その焦点や構造に固有の違いが原因である。
既存の手法は通常、バニラKGの資源集約的で非スケーリング可能な推論を用いるが、このギャップを見落としている。
我々は、LLMの事前知識を活用してKGを充実させる柔軟なフレームワークEnrich-on-Graph(EoG)を提案し、グラフとクエリ間のセマンティックギャップを埋める。
論文 参考訳(メタデータ) (2025-09-25T06:48:52Z) - GraphCogent: Mitigating LLMs' Working Memory Constraints via Multi-Agent Collaboration in Complex Graph Understanding [13.356521655409422]
大規模言語モデル(LLM)は、小規模なグラフ推論タスクでは有望な性能を示すが、複雑なクエリで現実のグラフを扱うと失敗する。
グラフ推論を特殊な認知プロセス(センス、バッファ、実行)に分解する協調エージェントフレームワークであるGraphCogentを提案する。
論文 参考訳(メタデータ) (2025-08-17T14:28:38Z) - Replay-and-Forget-Free Graph Class-Incremental Learning: A Task Profiling and Prompting Approach [28.194940062243003]
クラス増分学習(Class-incremental Learning, CIL)は、一連のタスクを連続的に学習することを目的としており、各タスクは固有のクラスで構成されている。
CILの主な特徴は、推論中にタスク識別子(ID)が存在しないことである。
グラフデータに対する正確なタスクID予測はラプラシアスムースティングに基づくグラフタスクプロファイリング手法により実現できることを示す。
論文 参考訳(メタデータ) (2024-10-14T09:54:20Z) - ControlLLM: Augment Language Models with Tools by Searching on Graphs [97.62758830255002]
我々は,大規模言語モデル(LLM)が実世界のタスクを解くためのマルチモーダルツールを利用できる新しいフレームワークであるControlLLMを提案する。
フレームワークは,(1)複雑なタスクを明確なサブタスクに分割し,入力と出力を適切に定義したサブタスクに分解するtextittask Decomposer,(2)構築済みのツールグラフ上で最適なソリューションパスを探索する textitThoughts-on-Graph(ToG)パラダイム,(3)ソリューションパスを解釈して実行するリッチなツールボックスを備えた textitexecution Engine,の3つの主要なコンポーネントから構成される。
論文 参考訳(メタデータ) (2023-10-26T21:57:21Z) - Unsupervised Task Graph Generation from Instructional Video Transcripts [53.54435048879365]
本研究では,実世界の活動を行う指導ビデオのテキスト書き起こしを提供する環境について考察する。
目標は、これらの重要なステップ間の依存関係関係と同様に、タスクに関連する重要なステップを特定することです。
本稿では,命令調整言語モデルの推論能力とクラスタリングとランキングコンポーネントを組み合わせたタスクグラフ生成手法を提案する。
論文 参考訳(メタデータ) (2023-02-17T22:50:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。