論文の概要: MAVEN: Improving Generalization in Agentic Tool Calling
- arxiv url: http://arxiv.org/abs/2605.30738v1
- Date: Fri, 29 May 2026 02:02:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.336438
- Title: MAVEN: Improving Generalization in Agentic Tool Calling
- Title(参考訳): MAVEN: エージェントツール呼び出しにおける一般化の改善
- Abstract要約: エージェントツールコール環境における一般化は、信頼できる推論システムにおいて依然として中心的な課題である。
本稿では、構造化分解、適応ツールオーケストレーション、中間検証のための軽量なシンボリック推論足場であるMAVENを提案する。
MAVEN-Benchは部分的推論品質とエンドツーエンドのタスク成功の間に大きなギャップを露呈する。
- 参考スコア(独自算出の注目度): 3.079997053226693
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generalization across agentic tool-calling environments remains a central challenge for reliable agentic reasoning systems. Although large language models achieve strong results on individual benchmarks, their ability to compose reasoning strategies, preserve intermediate states, and coordinate tools across domains remains underexplored. We present MAVEN (Modular Agentic Verification and Execution Network), a lightweight symbolic reasoning scaffold for structured decomposition, adaptive tool orchestration, and intermediate verification. We evaluate MAVEN across established tool-calling benchmarks, including BFCL v3, TauBench, Tau2Bench, AceBench, and introduce MAVEN-Bench, a stress-test benchmark for multi-step mathematical and physical reasoning with explicit verification and adversarial task composition. MAVEN-Bench exposes a substantial gap between partial reasoning quality and end-to-end task success; in direct MAVEN-Bench runs, MAVEN improves its GPT-OSS-120b base model from 48% to 71% accuracy without additional training. It also remains competitive with frontier proprietary baselines while using an open-weight backbone with an estimated cost ratio of roughly 1/10, suggesting that lightweight verification-centered scaffolds can strengthen compositional reasoning and motivate more process-aware evaluation of agents in the wild.
- Abstract(参考訳): エージェントツールコール環境における一般化は、信頼できるエージェント推論システムにおいて、依然として中心的な課題である。
大規模言語モデルは個々のベンチマークで強力な結果を得るが、推論戦略の作成、中間状態の保存、ドメイン間のコーディネートツールの探索は未定である。
本報告では,MAVEN(Modular Agentic Verification and Execution Network)について述べる。
我々は,BFCL v3, TauBench, Tau2Bench, AceBenchを含む既存のツールコールベンチマーク間でMAVENを評価し,多段階の数学的および物理的推論のためのストレステストベンチマークであるMAVEN-Benchを紹介した。
MAVEN-Benchは部分的推論品質とエンドツーエンドのタスク成功の間に大きなギャップをあしらっており、MAVEN-Benchの直接実行では、追加トレーニングなしでGPT-OSS-120bベースモデルを48%から71%の精度で改善している。
また、フロンティアのプロプライエタリなベースラインと競合する一方で、約1/10のコスト比で推定されるオープンウェイトバックボーンを使用することで、軽量な検証中心の足場は、組成推論を強化し、野生のエージェントのプロセス認識評価を促進することができることを示唆している。
関連論文リスト
- ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning [110.46431027868954]
ThinkBoosterは、大規模言語モデル(LLM)推論のシームレスなテスト時間計算スケーリングのためのフレームワークである。
最新のTTCスケーリング戦略とスコアファミリを実装するモジュール型のPythonライブラリで構成されている。
デプロイ可能なOpenAI互換プロキシサービスにより、現実のアプリケーションへの適応推論のドロップイン統合が可能になる。
論文 参考訳(メタデータ) (2026-06-05T05:28:46Z) - MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing [18.35295672031847]
MAVENは、LLMを明示的な役割分離を通じて意図的な推論に変換するように設計されたフレームワークである。
MAVEN は GEMINI-3.1-Pro などの潜在推論モデルより一貫して優れている。
MAVENは完全にモデルに依存しず、強力で伝達可能な推論ブースターとして機能する。
論文 参考訳(メタデータ) (2026-05-08T12:11:08Z) - Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning [34.10133693878611]
本稿では,冗長なチャンクを選択的にペナルティ化するマルチエージェントRLフレームワークを提案する。
MARL(SCMA)による自己圧縮(Self-Compression)は,2つの特殊エージェントによる冗長検出と評価をインスタンス化する。
モデルスケールでの実証的な評価により、SCMAは応答長を11.1%から39.0%削減し、精度は4.33%から10.02%向上した。
論文 参考訳(メタデータ) (2026-01-29T16:13:10Z) - Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning [58.432996881401415]
最近の作業では、エージェント推論を可能にするために、外部ツールで大きな言語モデル(LLM)を拡張している。
本稿では,入力プロンプトを書き換えることのみでエージェント推論を妨害するスポンジツールアタック(STA)を提案する。
STAは、意味的忠実度の高い原文からの良心的な即興的な書き直しを生成する。
論文 参考訳(メタデータ) (2026-01-24T19:36:51Z) - A Comprehensive Evaluation of LLM Reasoning: From Single-Model to Multi-Agent Paradigms [20.241519889633285]
大規模言語モデル(LLM)は、推論パラダイムが重要な役割を果たす推論システムとして、ますます多くデプロイされている。
我々は、直接単モデル生成、CoT拡張単モデル推論、代表MASなど、推論パラダイムを包括的かつ統一的に評価する。
MIMeBenchは、2つの基本的な未探索セマンティック機能をターゲットにした新しいオープンエンドベンチマークである。
論文 参考訳(メタデータ) (2026-01-19T17:23:45Z) - AWPO: Enhancing Tool-Use of Large Language Models through Explicit Integration of Reasoning Rewards [60.2998874976509]
我々は,ツール利用能力を高めるために,明示的な推論報酬を統合するために,有利なポリシー最適化(AWPO)を提案する。
AWPOは分散認識ゲーティングと困難認識重み付けを導入し、推論信号から利点を適応的に変調する。
実験により、AWPOは標準的なツール使用ベンチマークで最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2025-12-22T08:07:00Z) - TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM [45.91545449507256]
MLLM(Multimodal Large Language Models)は、数学的推論において優れた性能を発揮する。
視覚幻覚や論理的不整合に弱いままであり、標準的な結果に基づく監督が軽減に失敗する。
TIM-PRMは,受動的分類タスクから能動的ツール強化調査へ検証を変換する新しいエージェントフレームワークである。
論文 参考訳(メタデータ) (2025-11-28T09:01:38Z) - On Generalization in Agentic Tool Calling: CoreThink Agentic Reasoner and MAVEN Dataset [16.921428284844684]
エージェントツールコール環境間の一般化は、信頼できる推論システムを開発する上で重要な未解決課題である。
本稿では、構造化分解と適応ツールオーケストレーションのための軽量なシンボリック推論層を用いて、大規模言語モデルを強化するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-27T00:58:48Z) - TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning [77.01182934427095]
TaTTooは、ツールベースの検証を統合し、正確な報酬管理を提供する新しいテーブルグラウンドのPRMフレームワークである。
私たちはTTTooを2段階のパラダイムでトレーニングします。ツール使用推論パターンをキャプチャするために、コールドスタートの教師による微調整を行い、続いて強化学習を行い、私たちのモデルをテーブルベースの検証と整合させます。
論文 参考訳(メタデータ) (2025-10-07T17:59:41Z) - SEEA-R1: Tree-Structured Reinforcement Fine-Tuning for Self-Evolving Embodied Agents [58.174206358223415]
自己進化型エボダイドエージェント(SeEA-R1)は、自己進化型エボダイドエージェント用に設計された最初の強化微細調整フレームワークである。
本研究は,SEEA-R1が自律適応と報酬駆動型自己進化をサポートすることを示す。
論文 参考訳(メタデータ) (2025-06-26T18:00:07Z) - Computational Reasoning of Large Language Models [51.629694188014064]
textbfTuring Machine Benchは,Large Language Models(LLM)による推論プロセスの実行能力を評価するベンチマークである。
TMBenchには、自己完結型および知識に依存しない推論、最小主義的な多段階構造、制御可能な難易度、チューリングマシンに基づく理論的基礎の4つの重要な特徴が組み込まれている。
論文 参考訳(メタデータ) (2025-04-29T13:52:47Z) - AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents [74.16170899755281]
本稿では,LLMエージェントの分析的評価に適したオープンソース評価フレームワークであるAgentBoardを紹介する。
AgentBoardは、インクリメンタルな進歩と包括的な評価ツールキットをキャプチャする、きめ細かい進捗率のメトリクスを提供する。
これはLLMエージェントの能力と限界に光を当てるだけでなく、その性能の解釈可能性も最前線に広める。
論文 参考訳(メタデータ) (2024-01-24T01:51:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。