論文の概要: Agent Explorative Policy Optimization for Multimodal Agentic Reasoning
- arxiv url: http://arxiv.org/abs/2605.28774v1
- Date: Wed, 27 May 2026 17:36:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:56.250212
- Title: Agent Explorative Policy Optimization for Multimodal Agentic Reasoning
- Title(参考訳): マルチモーダルエージェント推論のためのエージェント探索的ポリシー最適化
- Authors: Minki Kang, Shizhe Diao, Ryo Hachiuma, Sung Ju Hwang, Pavlo Molchanov, Yu-Chiang Frank Wang, Byung-Kwan Lee,
- Abstract要約: エージェント推論は2つの行動と構造的非対称性(思考と道具の使用)をインターリーブする。
GRPOのような標準的なRLレシピでは、ギャップはトレーニング中に2つの診断症状として現れる。
AXPO (Agent eXplorative Policy Optimization) を提案する。
- 参考スコア(独自算出の注目度): 97.64835302176056
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models with extended reasoning succeed on complex problems, but many real-world problems require external tools that internal reasoning alone often cannot resolve. Agentic reasoning therefore interleaves two behaviors with a structural asymmetry: thinking (the self-contained default) and tool use (a high-variance auxiliary acting). We refer to this asymmetry as the Thinking-Acting Gap. Under standard RL recipes like GRPO, the gap manifests as two diagnostic symptoms during training: tool use is attempted on only ~30% of rollouts, and when attempted, the tool-using rollouts within a group are all-wrong on ~40% of questions, suppressing the learning signal at the tool calls that needed it. We propose AXPO (Agent eXplorative Policy Optimization): for each all-wrong tool-using subgroup, AXPO fixes the thinking prefix and resamples the tool call and its continuation, paired with uncertainty-based prefix selection. Across nine multimodal benchmarks and three scales of Qwen3-VL-Thinking, SFT+AXPO outperforms SFT+GRPO at average (+1.8pp Pass@1 and +1.8pp Pass@4 at 8B on average) and 8B with SFT+AXPO surpasses the 32B Base on Pass@4 with 4 times fewer parameters.
- Abstract(参考訳): 推論が拡張された視覚言語モデルは複雑な問題に成功するが、現実の問題の多くは内部推論だけでは解決できない外部ツールを必要とする。
したがってエージェント推論は、思考(自己完結したデフォルト)と道具使用(高分散補助作用)という、構造的非対称性で2つの振る舞いをインターリーブする。
この非対称性をシンキング・アクティングギャップ(Thinking-Acting Gap)と呼ぶ。
ツールの使用はロールアウトの30%程度で試みられ、試みられた場合、グループ内のツール使用のロールアウトは、約40%の質問で全文化され、必要なツールコールでの学習信号が抑制される。
我々は,AXPO (Agent eXplorative Policy Optimization: AXPO) を提案する。
9つのマルチモーダルベンチマークと3スケールのQwen3-VL-Thinkingにおいて、SFT+AXPOは平均でSFT+GRPOを上回っている(平均で+1.8pp Pass@1と+1.8pp Pass@4)。
関連論文リスト
- ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning [91.51460129144654]
我々はParaVTを紹介した。ParaVTは、Parallel Video Tool呼び出しのための、最初のマルチエージェントのエンドツーエンドRLトレーニングフレームワークである。
ParaVTはQwen3-VLベースラインを平均で+7.9%改善し、PARA-GRPOはトレーニングタイムのフォーマット準拠を0.13から0.64に引き上げた。
論文 参考訳(メタデータ) (2026-05-19T18:01:26Z) - MAXS: Meta-Adaptive Exploration with LLM Agents [48.04723638253802]
MaxSはLarge Language Model (LLM) Agentsをベースにしたメタ適応推論フレームワークである。
MAXSは、いくつかのステップを進む推論パスを拡張するために、ルックアヘッド戦略を採用している。
ステップの一貫性のばらつきとステップ間のトレンドスロープを組み合わせることで、安定で一貫性があり、高い値の推論ステップを共同で選択する。
論文 参考訳(メタデータ) (2026-01-14T07:48:00Z) - A$^2$FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning [40.6234318894435]
大規模言語モデルは、推論中心のLLMとエージェントのLLMの2つのファミリーに分けられた。
この分割は、基本的に異なるトレーニング目標から生じ、単純なクエリに対して不一致の強度と非効率をもたらす。
本稿では,アダプティブ・エージェント・ファンデーション・モデル (A$2$FM) を提案する。
論文 参考訳(メタデータ) (2025-10-13T17:08:25Z) - Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning [29.605396813225386]
マルチターン対話型タスクにおけるエージェントの訓練に強化学習をどのように利用できるかを示す。
本手法は,オープンウェイトモデルを用いた多ターン対話タスクのための有能エージェントの訓練のための実践的アプローチを提供する。
論文 参考訳(メタデータ) (2025-08-05T14:30:47Z) - Adaptive Thinking via Mode Policy Optimization for Social Language Agents [75.3092060637826]
動的社会的相互作用における言語エージェントの適応的思考能力を改善するための枠組みを提案する。
本フレームワークは,(1)多言語思考モード設計,(2)コンテキスト認識モード切り替え,(3)深度適応処理によるトークン効率推論の3つの重要な側面において,既存の研究を推し進めている。
論文 参考訳(メタデータ) (2025-05-04T15:39:58Z) - Acting Less is Reasoning More! Teaching Model to Act Efficiently [87.28134636548705]
ツール統合推論は、タスクを解決するために外部ツールを呼び出す機能によって、大きな言語モデルを拡張します。
現在のアプローチは、外部ツールの使用効率や必要性を考慮せずに、最終的な正確性のためにのみ最適化されている。
最小限のツールコールで正確な回答をモデルに提示するフレームワークを提案する。
このアプローチでは,ツールコールを最大68.3%削減し,ツールの生産性を最大215.4%向上すると同時に,同等の回答精度を維持している。
論文 参考訳(メタデータ) (2025-04-21T05:40:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。