論文の概要: From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use
- arxiv url: http://arxiv.org/abs/2608.24368v2
- Date: Thu, 27 Aug 2026 08:07:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.801349
- Title: From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use
- Title(参考訳): 状態から行動へ:OODAツールによる信頼性の高いマルチTurnツールの使用
- Authors: Rongfeng Guo, Yinxuan Huang, Yusen Wu, Maoqing Zhong, Yunlu Chen, Meng Tang, Teng Long, Vincent Tao Hu,
- Abstract要約: 本稿では,国家行動競争を緩和するためのクローズドループ方式であるOODA-Toolを紹介する。
OODA-Toolは、コントローラがチェックした中間状態を通じて各決定をルーティングし、最終的な出力が現在のタスク状態に残されていることを保証します。
我々は,マルチターン,マルチツール,不完全情報設定にまたがるQwen3モデルを用いて,直接関数呼び出しとReActポリシーに対するOODAツールの評価を行った。
- 参考スコア(独自算出の注目度): 12.466318496864742
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable multi-turn tool use requires an agent to preserve an evolving task state and ensure that each action remains consistent with it. However, direct function-calling and ReAct-style policies learn state tracking and action generation within the same autoregressive trajectory. This coupling creates state-action competition: the pressure to produce the next call can overwrite or ignore information accumulated earlier in the interaction. Inspired by Boyd's Observe-Orient-Decide-Act cycle, we introduce OODA-Tool, a typed closed-loop policy designed to mitigate this competition by separating state preservation from action realization. Rather than generating an action directly from the interaction history, OODA-Tool routes each decision through controller-checked intermediate states, ensuring that the final output remains grounded in the current task state. Specifically, Observe reconstructs the task state, Orient determines whether execution is warranted, Decide forms an admissible action structure, and Act realizes the external output. We evaluate OODA-Tool against direct function-calling and ReAct policies using Qwen3 models ranging from 0.6B to 14B across multi-turn, multi-tool, and incomplete-information settings. OODA-Tool consistently improves task success across model sizes, with larger gains on smaller models and on tasks whose actions depend strongly on information accumulated across turns and prior tool results. Controlled variants, stage-level ablations, and transfer evaluations further demonstrate the robustness of these improvements.
- Abstract(参考訳): 信頼性の高いマルチターンツールの使用では、エージェントが進化するタスク状態を保持し、各アクションがそれと整合性を維持する必要がある。
しかし、直接関数呼び出しとReActスタイルのポリシーは、同じ自己回帰軌道内で状態追跡とアクション生成を学ぶ。
次の呼び出しを生成するプレッシャーは、インタラクションの初期に蓄積された情報を上書きまたは無視することができる。
Boyd の Observe-Orient-Decide-Act サイクルにインスパイアされたOODA-Tool を導入する。
OODA-Toolは、インタラクション履歴から直接アクションを生成するのではなく、コントローラがチェックした中間状態を通じて各決定をルーティングし、最終的な出力が現在のタスク状態のままであることを保証する。
具体的には、Observeはタスク状態を再構築し、Orientは実行が保証されているかどうかを判断し、Dedeideは許容可能なアクション構造を形成し、Actは外部出力を実現する。
我々は,マルチターン,マルチツール,不完全情報設定にまたがるQwen3モデルを用いて,直接関数呼び出しとReActポリシーに対するOODAツールの評価を行った。
OODA-Toolは、モデルサイズ全体にわたるタスクの成功を一貫して改善し、より小さなモデルや、ターンと以前のツール結果の間で蓄積された情報に強く依存するタスクに大きな利益をもたらす。
制御された変種、ステージレベルの改善、転送評価は、これらの改善の堅牢性をさらに示している。
関連論文リスト
- IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents [10.577620258047665]
大規模言語モデル(LLM)エージェントは、ユーザと外部ツールとのマルチターンインタラクションを通じて、長い水平タスクをますます解決します。
この研究は、マルチターンユーザインタラクションにおけるクレジット割り当ての理解を深め、スパースな結果フィードバックからサービスエージェントを訓練するための原則的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-08-25T14:14:36Z) - AutoIntervene: Calibrated Intervention for Action-Chunking Imitation Learning Policies [4.786936073180585]
アクションチャンキングビズモータポリシは、デモから学び、時間的一貫性を改善する。
デプロイ中にアクションチャンキングポリシーとオペレータ間で制御を選択的に転送するオンラインフレームワークであるAutoInterveneを提案する。
論文 参考訳(メタデータ) (2026-08-07T10:14:29Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents [74.20327254615854]
大規模言語モデルエージェントは、シーケンシャルな意思決定タスクを解決するために、推論、行動選択、観察をインターリーブする。
LLMエージェントの既存の推論時間適応法は、主にプロンプトや検索に依存している。
提案するOLIVIAは,ReAct型エージェントのための推論時行動適応フレームワークである。
論文 参考訳(メタデータ) (2026-05-11T19:28:20Z) - SIT-Graph: State Integrated Tool Graph for Multi-Turn Agents [35.85800795225018]
State Integrated Tool Graph (SIT-Graph)は、エピソードとプロシージャメモリを統合した人間の意思決定にインスパイアされている。
推論時に、SIT-Graphは、エピソード的リコールと手続き的実行の間の人間のようなバランスを可能にする。
複数のステートフルなマルチターンツール使用ベンチマークによる実験は、SIT-Graphが強いメモリベースとグラフベースのベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-12-08T08:27:24Z) - DeepAgent: A General Reasoning Agent with Scalable Toolsets [111.6384541877723]
DeepAgentは、自律的な思考、ツール発見、アクション実行を実行するエンドツーエンドのディープ推論エージェントである。
長期にわたる相互作用の課題に対処するために,過去の相互作用を構造化エピソード,動作,ツール記憶に圧縮する自律的メモリ折り畳み機構を導入する。
LLMシミュレートされたAPIを活用し、ツール呼び出しトークンにきめ細かいクレジットを割り当てるツールコールアドバンテージ属性を適用した、エンドツーエンドの強化学習戦略であるToolPOを開発した。
論文 参考訳(メタデータ) (2025-10-24T16:24:01Z) - How Can Input Reformulation Improve Tool Usage Accuracy in a Complex Dynamic Environment? A Study on $τ$-bench [58.114899897566964]
マルチターンの会話環境では、大きな言語モデル(LLM)は、一貫性のある推論とドメイン固有のポリシーへの固執にしばしば苦労する。
本稿では,関連するドメインルールを付加したユーザクエリを自動的に再構成するIRMA(Input-Reformulation Multi-Agent)フレームワークを提案する。
IRMAはReAct、Function Calling、Self-Reflectionをそれぞれ16.1%、12.7%、19.1%で大きく上回っている。
論文 参考訳(メタデータ) (2025-08-28T15:57:33Z) - You Only Look at Screens: Multimodal Chain-of-Action Agents [37.118034745972956]
Auto-GUIは、インターフェースと直接対話するマルチモーダルソリューションである。
そこで本研究では,エージェントが実行すべきアクションを決定するためのチェーン・オブ・アクション手法を提案する。
我々は,30$Kのユニークな命令を持つ新しいデバイス制御ベンチマークAITWに対するアプローチを評価した。
論文 参考訳(メタデータ) (2023-09-20T16:12:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。