論文の概要: IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation under Dynamic Intent Fluctuations
- arxiv url: http://arxiv.org/abs/2608.02110v1
- Date: Mon, 03 Aug 2026 12:09:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.521732
- Title: IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation under Dynamic Intent Fluctuations
- Title(参考訳): IACM-RL:動的インテント変動下における複雑なツール実行のための意図的コンテキスト管理と強化学習
- Abstract要約: IACM-RLは、堅牢なツール呼び出しのための包括的なフレームワークである。
我々は、13のきめ細かいゆらぎシナリオにまたがる軌道を合成するDynamicIntentパイプラインを導入する。
第2に、IACM-RLはBeliefStateベースのセルフ生成コンテキストマネージャをデプロイする。
- 参考スコア(独自算出の注目度): 86.93902234336393
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Executing long-horizon tool invocations in real-world environments is severely challenged by dynamic user intent noise. Existing methods attempt robustness via implicit history scanning or text compression, yet predominantly assume perfect instructions in simplistic scenarios. Inevitably, under fluctuating contexts, obsolete constraints dilute model attention, triggering catastrophic intent deviation and infinite API loops. To resolve this, we propose IACM-RL, a comprehensive framework for robust tool invocation. First, we introduce the DynamicIntent pipeline, synthesizing trajectories across 13 fine-grained fluctuation scenarios, paired with a five-dimensional diagnostic metric suite. Second, IACM-RL deploys a BeliefState-based Self-Generated Context Manager that proactively tracks shifting goals and isolates overwritten parameters using structural stale flags. To autonomously internalize this state-tracking capability, we optimize the policy using a hierarchical intent-driven reward alongside three auxiliary losses (action calibration, CM extraction, and state distillation). Experiments on DynamicIntent, BFCL-V3, and $\mathrmτ^2$-Bench demonstrate that IACM-RL significantly outperforms baselines, reducing infinite loops and stale context errors while enhancing out-of-domain generalization.
- Abstract(参考訳): リアルタイム環境における長時間のツール呼び出しの実行は、動的なユーザ意図のノイズによって非常に困難である。
既存の手法は暗黙の履歴スキャンやテキスト圧縮によって堅牢性を試すが、ほとんどの場合、単純なシナリオで完璧な命令を仮定する。
必然的に、変動する状況下では、陳腐化した制約がモデルの注意を減らし、破滅的な意図の逸脱と無限のAPIループを引き起こします。
そこで我々は,堅牢なツール実行のための包括的なフレームワークIACM-RLを提案する。
まず、13のきめ細かいゆらぎシナリオにまたがる軌道を合成するDynamicIntentパイプラインを紹介し、5次元の診断基準スイートと組み合わせる。
第2に,IACM-RL は Belief State ベースの Self-Generated Context Manager をデプロイする。
この状態追跡能力を自律的に内部化するために、我々は3つの補助的損失(アクションキャリブレーション、CM抽出、状態蒸留)とともに階層的意図駆動報酬を用いて政策を最適化する。
DynamicIntent, BFCL-V3, $\mathrmτ^2$-Benchの実験では、IACM-RLはベースラインを著しく上回り、無限ループを減らし、コンテキストエラーを減らし、領域外一般化を強化している。
関連論文リスト
- AgentBrew: Offline Tool-Use Agent Learning from Raw Real-World Trajectories [36.7302669545557]
現実世界のアプリケーションは、事前に定義されたタスクや検証、忠実なシミュレーター、大規模環境相互作用のための限られた予算を提供する。
オフラインのトレーニングフレームワークである textbfAgentBrew を提案する。
AgentBrew は Qwen3-32B を +8.7 Acc / +9.7 Score で改善し、Qwen3-235B (+2.3 / +4.4) を上回り、拒絶サンプリングより優れている。
論文 参考訳(メタデータ) (2026-09-05T03:04:23Z) - StructRL: Structured Action-Space Exploration for Flow-Based VLAs [81.43458629514139]
フローベースのビジョン・ランゲージ・アクションモデルは現在、連続的なロボット操作に広く使われている。
オンライン強化学習は、それらを新しいタスクに適応するための重要なテクニックとして浮上している。
動作群間で時間的にスムーズかつスケールの異なる,構造的雑音に対する効果的なロボット探索の必要性を示す。
論文 参考訳(メタデータ) (2026-08-15T09:31:29Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy [52.106797722292896]
我々は,チャンクベースのアクション生成とリアルタイム修正を統合した動的クローズドループ拡散ポリシーフレームワークDCDPを提案する。
動的PushTシミュレーションでは、DCDPは5%の計算しか必要とせず、再トレーニングなしに適応性を19%改善する。
論文 参考訳(メタデータ) (2026-03-02T15:04:18Z) - LOGIGEN: Logic-Driven Generation of Verifiable Agentic Tasks [4.6880826836662814]
検証可能なトレーニングデータを合成するロジック駆動フレームワークである textbfLOGIGEN を紹介する。
2$-Benchでは、LOGIGEN-32B(RL)がtextbf79.5%の成功率を獲得し、ベースモデルを大幅に上回っている。
論文 参考訳(メタデータ) (2026-02-28T08:35:30Z) - Mind the Gap: Learning Implicit Impedance in Visuomotor Policies via Intent-Execution Mismatch [7.078279704479455]
本稿では,学習目標を「インテント・クローン(マスター・コマンド)」にシフトさせるデュアルステート・コンディショニング・フレームワークを提案する。
マスター意図を予測することによって、我々の政策は「仮想平衡点」を生成することを学び、暗黙のインピーダンス制御を効果的に実現した。
これは、低コストハードウェアのための最小限の動作クローニングフレームワークを示し、明示的な力センシングに頼ることなく、力知覚と動的補償を可能にする。
論文 参考訳(メタデータ) (2026-02-09T15:18:12Z) - Internalizing LLM Reasoning via Discovery and Replay of Latent Actions [4.830503861275364]
連鎖プロセスの隠れ状態への内部化は、テスト時間計算をスケールするための非常に効率的なパラダイムとして現れている。
動的潜在軌道制御問題として推論強化を再構築するSTIR(Self-Distilled Tools for Internal Reasoning)を提案する。
論文 参考訳(メタデータ) (2026-02-04T08:44:57Z) - V-CAGE: Context-Aware Generation and Verification for Scalable Long-Horizon Embodied Tasks [6.820118518027692]
V-CAGEは、大規模なセマンティックアライメントデータセットを生成するクローズドループフレームワークである。
本研究では,シーン合成における幾何学的整合性を実現する文脈認識型インスタンス化機構を提案する。
また、階層的な命令分解モジュールを用いて、抽象意図と低レベル制御のギャップを埋める。
論文 参考訳(メタデータ) (2026-01-21T16:41:51Z) - BINDER: Instantly Adaptive Mobile Manipulation with Open-Vocabulary Commands [22.562483208861078]
BINDERは、継続的環境監視から戦略的計画を切り離す、二重プロセスフレームワークである。
2つのモジュールは補完的な役割を果たす。DRMは構造化された3Dシーンの更新で戦略的計画を実行し、IRMが関与するものをガイドする。
BINDERはSoTAベースラインよりも成功と効率を著しく向上させ、実世界の展開に有効であることを実証している。
論文 参考訳(メタデータ) (2025-11-27T12:03:31Z) - Autonomous Vehicle Controllers From End-to-End Differentiable Simulation [57.278726604424556]
そこで我々は,AVコントローラのトレーニングにAPG(analytic Policy gradients)アプローチを適用可能なシミュレータを提案し,その設計を行う。
提案するフレームワークは, エージェントがより根底的なポリシーを学ぶのを助けるために, 環境力学の勾配を役立てる, エンド・ツー・エンドの訓練ループに, 微分可能シミュレータを組み込む。
ダイナミクスにおけるパフォーマンスとノイズに対する堅牢性の大幅な改善と、全体としてより直感的なヒューマンライクな処理が見られます。
論文 参考訳(メタデータ) (2024-09-12T11:50:06Z) - Action-Quantized Offline Reinforcement Learning for Robotic Skill
Learning [68.16998247593209]
オフライン強化学習(RL)パラダイムは、静的な行動データセットを、データを収集したポリシーよりも優れたパフォーマンスのポリシーに変換するためのレシピを提供する。
本稿では,アクション量子化のための適応型スキームを提案する。
IQL,CQL,BRACといった最先端のオフラインRL手法が,提案手法と組み合わせることで,ベンチマークのパフォーマンスが向上することを示す。
論文 参考訳(メタデータ) (2023-10-18T06:07:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。