論文の概要: PCTD: Preference-Guided Counterfactual Task Decomposition for Agent Tool Retrieval
- arxiv url: http://arxiv.org/abs/2607.15696v1
- Date: Fri, 17 Jul 2026 07:15:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.778662
- Title: PCTD: Preference-Guided Counterfactual Task Decomposition for Agent Tool Retrieval
- Title(参考訳): PCTD:エージェントツール検索のための推奨誘導対実タスク分解
- Authors: Chu Zhao, Lei Tang, Minghang Li, Jianzhe Zhao, Guibing Guo, Zhengzong Chen, Yuanyuan Zhao, Fei Huang,
- Abstract要約: タスク分解は曖昧な命令を実行可能なアトミックサブタスクに変換することを目的としている。
タスク分解に対する報酬は、強化学習に基づく手法で容易に報酬のハッキングを誘発することができる。
提案手法はPCTD, PCTD, Preference-guided Counterfactual Task Decomposition である。
- 参考スコア(独自算出の注目度): 32.19528642807244
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Task decomposition aims to transform ambiguous instructions into executable atomic subtasks, thereby guiding high-precision tool retrieval. However, our analysis reveals that directly adopting tool retrieval metrics, i.e., Recall or NDCG, as rewards for task decomposition can easily induce reward hacking in reinforcement learning-based methods. Specifically, models tend to maximize retrieval matching through strategies such as repetitive decomposition. This spurious correlation between the shallow features of decomposition results and retrieval metric impairs generalization in Out-of-Domain (OOD) scenarios involving unseen tools. To address this issue, we propose PCTD, a Preference-guided Counterfactual Task Decomposition framework. PCTD quantifies the marginal causal gain of decomposition on retrieval ranking through a counterfactual reward, thereby cutting off spurious correlations at their source. Meanwhile, it introduces a preference reward to impose fine-grained structural supervision on logical coherence and atomicity, encouraging the model to generate high-quality decompositions. In addition, we construct MTDTool, the task decomposition benchmark specifically designed for mobile multi-turn interactions. Extensive experiments demonstrate that PCTD alleviates repetitive decomposition and surpasses SOTA methods in retrieval, decomposition quality, and OOD generalization.
- Abstract(参考訳): タスク分解は、曖昧な命令を実行可能なアトミックサブタスクに変換することを目的としており、それによって高精度ツール検索を導く。
しかし,本分析の結果から,Recall や NDCG といったツール検索指標をタスク分解の報酬として直接適用することで,強化学習手法による報酬ハッキングを容易化できることが判明した。
具体的には、反復分解のような戦略によって、検索マッチングを最大化する傾向にある。
この分解結果の浅さと検索基準の相関関係は, 未確認ツールを含むアウト・オブ・ドメイン(OOD)シナリオにおける一般化を損なう。
そこで我々は,PCTD(Preference-guided Counterfactual Task Decomposition framework)を提案する。
PCTDは、逆ファクト報酬による検索ランク付けにおける分解の限界因果ゲインを定量化することにより、ソースの急激な相関を遮断する。
一方、論理的コヒーレンスと原子性にきめ細かな構造的監督を課し、モデルに高品質な分解を起こさせるよう奨励する好意的な報酬を導入する。
さらに,モバイルマルチターンインタラクションに特化して設計されたタスク分解ベンチマークMTDToolを構築した。
大規模な実験により,PCTDは反復分解を緩和し,SOTA法を上回り,検索,分解品質,OOD一般化を行う。
関連論文リスト
- OrthoTryOn: Geometric Orthogonalization for Conflict-Free Unified Fashion Generation [43.40052085990979]
統一ファッション生成は、仮想試着や衣服の再構築のようなタスクを単一のモデルに統合し、タスク固有の適応コストを削減する。
我々は、共有Low-AdaptationRank(LoRA)モジュール内でこの干渉を緩和する統合フレームワークOrthoTryOnを提案する。
論文 参考訳(メタデータ) (2026-06-26T09:23:25Z) - Toward Trustworthy AI: Multi-Target Adversarial Attacks and Robust Defenses for Continuous Data Summarization [8.957420305238177]
要約プロセスに対する敵対的な摂動は、上流で信頼できるAIを妥協する可能性がある。
本稿では,DR-サブモジュラー最適化による類似度レベルの摂動下での連続データ要約に対する逆攻撃について検討する。
非負のサブモジュラー集合関数の多重線型拡張として、多重解像度画像要約対象のクラスが定式化可能であることを示す。
次に、類似構造の許容摂動を最適化し、複数のターゲットの要約モデルを分解する、min-max問題としてマルチターゲット攻撃生成を定式化する。
論文 参考訳(メタデータ) (2026-06-10T08:38:27Z) - TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition [62.56752617853322]
アウトカムベースの報酬はスパースフィードバックのみを提供するが、トラジェクトリによる報酬は注釈付き参照ソリューションに依存している。
本稿では,関数スキーマと実行時実行を直接管理する報奨フレームワークであるtrajectory-Invariant Execution Rewardsを提案する。
論文 参考訳(メタデータ) (2026-05-16T03:47:26Z) - RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards [76.17893114021757]
長い形式のレポートを計画し、調査し、エビデンスを評価し、合成する深層研究システムには、根本的な答えがなく、多くのツール強化された決定にまたがる。
本研究では,ルーブリックは最終回答評価者だけでなく,ポリシーの実行,判断フィードバック,エージェントメモリを構成する共有インターフェースとして機能すべきである,と論じる。
我々は、段階的な政策分解とリフレクションに基づくメタ政治進化を組み合わせたルーリック誘導強化学習フレームワークEMを導入する。
論文 参考訳(メタデータ) (2026-05-11T17:40:38Z) - TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - Beyond Single-Shot: Multi-step Tool Retrieval via Query Planning [6.212994999785976]
TOOLQPは、検索を反復的なクエリ計画としてモデル化する軽量フレームワークである。
命令をサブタスクに分解し、リトリーバーと対話するクエリを動的に生成する。
最先端のパフォーマンスを実現し、より優れたゼロショットの一般化、多様なレトリバー間の堅牢性、下流のエージェント実行の大幅な改善を実現している。
論文 参考訳(メタデータ) (2026-01-12T17:58:39Z) - Decomposition-Enhanced Training for Post-Hoc Attributions In Language Models [64.49342399229529]
我々は、ポストホック帰属を推論問題として再編成し、回答を構成単位に分解し、それぞれ特定の文脈に結び付けることができると論じる。
DecompTuneは、モデルに中間的推論ステップとして解解分解を生成することを教えるポストトレーニング手法である。
DecompTuneは、広範な実験と改善を通じて、属性の品質を大幅に改善し、先行手法より優れ、最先端のフロンティアモデルに適合または超えている。
論文 参考訳(メタデータ) (2025-10-29T17:58:59Z) - RGMDT: Return-Gap-Minimizing Decision Tree Extraction in Non-Euclidean Metric Space [28.273737052758907]
オラクルの専門家政策と最適決定木政策のリターンギャップの上限について紹介する。
これにより、各エージェントの局所的な観測と行動値空間上で、DT抽出問題を新しい非ユークリッドクラスタリング問題に再キャストすることができる。
また,Return-Gap-Minimization Decision Tree (RGMDT)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-21T21:19:49Z) - Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach [51.76826149868971]
モンテカルロシミュレーションによる政策評価は多くのMC強化学習(RL)アルゴリズムの中核にある。
本研究では,異なる長さの軌跡を用いた回帰推定器の平均二乗誤差のサロゲートとして品質指標を提案する。
本稿では,Robust and Iterative Data Collection Strategy Optimization (RIDO) という適応アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-17T11:47:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。