論文の概要: Skill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity Preference Learning
- arxiv url: http://arxiv.org/abs/2606.00510v1
- Date: Sat, 30 May 2026 04:00:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.500079
- Title: Skill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity Preference Learning
- Title(参考訳): スキルとスキップ : デュアルグラニュラ性選好学習によるエージェントタスクにおける選択的スキル実践の学習
- Abstract要約: SelSkillは、選択的なスキル実行のための二粒度選好学習フレームワークである。
Qwen3-8BのALFWorldでは、SelSkillはタスク成功率を10.9ポイント、実行精度を29.1ポイント改善している。
- 参考スコア(独自算出の注目度): 7.040842274056163
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent skills are callable procedural modules that provide reusable knowledge and execution policies for complex agentic tasks. However, existing methods mainly focus on selecting relevant skills or improving the skills themselves, while overlooking whether a relevant skill should actually be invoked at the current decision point. Unhelpful invocations may introduce irrelevant context and disrupt an otherwise correct execution process. To address this issue, we propose SelSkill, a dual-granularity preference-learning framework for selective skill invocation. SelSkill formulates skill use as a skill-or-skip decision, uses predictive uncertainty to prioritize candidate decision points, and constructs controlled invoke-skip preference pairs from shared trajectory prefixes. It further combines episode-level outcome preferences with step-level invocation preferences to capture both overall trajectory quality and the local effectiveness of skill invocation. On ALFWorld with Qwen3-8B, SelSkill improves task success by 10.9 percentage points and execution precision by 29.1 percentage points. On BFCL, it improves task success by 5.7 percentage points and execution precision by 29.5 percentage points. Zero-shot results on Tau-bench and PopQA further suggest that the learned invocation policy transfers to new domains with previously unseen skills.
- Abstract(参考訳): エージェントスキルは、複雑なエージェントタスクに対して再利用可能な知識と実行ポリシーを提供する手続きモジュールと呼ばれる。
しかし、既存の手法は、主に関連するスキルの選択やスキル自体の改善に重点を置いており、現在の決定点において、関連するスキルが実際に呼び出されるべきかどうかを見落としている。
不要な呼び出しは、無関係なコンテキストを導入し、そうでなければ正しい実行プロセスを妨害する。
この問題に対処するために、選択的なスキル実行のための二粒度選好学習フレームワークであるSelSkillを提案する。
SelSkillは、スキル・オア・スキップの判断としてスキルを定式化し、予測不確実性を使用して候補決定点を優先順位付けし、共有軌跡プレフィックスから制御されたinvoke-skipの選好ペアを構築する。
さらに、エピソードレベルの結果の選好とステップレベルの呼び出しの選好を組み合わせることで、全体的な軌道品質とスキル実行の局所的効果の両方を捉える。
Qwen3-8BのALFWorldでは、SelSkillはタスク成功率を10.9ポイント、実行精度を29.1ポイント改善している。
BFCLではタスク成功率を5.7ポイント、実行精度を29.5ポイント改善している。
Tau-benchとPopQAのゼロショット結果はさらに、学習された呼び出しポリシーが、これまで見つからなかったスキルを持つ新しいドメインに転送されることを示唆している。
関連論文リスト
- Implicit Manipulation for Skill Selection in LLM Agents with Semantic Matching [19.025072797409198]
セマンティックマッチング(ISM)によるインプシティスキル選択操作について述べる。
ISMは、ターゲットスキルメタデータと再利用可能なプロンプトを作成し、明示的な選択命令なしでスキル選択を操作する。
人間のレビュアーはISMをわずか2.9%でブロックするが、明示的なステアリングは91.4%である。
論文 参考訳(メタデータ) (2026-09-02T03:07:11Z) - Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback [52.78692582507693]
専門家による自然言語スキルは、ツール使用エージェントを改善することができるが、エージェントによるスキルは、スキルを使用しないよりも8-11ポイント悪い。
本研究では,中間的スキルから実行経験を訓練状態に整理する方法について検討する。
論文 参考訳(メタデータ) (2026-08-18T09:52:48Z) - Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning [72.09826781730662]
ロングホライゾン推論は、モデルが推論チェーン内の異なるスキルを切り替えることを要求する。
スキル・エントロピー(Skill Entropy)とは、あるスキルから別のスキルに切り替えることの難しさを測る尺度である。
本稿では,RLフレームワークであるSkill-Entropy RLを提案する。
論文 参考訳(メタデータ) (2026-08-05T17:57:16Z) - Task Decomposition-Guided Reranking for Adaptive Agent Skill Retrieval [16.270741233471107]
本稿では,適応型スキル選択のための推論時間更新フレームワークであるSkillRerankerを提案する。
我々は、SkillRerankerがタスク性能を効果的に改善し、環境相互作用のステップを減らし、トークン消費を減らすことを示す。
論文 参考訳(メタデータ) (2026-07-07T13:49:08Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - SkillJuror: Measuring How Agent Skill Organization Changes Runtime Behavior [23.11308948097101]
現在のベンチマークでは、スキルがどのように組織化されているのかを区別することは滅多にありません。
我々は、この区別をプログレッシブ・開示(Progressive Disclosure)を通じて研究し、簡潔なルートファイルが要求に応じてリソースを支援するためにエージェントを指示する。
本稿では,スキル記述パラダイムを評価するフレームワークであるSkillJurorを紹介する。
論文 参考訳(メタデータ) (2026-06-10T01:11:50Z) - SkillsInjector: Dynamic Skill Context Construction for LLM Agents [16.631471381875816]
既存の方法では、静的なステップとしてスキルインジェクションを扱い、一定の基準でスキルを選択し、事前に予算を固定し、説明をそのまま残します。
本稿では,これらの決定に共同で対処する2段階適応手法であるSkillsInjectorを提案する。
Tau2-bench、SkillsBench、ALFWorldで、SkillsInjectorは最強のベースラインを3.9点、6.1点、7.3ポイント改善した。
論文 参考訳(メタデータ) (2026-05-28T11:44:32Z) - SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs [70.1970574147839]
有向グラフのノードとして再利用可能なスキルを表現するフレームワークであるSKILLGRAPHを提案する。
SKILLGRAPHは個々のスキルだけでなく、多段階意思決定をガイドできる順序付きスキルサブグラフも取得する。
実験により,SKILLGRAPHはメモリ拡張RL法に対して最先端の性能を実現することが示された。
論文 参考訳(メタデータ) (2026-05-12T12:21:49Z) - SkillLens: Adaptive Multi-Granularity Skill Reuse for Cost-Efficient LLM Agents [6.293920920196533]
SkillLensは階層的なスキル進化フレームワークで、スキルをポリシー、戦略、手順、プリミティブの4層グラフにまとめる。
セマンティックなスキルシードを検索し、スキルグラフの次数補正されたランダムウォークを通じて拡張し、各訪問したユニットが受け入れられ、分解され、書き直され、スキップされるかどうかを検証器を使って決定する。
MuLocbenchとALFWorld全体で、SkillLensは、強いスキルベースのベースラインよりも一貫して改善されている。
論文 参考訳(メタデータ) (2026-05-08T18:48:04Z) - How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings [29.3744517703302]
本研究は,段階的に挑戦的な現実的な環境下でのスキルユーティリティの総合的研究である。
その結果、設定がよりリアルになるにつれて、パフォーマンスは一貫して低下することがわかった。
クエリ固有の改善は、初期スキルが合理的な妥当性と品質を持つ場合に、性能を著しく回復することを示す。
論文 参考訳(メタデータ) (2026-04-06T00:10:30Z) - SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization [61.37478254738943]
推論時のスキル向上は基本的に制限されている。
SKILL0は,スキル内部化のためのコンテキスト内強化学習フレームワークである。
SKILL0は標準のRLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-04-02T17:03:05Z) - SkillRouter: Skill Routing for LLM Agents at Scale [18.540967600258607]
ユーザタスクが与えられたら、システムは、下流の計画や実行の前に、関連するスキルを特定する必要がある。
既存のエージェントスタックはプログレッシブな開示に依存しており、完全な実装ボディを隠蔽しながら、スキル名と記述のみを公開する。
1.2Bのコンパクトなフルテキスト検索/参照パイプラインであるSkillを提示する。
論文 参考訳(メタデータ) (2026-03-23T18:23:59Z) - EvoSkill: Automated Skill Discovery for Multi-Agent Systems [6.319876096746374]
エージェントスキルを自動的に発見・洗練する自己進化型フレームワークである textbfEvoSkill を紹介する。
EvoSkillは実行障害を分析し、新しいスキルや既存のスキルへの編集を提案し、それらを構造化された再利用可能なスキルフォルダに実体化する。
われわれはEvoSkillを米国財務データの根拠となる推論ベンチマークであるOfficeQAと、ノイズの多い検索ベンチマークであるSealQAの2つのベンチマークで評価した。
論文 参考訳(メタデータ) (2026-03-03T09:07:22Z) - SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks [61.89812116484928]
エージェントスキルは、LLMエージェントを推論時に増強する手続き的知識の構造化パッケージである。
SkillsBenchは、11のドメインにわたる86のタスクのベンチマークであり、キュレートされたスキルと決定論的検証との組み合わせを示す。
キュレートされたスキルは平均パスレートを16.2ポイント(pp)上昇させるが、効果は領域によって大きく異なる。
自己生成スキルは平均的に何の利益も与えず、モデルが消費から得られる手続き的な知識を確実に説明できないことを示している。
論文 参考訳(メタデータ) (2026-02-13T07:06:06Z) - Skill-Based Reinforcement Learning with Intrinsic Reward Matching [77.34726150561087]
Intrinsic Reward Matching (IRM) を提案する。
IRMにより、従来のスキル選択方法よりもはるかに効果的に事前訓練されたスキルを活用できる。
論文 参考訳(メタデータ) (2022-10-14T00:04:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。