論文の概要: Skills Know Their Neighbors: Cluster-Contrastive Capability Pages for Skill Retrieval
- arxiv url: http://arxiv.org/abs/2608.04482v1
- Date: Wed, 05 Aug 2026 06:09:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.73681
- Title: Skills Know Their Neighbors: Cluster-Contrastive Capability Pages for Skill Retrieval
- Title(参考訳): 隣人を知るスキル - スキル検索のためのクラスタコントラスト機能ページ
- Authors: Zifei Wang, Wei Wen, Qiang Ji, Ruizhi Qiao,
- Abstract要約: 我々は、スキルの能力をその実行可能な領域、解決可能なクエリの集合として定式化し、ドキュメントをその領域の失われた観察と見なす。
我々は、emphCapability Pages、正のトリガー$Tpos$、負のバウンダリ$Tneg$、差別的なボディ$B$を含むクラスタコントラストスキル表現を提案する。
6つのデータセットから26,262のスキルと5,400の質問を含むSRA-Benchでは、すべての機能ページがRecall@10を改善している
- 参考スコア(独自算出の注目度): 31.66405974559531
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: As skill libraries grow, large language model agents must retrieve reusable skills from candidates that often share the same topic and vocabulary but implement different capabilities. Retrieval is limited not only by the scorer but also by the text being scored: a document may describe what a skill does without stating which similar requests should be routed elsewhere. We formalize a skill's capability as its \emph{executable region}, the set of queries it can solve, and view its document as a lossy observation of that region. This view exposes a document-imposed component of retrieval error that cannot be removed by improving the retriever alone. We therefore propose \emph{Capability Pages}, cluster-contrastive skill representations containing a positive trigger $\Tpos$, a negative boundary $\Tneg$, and a discriminative body $B$. An offline compiler compares neighboring skills to write these fields. At inference time, the index uses $\Tpos$ and $B$ for candidate recall, while the router uses $\Tneg$ to reject confusable alternatives. On SRA-Bench, which contains 26{,}262 skills and 5{,}400 questions from six datasets, Capability Pages improve Recall@10 for all five tested retrievers, with a mean gain of $2.94$ points. Adding $\Tneg$ to candidate cards improves end-to-end task success by $3.62$ points on average across four executors and six datasets. A transfer evaluation on Chinese SSL-SkillDiscovery reaches $73.07\%$ MRR@50 using the same encoder across conditions. Capability Pages require no modification to the online models; they improve routing by rewriting the offline skill library.
- Abstract(参考訳): スキルライブラリが成長するにつれて、大きな言語モデルエージェントは、しばしば同じトピックと語彙を共有するが、異なる機能を実装する候補者から再利用可能なスキルを取り戻さなければならない。
Retrievalはスコアラーだけでなく、スコアされるテキストによっても制限される: 文書は、類似したリクエストがどの場所にルーティングされるべきかを記述することなく、スキルが何を行うかを記述できる。
我々は、そのスキル能力を、解決可能なクエリの集合であるemph{executable region}として定式化し、そのドキュメントを、その領域の失われた観察と見なす。
このビューは、検索エラーの文書化されたコンポーネントを公開します。
そこで我々は,正のトリガ$\Tpos$,負のバウンダリ$\Tneg$,差別的なボディ$B$を含むクラスタコントラストのスキル表現である \emph{Capability Pages} を提案する。
オフラインコンパイラは、これらのフィールドを書くために隣のスキルを比較する。
推論時に、インデックスは候補リコールに$\Tpos$と$B$を使用し、ルータは$\Tneg$を使用して、不良な代替品を拒否する。
6つのデータセットから26{,}262のスキルと5{,}400の質問を含むSRA-Benchでは、Capability Pagesが5つのテストレトリバーすべてに対してRecall@10を改善し、平均的な2.94$ポイントを獲得した。
候補カードに$\Tneg$を追加することで、4つのエグゼキュータと6つのデータセットの平均で、エンドツーエンドのタスク成功率が3.62ドル向上する。
中国のSSL-SkillDiscoveryの転送評価は、同じエンコーダを使って73.07\%$ MRR@50に達する。
オフラインスキルライブラリを書き換えることでルーティングを改善する。
関連論文リスト
- SkillSight: Calibrating Generic Content Bias for Skill Retrieval [12.466141257341851]
既存のレトリバーは、しばしばスキル内容を通常の文書として扱い、非常に規則的な構造を見下ろしている。
この共有背景は、密接な関連度スコアに反映され、クエリとスキルドキュメントの間に顕著なエネルギーギャップを生じさせ、識別シグナルを曖昧にすることを示す。
SkillSightは、意味空間と語彙空間の両方で共有背景を校正する学習自由検索フレームワークである。
論文 参考訳(メタデータ) (2026-07-21T07:05:15Z) - Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries [9.414340021489819]
大規模な言語モデルエージェントは、モデル外で再利用可能なプロシージャをますます保存する。
この調査は、このようなスキルライブラリが時間とともにどのように変化するのかを問うものだ。
エージェントは、相互作用から証拠を収集し、スキル更新を提案し、候補者を検証し、承認し、それらを検索と構成のために組織し、修復または不安定なエントリを修復し、証明とロールバックを通じて共有を管理する。
論文 参考訳(メタデータ) (2026-07-11T04:29:28Z) - What Should a Skill Remember? Quality--Cost Trade-offs in Cost-Aware Skill Rewriting for Language Model Agents [58.87681796862133]
我々は経済的なレンズを通してスキルの書き直しを勉強する。
我々のフレームワークは、情報保存戦略を用いて、スキル構造をプロファイルし、スキルを書き換える。
SkillsBenchの実験は、戦略間の異なる品質とコストのトレードオフを明らかにしている。
論文 参考訳(メタデータ) (2026-06-08T12:36:51Z) - Skill Is Not Document: A Query-Conditional Benchmark and Two-Stage Retriever for LLM Agent Skill Routing [40.648572239231804]
R3-Skillは、現実的なエージェントスキルルーティングのベンチマークである。
スキル互換性を明示的な訓練信号とする2段階検索システムを構築した。
データセット、トレーニングコード、モデルウェイトは、エージェントスキルルーティングのためのオープンソースとしてリリースされている。
論文 参考訳(メタデータ) (2026-06-02T12:30:46Z) - PAR$^2$-RAG: Planned Active Retrieval and Reasoning for Multi-Hop Question Answering [57.89576196160413]
大規模言語モデル (LLM) はマルチホップ質問応答 (MHQA) において脆弱のままである。
textbfPlanned Active Retrieval and Reasoning RAG (PAR$2-RAG)を提案する。
論文 参考訳(メタデータ) (2026-03-30T23:52:54Z) - $G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA [53.491241153213565]
G2$-Readerはマルチモーダルな質問応答のためのデュアルグラフシステムである。
Qwen3-VL-32B-Instructによる$G2$-Readerの平均精度は66.21%に達し、強力なベースラインとスタンドアローンのGPT-5(53.08%)を上回った。
5つのマルチモーダルドメインにわたるVisDoMBenchでは、Qwen3-VL-32B-Instructを使った$G2$-Readerが平均精度66.21%に達し、強力なベースラインとスタンドアロンのGPT-5(53.08%)を上回っている。
論文 参考訳(メタデータ) (2026-01-29T17:52:54Z) - Long$^2$RAG: Evaluating Long-Context & Long-Form Retrieval-Augmented Generation with Key Point Recall [20.048932795143976]
本稿では、Long$2$RAGベンチマークとKey Point Recallメトリックを紹介する。
Long$2$RAGは10のドメインにまたがる280の質問と8の質問カテゴリからなる。
KPRは、LLMが検索した文書から抽出したキーポイントを生成された応答に組み込む程度を評価する。
論文 参考訳(メタデータ) (2024-10-30T13:29:36Z) - Adaptive Query Rewriting: Aligning Rewriters through Marginal Probability of Conversational Answers [66.55612528039894]
AdaQRは、シードデータセットからの限定的な書き直しアノテーションと完全にパスラベルのないクエリ書き換えモデルをトレーニングするフレームワークである。
会話クエリに条件付き回答の確率を用いて,これらの候補に対する検索者の嗜好を評価する新しい手法を提案する。
論文 参考訳(メタデータ) (2024-06-16T16:09:05Z) - Query Rewriting for Retrieval-Augmented Large Language Models [139.242907155883]
大規模言語モデル(LLM)は、検索対象のパイプラインで強力なブラックボックスリーダーを動作させる。
この作業では、検索拡張LDMに対する以前の検索テーマ読み込みの代わりに、新しいフレームワークであるRewrite-Retrieve-Readを導入する。
論文 参考訳(メタデータ) (2023-05-23T17:27:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。