論文の概要: SkillSight: Calibrating Generic Content Bias for Skill Retrieval
- arxiv url: http://arxiv.org/abs/2607.18785v2
- Date: Wed, 29 Jul 2026 09:01:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 16:47:49.709377
- Title: SkillSight: Calibrating Generic Content Bias for Skill Retrieval
- Title(参考訳): SkillSight: スキル検索のためのジェネリックコンテンツバイアスの校正
- Abstract要約: 既存のレトリバーは、しばしばスキル内容を通常の文書として扱い、非常に規則的な構造を見下ろしている。
この共有背景は、密接な関連度スコアに反映され、クエリとスキルドキュメントの間に顕著なエネルギーギャップを生じさせ、識別シグナルを曖昧にすることを示す。
SkillSightは、意味空間と語彙空間の両方で共有背景を校正する学習自由検索フレームワークである。
- 参考スコア(独自算出の注目度): 12.466141257341851
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As large language model agents gain access to increasingly large skill libraries, retrieving the right skill becomes critical to reliable capability selection and execution. Existing retrievers often treat skill contents as ordinary documents, overlooking their highly regular structure: shared descriptive patterns recur across many skills while providing little evidence for distinguishing the required capability. We show that this shared descriptive background is reflected in dense relevance scores, induces a pronounced energy gap between queries and skill documents, and obscures discriminative signals, especially for structurally similar hard negatives. Based on this observation, we propose SkillSight, a training-free retrieval framework that calibrates shared background in both semantic and lexical spaces. Semantic Background Calibration estimates a background subspace from generic tokens identified by IDF, reducing similarity induced by shared descriptive patterns, while Lexical Evidence Calibration downweights shared background tokens to recover discriminative token-level evidence. Experiments on SRA-Bench and SkillBench-Supp demonstrate consistent improvements across retrieval metrics, with SkillSight improving Recall@10 by up to 20.21 percentage points over the original dense retriever. It is up to 1,248 times faster than the Dense + Reranker baseline. In end-to-end evaluation, SkillSight achieves the best overall performance across three agent models and outperforms LLM Selection by up to 4.97 percentage points. These results identify shared descriptive background as a source of ranking interference in skill retrieval and demonstrate that calibrating it enables accurate and efficient skill selection without additional training. Our code can be found at https://github.com/xiaojinying/SkillSight
- Abstract(参考訳): 大きな言語モデルエージェントがますます大きなスキルライブラリにアクセスできるようになると、信頼性の高い機能選択と実行のために適切なスキルを取得することが重要になります。
既存のレトリバーは、スキルの内容を通常の文書として扱うことが多く、非常に規則的な構造を見下ろしている。
この共有記述背景は、密接な関連性スコアに反映され、クエリとスキルドキュメントの間に顕著なエネルギーギャップを生じさせ、特に構造的に類似したハードネガティブに対して識別シグナルを曖昧にすることを示す。
そこで我々は,SkillSightを提案する。SkillSightは,意味空間と語彙空間の両方で,背景の共有を校正する学習自由検索フレームワークである。
セマンティック・バックグラウンド・キャリブレーションは、IDFによって特定された一般的なトークンから背景部分空間を推定し、共有記述パターンによって引き起こされる類似性を低減し、レキシカル・エビデンス・キャリブレーションは背景トークンを共有して識別的トークンレベルの証拠を回収する。
SRA-BenchとSkillBench-Suppの実験では、検索メトリクス間で一貫した改善が示されている。
Dense + Rerankerベースラインよりも1,248倍高速である。
エンドツーエンドの評価では、SkillSightは3つのエージェントモデルで最高の全体的なパフォーマンスを達成し、LLM選択を最大4.97ポイント上回っている。
これらの結果は,スキル検索におけるランキングの干渉源として,共有記述の背景を同定し,それを校正することで,追加のトレーニングを伴わずに,正確かつ効率的なスキル選択が可能になることを示した。
私たちのコードはhttps://github.com/xiaojinying/SkillSightにある。
関連論文リスト
- Skill2Query: Exploiting Skill Structure to Generate Pseudo-Queries for Agent Skill Retrieval [23.49934184220403]
擬似クエリ生成は、エージェントスキル検索の監視ボトルネックを軽減することができる。
本稿では,スキルドキュメントをスキル知識グラフに解析し,擬似クエリを生成するフレームワークであるSkill2Queryを提案する。
生成されたクエリは、オフラインインデックス拡張、オンラインクエリ拡張、レトリバートレーニングに使用することができる。
論文 参考訳(メタデータ) (2026-08-17T04:04:19Z) - Demystifying Agent Skills: Why They Work-Until They Don't [58.92875630998418]
既存の評価は、スキルが集約されたタスクの成功を改善するかどうかを主に測定する。
我々は、表現、結果アノテーション、検索難易度、スキルのクロスフレームワークの影響を分離する。
我々はこれらの観察を3つの高レベルカテゴリと12のスキルユースモードの分類に集約する。
論文 参考訳(メタデータ) (2026-08-14T07:26:38Z) - Generative Skill Composition for LLM Agents [58.47191648555256]
LLMエージェントは複雑なタスクを解決するためのスキルの恩恵を受ける。
スキルライブラリが成長するにつれて、適切なスキル構成を選択することが中心的なボトルネックとして現れている。
本稿では,タスク条件付きスキルシーケンス予測として構造化されたスキルコンポジションをインスタンス化するSkillComposerを提案する。
論文 参考訳(メタデータ) (2026-06-30T17:53:09Z) - Co-Evolving Skill Generation and Policy Optimization [35.41582114275514]
既存の手法は通常、強力な言語モデルを使用してトラジェクトリを分析し、スキルを生成し、オンライントレーニング中に検索可能なスキルバンクを更新します。
プレストレージスキル検証のためのオンライン強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-07T17:55:55Z) - SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs [70.1970574147839]
有向グラフのノードとして再利用可能なスキルを表現するフレームワークであるSKILLGRAPHを提案する。
SKILLGRAPHは個々のスキルだけでなく、多段階意思決定をガイドできる順序付きスキルサブグラフも取得する。
実験により,SKILLGRAPHはメモリ拡張RL法に対して最先端の性能を実現することが示された。
論文 参考訳(メタデータ) (2026-05-12T12:21:49Z) - SkillRAE: Agent Skill-Based Context Compilation for Retrieval-Augmented Execution [10.83969404435554]
大きな言語モデル(LLM)ベースのエージェントは、アーティファクトリッチなタスクを解決するために、再利用可能なスキルライブラリに依存している。
本稿では,スキルベースのコンテキストコンパイルに着目した2段階RAE手法であるSkillRAEを提案する。
2つの公開ベンチマークの実験によると、SkillRAEはRAEのベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-05-11T07:31:48Z) - SkillLens: Adaptive Multi-Granularity Skill Reuse for Cost-Efficient LLM Agents [6.293920920196533]
SkillLensは階層的なスキル進化フレームワークで、スキルをポリシー、戦略、手順、プリミティブの4層グラフにまとめる。
セマンティックなスキルシードを検索し、スキルグラフの次数補正されたランダムウォークを通じて拡張し、各訪問したユニットが受け入れられ、分解され、書き直され、スキップされるかどうかを検証器を使って決定する。
MuLocbenchとALFWorld全体で、SkillLensは、強いスキルベースのベースラインよりも一貫して改善されている。
論文 参考訳(メタデータ) (2026-05-08T18:48:04Z) - SkillRet: A Large-Scale Benchmark for Skill Retrieval in LLM Agents [8.628588436048952]
LLMエージェントにおけるスキル検索のための大規模ベンチマークであるSkillRetを紹介する。
63,259のトレーニングサンプルと,相容れないスキルプールを備えた4,997のアセスメントクエリを提供する。
オフザシェルフモデルは現実的な大規模スキルライブラリに苦しむが、以前のスキル検索モデルは依然として相当なヘッドルームを残している。
論文 参考訳(メタデータ) (2026-05-07T06:18:11Z) - How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings [29.3744517703302]
本研究は,段階的に挑戦的な現実的な環境下でのスキルユーティリティの総合的研究である。
その結果、設定がよりリアルになるにつれて、パフォーマンスは一貫して低下することがわかった。
クエリ固有の改善は、初期スキルが合理的な妥当性と品質を持つ場合に、性能を著しく回復することを示す。
論文 参考訳(メタデータ) (2026-04-06T00:10:30Z) - From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation [52.62655622099456]
検証基準ベース報酬(RLVRR)を用いた強化学習を提案する。
最後の答えをチェックする代わりに、RLVRRは高品質な参照(すなわち報酬連鎖)から順序付けられた言語信号を抽出する。
このようにして、RLVRRは報酬を2つの次元に分解する。
論文 参考訳(メタデータ) (2026-01-26T14:39:58Z) - Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models [44.31597857713689]
最初の段階でActive Indexingを導入し、一般化可能なソースアンコールバインディングを作成します。
Qwen-2.5-7B&3Bの実験は、アクティブインデックスがパッシブインデックスのベースラインを一貫して上回っていることを示している。
内部の引用は、モデルを検索ノイズに対してより堅牢にすることで、外部の引用を補完する。
論文 参考訳(メタデータ) (2025-06-21T04:48:05Z) - Training a Utility-based Retriever Through Shared Context Attribution for Retrieval-Augmented Language Models [51.608246558235166]
SCARLetは、RALMsでユーティリティベースのレトリバーをトレーニングするためのフレームワークである。
マルチタスクの一般化とパッセージ間相互作用という2つの重要な要素が組み込まれている。
ドメイン内とドメイン外の両方で、さまざまなタスクにまたがる10のデータセットに対するアプローチを評価します。
論文 参考訳(メタデータ) (2025-04-01T09:28:28Z) - Beyond Contrastive Learning: Synthetic Data Enables List-wise Training with Multiple Levels of Relevance [30.879299174443812]
本研究では,実際の文書やアノテーションを定式化し,大規模な言語モデルを用いて合成文書を生成する。
MARCO と BEIR のベンチマーク実験により,提案手法は従来の InfoNCE を用いたトレーニングよりも高い性能を示した。
論文 参考訳(メタデータ) (2025-03-29T22:33:22Z) - Beyond Relevance: Evaluate and Improve Retrievers on Perspective Awareness [56.42192735214931]
検索者は、ドキュメントとクエリ間のセマンティックな関連性に頼るだけでなく、ユーザクエリの背後にある微妙な意図や視点を認識することも期待されている。
本研究では,検索者がクエリの異なる視点を認識し,応答できるかどうかを検討する。
我々は,現在の検索者はクエリにおいて微妙に異なる視点に対する認識が限られており,特定の視点に偏りがあることを示す。
論文 参考訳(メタデータ) (2024-05-04T17:10:00Z) - Bridging the Training-Inference Gap for Dense Phrase Retrieval [104.4836127502683]
密度の高いレトリバーを構築するには、トレーニングやニューラルネットワークの検証など、一連の標準手順が必要である。
本稿では,高密度検索におけるトレーニングと推論のギャップを減らせる方法について検討する。
コーパス全体の小さな部分集合を用いて高密度レトリバーを効率よく検証する方法を提案する。
論文 参考訳(メタデータ) (2022-10-25T00:53:06Z) - LED: Lexicon-Enlightened Dense Retriever for Large-Scale Retrieval [68.85686621130111]
そこで本研究では,高密度なレトリバーをレキシコン認識表現モデルに整合させることを提案する。
提案手法を3つの公開ベンチマークで評価した結果,教師と同等のレキシコン・アウェア・レトリバーにより,提案手法が一貫した,重要な改善をもたらす可能性が示唆された。
論文 参考訳(メタデータ) (2022-08-29T15:09:28Z) - LaPraDoR: Unsupervised Pretrained Dense Retriever for Zero-Shot Text
Retrieval [55.097573036580066]
実験結果から,LaPraDoRは教師付き高密度検索モデルと比較して最先端の性能が得られることがわかった。
再ランクと比較すると,1ミリ秒 (22.5倍高速) でレキシコン強化手法を動作させることができるが,性能は良好である。
論文 参考訳(メタデータ) (2022-03-11T18:53:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。