論文の概要: Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents
- arxiv url: http://arxiv.org/abs/2609.00549v1
- Date: Tue, 01 Sep 2026 01:33:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.197244
- Title: Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents
- Title(参考訳): 検索可能なLLMエージェントにおける実技使用の評価
- Authors: Seonghyeon Cho, Chanjun Park,
- Abstract要約: 大きな言語モデル(LLM)エージェントは、ますます外部スキルに依存している。
この実使用能力を測定するために、我々は「スキル追従(SF)」を定式化し、検索誘導実使用効果(RAE)を導入する。
RAEは、エージェントが積極的にスキルを回収したタスクにのみ条件付きで、マッチしたスキル対応実行とスキル障害実行の間の同じタスク結果の差を計算する。
- 参考スコア(独自算出の注目度): 14.569054900961921
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM) agents increasingly rely on external skills, yet standard evaluations obscure whether retrieving these skills actually helps. Aggregate metrics often compare retrieved versus non-retrieved tasks, introducing severe selection bias and failing to isolate the true effect of skill use. To measure this actual-use capability-which we formalize as Skill Following (SF)-we introduce the Retrieval-Invoked Actual-Use Effect (RAE). RAE computes the same-task outcome difference between matched skill-enabled and skill-disabled executions, conditioned exclusively on tasks where the agent actively retrieved a skill. Evaluating 17 LLMs across coding and mathematical domains, we uncover a stark evaluation paradox: models frequently show positive aggregate retrieval lift but negative RAE. On MBPP+, multiple models that appear to benefit system-wide actually harm their own performance on the exact tasks where retrieval occurred. These findings demonstrate that aggregate averages can create a misleading illusion of tool-use proficiency, whereas RAE directly measures whether the retrieval-to-answer pipeline genuinely rescues more outcomes than it harms.
- Abstract(参考訳): 大きな言語モデル(LLM)エージェントは、ますます外部スキルに依存している。
集約メトリクスは、取得されたタスクと非取得されたタスクを比較し、厳しい選択バイアスを導入し、スキル使用の本当の影響を分離しない。
この実使用能力を測定するため、我々は「スキル追従(SF)」として定式化し、検索誘導実使用効果(RAE)を導入する。
RAEは、エージェントが積極的にスキルを回収したタスクにのみ条件付きで、マッチしたスキル対応実行とスキル障害実行の間の同じタスク結果の差を計算する。
符号化領域と数理領域にまたがる17のLLMを評価することで,正の集合検索リフトを示すが負のRAEを示すモデルにおいて,スターク評価パラドックスを明らかにする。
MBPP+では、システム全体の恩恵を受けるように見える複数のモデルが、検索の正確なタスクにおいて、実際に自身のパフォーマンスを損なう。
これらの結果から,集計平均値がツール使用能力の誤認を招きかねない錯覚を生じさせることが示された。
関連論文リスト
- Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents [67.97365535829098]
経験から学ぶことは、有能で自己改善型の大規模言語モデル(LLM)エージェントの開発に不可欠である。
Evo-Harnessは、ノイズの多いシングルショット実行を、クロスドメインとトピックレベルの適応のための再利用可能なスキルハーネスに蒸留する。
本分析は,エボ・ハーネスの有効性を実証し,LLMエージェントがリアルタイムで効果的に学習する方法の原理的理解を提供する。
論文 参考訳(メタデータ) (2026-08-15T06:43:56Z) - When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning [70.72643569128316]
イミテーション学習(Imitation Learning, IL)は、エージェントがデモンストレーションから専門家の行動を再現するように訓練する。
我々は,学習者が専門家の値関数を表現できる場合,統計的に効率的である,インタラクティブなオンラインILアルゴリズムであるOVIを紹介する。
OVIは、オフラインポリシーベース(BC)、インタラクティブポリシーベース(DAgger)、オフライン価値ベースのILメソッドよりも優れており、学習者ネットワークが専門家よりも表現力に乏しい場合に最大である。
論文 参考訳(メタデータ) (2026-07-31T16:52:47Z) - Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents [19.325317938976355]
我々は、スキル強化エージェントが、前述のスキル使用と介入測定の影響の体系的なギャップであるtextbfReasoning Backroom を提示するかどうかを問う。
BACKTRACE(BACKTRACE)は,各スキル条件の回答と一致した非スキルのカウンターファクトとをペアリングする評価フレームワークである。
BACKROOMBenchは、制御された論理と競合数学にまたがる検証ベッドである。
論文 参考訳(メタデータ) (2026-07-29T21:59:20Z) - Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting [20.811638832981178]
大規模言語モデル(LLM)エージェントは、過去のインタラクションからの経験を蓄積し再利用する必要がある。
データ駆動のスキル最適化は、実際の環境から収集された限られた軌道に過度に適合する傾向がある。
リスクを緩和する3段階フレームワークであるSkillBoostを提案する。
論文 参考訳(メタデータ) (2026-07-29T09:05:40Z) - SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment [10.850946672552277]
スキル中心アセスメントのためのエンドツーエンドフレームワークであるSkillAuditを紹介します。
実用性、効率/コスト、安全性にまたがる包括的多次元評価レポートを生成する。
トップランクの現実世界のスキルパッケージをスキャンした結果、スキルの7%以上が危険な状態にあることがわかった。
論文 参考訳(メタデータ) (2026-06-21T17:40:05Z) - Co-Evolving Skill Generation and Policy Optimization [35.41582114275514]
既存の手法は通常、強力な言語モデルを使用してトラジェクトリを分析し、スキルを生成し、オンライントレーニング中に検索可能なスキルバンクを更新します。
プレストレージスキル検証のためのオンライン強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-07T17:55:55Z) - Offloading Score: Measuring AI Reliance Through Counterfactual Workflows [70.84727355516559]
私たちは、AIツールにオフロードされた認知活動の分断を定量化する、信頼度尺度であるオフロードスコアを導入します。
本研究は,本質的な計量妥当性評価と制御されたユーザスタディにより,オフロードスコアの検証を行う。
オフロードスコアは、時間制約設定における依存度を著しく高めることを示す。
論文 参考訳(メタデータ) (2026-05-28T05:44:31Z) - What Works for 'Lost-in-the-Middle' in LLMs? A Study on GM-Extract and Mitigations [1.2879523047871226]
GM-Extract は制御変数の検索において LLM 性能を評価するために慎重に設計された新しいベンチマークデータセットである。
2つのマルチドキュメントタスク(キー値抽出と質問応答)における7-8Bパラメータモデルの体系的評価を行う。
明瞭なU字曲線は一貫して観測されなかったが,本研究では,モデル間での明らかな性能パターンを明らかにした。
論文 参考訳(メタデータ) (2025-11-17T20:50:50Z) - Towards Effective Evaluations and Comparisons for LLM Unlearning Methods [97.2995389188179]
本稿では,大規模言語モデルにおける機械学習評価の精度向上を図る。
評価指標の堅牢性と、競合する目標間のトレードオフという、2つの重要な課題に対処します。
論文 参考訳(メタデータ) (2024-06-13T14:41:00Z) - Learning to Use Tools via Cooperative and Interactive Agents [58.77710337157665]
ツール学習は、外部ツールを使用してユーティリティを拡張するエージェントとして、大きな言語モデル(LLM)を促進する。
ツール選択,ツール実行,アクションキャリブレーションの3つの特別なエージェントを個別にコーディネートする,協調型対話型エージェントフレームワークであるConAgentsを提案する。
3つのデータセットに対する実験により、LLMは、ConAgentsを装備した場合、大幅に改善されたベースラインよりも優れた性能を示した。
論文 参考訳(メタデータ) (2024-03-05T15:08:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。