論文の概要: What Does a Skill Actually Do? Estimands and Evaluation Validity for Tool and Skill Use in LLM Agents: A Critical Review
- arxiv url: http://arxiv.org/abs/2609.33153v1
- Date: Sun, 27 Sep 2026 03:26:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.413607
- Title: What Does a Skill Actually Do? Estimands and Evaluation Validity for Tool and Skill Use in LLM Agents: A Critical Review
- Title(参考訳): スキルとは何か? LLMエージェントのツールとスキル使用に対する評価と評価の妥当性:批判的レビュー
- Abstract要約: 大きな言語モデル(LLM)エージェントは、数千のエントリを保持するライブラリから実行時に選択された外部ツールや再利用可能なスキルをますます引き出す。
このレビューでは、各設計がどの設計と比較し、どの仮定に基づいているかを問う。
- 参考スコア(独自算出の注目度): 6.446568742921826
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents increasingly draw on external tools and reusable skills selected at run time from libraries that hold thousands of entries. Reports that a retriever, router, or skill library "improves" an agent may refer to retrieval recall, the success change from enabling a library, a paired contrast restricted to triggered tasks, or a gain under an approximate budget constraint. This critical review asks what each design compares and under which assumptions. Building on estimand-based approaches to agent evaluation, we describe tool and skill designs along six axes: treatment contrast, target population, outcome, budget constraint, summary measure, and identification assumptions. Thirteen core empirical studies anchor the evidence synthesis, supplemented by related methodological work and design-level reading of the wider literature. Our contribution is to make explicit distinctions that some source authors already acknowledge through a decomposition of trigger-conditioned pairing, analytic counterexamples, and comparisons across studies. Pairing on the task does not by itself identify an invocation effect; paired gain and regression counts measure protocol-specific discordance rather than the share of tasks whose expected outcomes worsen; and total effects of module deployment answer a different question from budget-constrained efficiency. We compare curated skill provision with retriever replacement, triggered subsets with all-task outcomes, and observed cost reductions with budget-constrained comparisons. A reporting checklist and worked examples connect these distinctions to information that studies can report. The review runs no new experiments; empirical results come from the cited studies, and numerical toy examples are analytical illustrations.
- Abstract(参考訳): 大きな言語モデル(LLM)エージェントは、数千のエントリを保持するライブラリから実行時に選択された外部ツールや再利用可能なスキルをますます引き出す。
検索者、ルータ、またはスキルライブラリがエージェントを「改善する」という報告は、リカバリリコール、ライブラリの有効化による成功の変化、トリガタスクに制限されたペアコントラスト、あるいはおよそ予算制約の下での利得などを指す。
この批判的なレビューでは、各設計がどの設計と比較し、どの仮定の下にあるかを問う。
エージェント評価に対する評価に基づくアプローチに基づいて、治療コントラスト、対象人口、成果、予算制約、要約測度、識別仮定の6つの軸に沿って、ツールとスキル設計を記述する。
13の核実験研究は、より広い文献の方法論的な研究と設計レベルの読解によって補足された証拠合成を固定した。
我々の貢献は、トリガー条件のペアリング、解析的反例、研究間の比較を分解することで、一部の著者が既に認識している明確な区別を行うことである。
対の利得と回帰は、期待される結果が悪化するタスクの共有よりもプロトコル固有の不一致を計測し、モジュール配置の合計効果は、予算制約された効率とは異なる疑問に答える。
得られた技術提供とレトリバーの交換,全タスク結果のサブセットのトリガ,予算制約の比較によるコスト削減について検討した。
レポートチェックリストと作業例は、これらの区別を、研究が報告できる情報と結びつけます。
このレビューでは、新しい実験は行われず、実験結果が引用された研究から得られ、数値的なおもちゃの例は分析的な図解である。
関連論文リスト
- When does a scaling result justify a different allocation? A critical review of resource-allocation evidence for AI systems [0.0]
このレビューでは、レポートされたスケーリング結果がリソース割り当て決定をサポートするかどうかを問う。
事前トレーニング、テスト時間計算、検索、エージェント評価のエビデンスを比較する。
普遍的なスケーリング法則を提案したり、ベンチマークゲインから一般的なインテリジェンスを推測したりしない。
論文 参考訳(メタデータ) (2026-09-13T13:22:32Z) - Estimating Item Difficulty with Large Language Models as Experts [0.44101646956991475]
本研究は,3つの既成言語モデルを,応答データにアクセスできることなく,新たに作成された項目のラベル付けが困難であるとして評価した。
この調査では、判断形式(絶対対対ペア)、決定型(ハードな決定対トークン確率に基づく見積もり)、そして戦略の推進という3つの要因を横断する完全な因子的設計が用いられた。
LLMをベースとした評価では, 実験項目の難易度と中程度から強い正の相関が認められた。
論文 参考訳(メタデータ) (2026-05-18T15:42:13Z) - LLM4SCREENLIT: Recommendations on Assessing the Performance of Large Language Models for Screening Literature in Systematic Reviews [2.2175470459999636]
我々は、系統的なレビューにおいて、関連する文献を特定するために、Gen-AIツールのパフォーマンスを評価するために伝統的なメトリクスを使用する際の問題を特定する。
主な弱点は、不均衡なデータに対して堅牢で、結果が偶然よりも優れているかどうかを直接示さないメトリクスを使用できないことであった。
ポジティブな面では、研究者や実践者や政策立案者に対する勧告が構築される優れた(評価)プラクティスを抽出する。
論文 参考訳(メタデータ) (2025-11-16T15:04:50Z) - Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization [86.98098988779809]
SummQは長期文書要約のための新しい逆多重エージェントフレームワークである。
提案手法では,包括的な要約を作成し,評価するために協調作業を行う要約ジェネレータとレビュアーを用いる。
広範に使用されている3つの文書要約ベンチマーク上でSummQを評価する。
論文 参考訳(メタデータ) (2025-09-25T08:36:19Z) - Agent-as-Judge for Factual Summarization of Long Narratives [37.46772108810212]
大規模言語モデル(LLM)は、ROUGEやBERTScoreといった従来のメトリクスに基づいた要約タスクにおいて、ほぼ人間に近い性能を示す。
LLM-as-a-Judgeのような最近の進歩は、語彙的類似性に基づくメトリクスの限界に対処するが、実際には矛盾を示す。
本稿では,要約を評価・精査するための新しい「Agent-as-a-Judge」フレームワークであるNarrativeFactScoreを紹介する。
論文 参考訳(メタデータ) (2025-01-17T07:23:06Z) - C-ICL: Contrastive In-context Learning for Information Extraction [54.39470114243744]
c-ICLは、正しいサンプル構築と間違ったサンプル構築の両方を活用して、コンテキスト内学習のデモを作成する、新しい数ショット技術である。
各種データセットに対する実験により,c-ICLは従来の数発のインコンテキスト学習法よりも優れていたことが示唆された。
論文 参考訳(メタデータ) (2024-02-17T11:28:08Z) - USB: A Unified Summarization Benchmark Across Tasks and Domains [68.82726887802856]
ウィキペディア由来のベンチマークを導入し、クラウドソースアノテーションの豊富なセットを補完し、8ドルの相互関連タスクをサポートする。
このベンチマークで様々な手法を比較し、複数のタスクにおいて、中程度の大きさの微調整されたモデルが、より大きな数発の言語モデルよりも一貫して優れていることを発見した。
論文 参考訳(メタデータ) (2023-05-23T17:39:54Z) - Active Learning for Abstractive Text Summarization [50.79416783266641]
本稿では,抽象テキスト要約におけるアクティブラーニングのための最初の効果的なクエリ戦略を提案する。
ALアノテーションにおける私たちの戦略は、ROUGEと一貫性スコアの点からモデル性能を向上させるのに役立ちます。
論文 参考訳(メタデータ) (2023-01-09T10:33:14Z) - CORE: A Retrieve-then-Edit Framework for Counterfactual Data Generation [91.16551253297588]
Counterfactual Generation via Retrieval and Editing (CORE) は、トレーニングのための多様な反事実摂動を生成するための検索強化された生成フレームワークである。
COREはまず、学習されたバイエンコーダを用いて、タスク関連未ラベルテキストコーパス上で密集した検索を行う。
COREはこれらを、反ファクト編集のために、数ショットの学習機能を備えた大規模な言語モデルへのプロンプトに組み込む。
論文 参考訳(メタデータ) (2022-10-10T17:45:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。