論文の概要: What Does a Skill Actually Do? Estimands and Evaluation Validity for Tool and Skill Use in LLM Agents: A Critical Review
- arxiv url: http://arxiv.org/abs/2609.33153v2
- Date: Thu, 01 Oct 2026 12:19:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.414092
- Title: What Does a Skill Actually Do? Estimands and Evaluation Validity for Tool and Skill Use in LLM Agents: A Critical Review
- Title(参考訳): スキルとは何か? LLMエージェントのツールとスキル使用に対する評価と評価の妥当性:批判的レビュー
- Abstract要約: レビューでは、どの評価を見積もるか、どの設計支援を結論付けるかを検討する。
設計は、治療コントラスト、対象人口、結果、予算制約、概要測定、識別仮定によって特徴づけられる。
- 参考スコア(独自算出の注目度): 6.446568742921826
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reported improvements from tools and reusable skills in large language model agents refer to different comparisons. This critical narrative review examines what these evaluations estimate and which conclusions their designs support. The review checks the roles of one hundred cited papers and extracts focal evaluation designs in detail from thirty-five studies. Targeted readings of thirty-five additional published or accepted studies broaden coverage of tool creation, memory, interactive benchmarks, reliability, and risk. Designs are characterized by treatment contrast, target population, outcome, budget constraint, summary measure, and identification assumptions. Analytic decompositions and counterexamples show that pairing runs on the same task does not itself identify an invocation effect when evaluation conditions on a trigger within the treated run. Paired gain and regression counts describe discordance under the coupling protocol rather than the share of tasks whose expected outcomes worsen. Total effects of deploying a module answer a different question from efficiency under a common budget. Comparisons across studies distinguish curated skill provision from retriever replacement, task populations from triggered subsets, and preparation costs from marginal usage costs. Publication status and reading depth are recorded. The review provides a methodological synthesis and a reporting checklist to help align claims about tools and skills with the comparisons their evaluation designs support.
- Abstract(参考訳): 大規模な言語モデルエージェントにおけるツールと再利用可能なスキルの改善は、異なる比較を参照している。
この批判的物語レビューは、これらの評価がどのように見積もり、どの設計支援を結論づけるかを考察する。
このレビューでは、引用された100の論文の役割を確認し、35の研究から焦点評価設計を詳細に抽出する。
ツール作成、メモリ、インタラクティブなベンチマーク、信頼性、リスクのカバー範囲を広げている。
設計は、治療コントラスト、対象人口、結果、予算制約、概要測定、識別仮定によって特徴づけられる。
解析的分解と反例は、同一タスク上でのペアリングが、処理された実行中のトリガに対する評価条件において、それ自体が呼び出し効果を識別しないことを示している。
ペア化されたゲインとレグレッションカウントは、期待される結果が悪化するタスクの共有よりも、結合プロトコルの下での不一致を記述する。
モジュールのデプロイによる全体的な影響は、共通の予算の下での効率性とは異なる疑問に答えます。
研究間の比較では、キュレートされたスキル提供とレトリバーの代替、引き起こされたサブセットからのタスク人口、限界使用コストによる準備コストが区別される。
出版状況と読解深度が記録されている。
このレビューは、方法論的な合成とレポートチェックリストを提供し、ツールやスキルに関する主張を、評価設計がサポートする比較と整合させるのに役立つ。
関連論文リスト
- When does a scaling result justify a different allocation? A critical review of resource-allocation evidence for AI systems [0.0]
このレビューでは、レポートされたスケーリング結果がリソース割り当て決定をサポートするかどうかを問う。
事前トレーニング、テスト時間計算、検索、エージェント評価のエビデンスを比較する。
普遍的なスケーリング法則を提案したり、ベンチマークゲインから一般的なインテリジェンスを推測したりしない。
論文 参考訳(メタデータ) (2026-09-13T13:22:32Z) - Estimating Item Difficulty with Large Language Models as Experts [0.44101646956991475]
本研究は,3つの既成言語モデルを,応答データにアクセスできることなく,新たに作成された項目のラベル付けが困難であるとして評価した。
この調査では、判断形式(絶対対対ペア)、決定型(ハードな決定対トークン確率に基づく見積もり)、そして戦略の推進という3つの要因を横断する完全な因子的設計が用いられた。
LLMをベースとした評価では, 実験項目の難易度と中程度から強い正の相関が認められた。
論文 参考訳(メタデータ) (2026-05-18T15:42:13Z) - LLM4SCREENLIT: Recommendations on Assessing the Performance of Large Language Models for Screening Literature in Systematic Reviews [2.2175470459999636]
我々は、系統的なレビューにおいて、関連する文献を特定するために、Gen-AIツールのパフォーマンスを評価するために伝統的なメトリクスを使用する際の問題を特定する。
主な弱点は、不均衡なデータに対して堅牢で、結果が偶然よりも優れているかどうかを直接示さないメトリクスを使用できないことであった。
ポジティブな面では、研究者や実践者や政策立案者に対する勧告が構築される優れた(評価)プラクティスを抽出する。
論文 参考訳(メタデータ) (2025-11-16T15:04:50Z) - Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization [86.98098988779809]
SummQは長期文書要約のための新しい逆多重エージェントフレームワークである。
提案手法では,包括的な要約を作成し,評価するために協調作業を行う要約ジェネレータとレビュアーを用いる。
広範に使用されている3つの文書要約ベンチマーク上でSummQを評価する。
論文 参考訳(メタデータ) (2025-09-25T08:36:19Z) - Agent-as-Judge for Factual Summarization of Long Narratives [37.46772108810212]
大規模言語モデル(LLM)は、ROUGEやBERTScoreといった従来のメトリクスに基づいた要約タスクにおいて、ほぼ人間に近い性能を示す。
LLM-as-a-Judgeのような最近の進歩は、語彙的類似性に基づくメトリクスの限界に対処するが、実際には矛盾を示す。
本稿では,要約を評価・精査するための新しい「Agent-as-a-Judge」フレームワークであるNarrativeFactScoreを紹介する。
論文 参考訳(メタデータ) (2025-01-17T07:23:06Z) - C-ICL: Contrastive In-context Learning for Information Extraction [54.39470114243744]
c-ICLは、正しいサンプル構築と間違ったサンプル構築の両方を活用して、コンテキスト内学習のデモを作成する、新しい数ショット技術である。
各種データセットに対する実験により,c-ICLは従来の数発のインコンテキスト学習法よりも優れていたことが示唆された。
論文 参考訳(メタデータ) (2024-02-17T11:28:08Z) - USB: A Unified Summarization Benchmark Across Tasks and Domains [68.82726887802856]
ウィキペディア由来のベンチマークを導入し、クラウドソースアノテーションの豊富なセットを補完し、8ドルの相互関連タスクをサポートする。
このベンチマークで様々な手法を比較し、複数のタスクにおいて、中程度の大きさの微調整されたモデルが、より大きな数発の言語モデルよりも一貫して優れていることを発見した。
論文 参考訳(メタデータ) (2023-05-23T17:39:54Z) - Active Learning for Abstractive Text Summarization [50.79416783266641]
本稿では,抽象テキスト要約におけるアクティブラーニングのための最初の効果的なクエリ戦略を提案する。
ALアノテーションにおける私たちの戦略は、ROUGEと一貫性スコアの点からモデル性能を向上させるのに役立ちます。
論文 参考訳(メタデータ) (2023-01-09T10:33:14Z) - CORE: A Retrieve-then-Edit Framework for Counterfactual Data Generation [91.16551253297588]
Counterfactual Generation via Retrieval and Editing (CORE) は、トレーニングのための多様な反事実摂動を生成するための検索強化された生成フレームワークである。
COREはまず、学習されたバイエンコーダを用いて、タスク関連未ラベルテキストコーパス上で密集した検索を行う。
COREはこれらを、反ファクト編集のために、数ショットの学習機能を備えた大規模な言語モデルへのプロンプトに組み込む。
論文 参考訳(メタデータ) (2022-10-10T17:45:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。