論文の概要: Skill Availability and Presentation Granularity in Large-Language-Model Agents: A Controlled SkillsBench Study
- arxiv url: http://arxiv.org/abs/2605.31408v1
- Date: Fri, 29 May 2026 15:12:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.690065
- Title: Skill Availability and Presentation Granularity in Large-Language-Model Agents: A Controlled SkillsBench Study
- Title(参考訳): 大言語モデルエージェントのスキル・アベイラビリティとプレゼンテーション・グラニュラリティ:SkillsBenchによる研究
- Abstract要約: 本稿では、制御されたスキル知識の提示がタスク成功の下流に変化するかどうかを考察する。
この制御されたサブセットでは、スキルの可用性は、スキルのないものよりも高い成功と関連付けられ、一方、テストされたプレゼンテーションの粒度の変化は、小さく、不確実で、モデルに依存した効果をもたらす。
- 参考スコア(独自算出の注目度): 1.6787220460106658
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Skill documents provide procedural knowledge to large-language-model agents at inference time. This article studies whether the presentation granularity of controlled skill knowledge changes downstream task success. The experiment uses a pinned SkillsBench version, a 30-task domain-balanced subset validated by official oracle runs, two reasoning-enabled model configurations, six skill conditions, and five trials per task-condition-model cell. Skill availability is the clearest empirical signal. Relative to no skill, skill conditions increase task-mean pass rate by 26.7 to 36.0 percentage points for GPT-5.5 and by 18.0 to 26.0 percentage points for DeepSeek V4-Flash. The final data contain 1,800 rows, with 900 rows for each model. The task is the inference unit. Five trials are aggregated within each task-condition-model cell before paired contrasts are estimated over 30 tasks. The primary presentation contrasts are smaller and uncertain. Low-abstraction guidance differs from high-abstraction guidance by +0.7 percentage points for GPT-5.5 and -6.7 percentage points for DeepSeek V4-Flash, with both 95% bootstrap confidence intervals crossing zero. Adding one worked example to medium-abstraction guidance differs from the no-example variant by +0.7 and +1.3 percentage points. Mean-reward robustness checks preserve the same substantive conclusion. In this controlled subset, skill availability is associated with higher success than no skill, while the tested presentation-granularity changes yield small, uncertain, and model-dependent effects.
- Abstract(参考訳): スキルドキュメンテーションは、推論時に大言語モデルエージェントに手続き的な知識を提供する。
本稿では、制御されたスキル知識の提示の粒度がタスク成功の下流に変化するかどうかを考察する。
実験では、ピン留めされたSkillsBenchバージョン、公式のオラクルランによって検証された30タスクドメインバランスサブセット、推論可能なモデル構成2つ、スキル条件6つ、タスク条件モデルセル1つあたりのトライアル5つを使用する。
スキル・アベイラビリティは、最も明確な経験的な信号である。
GPT-5.5では26.7から36.0ポイント、DeepSeek V4-Flashでは18.0から26.0ポイントとなる。
最終データは1,800行で、各モデルは900行である。
タスクは推論ユニットです。
対のコントラストが30以上のタスクを推定する前に、各タスク条件モデルセル内に5つのトライアルを集約する。
主要なプレゼンテーションのコントラストは小さく、不確実である。
GPT-5.5で+0.7ポイント、DeepSeek V4-Flashで-6.7ポイント、95%のブートストラップ信頼区間が0を越えている。
中減算誘導に1つの例を加えると、+0.7 と+1.3 の非例変種とは異なる。
平均逆ロバスト性チェックは、同じ実質的な結論を維持する。
この制御されたサブセットでは、スキルの可用性は、スキルのないものよりも高い成功と関連付けられ、一方、テストされたプレゼンテーションの粒度の変化は、小さく、不確実で、モデルに依存した効果をもたらす。
関連論文リスト
- Demystifying Agent Skills: Why They Work-Until They Don't [58.92875630998418]
既存の評価は、スキルが集約されたタスクの成功を改善するかどうかを主に測定する。
我々は、表現、結果アノテーション、検索難易度、スキルのクロスフレームワークの影響を分離する。
我々はこれらの観察を3つの高レベルカテゴリと12のスキルユースモードの分類に集約する。
論文 参考訳(メタデータ) (2026-08-14T07:26:38Z) - FADE: From Passive Verification to Active Discovery in Counterfactual Video Understanding [19.559643217912114]
既存のMultiple-choice question (MCQ)ベンチマークは、質問や候補オプションを通じて、意図的にターゲットイベントをリークする。
本稿では, 対実的発見と説明のための効果的なトレーニングフレームワークであるFADEを紹介する。
FADEは、DualityVidQA-test と IPV-Bench の3つのタスクにまたがる、最先端の厳密なペアスコアを達成し、GPT-5.6を上回った。
論文 参考訳(メタデータ) (2026-08-11T10:22:08Z) - Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models [7.176656402971074]
最小限の監督で高精度な多型VIEのための分類誘導型大規模視覚言語モデル(LVLM)を提案する。
このフレームワークは、オフィス自動化における複雑なドキュメント理解のための効率的でスケーラブルなソリューションを提供する。
論文 参考訳(メタデータ) (2026-07-22T03:27:50Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Three Regimes of Context-Parametric Conflict: A Predictive Framework and Empirical Validation [0.0]
大規模言語モデルが学習知識と矛盾する文書の相違にどのように対処するかを考察する。
本稿では,Regime 1 (単一ソース更新),Regime 2 (競合統合),Regime 3 (タスクに適した選択)という3つの登録フレームワークを提案する。
我々はClaude Sonnet 4.6、GPT-5.5、Gemini 2.5 Flash、Llama 4 Maverick、DeepSeek V3の3つの実験段階で9,970のAPIコールを使用してフレームワークを検証する。
論文 参考訳(メタデータ) (2026-05-12T06:00:48Z) - Prompt Architecture Determines Reasoning Quality: A Variable Isolation Study on the Car Wash Problem [0.0]
本研究では,生産システムのアーキテクチャ層が正しい推論を可能にする方法を検討する。
STAR(Situation-Task-Action-Result)推論フレームワークだけでは精度が0%から85%に向上することがわかった。
論文 参考訳(メタデータ) (2026-02-25T11:40:15Z) - SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks [61.89812116484928]
エージェントスキルは、LLMエージェントを推論時に増強する手続き的知識の構造化パッケージである。
SkillsBenchは、11のドメインにわたる86のタスクのベンチマークであり、キュレートされたスキルと決定論的検証との組み合わせを示す。
キュレートされたスキルは平均パスレートを16.2ポイント(pp)上昇させるが、効果は領域によって大きく異なる。
自己生成スキルは平均的に何の利益も与えず、モデルが消費から得られる手続き的な知識を確実に説明できないことを示している。
論文 参考訳(メタデータ) (2026-02-13T07:06:06Z) - Silhouette-based Gait Foundation Model [56.27974816297294]
統一された歩行基盤モデルを構築するには、スケーラビリティと一般化の2つの長年の障壁に対処する必要がある。
私たちは、歩行理解のための最初のスケーラブルでセルフ教師付き事前学習フレームワークであるFoundationGaitを紹介します。
論文 参考訳(メタデータ) (2025-11-30T01:53:41Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - Explainable Sentiment Analysis with DeepSeek-R1: Performance, Efficiency, and Few-Shot Learning [2.1036545320600095]
DeepSeek-R1はOpenAIのGPT-4oとGPT-4o-miniに対するオープンソース推論モデルである。
実験の結果、DeepSeek-R1は5クラスの感情で91.39%のF1スコア、バイナリタスクで99.31%の精度を5ショットで達成した。
論文 参考訳(メタデータ) (2025-02-03T07:17:46Z) - Unearthing Skill-Level Insights for Understanding Trade-Offs of Foundation Models [61.467781476005435]
集約精度を検査する際には、スキルワイドのパフォーマンスが不明確になる。
モデル生成論理を検査することで,任意の評価事例に関連する基礎的スキルを復元する自動手法を提案する。
私たちのスキルスライスとフレームワークは、モデル評価の新しい道を開き、スキル固有の分析を活用して、よりきめ細やかで実用的なモデル機能の理解を解き放ちます。
論文 参考訳(メタデータ) (2024-10-17T17:51:40Z) - Plex: Towards Reliability using Pretrained Large Model Extensions [69.13326436826227]
我々は,視覚と言語モダリティのための事前訓練された大規模モデル拡張であるViT-PlexとT5-Plexを開発した。
Plexは信頼性タスク間の最先端性を大幅に改善し、従来のプロトコルを単純化する。
最大1Bパラメータまでのモデルサイズに対するスケーリング効果と,最大4B例までのデータセットサイズを事前トレーニングした。
論文 参考訳(メタデータ) (2022-07-15T11:39:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。