論文の概要: Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
- arxiv url: http://arxiv.org/abs/2605.16986v1
- Date: Sat, 16 May 2026 13:14:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 23:51:08.343397
- Title: Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
- Title(参考訳): 飛行時のスキル:LLMエージェントの試験時間適応型スキル合成
- Abstract要約: テスト時間適応型スキル合成法であるemphSkillTTAを提案する。
それは、現在のタスクに関連する小さなトレーニングトラジェクトリを検索し、それらを一時的なタスク固有のテキストスキルに合成する。
本手法をSpreadsheetBench, ALFWorld, BigCodeBenchで評価した。
- 参考スコア(独自算出の注目度): 33.57540444018471
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents benefit from reusable skills, yet test-time tasks often require guidance more specific than a static skill library can provide. We propose \emph{SkillTTA}, a Test-Time Adaptive Skill Synthesis method that retrieves a small set of training trajectories relevant to the current task and synthesizes them into a temporary, task-specific textual skill. The solver model is kept fixed, so adaptation happens entirely through generated context rather than parameter updates. We evaluate the method on SpreadsheetBench, ALFWorld, and BigCodeBench. Compared with static trajectory-to-skill synthesis using GPT-5.5, task-specific skills improve SpreadsheetBench Pass@1 from 0.397 to 0.505 and BigCodeBench Pass@1 from 0.517 to 0.651. On ALFWorld, the method matches a heavier memory-learning baseline within four points of success rate while producing the shortest successful trajectories among reported methods. Ablations on SpreadsheetBench further show that synthesized skills outperform raw trajectory prompting, that top-$k$ retrieval should stay small, and that failed trajectories are especially useful because they expose recurring evaluator-facing mistakes.
- Abstract(参考訳): LLMエージェントは再利用可能なスキルの恩恵を受けるが、テスト時のタスクは静的スキルライブラリが提供するものよりも具体的なガイダンスを必要とすることが多い。
本研究では,テスト時間適応スキル合成法である \emph{SkillTTA} を提案する。
ソルバモデルは固定されているので、適応はパラメータの更新ではなく、生成されたコンテキストを通して行われる。
本手法をSpreadsheetBench, ALFWorld, BigCodeBenchで評価した。
GPT-5.5を使った静的軌道合成と比較して、タスク固有のスキルはSpreadsheetBench Pass@1を0.397から0.505に、BigCodeBench Pass@1を0.517から0.651に改善した。
ALFWorldでは、本手法は4点の成功率でより重いメモリ学習ベースラインと一致し、報告された手法の中で最も短い成功軌道を生成する。
SpreadsheetBenchのアブレーションは、合成されたスキルが生の軌跡より優れていること、トップ$kの検索が小さくなければならないこと、そして失敗する軌跡が特に有用であることを示す。
関連論文リスト
- Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training [52.78248352851176]
強化学習(Reinforcement Learning, RL)は、大規模言語モデルにおける推論能力を引き出すための訓練後のパラダイムである。
本研究では,この残差軸をタスク学習可能性として検討する。
そこで我々はTrajValを提案する。TrajValは、短いプローブランと2つのエンドポイント評価からタスク毎の学習可能性を近似する軽量なプローブベース推定器である。
論文 参考訳(メタデータ) (2026-08-10T07:43:05Z) - SkillCAT: Contrastive Assessment and Topology-Aware Skill Self-Evolution for LLM Agents [42.30624901249764]
現在のパイプラインはタスク毎の1つのトラックから学び、チェックする前に候補スキルパッチをマージし、推論前にフルスキルコーパスをロードする。
トレーニング不要のフレームワークであるSkillCATを提案し,このプロセスを3段階に分けた。
SpreadsheetBench,WikiTableQuestions,DocVQAなど,一般的なエージェントベンチマーク上でSkillCATを評価する。
論文 参考訳(メタデータ) (2026-06-11T13:12:10Z) - SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization [61.37478254738943]
推論時のスキル向上は基本的に制限されている。
SKILL0は,スキル内部化のためのコンテキスト内強化学習フレームワークである。
SKILL0は標準のRLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-04-02T17:03:05Z) - MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild [74.7263562191605]
大規模言語モデル(LLM)エージェントは、複雑なタスクにますます使われている。
既存の方法は、知識を蒸留せずに生の軌跡を保存するか、静的なスキルライブラリを維持するか、または再訓練のために破壊的なダウンタイムを必要とする。
本稿では,基本的なLCMポリシと再利用可能な行動スキルのライブラリを共同で進化させるメタ学習フレームワークであるMetaClawを紹介する。
論文 参考訳(メタデータ) (2026-03-17T22:30:30Z) - CoT-based Synthesizer: Enhancing LLM Performance through Answer Synthesis [31.953858122298517]
本稿では,CoTをベースとした新しい推論スケーリング戦略であるSynthesizerを提案する。
複数の候補応答から相補的な情報を解析することにより、優れた回答を合成する。
その結果,Llama3-8Bは11.8%,GPT-4oは10.3%向上した。
論文 参考訳(メタデータ) (2025-01-03T06:50:06Z) - TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use [72.32614703504122]
大規模言語モデル(LLM)は、環境と対話するツールを活用することで、目覚ましい進歩を遂げる。
大規模なデータセットに依存する標準教師付き微調整アプローチでは、ツール使用時のタスク固有の特性を見落としていることが多い。
本稿では,最適下トレーニングデータの効果を緩和するタスク機能ベースのフレームワークであるTL-Trainingを提案する。
論文 参考訳(メタデータ) (2024-12-20T02:21:36Z) - The Surprising Effectiveness of Test-Time Training for Few-Shot Learning [59.309477460893916]
言語モデル(LM)は、トレーニングディストリビューション内のタスクにおいて印象的なパフォーマンスを示しているが、しばしば構造的に新しいタスクで苦労している。
LMの推論と少数ショット学習能力を改善するメカニズムとして,テストタイムトレーニング(TTT)の有効性を検討する。
本研究は,新しいタスクにおける文脈内学習の限界を強調し,言語モデルの適応性を高めるためのテストタイムトレーニングの可能性を示した。
論文 参考訳(メタデータ) (2024-11-11T18:59:45Z) - Improving Representational Continuity via Continued Pretraining [76.29171039601948]
トランスファーラーニングコミュニティ(LP-FT)は、ナイーブトレーニングやその他の継続的な学習方法よりも優れている。
LP-FTは、リアルタイム衛星リモートセンシングデータセット(FMoW)における忘れを減らす。
LP-FTの変種は、NLP連続学習ベンチマークで最先端の精度を得る。
論文 参考訳(メタデータ) (2023-02-26T10:39:38Z) - Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than
In-Context Learning [81.3514358542452]
ICL (Few-shot in-context Learning) は、予測を行うたびにトレーニング例を全て処理するので、かなりの計算、メモリ、ストレージコストを発生させる。
パラメータ効率の良い微調整は、モデルの新たなタスクの実行を可能にするために、小さなパラメータセットをトレーニングする、代替パラダイムを提供する。
本稿では,少数ショットICLとパラメータ効率の微調整を厳密に比較し,後者が計算コストを劇的に削減できることを示す。
論文 参考訳(メタデータ) (2022-05-11T17:10:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。