論文の概要: Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
- arxiv url: http://arxiv.org/abs/2608.05139v1
- Date: Wed, 05 Aug 2026 17:57:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.072158
- Title: Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
- Title(参考訳): スキルNative LLMに向けて:ロングホライゾン推論のベンチマークとトレーニングのためのスキルエントロピー
- Authors: Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora,
- Abstract要約: ロングホライゾン推論は、モデルが推論チェーン内の異なるスキルを切り替えることを要求する。
スキル・エントロピー(Skill Entropy)とは、あるスキルから別のスキルに切り替えることの難しさを測る尺度である。
本稿では,RLフレームワークであるSkill-Entropy RLを提案する。
- 参考スコア(独自算出の注目度): 72.09826781730662
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon reasoning in recent LLMs demands that the model switch between distinct skills inside a reasoning chain, such as first doing a math derivation, then using the result to plan a schedule. We call such problems cross-skill long-horizon tasks: multi-step tasks whose steps require different reasoning skills and depend on earlier outputs. Existing benchmarks often evaluate individual skills, lacking a principled way to measure how well a model switches between skills. We address this gap from both the evaluation and training sides. We introduce Skill Entropy, a measure of the difficulty of switching from one skill to another. We then propose Skill^2-Bench, a benchmark of cross-skill long-horizon tasks built over 558 skills across 9 verifiable and open-ended domains. Each task is assigned a task-level skill-entropy score and grouped into three difficulty levels. Evaluating 8 frontier and 4 open-source models on Skill^2-Bench reveals a skill-switching gap: accuracy decreases on higher-entropy tasks. We then turn skill entropy from a benchmark scale into a training signal. We propose Skill-Entropy RL, an RL framework where the model predicts not only the answer at each step but also the skill used to produce it. The reward combines step-level correctness with a skill-entropy reward that measures the alignment between the model-predicted skill sequence and the gold skill sequence. On Qwen3-4B-Instruct and Qwen3-1.7B, Skill-Entropy RL improves the Skill^2-Bench score from 34.4% to 68.4% and from 14.6% to 40.1%, respectively, outperforming competitive baselines. The same pipeline can be applied to off-the-shelf training data such as OpenR1-Math, indicating that skill entropy is a reusable training signal. Code available at: https://github.com/Gen-Verse/Skill-Entropy-RL
- Abstract(参考訳): 近年のLLMにおけるロングホライゾン推論では、まずは数学の導出を行い、次に結果を使用してスケジュールを計画するなど、推論チェーン内の異なるスキルを切り替えることが要求されている。
このような問題をクロススキルなロングホライゾンタスクと呼びます: ステップが異なる推論スキルを必要とし、初期の出力に依存するマルチステップタスクです。
既存のベンチマークは個々のスキルを評価することが多く、モデルがいかにスキルを切り替えるかを測定するための原則的な方法が欠如している。
評価とトレーニングの両面からこのギャップに対処する。
スキル・エントロピー(Skill Entropy)とは、あるスキルから別のスキルに切り替えることの難しさを測る尺度である。
次にSkill^2-Benchを提案する。これは9つの検証可能な、そしてオープンなドメインにまたがる558以上のスキルで構築されたクロススキルなロングホライゾンタスクのベンチマークである。
各タスクには、タスクレベルのスキルエントロピースコアが割り当てられ、3つの難易度にグループ化される。
Skill^2-Bench上の8つのフロンティアと4つのオープンソースモデルを評価すると、スキルスイッチングのギャップが明らかになる。
次に、スキルエントロピーをベンチマークスケールからトレーニングシグナルに変換します。
本稿では,RLフレームワークであるSkill-Entropy RLを提案する。
報酬は、ステップレベルの正しさと、モデル予測スキルシーケンスとゴールドスキルシーケンスのアライメントを測定するスキルエントロピー報酬とを組み合わせる。
Qwen3-4B-InstructとQwen3-1.7Bでは、スキルエントロピーRLはスキル^2-Benchスコアを34.4%から68.4%に改善し、それぞれ14.6%から40.1%に改善し、競争ベースラインを上回った。
同じパイプラインをOpenR1-Mathのような市販のトレーニングデータに適用することは、スキルエントロピーが再利用可能なトレーニング信号であることを示している。
https://github.com/Gen-Verse/Skill-Entropy-RL
関連論文リスト
- Not All Skills Help: Measuring and Repairing Agent Knowledge [47.498075849595374]
ASSAYは、生成をキュレーションから分離するフレームワークである。
スキルごとの因果属性を小さな開発セットで計算する。
ライブラリをオフラインで再構築し、各テストタスクに対して負の効果でスキルを抑圧する。
論文 参考訳(メタデータ) (2026-06-13T16:37:38Z) - SkillsInjector: Dynamic Skill Context Construction for LLM Agents [16.631471381875816]
既存の方法では、静的なステップとしてスキルインジェクションを扱い、一定の基準でスキルを選択し、事前に予算を固定し、説明をそのまま残します。
本稿では,これらの決定に共同で対処する2段階適応手法であるSkillsInjectorを提案する。
Tau2-bench、SkillsBench、ALFWorldで、SkillsInjectorは最強のベースラインを3.9点、6.1点、7.3ポイント改善した。
論文 参考訳(メタデータ) (2026-05-28T11:44:32Z) - SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs [70.1970574147839]
有向グラフのノードとして再利用可能なスキルを表現するフレームワークであるSKILLGRAPHを提案する。
SKILLGRAPHは個々のスキルだけでなく、多段階意思決定をガイドできる順序付きスキルサブグラフも取得する。
実験により,SKILLGRAPHはメモリ拡張RL法に対して最先端の性能を実現することが示された。
論文 参考訳(メタデータ) (2026-05-12T12:21:49Z) - Skill-R1: Agent Skill Evolution via Reinforcement Learning [84.35984979949502]
Skill-R1は、検証可能な報酬からインスタンスレベルの繰り返しスキル最適化のための強化学習フレームワークである。
オープンソースモデルとクローズドソースモデルの両方とのブラックボックス互換性を維持しつつ、モデルレベルの更新よりも大幅に安価に適応できる。
論文 参考訳(メタデータ) (2026-05-10T06:19:15Z) - SkillGen: Verified Inference-Time Agent Skill Synthesis [60.927977774369516]
SkillGenは、ベースエージェントによって生成されたトラジェクトリから単一の監査可能なスキルを合成するフレームワークである。
再利用可能な成功パターン、繰り返し発生する障害モード、そして近くの成功に現れるが失敗に欠ける行動を特定する。
SkillGenの重要な特徴は、エージェントスキルを、全体的なパフォーマンスに対するスキルのネット効果を実証的に検証するための介入としてモデル化することです。
論文 参考訳(メタデータ) (2026-05-09T19:24:11Z) - SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks [61.89812116484928]
エージェントスキルは、LLMエージェントを推論時に増強する手続き的知識の構造化パッケージである。
SkillsBenchは、11のドメインにわたる86のタスクのベンチマークであり、キュレートされたスキルと決定論的検証との組み合わせを示す。
キュレートされたスキルは平均パスレートを16.2ポイント(pp)上昇させるが、効果は領域によって大きく異なる。
自己生成スキルは平均的に何の利益も与えず、モデルが消費から得られる手続き的な知識を確実に説明できないことを示している。
論文 参考訳(メタデータ) (2026-02-13T07:06:06Z) - Pretrained Bayesian Non-parametric Knowledge Prior in Robotic Long-Horizon Reinforcement Learning [10.598207472087578]
強化学習(Reinforcement Learning, RL)の手法は通常、新しいタスクをゼロから学習する。
この研究は、潜在的な原始的なスキルモーションを未知の特徴を持つ非パラメトリックな特性を持つものとしてモデル化する手法を導入する。
非パラメトリックモデル、特にDirichlet Process Mixturesは、出生とマージによって強化され、スキルの多様な性質を効果的に捉えるための事前トレーニングに使用される。
論文 参考訳(メタデータ) (2025-03-27T20:43:36Z) - Skill Reinforcement Learning and Planning for Open-World Long-Horizon
Tasks [31.084848672383185]
オープンワールド環境におけるマルチタスクエージェントの構築について検討する。
我々は,マルチタスク学習問題を基礎的スキルの学習や,そのスキルの計画に転換する。
提案手法は40種類のMinecraftタスクをこなし,10以上のスキルを順次実行するタスクが多数存在する。
論文 参考訳(メタデータ) (2023-03-29T09:45:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。