論文の概要: Skill Set Optimization: Reinforcing Language Model Behavior via Transferable Skills
- arxiv url: http://arxiv.org/abs/2402.03244v2
- Date: Sat, 22 Jun 2024 18:58:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-06-26 02:11:02.826258
- Title: Skill Set Optimization: Reinforcing Language Model Behavior via Transferable Skills
- Title(参考訳): スキルセット最適化:トランスファー可能なスキルによる言語モデル行動の強化
- Abstract要約: 大規模言語モデル(LLM)は、インタラクティブ環境でのシーケンシャルな意思決定に最近使用されている。
トランスファー可能なスキルセットの構築と精細化を通じて,LLMアクターのパフォーマンスを向上させるためのスキルセット最適化(SSO)を提案する。
我々は,従来のビデオゲームNetHackとテキスト環境ScienceWorldで,SSOのスキルセットを最適化し,コンテキスト内ポリシーの改善を行う能力を実証するために,本手法を評価した。
- 参考スコア(独自算出の注目度): 40.823689847227975
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have recently been used for sequential decision making in interactive environments. However, leveraging environment reward signals for continual LLM actor improvement is not straightforward. We propose Skill Set Optimization (SSO) for improving LLM actor performance through constructing and refining sets of transferable skills. SSO constructs skills by extracting common subtrajectories with high rewards and generating subgoals and instructions to represent each skill. These skills are provided to the LLM actor in-context to reinforce behaviors with high rewards. Then, SSO further refines the skill set by pruning skills that do not continue to result in high rewards. We evaluate our method in the classic videogame NetHack and the text environment ScienceWorld to demonstrate SSO's ability to optimize a set of skills and perform in-context policy improvement. SSO outperforms baselines by 40% in our custom NetHack task and outperforms the previous state-of-the-art in ScienceWorld by 35%.
- Abstract(参考訳): 大規模言語モデル(LLM)は、インタラクティブ環境でのシーケンシャルな意思決定に最近使用されている。
しかし,環境報酬信号の連続的LLMアクター改善への活用は容易ではない。
トランスファー可能なスキルセットの構築と精細化を通じて,LLMアクターのパフォーマンスを向上させるためのスキルセット最適化(SSO)を提案する。
SSOは、報酬の高い共通のサブトラジェクトリを抽出し、各スキルを表すサブゴールと命令を生成することで、スキルを構築する。
これらのスキルは、高い報酬で行動を強化するために、LLMアクターにコンテキストで提供される。
そして、SSOは、高い報酬を得られない技術を切り刻むことによって設定されたスキルをさらに洗練する。
我々は,従来のビデオゲームNetHackとテキスト環境ScienceWorldで,SSOのスキルセットを最適化し,コンテキスト内ポリシーの改善を行う能力を実証するために,本手法を評価した。
SSOは当社のカスタムNetHackタスクのベースラインを40%上回り、ScienceWorldの最先端を35%上回ります。
関連論文リスト
- SkillsInjector: Dynamic Skill Context Construction for LLM Agents [16.631471381875816]
既存の方法では、静的なステップとしてスキルインジェクションを扱い、一定の基準でスキルを選択し、事前に予算を固定し、説明をそのまま残します。
本稿では,これらの決定に共同で対処する2段階適応手法であるSkillsInjectorを提案する。
Tau2-bench、SkillsBench、ALFWorldで、SkillsInjectorは最強のベースラインを3.9点、6.1点、7.3ポイント改善した。
論文 参考訳(メタデータ) (2026-05-28T11:44:32Z) - Skill-R1: Agent Skill Evolution via Reinforcement Learning [84.35984979949502]
Skill-R1は、検証可能な報酬からインスタンスレベルの繰り返しスキル最適化のための強化学習フレームワークである。
オープンソースモデルとクローズドソースモデルの両方とのブラックボックス互換性を維持しつつ、モデルレベルの更新よりも大幅に安価に適応できる。
論文 参考訳(メタデータ) (2026-05-10T06:19:15Z) - Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks [83.4942519570046]
大型言語モデル(LLM)はゲームプレイエージェントとして有望な代替手段を提供するが、一貫した長期的意思決定に苦戦することが多い。
我々は、LLM決定エージェントが学習可能なスキルバンクからスキルを回収し、アクションテイクをガイドするコ進化フレームワークであるCOSPLAYを提案する。
当社のフレームワークは,スキル検索とアクション生成を学習するための意思決定エージェントを改良し,スキルバンクエージェントは,契約とともに継続的にスキルを抽出し,洗練し,更新する。
論文 参考訳(メタデータ) (2026-04-22T18:17:17Z) - GraSP: Graph-Structured Skill Compositions for LLM Agents [29.818044584102456]
LLMエージェントのスキルエコシステムは急速に成熟しているが、最近のベンチマークでは、より多くのスキルを提供するエージェントはパフォーマンスを単調に改善しない。
スキル検索と実行の間にコンパイル層を導入する最初の実行可能なスキルグラフアーキテクチャであるGraSPを提案する。
GraSPは、フラットスキルセットをプレコンディションエフェクトエッジで型付き有向非巡回グラフ(DAG)に変換し、ノードレベルの検証でそれらを実行し、5つの型付き演算子を通して局所性バウンドな修復を行う。
論文 参考訳(メタデータ) (2026-04-20T06:31:11Z) - How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings [29.3744517703302]
本研究は,段階的に挑戦的な現実的な環境下でのスキルユーティリティの総合的研究である。
その結果、設定がよりリアルになるにつれて、パフォーマンスは一貫して低下することがわかった。
クエリ固有の改善は、初期スキルが合理的な妥当性と品質を持つ場合に、性能を著しく回復することを示す。
論文 参考訳(メタデータ) (2026-04-06T00:10:30Z) - SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization [61.37478254738943]
推論時のスキル向上は基本的に制限されている。
SKILL0は,スキル内部化のためのコンテキスト内強化学習フレームワークである。
SKILL0は標準のRLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-04-02T17:03:05Z) - GIFT: Games as Informal Training for Generalizable LLMs [64.47890325824763]
大規模言語モデル(LLM)は「実践的な知恵」と一般化可能な知性に苦しむ。
このギャップは、目標指向の指示よりもインタラクティブなフィードバックに長けている非公式な学習の欠如から生じる。
LLMの非公式学習におけるゲーム処理環境として,本質的な報酬信号と抽象化された複雑性を活用することを提案する。
論文 参考訳(メタデータ) (2026-01-09T08:42:44Z) - Reinforcement Learning for Self-Improving Agent with Skill Library [14.717149089634718]
大規模言語モデル(LLM)に基づくエージェントは、複雑な推論とマルチターン相互作用において顕著な機能を示した。
有望なアプローチの1つは、エージェントが新しいスキルを学び、検証し、適用できるスキルライブラリを実装することである。
スキルライブラリによるエージェントの自己改善能力を高めるための強化学習(RL)に基づくアプローチを提案する。
論文 参考訳(メタデータ) (2025-12-18T21:58:19Z) - Learning Adaptive Dexterous Grasping from Single Demonstrations [27.806856958659054]
この作業は、2つの重要な課題に対処する。人間による限られたデモンストレーションから、効率的なスキル獲得と、コンテキスト駆動のスキル選択だ。
AdaDexGraspは、スキルごとに1人の人間のデモからスキルを把握できるライブラリを学び、視覚言語モデル(VLM)を使用して最も適切なものを選択する。
我々はAdaDexGraspをシミュレーションと実世界の両方の環境で評価し、RLの効率を大幅に改善し、さまざまなオブジェクト構成をまたいだ人間的な把握戦略の学習を可能にした。
論文 参考訳(メタデータ) (2025-03-26T04:05:50Z) - LLM Post-Training: A Deep Dive into Reasoning Large Language Models [131.10969986056]
大規模言語モデル (LLMs) は自然言語処理の状況を変え、多様な応用をもたらした。
ポストトレーニング手法により、LLMは知識を洗練させ、推論を改善し、事実の正確性を高め、ユーザの意図や倫理的配慮をより効果的に整合させることができる。
論文 参考訳(メタデータ) (2025-02-28T18:59:54Z) - Self-Improving Skill Learning for Robust Skill-based Meta-Reinforcement Learning [6.959686714606018]
SISL(Self-Improving Skill Learning)は、ハイレベルなスキル改善ポリシーを分離して自己指導型スキル改善を行う。
SISLは様々なロングホライゾンタスクにおいて、他のスキルベースのメタRLメソッドよりも一貫して優れている。
論文 参考訳(メタデータ) (2025-02-06T03:28:45Z) - MaestroMotif: Skill Design from Artificial Intelligence Feedback [67.17724089381056]
MaestroMotifはAI支援スキルデザインの手法であり、高性能で適応可能なエージェントを生成する。
本稿では,AIを活用したスキルデザイン手法であるMaestroMotifについて述べる。
論文 参考訳(メタデータ) (2024-12-11T16:59:31Z) - LLM2CLIP: Powerful Language Model Unlocks Richer Visual Representation [72.02635550088546]
この研究は、大規模言語モデル(LLM)がCLIPの機能をどのように強化するか、特により長く複雑なイメージキャプションを処理するために検討する。
キャプション・トゥ・キャプション・トゥ・キャプション・トゥ・コントラスト・ファインチューニング・フレームワークを導入し,LLM出力の識別品質を大幅に向上させた。
提案手法はLoRA法よりも優れ,より優れた性能で4倍近い高速トレーニングを実現している。
論文 参考訳(メタデータ) (2024-11-07T18:59:16Z) - ICPL: Few-shot In-context Preference Learning via LLMs [15.84585737510038]
我々は,Large Language Models (LLM) が,サンプル効率のよい選好学習を実現するために,ネイティブな選好学習機能を備えていることを示す。
我々は,LLMの文脈内学習機能を用いて,人間のクエリ非効率を抑えるインコンテキスト優先学習(ICPL)を提案する。
論文 参考訳(メタデータ) (2024-10-22T17:53:34Z) - Skill-aware Mutual Information Optimisation for Generalisation in Reinforcement Learning [14.62474759939562]
Skill-aware Mutual Information (SaMI) は,スキルに応じたコンテキスト埋め込みの識別を支援する最適化目的である。
そこで我々は,SaMIの目的を最適化するための$K$sample推定器であるSkill-aware Noise Contrastive Estimation (SaNCE)を提案する。
SMIを最大化することで学習するRLエージェントが、目に見えないタスクに対して、ゼロショットの一般化を大幅に改善できることを実証的に見出した。
論文 参考訳(メタデータ) (2024-06-07T10:35:29Z) - Agentic Skill Discovery [19.5703917813767]
言語条件付きロボット技術により、Large Language Models (LLMs) の高レベル推論を低レベルロボット制御に適用することができる。
残る課題は、さまざまな基本的なスキルを取得することです。
LLMによって完全に駆動されるスキル発見のための新しいフレームワークを導入する。
論文 参考訳(メタデータ) (2024-05-23T19:44:03Z) - Acquiring Diverse Skills using Curriculum Reinforcement Learning with Mixture of Experts [58.220879689376744]
強化学習(Reinforcement Learning, RL)は, 優れた政策獲得のための強力なアプローチである。
多様なスキルを学習するための textbfDiverse textbfSkill textbfLearning (Di-SkilL) を提案する。
本稿では,Di-SkilLが多種多様なパフォーマンススキルを学習できるロボットシミュレーションタスクについて述べる。
論文 参考訳(メタデータ) (2024-03-11T17:49:18Z) - Eureka: Human-Level Reward Design via Coding Large Language Models [121.91007140014982]
大規模言語モデル(LLM)は、シーケンシャルな意思決定タスクのためのハイレベルなセマンティックプランナーとして優れています。
LLMを用いた人間レベルの報酬設計アルゴリズムであるEurekaを提案する。
Eurekaは、最先端のLLMの目覚ましいゼロショット生成、コード書き、コンテキスト内改善機能を利用する。
論文 参考訳(メタデータ) (2023-10-19T17:31:01Z) - Bootstrap Your Own Skills: Learning to Solve New Tasks with Large
Language Model Guidance [66.615355754712]
BOSSが"スキルブートストラップ"を実行して新しいタスクを達成
LLM誘導型ブートストラップ法で訓練されたエージェントは,実生活環境における実測実験により,ナイーブなブートストラップ法で訓練されたエージェントよりも優れていた。
論文 参考訳(メタデータ) (2023-10-16T02:43:47Z) - C$\cdot$ASE: Learning Conditional Adversarial Skill Embeddings for
Physics-based Characters [49.83342243500835]
C$cdot$ASEは、物理系文字に対する条件付き適応スキル埋め込みを学習する効率的なフレームワークである。
C$cdot$ASEは、不均一なスキルモーションを、低レベル条件モデルのトレーニングのための均質なサンプルを含む別個のサブセットに分割する。
スキル条件の模倣学習は、訓練後のキャラクターのスキルを明確に制御する。
論文 参考訳(メタデータ) (2023-09-20T14:34:45Z) - Language Reward Modulation for Pretraining Reinforcement Learning [61.76572261146311]
本稿では,強化学習のための事前学習信号としてLRFの機能を活用することを提案する。
我々の VLM プレトレーニングアプローチは,従来の LRF の使い方とは違い,ロボット操作タスクにおけるサンプル効率の学習を温めることができる。
論文 参考訳(メタデータ) (2023-08-23T17:37:51Z) - Residual Skill Policies: Learning an Adaptable Skill-based Action Space
for Reinforcement Learning for Robotics [18.546688182454236]
スキルベース強化学習(RL)は、ロボット学習の加速に先行知識を活用するための有望な戦略として登場した。
本研究では,状態条件付き生成モデルを用いて,スキル空間における探索を高速化する手法を提案する。
我々は4つの困難な操作タスクにまたがってアプローチを検証する。
論文 参考訳(メタデータ) (2022-11-04T02:42:17Z) - Hierarchical Kickstarting for Skill Transfer in Reinforcement Learning [27.69559938165733]
実践とホーミングのスキルは、人間の学習の基本的な要素だが、人工エージェントは、それらを実行するために特別に訓練されることはめったにない。
複雑な環境下での強化学習(RL)エージェントの訓練に、どのようにスキルを組み込むことができるかを検討する。
本実験により, 複雑な問題に対するエージェントの性能向上に寄与することが示唆された。
論文 参考訳(メタデータ) (2022-07-23T19:23:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。