論文の概要: COLLIE: Guiding Skill Discovery in Semantically Coherent Latent Space
- arxiv url: http://arxiv.org/abs/2606.00950v1
- Date: Sun, 31 May 2026 02:04:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.99621
- Title: COLLIE: Guiding Skill Discovery in Semantically Coherent Latent Space
- Title(参考訳): COLLIE: セマンティックにコヒーレントなラテントスペースにおけるスキル発見のガイド
- Authors: Yao Luan, Ni Mu, Hanfei Ge, Yiqin Yang, Bo Xu, Qing-Shan Jia,
- Abstract要約: 教師なしスキル発見(USD)は、報酬関数なしで多様な行動を学ぶことを目的としているが、多くの場合、タスク非関連または有害な行動をもたらす。
我々は,密集した教師なしデータを利用してセマンティック・コヒーレントなスキル潜在空間を構築するフレームワークであるCOLLIEを提案する。
実験の結果,COLLIEは多種多様な人間対応のスキルを習得し,有害な行動を回避し,人間からのフィードバックを最小限に抑えながら,より優れたダウンストリーム性能を実現することがわかった。
- 参考スコア(独自算出の注目度): 15.241002193763087
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Unsupervised skill discovery (USD) aims to learn diverse behaviors without reward functions, but often results in task-irrelevant or hazardous behaviors due to uniform exploration. Guided skill discovery (GSD) addresses this issue by incorporating human intent to focus exploration on meaningful regions. However, existing GSD methods typically require training additional guidance models, and rely on pre-defined rules or expert demonstration, which can be ineffective under sparse, online-collected human feedback. To overcome this, we propose COLLIE, a GSD framework that leverages dense unsupervised data to construct a semantically coherent skill latent space. This latent space is well-structured, enabling reliable guidance with sparse online feedback. Moreover, its semantic coherence property enables training-free construction of guidance signals, eliminating the need for additional model training beyond skill learning. Theoretical analysis justifies the effectiveness of our training-free guidance signal, while experiments across diverse state-based and pixel-based tasks show that COLLIE learns diverse, human-aligned skills, avoids hazardous behaviors, and achieves superior downstream performance with minimal human feedback.
- Abstract(参考訳): 非教師なしスキル発見(USD)は、報酬関数なしで多様な行動を学ぶことを目的としているが、多くの場合、一様探索によるタスク非関連または有害な行動をもたらす。
ガイドドスキル発見(GSD)は、有意義な領域を探索するために人間の意図を取り入れることでこの問題に対処する。
しかし、既存のGSDメソッドは、通常、追加のガイダンスモデルをトレーニングし、事前定義されたルールや専門家によるデモンストレーションに頼る必要がある。
これを解決するために,密集した教師なしデータを利用してセマンティック・コヒーレントなスキル潜在空間を構築するGSDフレームワークであるCOLLIEを提案する。
この潜伏空間は十分に構造化されており、少ないオンラインフィードバックで信頼性の高いガイダンスを可能にする。
さらに、そのセマンティックコヒーレンス特性は、指導信号のトレーニング不要な構築を可能にし、スキル学習以外の追加モデルトレーニングの必要性を排除している。
理論的分析はトレーニング不要誘導信号の有効性を正当化する一方で,多種多様な状態ベースおよび画素ベースタスクを対象とした実験により,COLLIEは多種多様な人間対応スキルを習得し,有害な行動を回避し,人間からのフィードバックを最小限に抑えてより優れたダウンストリーム性能を達成することを示す。
関連論文リスト
- Leveraging Human Feedback for Semantically-Relevant Skill Discovery [11.543807097834785]
本稿では,スキル発見のための新手法として,Semantically Relevant Skill Discovery (SRSD)を提案する。
SRSDは人間のフィードバックからセマンティックラベルを収集し、報酬関数を学び、よりセマンティックに多様性があり、関連するスキルを奨励する。
SRSDは意味的多様性を向上し,多様な行動に対して効果的にスケーリングしながら,関連する行動を発見することを実証する。
論文 参考訳(メタデータ) (2026-04-27T07:28:28Z) - Reference Grounded Skill Discovery [13.23914921356941]
本稿では,RGSD(Reference-Grounded Skill Discovery)を提案する。
RGSDは359-Dの観察と69-Dのアクションを備えたシミュレーションされたSMPLヒューマノイドで、歩行、ランニング、パンチング、サイドステップなどの構造化されたスキルを学習する。
この結果から,軽量な参照誘導接地は,高DoFシステムにおける意味豊かな構造的スキルの発見に有効な方法であることが示唆された。
論文 参考訳(メタデータ) (2025-10-07T17:55:01Z) - Behavioral Exploration: Learning to Explore via In-Context Adaptation [53.92981562916783]
我々は、過去の観察の文脈で条件付けられた専門家の行動を予測し、専門家の行動がこの文脈とどのように関係しているかを測定するために、長期コンテキスト生成モデルを訓練する。
これにより、モデルが専門家の振る舞いを模倣するだけでなく、過去の相互作用の歴史を文脈に反映することで、これまで選択されたものと異なる専門家の振る舞いを選択することができる。
本手法は実環境におけるロボット操作作業だけでなく,シミュレーションロコモーションと操作設定の両方において有効であることを示す。
論文 参考訳(メタデータ) (2025-07-11T21:36:19Z) - Human-Aligned Skill Discovery: Balancing Behaviour Exploration and Alignment [14.948610521764415]
我々は、より安全でより整合したスキルを発見するために、ヒューマンアライメントスキル発見(HaSD)を提案する。
HaSDはスキルの多様性と人間の価値との整合性を同時に最適化する。
2次元ナビゲーションとセーフティガイムナシウム環境の両方で有効性を示す。
論文 参考訳(メタデータ) (2025-01-29T06:14:27Z) - Unsupervised Continual Anomaly Detection with Contrastively-learned
Prompt [80.43623986759691]
UCADと呼ばれる新しい非教師付き連続異常検出フレームワークを提案する。
このフレームワークは、対照的に学習したプロンプトを通じて、UDAに継続的な学習能力を持たせる。
我々は総合的な実験を行い、教師なし連続異常検出とセグメンテーションのベンチマークを設定した。
論文 参考訳(メタデータ) (2024-01-02T03:37:11Z) - Weakly-supervised HOI Detection via Prior-guided Bi-level Representation
Learning [66.00600682711995]
ヒューマンオブジェクトインタラクション(HOI)検出は、人間中心のシーン理解において重要な役割を担い、多くの視覚タスクの基本的なビルディングブロックとして機能する。
HOI検出のための汎用的でスケーラブルな戦略の1つは、画像レベルのアノテーションからのみ学習する弱い監視を使用することである。
これは、不明瞭な人間と物体の関連、HOIを検出する大きな探索空間、非常にノイズの多い訓練信号によって本質的に困難である。
画像レベルとHOIインスタンスレベルの両方で事前の知識を組み込むことができるCLIP誘導HOI表現を開発し、不正な人間とオブジェクトの関連性を実証するために自己学習機構を採用する。
論文 参考訳(メタデータ) (2023-03-02T14:41:31Z) - Imitation from Observation With Bootstrapped Contrastive Learning [12.048166025000976]
IfO(IfO)は、マルコフ決定プロセスにおいて自律エージェントを訓練する学習パラダイムである。
本稿では,OfOアルゴリズムであるBootIfOLについて紹介する。
我々は,限られた数の実証軌道を用いて効果的な政策を訓練できることを示す,様々な制御タスクに対するアプローチを評価する。
論文 参考訳(メタデータ) (2023-02-13T17:32:17Z) - Autonomous Reinforcement Learning: Formalism and Benchmarking [106.25788536376007]
人間や動物が行うような現実世界の具体的学習は、連続的で非エポゾディックな世界にある。
RLの一般的なベンチマークタスクはエピソジックであり、試行錯誤によってエージェントに複数の試行を行う環境がリセットされる。
この相違は、擬似環境向けに開発されたRLアルゴリズムを現実世界のプラットフォーム上で実行しようとする場合、大きな課題となる。
論文 参考訳(メタデータ) (2021-12-17T16:28:06Z) - Direct then Diffuse: Incremental Unsupervised Skill Discovery for State
Covering and Goal Reaching [98.25207998996066]
我々は、スキル発見のための相互情報フレームワークを構築し、カバレッジ指向のトレードオフに対応するためにUPSIDEを導入します。
いくつかのナビゲーションおよび制御環境において、UPSIDEが学んだスキルが、既存のベースラインよりもスパース・リワードな下流タスクをどのように解決するかを説明する。
論文 参考訳(メタデータ) (2021-10-27T14:22:19Z) - Learning Task Agnostic Skills with Data-driven Guidance [0.0]
本稿では,専門家が訪問する状態のサブセットに向けて,スキル発見を導くための枠組みを提案する。
本手法を各種強化学習タスクに適用し,このような予測がより有用な行動をもたらすことを示す。
論文 参考訳(メタデータ) (2021-08-04T06:53:10Z) - Generalization Through Hand-Eye Coordination: An Action Space for
Learning Spatially-Invariant Visuomotor Control [67.23580984118479]
模倣学習(il)は、オフラインデモデータから視覚能力を学ぶための効果的なフレームワークである。
手目行動ネットワーク(HAN)は、人間の遠隔操作による実証から学習することにより、人間の手目協調行動を推定することができる。
論文 参考訳(メタデータ) (2021-02-28T01:49:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。