論文の概要: Efficient Exploration Is Enough
- arxiv url: http://arxiv.org/abs/2609.07575v1
- Date: Mon, 07 Sep 2026 14:52:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.448469
- Title: Efficient Exploration Is Enough
- Title(参考訳): 効率的な探査は十分である
- Abstract要約: 予測と一般化のレンズによる効率的な探索について検討する。
最適に効率的な探検家は、その軌道を自然にスケジュールし、最も情報に富んだ学習可能な地域を最初に訪れる。
エージェント環境システムは、外部の報酬やタスク、目的を伴わずに、ますます複雑な振る舞いのオープンなプロセスを維持することができる、原則化されたメカニズムを提供する、と我々は信じている。
- 参考スコア(独自算出の注目度): 12.168912356703016
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: This work introduces an alternative view of efficient exploration and studies its theoretical and empirical implications in the absence of extrinsic rewards. Specifically, we define efficient explorers as agents that prioritize generating generalizable experience, i.e., data that supports learning models capable of predicting and adapting across the environment. This allows us to analyze efficient exploration through the lens of prediction and generalization. Theoretically, we demonstrate that optimally efficient explorers naturally schedule their trajectories to visit the most informative and learnable regions first. Empirically, we show that optimizing for these agents gives rise to an automatic curriculum of progressively more complex behaviors, even in relatively simple environments. These results indicate that pursuing this purely intrinsic objective alone is enough to drive the emergence of highly sophisticated behaviors. We believe that this new framework provides a principled mechanism by which agent-environment systems may sustain an open-ended process of increasingly complex behavior without external rewards, tasks, or objectives.
- Abstract(参考訳): この研究は、効率的な探索の代替的見解を導入し、外因性報酬の欠如における理論的および経験的含意について研究する。
具体的には、効率的なエクスプローラーを、一般化可能な体験、すなわち環境全体にわたって予測および適応可能な学習モデルをサポートするデータの生成を優先するエージェントとして定義する。
これにより、予測と一般化のレンズによる効率的な探索を解析できる。
理論的には、最適に効率的な探検家が自然に軌道を調整し、最も情報に富んだ学習可能な地域を最初に訪れることを実証する。
経験的に、これらのエージェントの最適化は、比較的単純な環境においても、徐々に複雑な振る舞いを自動カリキュラム化することを示している。
これらの結果は、純粋に本質的な目的だけを追求することは、高度に洗練された行動の出現を促すのに十分であることを示している。
エージェント環境システムは、外部の報酬やタスク、目的を伴わずに、ますます複雑な振る舞いのオープンなプロセスを維持することができる、原則化されたメカニズムを提供する、と我々は信じている。
関連論文リスト
- Look Before You Leap: Autonomous Exploration for LLM Agents [46.001025916022066]
大規模言語モデルに基づくエージェントは、未熟な環境において、未熟な利用のために失敗することが多い。
我々は,自律探査を適応エージェント構築の重要かつ未探索の能力とみなす。
論文 参考訳(メタデータ) (2026-05-15T16:24:16Z) - Novelty-Driven Target-Space Discovery in Automated Electron and Scanning Probe Microscopy [0.5805874695844994]
我々は、ターゲット空間における発見をガイドするディープラーニングBEACONフレームワークを開発した。
このベンチマークフレームワークは、発見駆動アルゴリズムを評価する基盤を提供する。
関連するノートブックが利用可能で、ユーザはベンチマークを再現し、テストし、メソッドを自身の機器やデータセットに適応することができる。
論文 参考訳(メタデータ) (2026-03-17T16:04:20Z) - Towards Agentic Intelligence for Materials Science [73.4576385477731]
この調査は、コーパスキュレーションからプレトレーニングから、シミュレーションと実験プラットフォームに面した目標条件付きエージェントまで、ユニークなパイプライン中心の視点を推し進める。
コミュニティをブリッジし、参照の共有フレームを確立するために、まず、AIと材料科学をまたいだ用語、評価、ワークフローの段階を整列する統合レンズを提示する。
論文 参考訳(メタデータ) (2026-01-29T23:48:43Z) - AgentEvolver: Towards Efficient Self-Evolving Agent System [51.54882384204726]
本稿では,自律型エージェント学習を駆動する自己進化型エージェントシステムであるAgentEvolverを紹介する。
AgentEvolverは、セルフクエスト、セルフナビゲート、セルフコントリビューションという3つのシナジスティックメカニズムを導入している。
予備実験により、AgentEvolverは従来のRLベースのベースラインと比較して、より効率的な探索、より優れたサンプル利用、より高速な適応を実現していることが示された。
論文 参考訳(メタデータ) (2025-11-13T15:14:47Z) - Agent Learning via Early Experience [93.83579011718858]
言語エージェントの長期的な目標は、彼ら自身の経験から学び、改善することであり、最終的には複雑な現実世界のタスクにおいて人間より優れています。
現在のエージェントのほとんどは、専門家データによる教師付き微調整に依存しており、スケールと一般化が不十分である。
本研究では,(1)環境力学における政策の基盤として収集された状態を利用するインプリシット・ワールド・モデリング,(2)エージェントが最適な行動から学習し,推論と意思決定を改善するための自己回帰という2つの手法について検討する。
論文 参考訳(メタデータ) (2025-10-09T17:59:17Z) - Efficient Model-Based Reinforcement Learning Through Optimistic Thompson Sampling [11.478146371965984]
本稿では,トンプソンサンプリングに基づく楽観的な探索手法を提案する。
実験により,楽観的な探索は,少ない報奨を伴う環境における学習を著しく促進することが示された。
さらに、最適化がいつ有用かについての洞察を提供し、探索を導く上でのモデル不確実性の重要性を強調します。
論文 参考訳(メタデータ) (2024-10-07T12:42:51Z) - Self-supervised network distillation: an effective approach to exploration in sparse reward environments [0.0]
強化学習は、事前に設計された報酬関数に従って、エージェントが環境の中で振る舞うように訓練することができる。
そのような問題の解決策は、エージェントに情報的な探索を提供する本質的な動機を与えることであるかもしれない。
本稿では, 蒸留誤差に基づく本質的な動機づけアルゴリズムである自己教師ネットワーク蒸留(SND)を新規性指標として提示する。
論文 参考訳(メタデータ) (2023-02-22T18:58:09Z) - Online reinforcement learning with sparse rewards through an active
inference capsule [62.997667081978825]
本稿では,将来期待される新しい自由エネルギーを最小化するアクティブ推論エージェントを提案する。
我々のモデルは、非常に高いサンプル効率でスパース・リワード問題を解くことができる。
また、複雑な目的の表現を単純化する報奨関数から事前モデルを近似する新しい手法を提案する。
論文 参考訳(メタデータ) (2021-06-04T10:03:36Z) - Understanding the origin of information-seeking exploration in
probabilistic objectives for control [62.997667081978825]
探索と探索のトレードオフは適応行動の記述の中心である。
このトレードオフを解決する1つのアプローチは、エージェントが固有の「探索駆動」を持っていることを装備または提案することであった。
汎用的最大化と情報参照行動の組み合わせは, 目的の全く異なる分類の最小化から生じることを示す。
論文 参考訳(メタデータ) (2021-03-11T18:42:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。