論文の概要: Advantage-Driven Explicit Memory for Social Navigation
- arxiv url: http://arxiv.org/abs/2608.25610v1
- Date: Wed, 26 Aug 2026 10:27:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.766954
- Title: Advantage-Driven Explicit Memory for Social Navigation
- Title(参考訳): ソーシャルナビゲーションのためのアドバンテージ駆動型明示メモリ
- Authors: Yeonsoo Park, Mattia Racca, Guillaume Bono, Steeven Janny, Gianluca Monaci, Tomi Silander, Christian Wolf,
- Abstract要約: 重要な事象につながる前のステップを明示的にインデックスする非パラメトリックメモリを備えた新しいナビゲーションエージェントを提案する。
ソーシャルナビゲーションの文脈では、エージェントがスパースで高コストの障害を維持する能力を向上させることが示される。
我々は、レンダリングと非視覚的群衆シミュレーションを組み合わせたシミュレーションでエージェントを訓練し、そのエージェントがOOD社会行動に対して堅牢であることを示す。
- 参考スコア(独自算出の注目度): 12.557252183063
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robot policies are predominantly learned with classical parametric variants of imitation learning or RL, where training stores the agent's behavior exclusively in the policy's network parameters, putting a heavy burden on the representation learning algorithm. We propose a new navigation agent equipped with non-parametric memory which explicitly indexes prior steps leading to critical events. The advantages are twofold: first, it allows the policy to outsource some of its behavior into an explicit memory; second, it encourages a form of continual learning by allowing an agent to collect data from its testing episodes during deployment and therefore to better generalize to OOD situations. In the context of social navigation, we show that this improves the agent's capability to retain sparse, high-cost failures, such as human collisions. If the policy is trained in simulation, this also naturally addresses the sim-to-real gap, partially, by basing some of the decision making on real data. We integrate the explicit memory into a recurrent PPO architecture and use hidden states for memory retrieval to capture continuous spatiotemporal dynamics. The goal of exploiting rare, high-impact events is achieved by leveraging the RL agent's advantage signals. We train our agent in simulation with a combination of photorealistic rendering and non-visual crowd simulation and show that the agent is robust with respect to OOD social behavior.
- Abstract(参考訳): ロボットポリシーは、古典的な模倣学習(RL)のパラメトリック変種で主に学習され、トレーニングはエージェントの行動をポリシーのネットワークパラメータにのみ格納し、表現学習アルゴリズムに多大な負担をかける。
重要な事象につながる前のステップを明示的にインデックスする非パラメトリックメモリを備えた新しいナビゲーションエージェントを提案する。
ひとつは、その動作の一部を明示的なメモリにアウトソースすること、もうひとつは、エージェントがデプロイメント中にテストエピソードからデータを収集し、従ってOODの状況にもっと一般化することで、継続的な学習の形式を奨励することである。
ソーシャルナビゲーションの文脈では、人間の衝突など、スパースで高コストの故障を抑えるエージェントの能力を向上させることが示される。
このポリシーがシミュレーションで訓練されている場合、これはまた、実データに基づいて決定を下すことによって、部分的に、sim-to-realギャップに自然に対処する。
明示的なメモリをリカレントなPPOアーキテクチャに統合し,メモリ検索に隠された状態を用いて連続時空間ダイナミクスをキャプチャする。
RLエージェントの利点信号を活用することで、希少で高インパクトなイベントを利用するという目標を達成することができる。
我々は,フォトリアリスティックレンダリングと非視覚的群衆シミュレーションを組み合わせたシミュレーションでエージェントを訓練し,そのエージェントがOOD社会行動に対して堅牢であることを示す。
関連論文リスト
- SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents [35.45207852488779]
本稿では,ツールメモリをベースとした自己進化型エージェントフレームワークSEARLを紹介する。
インタラクションエクスペリエンスを直接利用するアプローチとは異なり,本手法では,計画と実行を統合する構造化されたエクスペリエンスメモリを構築している。
我々は,知識推論と数学タスクの枠組みを評価し,より実践的で効率的な学習を実現する上での有効性を実証した。
論文 参考訳(メタデータ) (2026-04-09T04:38:47Z) - Learning Personalized Agents from Human Feedback [36.47803872623135]
連続的なパーソナライズのための枠組みであるPAHF(Personalized Agents from Human Feedback)を紹介する。
PAHFは、ユーザ毎の明示的なメモリを使用して、ライブインタラクションからオンラインで学習する。
ベンチマークは、エージェントが最初の好みをスクラッチから学習し、その後ペルソナシフトに適応する能力を定量化する。
論文 参考訳(メタデータ) (2026-02-18T04:18:47Z) - From Experience to Strategy: Empowering LLM Agents with Trainable Graph Memory [48.22750809620306]
大規模言語モデル(LLM)に基づくエージェントは、自律的なタスク解決において顕著な可能性を示している。
本稿では,エージェント中心型,トレーニング可能な,多層グラフメモリフレームワークを提案する。
コンテクストメモリがLLMの情報活用能力をいかに向上させるかを示す。
論文 参考訳(メタデータ) (2025-11-11T03:36:33Z) - See, Think, Act: Online Shopper Behavior Simulation with VLM Agents [58.92444959954643]
本稿では,視覚情報,特にWebページスクリーンショットのVLMによる動作シミュレーションへの統合について検討する。
我々は,協調行動予測と合理化生成にSFTを用いて,相互作用の完全な文脈を条件づける。
推論能力をさらに強化するため,RLを階層的な報酬構造と統合し,難易度因子によって拡張する。
論文 参考訳(メタデータ) (2025-10-22T05:07:14Z) - SPACeR: Self-Play Anchoring with Centralized Reference Models [50.55045557371374]
Simエージェントポリシーは、現実的で、人間らしく、高速で、マルチエージェント設定でスケーラブルである。
大規模な拡散モデルやトークン化モデルを用いた模倣学習の最近の進歩は、人間の運転データから直接行動を把握することができることを示している。
本研究では,事前訓練されたトークン化自己回帰運動モデルを利用したSPACeRを提案する。
論文 参考訳(メタデータ) (2025-10-20T19:53:02Z) - From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning [59.88543114325153]
本稿では,航法基礎モデルの強化学習能力を高めるためのSeeing-to-Experiencingフレームワークを提案する。
S2Eは、ビデオの事前トレーニングとRLによるポストトレーニングの長所を組み合わせたものだ。
実世界のシーンを3DGSで再現した3D画像に基づく総合的なエンドツーエンド評価ベンチマークであるNavBench-GSを構築した。
論文 参考訳(メタデータ) (2025-07-29T17:26:10Z) - Retrieval-Augmented Reinforcement Learning [63.32076191982944]
過去の経験のデータセットを最適な行動にマップするために、ネットワークをトレーニングします。
検索プロセスは、現在のコンテキストで有用なデータセットから情報を取得するために訓練される。
検索強化R2D2はベースラインR2D2エージェントよりもかなり高速に学習し,より高いスコアを得ることを示す。
論文 参考訳(メタデータ) (2022-02-17T02:44:05Z) - PsiPhi-Learning: Reinforcement Learning with Demonstrations using
Successor Features and Inverse Temporal Difference Learning [102.36450942613091]
時間差学習(ITD)と呼ばれる逆強化学習アルゴリズムを提案する。
Psi Phi$-learningと呼ばれるデモで強化学習のための新しいアルゴリズムに到達し、オンライン環境の相互作用から学習とITDをシームレスに統合する方法を示します。
論文 参考訳(メタデータ) (2021-02-24T21:12:09Z) - PerSim: Data-Efficient Offline Reinforcement Learning with Heterogeneous
Agents via Personalized Simulators [19.026312915461553]
我々はpersimと呼ばれるモデルベースオフライン強化学習(rl)手法を提案する。
まず,各エージェントのパーソナライズされたシミュレータを,政策を学ぶ前に,各エージェントの履歴軌跡をまとめて学習する。
この表現は、エージェントごとの遷移ダイナミクスを効果的に学習するための、単純で正規化されたニューラルネットワークアーキテクチャを示唆している。
論文 参考訳(メタデータ) (2021-02-13T17:16:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。