論文の概要: Learning to Assist Humans without Inferring Rewards
- arxiv url: http://arxiv.org/abs/2411.02623v2
- Date: Thu, 07 Nov 2024 09:25:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-11-08 11:32:12.138887
- Title: Learning to Assist Humans without Inferring Rewards
- Title(参考訳): 恨みを含まない人を支援するための学習
- Authors: Vivek Myers, Evan Ellis, Sergey Levine, Benjamin Eysenbach, Anca Dragan,
- Abstract要約: 我々は、エンパワーメントのレンズを通して支援を研究する先行研究に基づいて構築する。
補助剤は、人間の行動の影響を最大化することを目的としている。
これらの表現は、先行研究と類似したエンパワーメントの概念を推定する。
- 参考スコア(独自算出の注目度): 65.28156318196397
- License:
- Abstract: Assistive agents should make humans' lives easier. Classically, such assistance is studied through the lens of inverse reinforcement learning, where an assistive agent (e.g., a chatbot, a robot) infers a human's intention and then selects actions to help the human reach that goal. This approach requires inferring intentions, which can be difficult in high-dimensional settings. We build upon prior work that studies assistance through the lens of empowerment: an assistive agent aims to maximize the influence of the human's actions such that they exert a greater control over the environmental outcomes and can solve tasks in fewer steps. We lift the major limitation of prior work in this area--scalability to high-dimensional settings--with contrastive successor representations. We formally prove that these representations estimate a similar notion of empowerment to that studied by prior work and provide a ready-made mechanism for optimizing it. Empirically, our proposed method outperforms prior methods on synthetic benchmarks, and scales to Overcooked, a cooperative game setting. Theoretically, our work connects ideas from information theory, neuroscience, and reinforcement learning, and charts a path for representations to play a critical role in solving assistive problems.
- Abstract(参考訳): 補助剤は人間の生活を楽にするべきだ。
古典的には、そのような援助は逆強化学習のレンズを通して研究され、補助剤(例えば、チャットボット、ロボット)が人間の意図を推測し、その目標を達成するための行動を選択する。
このアプローチでは、高次元の設定では難しい意図を推論する必要がある。
補助的エージェントは、人間の行動の影響を最大化し、より少ないステップでタスクを解くことを目的としている。
我々は、この領域における先行研究の大きな制限、すなわち高次元設定へのスケーリング可能性、および対照的な後続表現を解消する。
我々は、これらの表現が先行研究と類似したエンパワーメントの概念を推定し、それを最適化するための既製のメカニズムを提供することを正式に証明する。
実験により,提案手法は従来のベンチマーク手法よりも優れており,協調的なゲーム設定であるOvercookedにスケールする。
理論的には、我々の研究は情報理論、神経科学、強化学習のアイデアを結びつけ、支援的問題を解決する上で重要な役割を果たす表現の道筋をグラフ化している。
関連論文リスト
- Self-Explainable Affordance Learning with Embodied Caption [63.88435741872204]
具体的キャプションを具現化したSelf-Explainable Affordance Learning (SEA)を紹介する。
SEAは、ロボットが意図を明確に表現し、説明可能な視覚言語キャプションと視覚能力学習のギャップを埋めることを可能にする。
本稿では, 簡便かつ効率的な方法で, 空き地と自己説明を効果的に組み合わせた新しいモデルを提案する。
論文 参考訳(メタデータ) (2024-04-08T15:22:38Z) - Optimising Human-AI Collaboration by Learning Convincing Explanations [62.81395661556852]
本研究では,人間による意思決定によって安全を保ちながら協調的なシステムを構築する手法を提案する。
Ardentは、説明のための個人の好みに適応することで、効率的で効果的な意思決定を可能にする。
論文 参考訳(メタデータ) (2023-11-13T16:00:16Z) - Robust Planning for Human-Robot Joint Tasks with Explicit Reasoning on
Human Mental State [2.8246074016493457]
我々は,人間ロボットチームが達成するための既知の目的を持った共有タスクを与えられる,人間に意識したタスク計画問題を考える。
近年のアプローチでは、ロボットが両方のエージェント(共有された)タスクを計画する独立した合理的エージェントのチームとしてそれをモデル化している。
本稿では,実行時の可観測性規約をモデル化し,使用するための新しいアプローチについて述べる。
論文 参考訳(メタデータ) (2022-10-17T09:21:00Z) - Teaching Humans When To Defer to a Classifier via Examplars [9.851033166756274]
我々は、人間の意思決定者がエージェントの強みと弱みの有効な精神モデルを学ぶことを確実にすることを目指している。
本研究では,人間がエージェントの助けを借りてタスクを解く,模範的な教育戦略を提案する。
本稿では,局所的に最も近いルールを適用したAIの人間のメンタルモデルについて,新しいパラメータ化を提案する。
論文 参考訳(メタデータ) (2021-11-22T15:52:15Z) - Contrastive Active Inference [12.361539023886161]
本稿では,エージェントの生成モデル学習における計算負担を低減し,今後の行動計画を行うための,アクティブ推論のための対照的な目的を提案する。
提案手法は,画像に基づくタスクにおいて,確率に基づく能動推論よりも特に優れているが,計算処理が安価で,訓練も容易である。
論文 参考訳(メタデータ) (2021-10-19T16:20:49Z) - Recent Advances in Leveraging Human Guidance for Sequential
Decision-Making Tasks [60.380501589764144]
人工知能の長年の目標は、シーケンシャルな意思決定を必要とするタスクを実行することを学ぶことができる人工知能を作ることである。
学習し行動する人工エージェントであるが、実行すべき特定のタスクを特定するのは人間次第である。
この調査は、主に人間のガイダンスに依存する5つの最近の機械学習フレームワークのハイレベルな概要を提供する。
論文 参考訳(メタデータ) (2021-07-13T03:11:04Z) - Learning Human Rewards by Inferring Their Latent Intelligence Levels in
Multi-Agent Games: A Theory-of-Mind Approach with Application to Driving Data [18.750834997334664]
我々は、人間は有理論的であり、他人の意思決定過程を推論する際に異なる知能レベルを持っていると論じる。
学習中の人間の潜在知能レベルを推論する,新しいマルチエージェント逆強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2021-03-07T07:48:31Z) - AvE: Assistance via Empowerment [77.08882807208461]
そこで我々は,人間の環境制御能力を高めることで,支援のための新しいパラダイムを提案する。
このタスクに依存しない目的は、個人の自律性と最終的な状態を達成する能力を維持する。
論文 参考訳(メタデータ) (2020-06-26T04:40:11Z) - Automatic Curriculum Learning through Value Disagreement [95.19299356298876]
新しい未解決タスクを継続的に解決することが、多様な行動を学ぶための鍵です。
エージェントが複数の目標を達成する必要があるマルチタスク領域では、トレーニング目標の選択はサンプル効率に大きな影響を与える可能性がある。
そこで我々は,エージェントが解決すべき目標のための自動カリキュラムを作成することを提案する。
提案手法は,13のマルチゴールロボットタスクと5つのナビゲーションタスクにまたがって評価し,現在の最先端手法よりも高い性能を示す。
論文 参考訳(メタデータ) (2020-06-17T03:58:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。