論文の概要: Corrigible Assistance in One Round: Pragmatic-Pedagogic Best Response
- arxiv url: http://arxiv.org/abs/2607.27508v1
- Date: Wed, 29 Jul 2026 22:49:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.341579
- Title: Corrigible Assistance in One Round: Pragmatic-Pedagogic Best Response
- Title(参考訳): 1ラウンドの総合的支援:プラグマティック・ペダゴギー的ベスト・レスポンス
- Abstract要約: 本稿では,実用的・教育的推論が目標の不確実性を1ステップで解決する支援ゲームについて提案する。
このクラス内では、主流の逆最適制御がアライメントを妨げる推論天井を示すことを示す。
本稿では, 簡単な協調ブロック構築例について, 理論的結果と手法を検証した。
- 参考スコア(独自算出の注目度): 0.25066242154596113
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Assistance games formalize human-robot collaboration under asymmetric information: the human knows the goal, while the robot must infer it from observation and interaction in order to assist effectively. In general, computing optimal assistance game strategies online is intractable, since exact solutions require planning in a POMDP. We identify a class of assistance games in which pragmatic-pedagogic reasoning resolves goal uncertainty in a single time step, rendering the full-horizon game exactly solvable by a tractable best-response procedure. Within this class, we show that mainstream inverse optimal control exhibits an inference ceiling that hinders alignment, while pragmatic-pedagogic reasoning overcomes this barrier by immediately disambiguating goals through actions that look equivalent under task execution alone. Finally, we validate our theoretical results and proposed method on a simple collaborative block-building example.
- Abstract(参考訳): アシストゲームは、人間とロボットのコラボレーションを非対称な情報の下で形式化する: 人間はゴールを知っているが、ロボットは効果的に支援するために観察と相互作用からそれを推論する必要がある。
一般に、オンライン上での最適支援ゲーム戦略の計算は、POMDPで計画する必要があるため、難解である。
実用的・教育的推論が単一時間ステップでゴール不確かさを解消する支援ゲームの種類を特定し, 抽出可能な最良応答手順により, フルホライズンゲームが正確に解けるようにした。
このクラス内では、主流の逆最適制御はアライメントを妨げる推論天井を示し、一方、現実的な教育的推論は、タスク実行だけで同等に見える動作を通じて、即座にゴールを曖昧にすることで、この障壁を克服する。
最後に, 簡単な協調ブロック構築例について, 理論的結果と提案手法を検証した。
関連論文リスト
- Learning to Assist Humans without Inferring Rewards [65.28156318196397]
我々は、エンパワーメントのレンズを通して支援を研究する先行研究に基づいて構築する。
補助剤は、人間の行動の影響を最大化することを目的としている。
これらの表現は、先行研究と類似したエンパワーメントの概念を推定する。
論文 参考訳(メタデータ) (2024-11-04T21:31:04Z) - Attaining Human`s Desirable Outcomes in Human-AI Interaction via Structural Causal Games [34.34801907296059]
人間とAIの相互作用において、顕著なゴールは、AIエージェントの助けを借りて、人間が望ましい結果を達成することである。
我々は、人間とAIの対話プロセスを形式化するために、構造因果ゲーム(SCG)と呼ばれる理論的枠組みを用いる。
我々は、AIエージェントを操り、人間に望ましい結果を得るための、SCGに対する事前政治介入と呼ばれる戦略を導入する。
論文 参考訳(メタデータ) (2024-05-26T14:42:49Z) - Optimising Human-AI Collaboration by Learning Convincing Explanations [62.81395661556852]
本研究では,人間による意思決定によって安全を保ちながら協調的なシステムを構築する手法を提案する。
Ardentは、説明のための個人の好みに適応することで、効率的で効果的な意思決定を可能にする。
論文 参考訳(メタデータ) (2023-11-13T16:00:16Z) - Scalable Learning of Intrusion Responses through Recursive Decomposition [0.0]
本稿では,ITインフラへの自動侵入応答と,攻撃者と防御者との相互作用を部分的に観察されたゲームとして検討する。
この問題を解決するために、我々は、強化学習と均衡に向けた自己プレイを通じて、攻撃戦略と防衛戦略が共進化するアプローチに従う。
近似により平衡を学習するDFSP(Decompositional Fictitious Self-Play)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-09-06T18:12:07Z) - NOPA: Neurally-guided Online Probabilistic Assistance for Building
Socially Intelligent Home Assistants [79.27554831580309]
われわれは、家庭内の人々を支援するために、社会的にインテリジェントなロボットを構築する方法を研究する。
ロボットは人間の目標を同時に推測しなければならない。
論文 参考訳(メタデータ) (2023-01-12T18:59:34Z) - Outcome-Driven Reinforcement Learning via Variational Inference [95.82770132618862]
我々は、報酬を最大化する問題ではなく、望ましい結果を達成するための行動を推測する問題として、強化学習に関する新たな視点について論じる。
結果として得られる結果指向推論の問題を解決するため, 定型的報酬関数を導出する新しい変分推論定式を制定する。
我々は,この手法が報酬機能の設計を不要とし,効果的なゴール指向行動へと導くことを実証的に示す。
論文 参考訳(メタデータ) (2021-04-20T18:16:21Z) - End-to-End Learning and Intervention in Games [60.41921763076017]
ゲームにおける学習と介入のための統一的なフレームワークを提供する。
明示的および暗黙的な区別に基づく2つのアプローチを提案する。
分析結果は、実世界のいくつかの問題を用いて検証される。
論文 参考訳(メタデータ) (2020-10-26T18:39:32Z) - Extending the Hint Factory for the assistance dilemma: A novel,
data-driven HelpNeed Predictor for proactive problem-solving help [6.188683567894372]
非生産的な問題解決のステップを分類し、予測し、予防するための、データ駆動型の一連の手法を提案する。
本稿では,学生が非生産的になる確率を決定するために,事前の学生データを用いたHelpNeed分類を提案する。
我々は、これらのHelpNeedメソッドが、他のよく構造化されたオープンエンドドメインにどのように適用できるかという提案で締めくくった。
論文 参考訳(メタデータ) (2020-10-08T17:04:03Z) - AvE: Assistance via Empowerment [77.08882807208461]
そこで我々は,人間の環境制御能力を高めることで,支援のための新しいパラダイムを提案する。
このタスクに依存しない目的は、個人の自律性と最終的な状態を達成する能力を維持する。
論文 参考訳(メタデータ) (2020-06-26T04:40:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。