論文の概要: Rethinking the Implications of Human Feedback for Preference Learning in Human-Robot Collaboration
- arxiv url: http://arxiv.org/abs/2609.13982v1
- Date: Sat, 12 Sep 2026 14:54:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.629427
- Title: Rethinking the Implications of Human Feedback for Preference Learning in Human-Robot Collaboration
- Title(参考訳): 人間-ロボット協調における選好学習における人間のフィードバックの意味の再考
- Abstract要約: 人間-ロボットインタラクションでは、ロボットの行動に対する人間の嗜好を表す報酬モデルを学ぶための標準的なアプローチは、3つのステップから構成される。
まず、ロボットは人間のフィードバック(正あるいは負のバイナリフィードバックなど)から限られた直接的証拠を収集する。
第二に、ロボットは直接証拠を利用して、固定的な含意規則を用いて、受け入れられたラベルや拒否されたラベルを推測する。
第3に、ロボットは報酬モデルを更新し、直接証拠と導出証拠の両方を更新する。
- 参考スコア(独自算出の注目度): 2.8952292379640636
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: In Human-Robot Interaction, the standard approach to learn a reward model that represents human preferences for robot behavior consists of three steps. First, the robot collects limited direct evidence from human feedback (e.g., positive or negative binary feedback). Then, the robot utilizes the direct evidence to derive accepted or rejected labels to feasible but unchosen actions using fixed implication rules. Finally, the robot updates the reward model with both the direct and derived evidence. Unfortunately, the fixed rule can hinder preference learning: in a user study with two collaborative simulation environments, human-provided implication labels often differed from the standard fixed rule, and using the human labels substantially improved reward learning with the Preference Learning from Implicit and Explicit Feedback (PIE) algorithm. Consequently, we propose IMPLIED, an implication modeling method that treats fixed-rule implications as an initial guide while learning to infer and revise accepted and rejected action labels over time. Across evaluations on recorded human-robot interaction trajectories and a physical robot pizza-making study, IMPLIED predicts human implications more accurately than the fixed rule approach and LLM baselines, approaching the performance of a human-label oracle. In turn, IMPLIED reduces preference-estimation error and leads to robot actions that are more often rational with respect to a combined reward (which includes the true preference reward and a task-specific reward) compared to baselines. By learning to reason about the implications of human feedback, this work enables more faithful and efficient robot behavior adaptation during human-robot collaboration.
- Abstract(参考訳): 人間-ロボットインタラクションでは、ロボットの行動に対する人間の嗜好を表す報酬モデルを学ぶための標準的なアプローチは、3つのステップから構成される。
まず、ロボットは人間のフィードバック(正または負のバイナリフィードバック)から限られた直接的な証拠を収集する。
そして、ロボットは、直接的な証拠を利用して、固定的な含意規則を用いて、承認されたラベルまたは拒否されたラベルを不可能な動作に導出する。
最後に、ロボットは報酬モデルを更新し、直接証拠と導出証拠の両方を更新する。
2つの協調シミュレーション環境でのユーザスタディでは、人間が提供するインプリケーションラベルが標準の固定ルールとしばしば異なり、人間ラベルを使用することで、Preference Learning from Implicit と Explicit Feedback (PIE)アルゴリズムによる報酬学習が大幅に改善される。
そこで本研究では,固定ルール含意を初期ガイドとして扱う意味モデリング手法であるIMPLIEDを提案する。
IMPLIEDは、記録されたヒトとロボットの相互作用軌跡と物理ロボットによるピザ製造の研究を総合して、人間の意味を固定ルールアプローチやLDMベースラインよりも正確に予測し、人間のラベルオラクルのパフォーマンスにアプローチする。
IMPLIEDは、好み推定誤差を減らし、ベースラインと比較して、組み合わせた報酬(真の好み報酬とタスク固有の報酬を含む)に対してより合理的なロボット行動をもたらす。
この研究は、人間とロボットのコラボレーションにおいて、より忠実で効率的なロボットの行動適応を可能にする。
関連論文リスト
- Robot Self-Improvement via Human-Video Dynamics Models [52.14862052988773]
人間のビデオは、ロボットのエンボディメント間で伝達されるエンボディメントに依存しない動作、ダイナミクス、および値表現を学ぶのに利用できることを示す。
DGAC(Dynamics-Guided Action Correction)は,これらの適応モデルを用いて故障状態の修復を行うトレーニングフリーアプローチである。
以上の結果から,人間の先行とロボットの失敗が組み合わさって,スケーラブルな自律的政策改善を可能にすることが示唆された。
論文 参考訳(メタデータ) (2026-06-19T13:17:27Z) - Designing for Difference: How Human Characteristics Shape Perceptions of Collaborative Robots [8.095309110037315]
反社会的ロボット行動は一貫して最低と評価され、高齢者とのコラボレーションはより敏感な評価を導いた。
これらの結果は、人間の特徴と相互作用パラダイムの両方が協調ロボットの受容性に影響を与えることを示唆している。
論文 参考訳(メタデータ) (2025-07-22T11:36:08Z) - Human-Robot Mutual Learning through Affective-Linguistic Interaction and Differential Outcomes Training [Pre-Print] [0.3811184252495269]
本研究では,感情言語コミュニケーションが人間ロボットの文脈における相互学習にどのように影響するかを検証する。
児童介護のダイナミックスからインスピレーションを得て、私たちの人間とロボットのインタラクションのセットアップは、内部的、ホメオスタティックに制御されたニーズのコミュニケーション方法を学ぶための(シミュレートされた)ロボットで構成されています。
論文 参考訳(メタデータ) (2024-07-01T13:35:08Z) - Real-time Addressee Estimation: Deployment of a Deep-Learning Model on
the iCub Robot [52.277579221741746]
住所推定は、社会ロボットが人間とスムーズに対話するために必要なスキルである。
人間の知覚スキルにインスパイアされたディープラーニングモデルは、iCubロボットに設計、訓練、デプロイされる。
本研究では,人間-ロボットのリアルタイムインタラクションにおいて,そのような実装の手順とモデルの性能について述べる。
論文 参考訳(メタデータ) (2023-11-09T13:01:21Z) - What Matters to You? Towards Visual Representation Alignment for Robot
Learning [81.30964736676103]
人のために運用する場合、ロボットはエンドユーザーの好みに合わせて報酬を最適化する必要がある。
本稿では、視覚的表現アライメント問題を解決するためのRAPL(Representation-Aligned Preference-based Learning)を提案する。
論文 参考訳(メタデータ) (2023-10-11T23:04:07Z) - ImitationNet: Unsupervised Human-to-Robot Motion Retargeting via Shared Latent Space [9.806227900768926]
本稿では,ロボットの動きに対する新しいディープラーニング手法を提案する。
本手法では,新しいロボットへの翻訳を容易にする,人間とロボットのペアデータを必要としない。
我々のモデルは、効率と精度の観点から、人間とロボットの類似性に関する既存の研究よりも優れています。
論文 参考訳(メタデータ) (2023-09-11T08:55:04Z) - Self-Improving Robots: End-to-End Autonomous Visuomotor Reinforcement
Learning [54.636562516974884]
模倣と強化学習において、人間の監督コストは、ロボットが訓練できるデータの量を制限する。
本研究では,自己改善型ロボットシステムのための新しい設計手法であるMEDAL++を提案する。
ロボットは、タスクの実施と解除の両方を学ぶことで、自律的にタスクを練習し、同時にデモンストレーションから報酬関数を推論する。
論文 参考訳(メタデータ) (2023-03-02T18:51:38Z) - "No, to the Right" -- Online Language Corrections for Robotic
Manipulation via Shared Autonomy [70.45420918526926]
LILACは、実行中に自然言語の修正をオンラインで実施し、適応するためのフレームワークである。
LILACは人間とロボットを個別にターンテイクする代わりに、人間とロボットの間にエージェンシーを分割する。
提案手法は,タスク完了率が高く,ユーザによって主観的に好まれることを示す。
論文 参考訳(メタデータ) (2023-01-06T15:03:27Z) - Learning Latent Representations to Co-Adapt to Humans [12.71953776723672]
非定常的な人間はロボット学習者に挑戦しています。
本稿では,ロボットが動的人間と協調して適応できるアルゴリズム形式について紹介する。
論文 参考訳(メタデータ) (2022-12-19T16:19:24Z) - Continuous ErrP detections during multimodal human-robot interaction [2.5199066832791535]
我々は,シミュレーションロボットが音声やジェスチャーを通じて人間とコミュニケーションする,マルチモーダルなヒューマンロボットインタラクション(HRI)シナリオを実装した。
人間のパートナーは、ロボットが選択した動作(ポインティングジェスチャー)とロボットの口頭発表(意図)が一致しているかを評価する。
脳波で明らかな、人間によるロボット行動の本質的な評価は、リアルタイムで記録され、オンラインで連続的にセグメンテーションされ、非同期に分類された。
論文 参考訳(メタデータ) (2022-07-25T15:39:32Z) - Show Me What You Can Do: Capability Calibration on Reachable Workspace
for Human-Robot Collaboration [83.4081612443128]
本稿では,REMPを用いた短時間キャリブレーションにより,ロボットが到達できると考える非専門家と地道とのギャップを効果的に埋めることができることを示す。
この校正手順は,ユーザ認識の向上だけでなく,人間とロボットのコラボレーションの効率化にも寄与することを示す。
論文 参考訳(メタデータ) (2021-03-06T09:14:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。