論文の概要: Synchronizing Beliefs with Second-Order Theory-of-Mind in Human-Autonomy Teams (Extended Version)
- arxiv url: http://arxiv.org/abs/2608.11229v1
- Date: Wed, 29 Jul 2026 18:44:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 01:32:04.585881
- Title: Synchronizing Beliefs with Second-Order Theory-of-Mind in Human-Autonomy Teams (Extended Version)
- Title(参考訳): ヒューマン・オートノミー・チームにおける第2次ミンド理論による信念の同期化(拡張版)
- Abstract要約: 嗜好に基づく報奨学習は、学習者が生成したクエリに応答する受動的オラクルとして、人間の教師を形容する。
ターゲットを知っている教師は、学習者主導の獲得戦略よりも効率的にトレーニング例を構築することができる。
選好学習は、人間と自律のチームが2つの行動モデルを結合する問題であると再認識する。
- 参考スコア(独自算出の注目度): 3.248039323542496
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Comparative feedback, asking people which of two behaviors they prefer, has become a standard way to align robot and agent behavior with human intent when the reward itself cannot be specified directly. Preference-based reward learning typically casts the human teacher as a passive oracle answering learner-generated queries. We argue this forfeits the teacher's defining advantage: knowledge of the objective. A teacher who knows the target can construct training examples more efficiently than any learner-driven acquisition strategy, an advantage that widens as the reward's feature dimension grows. However, exploiting this advantage requires an accurate model of what the learner currently knows. We therefore recast preference learning as a human-autonomy team problem coupling two behavioral models: the teacher maintains a model of the learner to design an informative curriculum, and the learner maintains a second-order model of the teacher's model, emitting structured preference constraints (understanding statements) that keep the teacher's model of the learner synchronized. In simulation, an informed teacher outperforms learner-led selection; teacher-model drift under alternating teachers erodes this advantage; and understanding statements repair it, with second-order (ToM-2) statements outperforming mean-belief statements when the teacher's error about the learner is concentrated in a particular direction rather than spread evenly.
- Abstract(参考訳): 報酬そのものが直接特定できない場合に、ロボットとエージェントの行動と人間の意図を一致させる標準的な方法となっている。
嗜好に基づく報酬学習は、典型的には、学習者が生成したクエリに応答する受動的オラクルとして、人間の教師を配置する。
このことは教師が定義する優位性、すなわち目的の知識を損なうと我々は主張する。
目標を知っている教師は、学習者主導の獲得戦略よりも効率的に訓練例を構築することができ、報酬の特長が大きくなるにつれてその利点が広がる。
しかし、この利点を利用するには、学習者が現在知っていることを正確にモデル化する必要がある。
教師は情報カリキュラムを設計するための学習者のモデルを維持し、学習者は教師のモデルの2階モデルを維持し、教師のモデルと学習者のモデルが同期する構造的嗜好制約を発生させる。
シミュレーションでは、教師が学習者主導の選択を上回り、教師の交替によるモデルドリフトがこの利点を損なうことを理解し、学習者に対する教師の誤りが均等に広まるよりも特定の方向に集中した場合に平均信頼度を上回り、2次(ToM-2)文でそれを修復する。
関連論文リスト
- Good Teachers Explain: Explanation-Enhanced Knowledge Distillation [52.498055901649025]
知識蒸留(KD)は、大規模な教師モデルをより小さな学生モデルに圧縮するのに有効であることが証明されている。
本研究は,古典的KD損失を最適化するだけでなく,教師と生徒が生み出す説明の類似性についても検討する。
シンプルで直感的なアイデアであるにもかかわらず、提案した「説明強調」KDは、精度と生徒と教師の合意の点で、一貫して大きな利益をもたらしている。
論文 参考訳(メタデータ) (2024-02-05T15:47:54Z) - Utility-based Adaptive Teaching Strategies using Bayesian Theory of Mind [7.754711372795438]
教育戦略を学習者に合わせた教師エージェントを設計するための認知科学を構築している。
ToMを組み込んだ教師は、観察から学習者の内部状態のモデルを構築する。
シミュレーション環境での実験では、この方法で教えられた学習者は、学習者に依存しない方法で教えた学習者よりも効率的であることが示されている。
論文 参考訳(メタデータ) (2023-09-29T14:27:53Z) - Can Language Models Teach Weaker Agents? Teacher Explanations Improve
Students via Personalization [84.86241161706911]
教師のLLMは、実際に生徒の推論に介入し、パフォーマンスを向上させることができることを示す。
また,マルチターンインタラクションでは,教師による説明が一般化され,説明データから学習されることを示す。
教師のミスアライメントが学生の成績をランダムな確率に低下させることを、意図的に誤解させることで検証する。
論文 参考訳(メタデータ) (2023-06-15T17:27:20Z) - Better Teacher Better Student: Dynamic Prior Knowledge for Knowledge
Distillation [70.92135839545314]
本研究では,教師の持つ特徴の一部を,特徴蒸留前の先行知識として統合した動的事前知識(DPK)を提案する。
DPKは,教員モデルと生徒モデルのパフォーマンスを正に相関させ,より大きな教員を適用することで生徒の精度をさらに高めることができる。
論文 参考訳(メタデータ) (2022-06-13T11:52:13Z) - Generalized Knowledge Distillation via Relationship Matching [53.69235109551099]
よく訓練されたディープニューラルネットワーク(いわゆる「教師」)の知識は、同様のタスクを学ぶのに有用である。
知識蒸留は教師から知識を抽出し、対象モデルと統合する。
教師に学生と同じ仕事をさせる代わりに、一般のラベル空間から訓練を受けた教師の知識を借りる。
論文 参考訳(メタデータ) (2022-05-04T06:49:47Z) - Iterative Teacher-Aware Learning [136.05341445369265]
人間の教育において、教師と学生はコミュニケーション効率を最大化するために適応的に交流することができる。
本稿では,教師の協調意図を可能性関数に組み込むことができる,勾配最適化に基づく教師認識学習者を提案する。
論文 参考訳(メタデータ) (2021-10-01T00:27:47Z) - Explainable Active Learning (XAL): An Empirical Study of How Local
Explanations Impact Annotator Experience [76.9910678786031]
本稿では、最近急増している説明可能なAI(XAI)のテクニックをアクティブラーニング環境に導入することにより、説明可能なアクティブラーニング(XAL)の新たなパラダイムを提案する。
本研究は,機械教育のインタフェースとしてのAI説明の利点として,信頼度校正を支援し,リッチな形式の教示フィードバックを可能にすること,モデル判断と認知作業負荷による潜在的な欠点を克服する効果を示す。
論文 参考訳(メタデータ) (2020-01-24T22:52:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。