論文の概要: From Wizard-of-Oz Human-Robot Dialogue Collection to a Taxonomy of Robot Response Decisions: A Retrospective Analysis of Assistive Pilot Interactions
- arxiv url: http://arxiv.org/abs/2609.19447v1
- Date: Wed, 16 Sep 2026 21:31:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.018284
- Title: From Wizard-of-Oz Human-Robot Dialogue Collection to a Taxonomy of Robot Response Decisions: A Retrospective Analysis of Assistive Pilot Interactions
- Title(参考訳): ウィザード・オブ・オズの人間-ロボット対話コレクションからロボット反応決定の分類学へ:補助的パイロットインタラクションのふりかえりの分析
- Abstract要約: 既存のデータセットには、実際の位置の対話はほとんど含まれていない。
我々は,5人の被験者が日常的な屋内作業を行ったパイロットWizard-of-Oz研究を振り返って分析した。
これは真のユーザ行動を保持するが、一貫性のないロボット側の決定を生み出し、明確な決定スキームを動機付けている。
- 参考スコア(独自算出の注目度): 2.0827527012634133
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Robots that follow natural-language instructions in everyday indoor environments must act on incomplete human utterances. Instructions often omit essential information, such as the identity of an out-of-view object, an intended destination, or the user's goal. Existing datasets contain little real-world situated dialogue and provide few practice-grounded criteria for deciding when a robot should act, confirm, clarify, or refuse. We retrospectively analyze a pilot Wizard-of-Oz study in which five participants performed everyday indoor tasks, including door opening, drawer opening, feeding, drinking, and cleaning, with a wheelchair-mounted mobile manipulator while the wizard responded without a formal communication policy. This preserved authentic user behavior but produced inconsistent robot-side decisions, motivating an explicit decision scheme. From 40 episodes, we derived a hierarchical taxonomy of six response modes (ANSWER, REPORT_DONE, REFUSE, CONFIRM, CLARIFY, ACT) and four ambiguity types (intent, referential, spatial, intelligibility). Two human annotators and an AI annotator applied the scheme to the pilot data. Clean-label rates were 91% and 89%, and Cohen's ranged from 0.72 to 0.95 across decision-point, mode, and ambiguity levels for both human-human and human-AI comparisons. Fine-tuning LLaVA-1.6-7B on taxonomy-derived labels for ACT and CLARIFY indicates the feasibility of training vision-language models using annotations from our taxonomy. Remaining boundary cases in decision-point identification and REPORT_DONE motivate a constrained protocol for more consistent dialogue collection.
- Abstract(参考訳): 日常的な屋内環境で自然言語の指示に従うロボットは、不完全な人間の発話に対処しなければならない。
インストラクションはしばしば、オブ・オブ・ビューオブジェクトのアイデンティティ、意図された目的地、ユーザの目標といった重要な情報を省略する。
既存のデータセットには、実際の位置の対話がほとんどなく、ロボットがいつ行動すべきか、確認し、確認し、拒否するかを決めるための実践的な基準がほとんどない。
本研究は, 車椅子搭載移動マニピュレータを用いて, ドア開口, 引き出し開口, 給餌, 飲酒, クリーニングなどの日常的な屋内作業を行う5人の被験者を対象に, ウィザードが正式なコミュニケーション方針を取らずに応答する間, パイロットWizard-of-Oz研究を遡及的に分析した。
これは真のユーザ行動を保持するが、一貫性のないロボット側の決定を生み出し、明確な決定スキームを動機付けている。
40話から6つの応答モード (ANSWER, CASE_DONE, REFUSE, CONFIRM, CLARIFY, ACT) と4つのあいまいさタイプ (intent, referential, space, intelligibility) の階層的分類を導出した。
2人の人間アノテータとAIアノテータが、このスキームをパイロットデータに適用した。
クリーンラベル率は91%と89%で、コーエンは人間とAIの両比較において、意思決定点、モード、曖昧さのレベルにおいて0.72から0.95の範囲であった。
ACT と CLARIFY の分類学由来ラベルを微調整した LLaVA-1.6-7B は,我々の分類学からのアノテーションを用いた視覚言語モデルの訓練の可能性を示している。
決定ポイント識別における境界ケースの保持とCASE_DONEは、より一貫性のある対話収集のための制約付きプロトコルを動機付けている。
関連論文リスト
- DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents [67.07361089429757]
6つのリアルタイム音声システムを用いて, 実時間床の付着度を測定した。
アーキテクチャに依存したトレードオフを見つけます。
GPT-Realtime, Mini-o Duplex, Fun-Audio-Chatはペルソナ一貫性のあるコンテンツに強く固執する。
論文 参考訳(メタデータ) (2026-09-03T06:28:02Z) - A Semantic Autonomy Framework for VLM-Integrated Indoor Mobile Robots: Hybrid Deterministic Reasoning and Cross-Robot Adaptive Memory [5.2851376150891864]
本稿では,セマンティックな屋内ナビゲーションのための6層参照フレームワークを提案する。
7ステップのパラメトリックリゾルバは、言語モデル、カメラ、GPUを呼び出すことなく0.1ミリ秒未満で88%の命令を処理する。
明示的なスコープ分類を持つ5カテゴリセマンティックメモリフレームワークは、クロスセッション学習とクロスロボット知識伝達を可能にする。
論文 参考訳(メタデータ) (2026-05-04T12:27:03Z) - LVLMs and Humans Ground Differently in Referential Communication [33.82075906105276]
本稿では,複数回にまたがって複数のターンを交互に交互に交互に交互に交互に交互に交互に交互に操作するディレクトリ・マーチャントの設計について述べる。
データ収集のためのオンラインパイプライン、精度、効率、語彙オーバーラップのためのツールと分析、およびLVLMが参照表現を対話的に解決する際の制限を解き放つ356の対話コーパスをリリースする。
論文 参考訳(メタデータ) (2026-01-27T16:52:20Z) - RoboOmni: Proactive Robot Manipulation in Omni-modal Context [165.09049429566238]
我々は,音声対話や環境音,視覚的手がかりから意図を導出する,クロスモーダルな文脈指示を導入する。
目的認識,インタラクション確認,アクション実行を統一する,エンドツーエンドのOmni-Modal LLMに基づくフレームワークであるRoboOmniを提案する。
シミュレーションと実世界の設定の実験では、Robo OmniはテキストベースとASRベースのベースラインを越え、成功率、推論速度、意図認識、積極的に支援している。
論文 参考訳(メタデータ) (2025-10-27T18:49:03Z) - Collaborative Instance Object Navigation: Leveraging Uncertainty-Awareness to Minimize Human-Agent Dialogues [54.81155589931697]
協調インスタンスオブジェクトナビゲーション(CoIN)は、エージェントがターゲットインスタンスに関する不確実性を積極的に解決する新しいタスク設定である。
未認識者に対するエージェント・ユーザインタラクション(AIUTA)の新たな学習自由化手法を提案する。
まず、オブジェクト検出時に、セルフクエチオナーモデルがエージェント内で自己対話を開始し、完全かつ正確な観察記述を得る。
インタラクショントリガーモジュールは、人間に質問するか、継続するか、ナビゲーションを停止するかを決定する。
論文 参考訳(メタデータ) (2024-12-02T08:16:38Z) - Simulating User Agents for Embodied Conversational-AI [9.402740034754455]
我々は,エンボディエージェントとのインタラクション中にユーザ動作をシミュレート可能な,LLMベースのユーザエージェントを構築した。
シミュレーション対話をTEAChデータセットと比較することにより,ユーザエージェントの人間的行動生成能力を評価する。
論文 参考訳(メタデータ) (2024-10-31T00:56:08Z) - PREDILECT: Preferences Delineated with Zero-Shot Language-based
Reasoning in Reinforcement Learning [2.7387720378113554]
ロボット学習の新たな分野として,嗜好に基づく強化学習(RL)が出現している。
我々は、人間が提供するテキストから大言語モデル(LLM)のゼロショット機能を利用する。
シミュレーションシナリオとユーザスタディの両方において、フィードバックとその意味を分析することによって、作業の有効性を明らかにする。
論文 参考訳(メタデータ) (2024-02-23T16:30:05Z) - "No, to the Right" -- Online Language Corrections for Robotic
Manipulation via Shared Autonomy [70.45420918526926]
LILACは、実行中に自然言語の修正をオンラインで実施し、適応するためのフレームワークである。
LILACは人間とロボットを個別にターンテイクする代わりに、人間とロボットの間にエージェンシーを分割する。
提案手法は,タスク完了率が高く,ユーザによって主観的に好まれることを示す。
論文 参考訳(メタデータ) (2023-01-06T15:03:27Z) - Continuous ErrP detections during multimodal human-robot interaction [2.5199066832791535]
我々は,シミュレーションロボットが音声やジェスチャーを通じて人間とコミュニケーションする,マルチモーダルなヒューマンロボットインタラクション(HRI)シナリオを実装した。
人間のパートナーは、ロボットが選択した動作(ポインティングジェスチャー)とロボットの口頭発表(意図)が一致しているかを評価する。
脳波で明らかな、人間によるロボット行動の本質的な評価は、リアルタイムで記録され、オンラインで連続的にセグメンテーションされ、非同期に分類された。
論文 参考訳(メタデータ) (2022-07-25T15:39:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。