論文の概要: ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions
- arxiv url: http://arxiv.org/abs/2607.11570v1
- Date: Mon, 13 Jul 2026 13:50:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.495371
- Title: ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions
- Title(参考訳): ERR@HRI 3.0チャレンジ:人間とロボットのインタラクションにおけるエラーと予測のマルチモーダル検出
- Abstract要約: ERR@HRI Challenge (ERR@HRI 3.0)の第3版では、2つの補完的なデータセットが提供されている。
本稿では,ERR@HRI 3.0のデータセット,タスク,ベースライン,および結果について述べる。
- 参考スコア(独自算出の注目度): 18.151307410451796
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As robots become increasingly integrated into human environments, their ability to detect and respond to errors remains critical for maintaining user trust and interaction quality. While recent advances in machine learning have improved error detection capabilities, most approaches are limited to specific contexts, controlled settings, or pre-extracted features, limiting their generalizability and applicability to real-world conditions. To address this challenge, the third edition of the ERR@HRI Challenge (ERR@HRI 3.0) provided researchers with two complementary datasets that enable end-to-end innovation in methods for both detecting and preventing errors in human-robot interaction. The challenge offered raw, non-anonymized video data from naturalistic settings: (1) the Bystander Affect Detection (BAD) dataset, containing webcam recordings of 45 participants' spontaneous reactions to robot and human failure scenarios; and (2) the Bad Idea dataset, featuring 29 participants' anticipatory facial responses while predicting action outcomes before failures occur. Both datasets were collected via crowdsourcing, capturing the inherent variability of real-world conditions. This naturalistic variability, while challenging, provides an authentic testbed for developing robust error detection systems. Participants developed multimodal machine learning models for bystander reaction detection (Track 1) and anticipatory outcome prediction (Track 2), with an optional cross-dataset generalization track (Track 3). Three teams submitted valid models, all of which surpassed our convolutional neural network baselines. This paper describes the datasets, tasks, baselines, and results of ERR@HRI 3.0, and discusses implications for building generalizable, context-aware, and anticipatory error detection systems for human-robot interaction.
- Abstract(参考訳): ロボットがますます人間環境に統合されるにつれて、エラーを検出して応答する能力は、ユーザの信頼と対話の質を維持する上で重要である。
機械学習の最近の進歩はエラー検出機能を改善しているが、ほとんどのアプローチは特定のコンテキスト、制御された設定、または事前抽出された機能に限定されており、その一般化可能性と現実の条件への適用性に制限されている。
この課題に対処するため、ERR@HRI Challenge(ERR@HRI 3.0)の第3版では、2つの補完的なデータセットが提供され、人間とロボットのインタラクションにおけるエラーの検出と防止の方法のエンドツーエンドのイノベーションを可能にする。
課題は, 自然主義的な環境下での生の非匿名化ビデオデータ提供: 1) 傍観者感情検出(BAD)データセット, 45人の参加者がロボットや人間の失敗シナリオに対して自発的に反応するWebカメラ記録, (2) 障害発生前の行動結果を予測しながら29人の参加者の予測的表情応答を特徴とするBad Ideaデータセット。
両方のデータセットはクラウドソーシングを通じて収集され、現実世界の条件の固有の変数をキャプチャした。
この自然主義的な可変性は、難しいが、堅牢なエラー検出システムを開発するための真のテストベッドを提供する。
参加者は、傍観者反応検出のためのマルチモーダル機械学習モデル(トラック)を開発した。
1および予測結果予測(トラック2)、オプションのクロスデータセット一般化トラック(トラック3)。
3つのチームが有効なモデルを提出しました。
本稿では、ERR@HRI 3.0のデータセット、タスク、ベースライン、および結果について述べ、人間-ロボットインタラクションのための一般化可能な、コンテキスト認識、予測エラー検出システムを構築することの意味について論じる。
関連論文リスト
- Multimodal Anomaly Detection for Human-Robot Interaction [0.0]
本稿では,ビデオストリームを意味論的に意味のある特徴ベクトルに変換して,再構成に基づく異常検出を行うフレームワークを提案する。
これらの視覚特徴ベクトルを、ロボットの内部センサーの読み取りとシーングラフで拡張することで、モデルが視覚環境における外部異常とロボット内部の障害の両方を捉えることができる。
論文 参考訳(メタデータ) (2026-04-10T13:51:19Z) - RFM-HRI : A Multimodal Dataset of Medical Robot Failure, User Reaction and Recovery Preferences for Item Retrieval Tasks [0.0]
本研究は,(1)公開型マルチモーダルデータセット(RFM-HRI),(2)異なる障害タイプに対するユーザ応答の分析,(3)安全クリティカルな障害回復に影響を及ぼすような回復戦略の体系的比較を可能にするクラッシュカート検索シナリオに寄与する。
論文 参考訳(メタデータ) (2026-03-05T19:52:19Z) - HHI-Assist: A Dataset and Benchmark of Human-Human Interaction in Physical Assistance Scenario [63.77482302352545]
HHI-Assist(ヒヒ・アシスト)は、人間の介助作業における人間のインタラクションのモーションキャプチャークリップからなるデータセットである。
私たちの研究は、ロボット支援ポリシーを大幅に強化する可能性がある。
論文 参考訳(メタデータ) (2025-09-12T09:38:17Z) - Bridging the Gap Between Ideal and Real-world Evaluation: Benchmarking AI-Generated Image Detection in Challenging Scenarios [54.07895223545793]
本稿では,実世界ロバストネスデータセット(RRDataset)を導入し,3次元にわたる検出モデルの包括的評価を行う。
RRDatasetには7つの主要なシナリオの高品質なイメージが含まれている。
我々はRRDataset上で17の検出器と10の視覚言語モデル(VLM)をベンチマークし、大規模な人間実験を行った。
論文 参考訳(メタデータ) (2025-09-11T06:15:52Z) - ERR@HRI 2.0 Challenge: Multimodal Detection of Errors and Failures in Human-Robot Conversations [18.151307410451796]
ERR@HRI 2.0 Challengeは、人間とロボットの会話中の会話ロボットの失敗のデータセットを提供する。
データセットには、顔、スピーチ、頭の動きを取り入れた16時間の人-ロボットインタラクションが含まれている。
参加者はチームを作り、マルチモーダルデータを使用してこれらの障害を検出する機械学習モデルを開発するために招待される。
論文 参考訳(メタデータ) (2025-07-17T18:21:45Z) - Towards Unified 3D Object Detection via Algorithm and Data Unification [70.27631528933482]
我々は、最初の統一型マルチモーダル3Dオブジェクト検出ベンチマークMM-Omni3Dを構築し、上記のモノクロ検出器をマルチモーダルバージョンに拡張する。
設計した単分子・多モード検出器をそれぞれUniMODEとMM-UniMODEと命名した。
論文 参考訳(メタデータ) (2024-02-28T18:59:31Z) - Few-Shot Visual Grounding for Natural Human-Robot Interaction [0.0]
本稿では,人間ユーザによって音声で示される,混み合ったシーンから対象物を分割するソフトウェアアーキテクチャを提案する。
システムのコアでは、視覚的な接地のためにマルチモーダルディープニューラルネットワークを使用します。
公開シーンデータセットから収集した実RGB-Dデータに対して,提案モデルの性能を評価する。
論文 参考訳(メタデータ) (2021-03-17T15:24:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。