論文の概要: Gaze4HRI: Zero-shot Benchmarking Gaze Estimation Neural-Networks for Human-Robot Interaction
- arxiv url: http://arxiv.org/abs/2605.04770v1
- Date: Wed, 06 May 2026 11:17:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.792529
- Title: Gaze4HRI: Zero-shot Benchmarking Gaze Estimation Neural-Networks for Human-Robot Interaction
- Title(参考訳): Gaze4HRI:人間-ロボットインタラクションのためのゼロショットベンチマーク・ゲイズ推定ニューラルネットワーク
- Abstract要約: 本稿では,重要なHRI変数に対する最先端性能を評価するために設計された大規模データセットであるGaze4HRIを紹介する。
我々のベンチマークでは、評価されたすべてのメソッドが少なくとも1つの条件でフェールし、急な下向きの視線を普遍的な障害点として特定する。
- 参考スコア(独自算出の注目度): 8.819673391477036
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While zero-shot appearance-based 3D gaze estimation offers significant cost-efficiency by directly mapping RGB images to gaze vectors, its reliability in Human-Robot Interaction (HRI) settings remains uncertain. Existing benchmarks frequently overlook fundamental HRI conditions, such as dynamic camera viewpoints and moving targets in video. Furthermore, current cross-dataset evaluations often suffer from a complexity gap, where methods trained on diverse datasets are tested on significantly smaller and less varied sets, failing to assess true robustness. To bridge these gaps, we introduce Gaze4HRI, a large-scale dataset (50+ subjects, 3,000+ videos, 600,000+ frames) designed to evaluate state-of-the-art performance against critical HRI variables: illumination, head-gaze conflict, as well as the motion of camera and gaze target in video. Our benchmark reveals that all evaluated methods fail in at least one condition, identifying steeply-downward gaze as a universal failure point. Notably, PureGaze trained on the ETH-X-Gaze dataset uniquely maintains resilience across all other conditions. These results challenge the recent focus in the literature on complex spatial-temporal modeling and Transformer-based architectures. Instead, our findings suggest that extensive data diversity, as exemplified by the ETH-X-Gaze dataset, serves as the primary driver of zero-shot robustness in unconstrained environments, while resilience-enhancing frameworks, such as PureGaze's self-adversarial loss for gaze feature purification, provide a substantial further improvement. Ultimately, this study establishes a rigorous benchmark that provides practical guidelines for practitioners as well as reshaping future research. The dataset and codes are available at https://gazeforhri.github.io.
- Abstract(参考訳): ゼロショットの外観に基づく3D視線推定は、RGB画像を視線ベクトルに直接マッピングすることで、かなりのコスト効率を提供するが、ヒューマン・ロボット・インタラクション(HRI)設定の信頼性は依然として不明である。
既存のベンチマークでは、ダイナミックカメラの視点や動画の移動目標など、基本的なHRI条件をしばしば見落としている。
さらに、現在のクロスデータセット評価は、様々なデータセットで訓練されたメソッドが、著しく小さく、より少ない多様なセットでテストされ、真の堅牢性を評価することができない、複雑さのギャップに悩まされることが多い。
これらのギャップを埋めるために、Gaz4HRIという大規模なデータセット(50以上の被験者、3000以上のビデオ、600,000以上のフレーム)を紹介します。
我々のベンチマークでは、評価されたすべてのメソッドが少なくとも1つの条件でフェールし、急な下向きの視線を普遍的な障害点として特定する。
特に、ETH-X-GazeデータセットでトレーニングされたPureGazeは、他のすべての条件に対するレジリエンスを独自に維持する。
これらの結果は、複雑な時空間モデリングとトランスフォーマーに基づくアーキテクチャに関する最近の文献に焦点をあてることに挑戦する。
その代わり、ETH-X-Gazeデータセットが示すように、広範囲なデータ多様性は、制約のない環境でゼロショットロバスト性の主要な要因であり、PureGazeの視線特徴の浄化に対する自己逆方向の損失など、レジリエンス向上フレームワークは、大幅な改善をもたらすことを示唆している。
最終的に、この研究は、実践者のための実践的ガイドラインを提供するとともに、将来の研究を再構築する厳密なベンチマークを確立します。
データセットとコードはhttps://gazeforhri.github.io.comで公開されている。
関連論文リスト
- Event-based SLAM Benchmark for High-Speed Maneuvers [68.148886127117]
イベントベースのカメラはバイオインスパイアされたセンサーで、独立して、マイクロ秒の解像度で明るさの変化に非同期に反応する。
既存のイベントベースのアプローチは、高速操作による動きのぼかしを緩和することに成功したが、多くの制限に悩まされた。
イベントベースの状態推定のためのベンチマークフレームワークであるEvSLAMを導入する。
論文 参考訳(メタデータ) (2026-04-27T04:36:41Z) - Towards Realistic Open-Vocabulary Remote Sensing Segmentation: Benchmark and Baseline [52.65099689153431]
オープンボキャブラリリモートセンシングイメージセグメンテーション(OVRSIS)は、データセットの断片化、トレーニングの多様性の制限、評価ベンチマークの欠如などにより、まだ探索されていない。
我々はOVRSISの大規模かつアプリケーション指向のベンチマークである textitOVRSISBenchV2 を提案する。
以上の結果から,リアルなベンチマーク設計の重要性と,OVRSISの摂動型転送の有効性が示唆された。
論文 参考訳(メタデータ) (2026-04-17T02:49:46Z) - Real-time Appearance-based Gaze Estimation for Open Domains [15.195617974731766]
本稿では,人手による付加的なデータを必要としない,高機能なAGEフレームワークを提案する。
異方性データセット間ラベル偏差の影響を軽減するため、マルチタスク学習問題として視線回帰を再構成する。
我々のMobileNetベースの軽量モデル一般化は、最先端(SOTA)のUniGaze-Hと競合する性能を実現する。
論文 参考訳(メタデータ) (2026-03-27T19:33:18Z) - Hybrid-Domain Adaptative Representation Learning for Gaze Estimation [20.422491630669885]
本稿では,頑健な視線表現を学習するためのハイブリッドドメイン適応表現学習フレームワークを提案する。
高品質近眼画像から抽出した特徴をアライメントすることで、低品質の顔画像から視線関連表現を遠ざけることを提案する。
EyeDiap、MPIIFaceGaze、Gaze360データセットの実験は、我々のアプローチが最先端の精度を達成することを示す。
論文 参考訳(メタデータ) (2025-11-17T10:38:50Z) - OmniGaze: Reward-inspired Generalizable Gaze Estimation In The Wild [104.57404324262556]
現在の3次元視線推定法は、多様なデータ領域にまたがる一般化に苦慮している。
OmniGazeは3次元視線推定のための半教師付きフレームワークである。
OmniGazeは5つのデータセットで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-10-15T15:19:52Z) - Bridging the Synthetic-Real Gap: Supervised Domain Adaptation for Robust Spacecraft 6-DoF Pose Estimation [13.83897333268682]
宇宙船のポース推定は、ランデブー、ドッキング、軌道上のドッキングのような自律的な宇宙活動の基本的な能力である。
既存のドメイン適応アプローチは、この問題を軽減することを目的としているが、ラベル付きターゲットサンプルの少ない数が利用できる場合、しばしば性能が低下する。
本稿では,SPEキーポイント回帰に適したSDA(Supervised Domain Adaptation)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-17T08:03:05Z) - RoHOI: Robustness Benchmark for Human-Object Interaction Detection [84.78366452133514]
ヒューマン・オブジェクト・インタラクション(HOI)検出は、コンテキスト認識支援を可能にするロボット・ヒューマン・アシストに不可欠である。
HOI検出のための最初のベンチマークを導入し、様々な課題下でモデルのレジリエンスを評価する。
我々のベンチマークであるRoHOIは、HICO-DETとV-COCOデータセットに基づく20の汚職タイプと、新しいロバストネスにフォーカスしたメトリクスを含んでいる。
論文 参考訳(メタデータ) (2025-07-12T01:58:04Z) - DHECA-SuperGaze: Dual Head-Eye Cross-Attention and Super-Resolution for Unconstrained Gaze Estimation [0.0]
本稿では,DHECA-SuperGazeについて紹介する。DHECA-SuperGazeは,視線予測を超解像(SR)とデュアルヘッドアイ・クロスアテンション(DHECA)モジュールを用いて進める深層学習に基づく手法である。
Gaze360およびGFIEデータセットの性能評価は,提案手法のデータセット内性能に優れていた。
論文 参考訳(メタデータ) (2025-05-13T10:45:08Z) - Benchmark Granularity and Model Robustness for Image-Text Retrieval [44.045767657945895]
データセットの粒度とクエリの摂動が検索性能とロバスト性にどのように影響するかを示す。
よりリッチなキャプションは、特にテキスト・ツー・イメージタスクにおいて、検索を継続的に強化することを示す。
本研究は, モデル頑健性の変化とキャプション粒度と感度摂動のデータセット依存的関係に着目した。
論文 参考訳(メタデータ) (2024-07-21T18:08:44Z) - Exploring the Physical World Adversarial Robustness of Vehicle Detection [13.588120545886229]
アドリアックは現実世界の検知モデルの堅牢性を損なう可能性がある。
CARLAシミュレータを用いた革新的なインスタントレベルデータ生成パイプラインを提案する。
本研究は, 逆境条件下での多種多様なモデル性能について考察した。
論文 参考訳(メタデータ) (2023-08-07T11:09:12Z) - OOD-CV-v2: An extended Benchmark for Robustness to Out-of-Distribution
Shifts of Individual Nuisances in Natural Images [59.51657161097337]
OOD-CV-v2は、ポーズ、形状、テクスチャ、コンテキスト、気象条件の10のオブジェクトカテゴリのアウト・オブ・ディストリビューションの例を含むベンチマークデータセットである。
この新たなデータセットに加えて、一般的なベースライン手法を用いた広範な実験にも貢献する。
論文 参考訳(メタデータ) (2023-04-17T20:39:25Z) - ETH-XGaze: A Large Scale Dataset for Gaze Estimation under Extreme Head
Pose and Gaze Variation [52.5465548207648]
ETH-XGazeは100万以上の高解像度画像からなる新しい視線推定データセットである。
我々のデータセットは、異なる頭部ポーズと視線角度で視線推定手法のロバスト性を大幅に改善できることを示す。
論文 参考訳(メタデータ) (2020-07-31T04:15:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。