論文の概要: HiFiGaze: Improving Eye Tracking Accuracy Using Screen Content Knowledge
- arxiv url: http://arxiv.org/abs/2603.19588v1
- Date: Fri, 20 Mar 2026 02:58:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:38.954954
- Title: HiFiGaze: Improving Eye Tracking Accuracy Using Screen Content Knowledge
- Title(参考訳): HiFiGaze:スクリーンコンテンツ知識による視線追跡精度の向上
- Authors: Taejun Kim, Vimal Mollyn, Riku Arakawa, Chris Harrison,
- Abstract要約: コンシューマー・コンピューティング・デバイス上での視線推定のための新しい高精度なアプローチを提案する。
我々は、スマートフォン、ラップトップ、デスクトップなど、ユーザー向けカメラの品質の継続的な進歩を生かしている。
- 参考スコア(独自算出の注目度): 21.605063672214225
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We present a new and accurate approach for gaze estimation on consumer computing devices. We take advantage of continued strides in the quality of user-facing cameras found in e.g., smartphones, laptops, and desktops - 4K or greater in high-end devices - such that it is now possible to capture the 2D reflection of a device's screen in the user's eyes. This alone is insufficient for accurate gaze tracking due to the near-infinite variety of screen content. Crucially, however, the device knows what is being displayed on its own screen - in this work, we show this information allows for robust segmentation of the reflection, the location and size of which encodes the user's screen-relative gaze target. We explore several strategies to leverage this useful signal, quantifying performance in a user study. Our best performing model reduces mean tracking error by ~8% compared to a baseline appearance-based model. A supplemental study reveals an additional 10-20% improvement if the gaze-tracking camera is located at the bottom of the device.
- Abstract(参考訳): コンシューマー・コンピューティング・デバイス上での視線推定のための新しい高精度なアプローチを提案する。
私たちは、スマートフォン、ラップトップ、デスクトップなど、ハイエンドデバイスで4K以上のユーザー向けカメラの質を継続的に向上させ、ユーザの目でデバイスの画面の2Dリフレクションを捉えることができるようにしています。
これは、ほぼ無限のスクリーンコンテンツのために正確な視線追跡には不十分である。
しかし、重要なことに、デバイスは自身の画面で何が表示されているかを知っている。この研究では、この情報によってリフレクションの堅牢なセグメンテーションが可能になり、その位置とサイズがユーザのスクリーン関連視線ターゲットをエンコードする。
この有用な信号を活用するためのいくつかの戦略を探索し、ユーザスタディのパフォーマンスを定量化する。
我々の最高の性能モデルは、ベースラインの外観に基づくモデルと比較して平均追跡誤差を約8%削減する。
補足的な研究によると、視線追跡カメラがデバイスの下部にある場合、さらに10~20%改善されている。
関連論文リスト
- WEBEYETRACK: Scalable Eye-Tracking for the Browser via On-Device Few-Shot Personalization [3.884714448890651]
We bEyeTrackは軽量なSOTA視線推定モデルをブラウザに直接統合するフレームワークです。
モデルベースの頭部ポーズ推定と、デバイス上でのいくつかのショット学習と、9つのキャリブレーションサンプルが組み込まれている。
WebEyeTrackは新しいユーザーに適応し、GazeCaptureでエラーマージンが2.32cm、iPhone 14で2.4ミリ秒のリアルタイム推論速度でSOTAのパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-08-27T03:38:58Z) - Trade-offs in Privacy-Preserving Eye Tracking through Iris Obfuscation: A Benchmarking Study [44.44776028287441]
ユーザアイデンティティを難読化するために,ボーリング,ノイズアップ,ダウンサンプリング,ゴムシートモデル,アイリススタイルの転送をベンチマークした。
実験の結果,曖昧化やノイズ化といった標準的な画像処理手法が,ディープラーニングに基づくタスクに限界的影響を与えることがわかった。
ダウンサンプリング,ゴムシートモデル,アイリススタイル転送は,ユーザ識別子の隠蔽に有効であるが,アイリススタイル転送は高い計算コストで,両ユーティリティタスクにおいて他よりも優れている。
論文 参考訳(メタデータ) (2025-04-14T14:29:38Z) - SparseFormer: Detecting Objects in HRW Shots via Sparse Vision Transformer [62.11796778482088]
本稿では,近接撮影とHRW撮影のオブジェクト検出のギャップを埋めるために,SparseFormerと呼ばれるモデル非依存のスパース視覚変換器を提案する。
提案されたSparseFormerは、オブジェクトを含む可能性のあるスパース分散ウィンドウを精査するために、注意トークンを選択的に使用する。
2つのHRWベンチマークであるPANDAとDOTA-v1.0の実験により、提案されたSparseFormerは、最先端のアプローチよりも検出精度(最大5.8%)と速度(最大3倍)を大幅に改善することを示した。
論文 参考訳(メタデータ) (2025-02-11T03:21:25Z) - Which Viewpoint Shows it Best? Language for Weakly Supervising View Selection in Multi-view Instructional Videos [66.1935609072708]
LangViewは、ビュー依存のキャプション予測の相対的精度を、擬似ラベルを最もよく見るためのプロキシとして利用するフレームワークである。
推論中、我々のモデルは多視点ビデオ(言語やカメラのポーズなし)のみを入力として、各タイミングで見るのに最適な視点を返します。
論文 参考訳(メタデータ) (2024-11-13T16:31:08Z) - Real-Time Under-Display Cameras Image Restoration and HDR on Mobile
Devices [81.61356052916855]
アンダーディスプレイカメラ(UDC)によって撮影された画像は、その前のスクリーンによって劣化する。
画像復元のためのディープラーニング手法は、キャプチャ画像の劣化を著しく低減することができる。
我々は,視覚的UDC画像復元とHDRのための軽量なモデルを提案し,スマートフォン上での様々な手法の性能と実行状況を比較したベンチマークを提供する。
論文 参考訳(メタデータ) (2022-11-25T11:46:57Z) - Resolving Camera Position for a Practical Application of Gaze Estimation
on Edge Devices [6.692686655277163]
ほとんどの視線推定研究は、カメラが完全に視線を捉えている設定条件でのみ機能する。
本稿では,論理カメラの設置位置による視線推定について検討する。
現実的なシナリオを持つ安価なエッジデバイスを使用することで,本研究を実用化する。
論文 参考訳(メタデータ) (2022-01-09T07:19:59Z) - You Better Look Twice: a new perspective for designing accurate
detectors with reduced computations [56.34005280792013]
BLT-netは、新しい低計算の2段階オブジェクト検出アーキテクチャである。
非常にエレガントな第1ステージを使用して、オブジェクトをバックグラウンドから分離することで、計算を削減します。
結果のイメージ提案は、高度に正確なモデルによって第2段階で処理される。
論文 参考訳(メタデータ) (2021-07-21T12:39:51Z) - Towards End-to-end Video-based Eye-Tracking [50.0630362419371]
画像のみから視線を推定することは、観察不可能な人固有の要因のために難しい課題である。
本稿では,これらの意味的関係と時間的関係を明確に学習することを目的とした,新しいデータセットとアタッチメント手法を提案する。
視覚刺激からの情報と視線画像の融合が,文献に記録された人物と同じような性能を達成することにつながることを実証した。
論文 参考訳(メタデータ) (2020-07-26T12:39:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。