論文の概要: EyeTAG: Eye Trajectory-Aware Gaze Estimation
- arxiv url: http://arxiv.org/abs/2610.00922v1
- Date: Thu, 01 Oct 2026 01:57:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.845695
- Title: EyeTAG: Eye Trajectory-Aware Gaze Estimation
- Title(参考訳): EyeTAG: 視線を意識した視線推定
- Abstract要約: 単フレーム法は各フレームを独立して予測するため、連続的な出力はジッタとして変動する。
我々は,前述した一階目を中心に構築された因果的マルチフレームフレームワークであるEyeTAGを提案する。
EyeTAG は Gaze360 上での平均角誤差を 1.0$circ 程度削減し、EVE 上で最強のベースラインと同等に実行する。
- 参考スコア(独自算出の注目度): 5.223130446469262
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Gaze estimation under natural head-eye motion underpins applications from driver monitoring to human-computer interaction. Single-frame methods predict each frame independently, so consecutive outputs fluctuate as jitter. Multi-frame methods reduce this, but they learn motion implicitly inside appearance features, so the gaze trajectory is never an explicit variable. We propose EyeTAG (Eye Trajectory-Aware Gaze Estimation), a causal multi-frame framework built around an explicit first-order gaze prior: at each step it differentiates its own recent predictions and feeds the resulting trajectory back as a compact kinematic token. Because differencing is translation-invariant in gaze space, this token carries subject-invariant motion rather than personal gaze offsets. Face and eye streams supply visual evidence, fused by cross-attention and a causal Transformer decoder. EyeTAG reduces the mean angular error by about 1.0$^\circ$ on Gaze360 and performs on par with the strongest baseline on EVE (2.56$^\circ$ vs. 2.58$^\circ$). Within-model ablations, which keep the encoder and the rest of the architecture fixed and vary only the gaze history, show that the differential formulation, rather than temporal context alone, removes the systematic saccade bias that persists even with an absolute gaze-history prior. Our code is available at https://github.com/peter8366/EyeTAG.
- Abstract(参考訳): 自然眼球運動による視線推定は、運転者監視から人間とコンピュータの相互作用への応用を支えている。
単フレーム法は各フレームを独立して予測するため、連続的な出力はジッタとして変動する。
マルチフレーム手法によりこれを低減できるが、外見の特徴の中で暗黙的に動きを学習するので、視線軌跡は明示的な変数ではない。
我々はEyeTAG(Eye Trajectory-Aware Gaze Estimation)を提案する。これは、前述した1次視線に基づいて構築された因果的マルチフレームフレームワークで、各ステップにおいて、自身の最新の予測を区別し、その結果の軌跡をコンパクトなキネマティックトークンとしてフィードバックする。
このトークンは、視線空間において変換不変であるため、個人的な視線オフセットではなく、被写体不変の運動を持つ。
顔と眼のストリームは視覚的証拠を提供し、クロスアテンションと因果トランスフォーマーデコーダによって融合する。
EyeTAG は Gaze360 上での平均角誤差を 1.0$^\circ$ に減らし、EVE 上で最強のベースライン(2.56$^\circ$ 対 2.58$^\circ$ 対 2.58$^\circ$)と同等に実行する。
エンコーダとその他のアーキテクチャの固定を保ち、視線履歴のみを変化させるモデル内アブレーションは、時間的文脈のみでなく、それ以前の絶対的な視線史においても持続する体系的なササードバイアスを取り除くことを示している。
私たちのコードはhttps://github.com/peter8366/EyeTAG.comで公開されています。
関連論文リスト
- EgoTSR++: Egocentric Spatiotemporal Reasoning for Task Progress Understanding [51.078675806865306]
VLM(Vision-Language Models)は、静的な視覚的理解において急速に進歩しているが、エゴセントリックなタスクがどのように進行しているかを判断しても信頼性が低い。
EgoTSR(EgoTSR)は,オーダーローバストなタスク・プログレス理解を診断・改善するための統合フレームワークである。
論文 参考訳(メタデータ) (2026-09-23T09:20:44Z) - Inference-Time Attention Steering for Vision-Language-Action Driving Models [0.8538830579425146]
視覚言語-アクション(VLA)駆動モデルは、拡散に基づく軌道デコーダと推論段階を結合する。
我々は,Alpamayo-R1のQwen3-VLバックボーン上の検出器局在化トラフィックアクターの視覚トークンに対する有界付加性プレソフトマックスアテンションバイアスについて検討した。
論文 参考訳(メタデータ) (2026-08-17T20:03:38Z) - Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models [54.097381112138]
現在の自己進化型LMMは、イメージキャプションや視覚的質問応答といった視覚言語理解タスクに苦慮している。
モデルの視覚条件を直接正規化する,純粋に教師なしの自己進化型フレームワークであるVISEを提案する。
VISEは、専門的な役割、外部報酬モデル、アノテーションなしで単一のモデル内で動作します。
論文 参考訳(メタデータ) (2026-06-25T17:59:55Z) - ST-DiffEye: Diffusion-based Continuous Gaze Generation via Joint Scanpath-Trajectory Modeling [36.51837241351688]
視覚刺激を観察しながら視線パターンを生成することを目的とした人間の視線モデリングの課題について検討する。
視線は視聴者やトライアルによって大きく異なるため、この可変性はノイズやモデル視線を生成過程としてではなく、定義特性として扱う。
本稿では,ST-DiffEyeについて紹介する。ST-DiffEyeは,両モードを付加的な生入力チャネルとして結合することで,両モードを結合する共振器拡散フレームワークである。
論文 参考訳(メタデータ) (2026-06-13T21:56:08Z) - Insights from Visual Cognition: Understanding Human Action Dynamics with Overall Glance and Refined Gaze Transformer [9.235058796055139]
近年、Transformerは様々な視覚タスクにおいて大きな進歩を遂げている。
時間的・空間的な情報の重要性は時間スケールによって異なると論じる。
本稿では,Glance と Glance Gaze Transformer というデュアルパスネットワークを提案する。
論文 参考訳(メタデータ) (2026-04-08T07:52:28Z) - Merging Multiple Datasets for Improved Appearance-Based Gaze Estimation [10.682719521609743]
2段階のTransformer-based Gaze-Feature Fusion (TTGF) 法では、トランスフォーマーを使用して、両眼と顔の情報を別々にマージし、両眼にマージする。
提案手法は,各データセットにGaze Adaption Moduleを適用して,単一の共有推定器から推定した推定値を補正することにより,アノテーションの不一致を処理する。
論文 参考訳(メタデータ) (2024-09-02T02:51:40Z) - Online Deep Clustering with Video Track Consistency [85.8868194550978]
ビデオオブジェクトトラックから視覚的特徴を学習するための教師なしクラスタリングに基づく手法を提案する。
教師なしのクラス非依存でノイズの多いトラックジェネレータを利用すれば、コストと正確なトラックアノテーションに依存するよりも精度が向上することを示す。
論文 参考訳(メタデータ) (2022-06-07T08:11:00Z) - IA-RED$^2$: Interpretability-Aware Redundancy Reduction for Vision
Transformers [81.31885548824926]
自己注意型モデルであるTransformerは近年,コンピュータビジョン分野における主要なバックボーンになりつつある。
解釈可能性を考慮した冗長度低減フレームワーク(IA-RED$2$)を提案する。
画像タスクとビデオタスクの両方で広範囲に実験を行い、最大1.4倍のスピードアップを実現しました。
論文 参考訳(メタデータ) (2021-06-23T18:29:23Z) - Do Generative Models Know Disentanglement? Contrastive Learning is All
You Need [59.033559925639075]
本論文では,変数空間におけるコントラスト(DisCo)による非監視的,モデル非依存的手法を提案する。
DisCoは、GAN、VAE、およびフローを含む、事前訓練された非解離生成モデルに与えられた最先端の解離を達成します。
論文 参考訳(メタデータ) (2021-02-21T08:01:20Z) - 360-Degree Gaze Estimation in the Wild Using Multiple Zoom Scales [26.36068336169795]
焦点を絞った表情から視線を推定する能力を模倣するモデルを開発した。
このモデルは、クリアアイパッチを抽出する必要がない。
モデルを拡張して、360度視線推定の課題に対処する。
論文 参考訳(メタデータ) (2020-09-15T08:45:12Z) - Dual In-painting Model for Unsupervised Gaze Correction and Animation in
the Wild [82.42401132933462]
視線角度と頭部ポーズの正確なアノテーションを必要とせずに機能する解を提案する。
我々の手法は3つの新しいモジュールからなる: Gaze Correction Module (GCM)、 Gaze Animation Module (GAM)、 Pretrained Autoencoder Module (PAM)。
論文 参考訳(メタデータ) (2020-08-09T23:14:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。