論文の概要: How Much Future Helps? A Controlled Study of Future-Privileged Supervision for Causal Egocentric Gaze Estimation
- arxiv url: http://arxiv.org/abs/2607.01437v1
- Date: Wed, 01 Jul 2026 20:00:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.583872
- Title: How Much Future Helps? A Controlled Study of Future-Privileged Supervision for Causal Egocentric Gaze Estimation
- Title(参考訳): 今後どのくらいの助けになるか : 因果性集中型迷路推定のための先進的スーパービジョンの制御研究
- Abstract要約: 本稿では、学習中に調整可能なルックアヘッド水平線にアクセスするが、推論時に破棄される未来認識ブランチを特徴とする制御フレームワークを提案する。
EGTEA Gaze+ と Ego4D 全体では、将来の私的な監督は因果の視線予測を継続的に改善する。
- 参考スコア(独自算出の注目度): 40.56103715954253
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Egocentric gaze estimation is commonly studied using models that process the full video with access to future frames, while real-world applications require strictly causal, online prediction. This discrepancy raises key questions: Does future context inherently provide valuable signals for gaze estimation? If so, how much future look-ahead optimally supervises a causal model during training? To investigate, we propose a controlled framework featuring a future-aware branch that accesses a tunable look-ahead horizon during training but is discarded at inference. This design isolates the impact of future context while keeping the inference architecture fixed and strictly causal. Across EGTEA Gaze+ and Ego4D, we find that future-privileged supervision consistently improves causal gaze prediction, confirming its utility. However, performance gains do not increase monotonically with longer look-ahead, but rather peak within a bounded temporal regime. Specifically, optimal performance corresponds to roughly 1.7--3.3 seconds of future context ($H{\in}[5, 10]$) on EGTEA Gaze+ and 2.7 seconds ($H{=}10$) on Ego4D. Our results demonstrate that lightweight causal models can effectively absorb future-aware signals, providing practical guidance for real-time egocentric gaze modeling.
- Abstract(参考訳): エゴセントリックな視線推定は、将来のフレームへのアクセスで全ビデオを処理するモデルを用いて一般的に研究されるが、現実のアプリケーションは厳密に因果的、オンライン予測を必要とする。
この不一致は、重要な疑問を提起する: 将来の文脈は本質的に、視線推定に有用な信号を提供するのだろうか?
もしそうなら、将来のルックアヘッドがトレーニング中の因果モデルを最適に監督するか?
そこで本研究では,学習中に修正可能なルックアヘッド地平線にアクセスするが,推論時に破棄される未来意識のブランチを特徴とする制御フレームワークを提案する。
この設計は、推論アーキテクチャの修正と厳密な因果関係を維持しながら、将来のコンテキストの影響を分離する。
EGTEA Gaze+ と Ego4D 全体では、将来有望な監督が因果的視線予測を継続的に改善し、その実用性を確認している。
しかし、パフォーマンスの上昇はより長いルックアヘッドで単調に増加するのではなく、むしろ時間的境界内でピークとなる。
具体的には、EGTEA Gaze+で約1.7~3.3秒(H{\in}[5, 10]$)、Ego4Dで2.7秒(H{=}10$)となる。
本研究は,光因果モデルが将来の認識信号を効果的に吸収できることを示し,リアルタイムな自我中心の視線モデリングのための実践的なガイダンスを提供する。
関連論文リスト
- DA-WAM: Decision-Aligned Future Latents for Driving World Models [6.756366477497099]
DA-WAMは、予測表現学習、行動条件付き将来のモデリング、軌道スコアを単一の意思決定目標の下で統一するフレームワークである。
動作条件付き予測器は、トラジェクトリ候補毎の異なる将来の潜在状態を生成し、将来の遅延条件付き因子化スコアラによって評価される。
NAVSIM-v1とNAVSIM-v2の実験は、最先端の性能を示し、改善と診断分析は鍵となる構成要素を検証する。
論文 参考訳(メタデータ) (2026-08-19T16:33:02Z) - FLaRA: Predicting Future Latent Representations for Accident Anticipation [15.994549120609358]
ダッシュカムビデオからの交通事故を予想することは、インテリジェント交通システムにおいて重要な課題である。
事故予知のための潜在表現を予測することで、このパラダイムをシフトさせる新しい予測アーキテクチャであるFLaRAを提案する。
提案手法は,現実的な早期警告機能を維持しつつ,最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-06-12T12:16:45Z) - LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning [51.969318585152116]
LatentPilotは、トレーニング中の将来の観察を貴重なデータソースとして利用して、アクション条件付きビジュアルダイナミクスを学習する。
そこで本稿では,フライホイール方式のトレーニング機構を提案する。これは,道路上の軌道を反復的に収集し,エージェントの行動分布に適合するようにモデルを再訓練する。
R2R-CE、RxR-CE、R2R-PEベンチマークの実験では新たなSOTA結果が得られた。
論文 参考訳(メタデータ) (2026-03-31T02:21:59Z) - ARGaze: Autoregressive Transformers for Online Egocentric Gaze Estimation [46.30718574969354]
エゴセントリックな視線推定は、カメラ装着者が過去と現在のフレームのみを使用して、ファースト・パーソン・ビデオから見ている場所を予測する。
本稿では,視線推定を逐次予測として再構成するARGazeを提案する。
オンライン評価では,複数のエゴセントリックなベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-04T23:33:16Z) - From Observations to States: Latent Time Series Forecasting [65.98504021691666]
本稿では,TSFを観測回帰から潜時予測に移行する新しいパラダイムであるLatent Time Series Forecasting(LatentTSF)を提案する。
具体的には、LatentTSFはAutoEncoderを使用して、各段階での観測結果を高次元の潜在状態空間に投影する。
提案する潜伏目標は,予測潜伏状態と地道状態と観測値との相互情報を暗黙的に最大化する。
論文 参考訳(メタデータ) (2026-01-30T20:39:44Z) - Learning Through Retrospection: Improving Trajectory Prediction for Automated Driving with Error Feedback [41.94295877935867]
自動走行では、周囲の車両の軌道予測がシーンダイナミクスの推論をサポートし、エゴ車両の安全な計画を可能にする。
既存のモデルは、観測された情報に基づいて将来の軌跡を予測するための瞬間的なタスクとして予測を扱う。
提案手法は,推論中の誤差を補正し,再現する手法である。
論文 参考訳(メタデータ) (2025-04-18T16:35:12Z) - Gated Temporal Diffusion for Stochastic Long-Term Dense Anticipation [17.4088244981231]
長期的な行動予測は、自律運転や人間とロボットの相互作用など、多くのアプリケーションにとって重要な課題となっている。
本稿では,Gated Temporal Diffusion (GTD) ネットワークを提案する。
我々のモデルは、Breakfast、Ambly101、50Saladsの両方の決定論的設定で、最先端の結果を達成する。
論文 参考訳(メタデータ) (2024-07-16T17:48:05Z) - Back to the Future: GNN-based NO$_2$ Forecasting via Future Covariates [49.93577170464313]
都市全域にわたる地上監視ネットワークにおける大気質観測について検討する。
我々は過去と将来の共変分を現在の観測に埋め込む条件付きブロックを提案する。
将来の気象情報に対する条件付けは,過去の交通状況を考えるよりも影響が大きいことが判明した。
論文 参考訳(メタデータ) (2024-04-08T09:13:16Z) - Learning to Anticipate Egocentric Actions by Imagination [60.21323541219304]
我々は,エゴセントリックなアクション予測タスクについて検討し,エゴセントリックなビデオの再生に先立って,将来のアクション秒を予測する。
本手法は, EPIC Kitchens Action Precipation Challenge の既視テストセットと未確認テストセットの両方において, 従来手法を有意に上回った。
論文 参考訳(メタデータ) (2021-01-13T08:04:10Z) - A Novel Graph based Trajectory Predictor with Pseudo Oracle [15.108410951760131]
GTPPOは、歩行者の将来の行動に配慮したエンコーダデコーダに基づく手法である。
ETH、UCY、Stanford Droneのデータセットで評価されている。
論文 参考訳(メタデータ) (2020-02-02T13:40:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。