論文の概要: Gaze Target Estimation Anywhere with Concepts
- arxiv url: http://arxiv.org/abs/2608.11367v1
- Date: Tue, 11 Aug 2026 19:23:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.359389
- Title: Gaze Target Estimation Anywhere with Concepts
- Title(参考訳): Gaze Target Estimation Anywheres with Concepts
- Abstract要約: 本稿では、視線分析のためのPGE(Promptable Gaze Target Estimation)タスクを紹介する。
PGE条件は、フレキシブルなユーザテキストや視覚的なプロンプトに基づいて、特定の主題を識別する。
そこで我々は,120Kの高品質な高速アノテート画像ペアのデータセットとベンチマークであるGaze-Coを生成するスケーラブルなデータエンジンを開発した。
PGE用に設計された最初のモデルであるGazeAnywhereも提案する。
- 参考スコア(独自算出の注目度): 28.49132281076088
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Estimating human gaze targets from images in-the-wild is an important and formidable task. Existing approaches primarily employ brittle, multi-stage pipelines that require explicit inputs, like head bounding boxes and human pose, in order to identify the subject of gaze analysis. As a result, detection errors can cascade and lead to failure. Moreover, these prior works lack the flexibility of specifying the gaze analysis task via natural language prompting, an approach which has been shown to have significant benefits in convenience and scalability for other image analysis tasks. To overcome these limitations, we introduce the Promptable Gaze Target Estimation (PGE) task, a new end-to-end, concept-driven paradigm for gaze analysis. PGE conditions gaze prediction on flexible user text or visual prompts (e.g., "the boy in the red shirt" or "person in point [0.52, 0.48]") to identify a specific subject for gaze analysis. This approach integrates subject localization with gaze estimation, and eliminates the rigid dependency on intermediate analysis stages. We develop a scalable data engine to generate Gaze-Co (Gaze Estimation with Concepts), a dataset and benchmark of 120K high-quality, prompt-annotated image pairs. We also propose GazeAnywhere, the first model designed for PGE. GazeAnywhere uses a transformer-based detector to fuse features from frozen encoders and simultaneously solves subject localization, in/out-of-frame presence, and gaze target heatmap estimation. GazeAnywhere achieves state-of-the-art performance on multiple PGE benchmarks, setting a strong baseline for this new problem even on a difficult out-of-domain, real-world clinical dataset. GazeAnywhere is open-sourced in github.com/IrohXu/GazeAnywhere.
- Abstract(参考訳): 画像から人間の視線目標を推定することは重要で恐ろしい作業である。
既存のアプローチは主に、視線分析の主題を特定するために、ヘッドバウンディングボックスや人間のポーズのような明示的な入力を必要とする脆いマルチステージパイプラインを使用している。
その結果、検出エラーがカスケードされ、失敗につながる。
さらに、これらの先行研究は、自然言語プロンプトによる視線解析タスクを特定する柔軟性に欠けており、他の画像解析タスクの利便性とスケーラビリティに大きなメリットがあることが示されている。
これらの制約を克服するために、我々は視線分析のための新しいエンドツーエンドの概念駆動パラダイムであるPromptable Gaze Target Estimation (PGE)タスクを導入する。
PGE条件は、フレキシブルなユーザテキストや視覚的プロンプト(例えば、「赤いシャツの少年」や「ポイント[0.52, 0.48]の人物」など)を目視し、視線分析の特定の対象を特定する。
このアプローチは、主観的局所化と視線推定を統合し、中間解析段階における剛性的な依存を取り除く。
そこで我々は,120Kの高品質な画像ペアのデータセットとベンチマークであるGaze-Co(Gaze Estimation with Concepts)を生成するスケーラブルなデータエンジンを開発した。
PGE用に設計された最初のモデルであるGazeAnywhereも提案する。
GazeAnywhereはトランスフォーマーベースの検出器を使って、冷凍エンコーダから特徴を融合させ、同時に被写体の位置、フレーム内存在、ターゲットの熱マップの推定を解く。
GazeAnywhereは、複数のPGEベンチマークで最先端のパフォーマンスを実現し、ドメイン外の実際の臨床データセットが難しい場合でも、この新しい問題に対する強力なベースラインを設定する。
GazeAnywhereはgithub.com/IrohXu/GazeAnywhereでオープンソース化されている。
関連論文リスト
- Multi-scale Object-Aware Gaze Estimation via Geometric Reasoning [22.665947623978]
オブジェクトセマンティクスによって導かれる2段階の視線推定フレームワークを提案する。
提案手法は, パラメータサイズ7.1Mを維持しながら, 全ベンチマークで高い性能を実現する。
論文 参考訳(メタデータ) (2026-06-28T11:02:21Z) - OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following [59.53720386342017]
拡張性のある多対人視線推論に基礎的な視覚言語モデルを適用する統合視覚言語フレームワークを提案する。
すべての個人をモデル化することにより、OmniGFは正確な空間的視線目標推定、意味的視線予測、複雑な社会的視線推定をシームレスに統合する。
論文 参考訳(メタデータ) (2026-05-26T00:08:06Z) - GazeCLIP: Gaze-Guided CLIP with Adaptive-Enhanced Fine-Grained Language Prompt for Deepfake Attribution and Detection [80.12497948980378]
現在のディープフェイク属性やディープフェイク検出作業は、新しい生成方法への一般化が不十分である傾向にある。
適応型きめ細粒度言語プロンプトを用いた新しい視線誘導型CLIPを提案する。
拡散モデルや流れモデルのような新しい発電機上でのネットワークのDFAD性能を評価するために, 新規できめ細かなベンチマークを行う。
CLIPをベースとした視線認識モデルを導入し,顔偽造攻撃の一般化を図った。
論文 参考訳(メタデータ) (2026-03-31T05:59:59Z) - Revisiting Salient Object Detection from an Observer-Centric Perspective [48.99721284788945]
そこで我々は,視覚的手がかりだけでなく,その嗜好や意図など,観察者固有の要因を考慮し,有意な領域を予測できるオブザーバ中心の有意物体検出(OC-SOD)を提案する。
結果として、この定式化は本質的なあいまいさと人間の知覚の多様性を捉え、パーソナライズされ、文脈に合ったサリエンシの予測を可能にする。
論文 参考訳(メタデータ) (2026-02-06T03:53:01Z) - Hybrid-Domain Adaptative Representation Learning for Gaze Estimation [20.422491630669885]
本稿では,頑健な視線表現を学習するためのハイブリッドドメイン適応表現学習フレームワークを提案する。
高品質近眼画像から抽出した特徴をアライメントすることで、低品質の顔画像から視線関連表現を遠ざけることを提案する。
EyeDiap、MPIIFaceGaze、Gaze360データセットの実験は、我々のアプローチが最先端の精度を達成することを示す。
論文 参考訳(メタデータ) (2025-11-17T10:38:50Z) - OmniGaze: Reward-inspired Generalizable Gaze Estimation In The Wild [104.57404324262556]
現在の3次元視線推定法は、多様なデータ領域にまたがる一般化に苦慮している。
OmniGazeは3次元視線推定のための半教師付きフレームワークである。
OmniGazeは5つのデータセットで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-10-15T15:19:52Z) - Gaze-LLE: Gaze Target Estimation via Large-Scale Learned Encoders [33.26237143983192]
本研究では,視覚目標推定の問題に対処する。
凍結したDINOv2エンコーダの特徴を活用して視線目標推定を効率化する新しいトランスフォーマフレームワークであるGaze-LLEを提案する。
論文 参考訳(メタデータ) (2024-12-12T18:55:30Z) - Towards Pixel-Level Prediction for Gaze Following: Benchmark and Approach [27.84672974344777]
本稿ではGazeSegという新しい視線目標予測手法を提案する。
人物の空間的視野を案内情報として完全に活用し、徐々に粗い視線目標のセグメンテーションと認識プロセスへと導くことができる。
本手法は、視線目標セグメンテーションにおける0.325のDiceと、71.7%のトップ5認識を実現する。
論文 参考訳(メタデータ) (2024-11-30T01:27:48Z) - LatentGaze: Cross-Domain Gaze Estimation through Gaze-Aware Analytic
Latent Code Manipulation [0.0]
本稿では,データ駆動型手法を応用した視線認識型解析操作手法を提案する。
GANベースのエンコーダジェネレータプロセスを利用することで、入力画像がターゲット領域からソース領域イメージにシフトし、視線推定器が十分に認識できる。
論文 参考訳(メタデータ) (2022-09-21T08:05:53Z) - End-to-End Human-Gaze-Target Detection with Transformers [57.00864538284686]
本稿では,Human-Gaze-Target(HGT)検出のための効果的かつ効率的な手法を提案する。
提案手法は,Human-Gaze-Target Detection TRansformer (HGTTR) と名付けられ,HGT検出パイプラインを簡素化する。
提案手法の有効性とロバスト性は,GazeFollowing と VideoAttentionTarget の2つの標準ベンチマークデータセットで検証した。
論文 参考訳(メタデータ) (2022-03-20T02:37:06Z) - Weakly-Supervised Physically Unconstrained Gaze Estimation [80.66438763587904]
我々は、人間のインタラクションのビデオから弱教師付き視線推定を行うという未発見の問題に対処する。
本稿では,タスクに特化して設計された新しい損失関数とともに,トレーニングアルゴリズムを提案する。
a)半教師付き視線推定の精度と(b)最先端の物理的に制約のないGaze360視線推定ベンチマーク上でのクロスドメイン一般化の精度を大幅に改善した。
論文 参考訳(メタデータ) (2021-05-20T14:58:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。