論文の概要: Self-Supervised Multi-View 3D Gaze Target Estimation via Probabilistic Ray Marching
- arxiv url: http://arxiv.org/abs/2609.07415v1
- Date: Mon, 07 Sep 2026 12:26:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 00:28:37.868175
- Title: Self-Supervised Multi-View 3D Gaze Target Estimation via Probabilistic Ray Marching
- Title(参考訳): 確率的光マーチによるマルチビュー3次元目標推定
- Abstract要約: 複数のカメラビューから3次元視線目標を推定するための自己教師型アプローチであるSelf-MVGTEを提案する。
カメラビュー当たりの2D視線目標を独立に推定する既存の手法とは異なり、Self-MVGTEは初めて3D空間内での視線目標を直接予測する。
- 参考スコア(独自算出の注目度): 13.206046367696961
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We present a self-supervised approach, Self-MVGTE, for estimating 3D gaze targets from multiple camera views. Unlike existing methods that independently estimate 2D gaze targets per camera view, Self-MVGTE predicts gaze targets directly in 3D space for the first time. Moreover, it does not require any ground-truth annotations from the target scene and uses only the multi-view input images from a calibrated camera setup, pseudo 2D gaze target labels from a monocular gaze target estimation model, and 3D gaze vectors from a monocular 3D gaze estimation model. A key challenge is that these pseudo labels are inherently noisy and multi-view inconsistent. To address this, we propose a probabilistic ray marching framework, which models the uncertainty of these pseudo labels and exploits 3D gaze vectors as geometric priors. Specifically, these gaze vectors are first integrated into the monocular gaze target estimation model to improve its generalization to unseen scenes, producing higher-quality pseudo labels. Then, for 3D gaze target estimation, we construct a 3D gaze cone by casting a bundle of rays from the eye position around the gaze vector to strictly constrain the solution space. Within this cone, we propose a depth-guided feature sampling strategy using off-the-shelf DINOv2 and Depth-Anything-3 models, and estimate a spatial likelihood distribution of the gaze target. Finally, we convert the pseudo gaze target labels into a target distribution and softly optimize the network. Extensive experiments on the MVGT dataset show that Self-MVGTE achieves state-of-the-art performance, surpassing existing fully-supervised baselines.
- Abstract(参考訳): 複数のカメラビューから3次元視線目標を推定するための自己教師型アプローチであるSelf-MVGTEを提案する。
カメラビュー当たりの2D視線目標を独立に推定する既存の手法とは異なり、Self-MVGTEは初めて3D空間内での視線目標を直接予測する。
さらに、ターゲットシーンからの地平線アノテーションを一切必要とせず、校正カメラ設定からの多視点入力画像、単眼視目標推定モデルからの擬似2D視線目標ラベル、単眼視目標推定モデルからの3D視線ベクトルのみを使用する。
重要な課題は、これらの擬似ラベルが本質的にノイズが多く、複数ビューに一貫性がないことである。
そこで我々は,これらの擬似ラベルの不確かさをモデル化し,幾何学的先行として3次元視線ベクトルを利用する確率的光線マーチングフレームワークを提案する。
具体的には、視線ベクトルをモノクロ視線目標推定モデルに統合し、見えないシーンへの一般化を改善し、高品質な擬似ラベルを生成する。
そして、3次元視線目標推定のために、視線ベクトルの周囲の視線位置から光束を鋳造して3次元視線コーンを構築し、解空間を厳格に拘束する。
本研究では,DINOv2モデルとDepth-Anything-3モデルを用いた奥行き誘導型特徴サンプリング手法を提案する。
最後に、擬似視線目標ラベルを目標分布に変換し、そのネットワークをソフトに最適化する。
MVGTデータセットの大規模な実験により、Self-MVGTEは最先端のパフォーマンスを達成し、既存の完全に教師されたベースラインを超えたことが示されている。
関連論文リスト
- OmniGaze: Reward-inspired Generalizable Gaze Estimation In The Wild [104.57404324262556]
現在の3次元視線推定法は、多様なデータ領域にまたがる一般化に苦慮している。
OmniGazeは3次元視線推定のための半教師付きフレームワークである。
OmniGazeは5つのデータセットで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-10-15T15:19:52Z) - Enhancing 3D Gaze Estimation in the Wild using Weak Supervision with Gaze Following Labels [10.827081942898506]
我々は,新しい自己学習弱弱視線推定フレームワーク(ST-WSGE)を紹介する。
画像とビデオのデータセットから静的および動的視線情報を同時に学習できるモダリティに依存しないアーキテクチャであるGaze Transformer (GaT)を提案する。
3次元映像データセットと2次元視線目標ラベルを追従タスクから組み合わせることで,本手法は以下の重要な貢献を達成できる。
論文 参考訳(メタデータ) (2025-02-27T16:35:25Z) - 3D Prior is All You Need: Cross-Task Few-shot 2D Gaze Estimation [27.51272922798475]
本研究では,未確認デバイス上での2次元視線予測に事前学習した3次元視線推定ネットワークを適用することを目的とした,クロスタスクな2次元視線推定手法を提案する。
このタスクは、3Dと2Dの視線、未知の画面ポーズ、限られたトレーニングデータとのドメインギャップのため、非常に難しい。
我々は,MPIIGaze,EVE,GazeCaptureの各データセットに対して,それぞれノートパソコン,デスクトップコンピュータ,モバイルデバイス上で収集した手法を評価する。
論文 参考訳(メタデータ) (2025-02-06T13:37:09Z) - Towards Pixel-Level Prediction for Gaze Following: Benchmark and Approach [27.84672974344777]
本稿ではGazeSegという新しい視線目標予測手法を提案する。
人物の空間的視野を案内情報として完全に活用し、徐々に粗い視線目標のセグメンテーションと認識プロセスへと導くことができる。
本手法は、視線目標セグメンテーションにおける0.325のDiceと、71.7%のトップ5認識を実現する。
論文 参考訳(メタデータ) (2024-11-30T01:27:48Z) - VFMM3D: Releasing the Potential of Image by Vision Foundation Model for Monocular 3D Object Detection [80.62052650370416]
モノクル3Dオブジェクト検出は、自律運転やロボティクスなど、さまざまなアプリケーションにおいて重要な役割を担っている。
本稿では,VFMM3Dを提案する。VFMM3Dは,ビジョンファウンデーションモデル(VFM)の機能を利用して,単一ビュー画像を正確にLiDARポイントクラウド表現に変換する,革新的なフレームワークである。
論文 参考訳(メタデータ) (2024-04-15T03:12:12Z) - Towards Unified 3D Object Detection via Algorithm and Data Unification [70.27631528933482]
我々は、最初の統一型マルチモーダル3Dオブジェクト検出ベンチマークMM-Omni3Dを構築し、上記のモノクロ検出器をマルチモーダルバージョンに拡張する。
設計した単分子・多モード検出器をそれぞれUniMODEとMM-UniMODEと命名した。
論文 参考訳(メタデータ) (2024-02-28T18:59:31Z) - Model-aware 3D Eye Gaze from Weak and Few-shot Supervisions [60.360919642038]
本稿では,眼意味分類マスクの弱い監督と数個の3次元視線ベクトルの直接監督から3次元視線を予測することを提案する。
多様な環境下での実験では,提案手法の利点が示され,ベースラインの角度誤差が約5度低くなった。
論文 参考訳(メタデータ) (2023-11-20T20:22:55Z) - 3DiffTection: 3D Object Detection with Geometry-Aware Diffusion Features [70.50665869806188]
3DiffTectionは、単一の画像から3Dオブジェクトを検出する最先端の方法である。
拡散モデルを微調整し、単一の画像に条件付けされた新しいビュー合成を行う。
さらに、検出監視により、ターゲットデータ上でモデルをトレーニングする。
論文 参考訳(メタデータ) (2023-11-07T23:46:41Z) - NeRF-Gaze: A Head-Eye Redirection Parametric Model for Gaze Estimation [37.977032771941715]
本稿では,ニューラルラジアンス場に基づく新しい頭部方向パラメトリックモデルを提案する。
我々のモデルは、顔と目を切り離して、別々のニューラルレンダリングを行うことができる。
顔、アイデンティティ、照明、視線方向の属性を別々に制御する目的を達成することができる。
論文 参考訳(メタデータ) (2022-12-30T13:52:28Z) - 3DGazeNet: Generalizing Gaze Estimation with Weak-Supervision from
Synthetic Views [67.00931529296788]
本稿では,適応を伴わない新しい環境に直接適用可能な一般的な視線推定モデルを訓練することを提案する。
視覚的擬似アノテーションを用いた多彩な顔の大規模データセットを作成し、シーンの3次元形状に基づいて抽出する。
本研究では,本手法を視線一般化タスクにおいて検証し,真理データが得られない場合の最先端技術と比較して最大30%の改善を実証する。
論文 参考訳(メタデータ) (2022-12-06T14:15:17Z) - MonoGRNet: A General Framework for Monocular 3D Object Detection [23.59839921644492]
幾何学的推論によるモノクロ画像からのアモーダル3次元物体検出のためのMonoGRNetを提案する。
MonoGRNetは、モノラル3Dオブジェクト検出タスクを2Dオブジェクト検出、インスタンスレベルの深さ推定、投影された3Dセンター推定、ローカルコーナー回帰を含む4つのサブタスクに分解する。
KITTI、Cityscapes、MS COCOデータセットで実験が行われた。
論文 参考訳(メタデータ) (2021-04-18T10:07:52Z) - M3DSSD: Monocular 3D Single Stage Object Detector [82.25793227026443]
特徴アライメントと非対称非局所的注意を有するモノクロ3次元単段物体検出器(M3DSSD)を提案する。
提案したM3DSSDは,KITTIデータセット上のモノラルな3Dオブジェクト検出手法よりも大幅に性能が向上する。
論文 参考訳(メタデータ) (2021-03-24T13:09:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。