論文の概要: PAGE: Towards Practical Human-level Gaze Target Estimation
- arxiv url: http://arxiv.org/abs/2607.04860v1
- Date: Mon, 06 Jul 2026 09:33:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.104443
- Title: PAGE: Towards Practical Human-level Gaze Target Estimation
- Title(参考訳): PAGE:人間レベルの目標推定の実現に向けて
- Abstract要約: PaGE (Practical Gaze Estimator) は、シーンとヘッドの複雑な相互作用を明示的にモデル化した視線推定モデルである。
教師は、大きなViT-H+バックボーンを持つPaGEモデルを使用して、より大きく、より多様なラベル付けされていないデータセット上に、より軽いバックボーンを持つ学生モデルを蒸留する。
アーキテクチャの改善と新しいトレーニングのレシピにより、PaGEはいくつかの視線推定タスクで最先端のパフォーマンスを達成でき、9つの指標のうち7つで人間を上回り、残りの2つのうち少なくとも60%は人間とAIのギャップを減らした。
- 参考スコア(独自算出の注目度): 37.42082998516239
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Gaze target estimation, the task of predicting where a person is looking in a scene, is crucial to understanding human attention and intent. It is a challenging task that combines high-level understanding of global scene semantics and precise spatial reasoning using human appearance (e.g. pose, eye orientation). As a result, human-level performance remains elusive for existing models, limiting their practical application. To this end, we propose PaGE (Practical Gaze Estimator), a gaze estimation model that explicitly models the complex interaction between scene and head features. Using a PaGE model with a large ViT-H+ backbone as the teacher, we further distill student models with lighter backbones on a much larger and more diverse unlabeled dataset. The architectural improvements and novel training recipe allow PaGE to achieve state-of-the-art performance on several gaze estimation tasks, outperforming humans in 7 out of 9 metrics while reducing the human-AI gap by at least 60% in the remaining 2. The distilled student models retain most of the teacher's performance while being lightweight enough for practical deployment on robots and consumer devices. The code and model checkpoints are available at our project page.
- Abstract(参考訳): 注視対象推定とは、人が現場で見ている場所を予測するタスクであり、人間の注意と意図を理解するのに不可欠である。
これは、グローバルなシーンセマンティクスの高レベルな理解と、人間の外見(例えば、ポーズ、目向)を用いた正確な空間的推論を組み合わせた、困難なタスクである。
結果として、既存のモデルでは人間レベルのパフォーマンスは依然として解明され続けており、実用的応用は制限されている。
そこで我々は,シーン特徴と頭部特徴との複雑な相互作用を明示的にモデル化した視線推定モデルPaGE(Practical Gaze Estimator)を提案する。
教師は、大きなViT-H+バックボーンを持つPaGEモデルを使用して、より大きく、より多様なラベル付けされていないデータセット上に、より軽いバックボーンを持つ学生モデルを蒸留する。
アーキテクチャの改善と新しいトレーニングのレシピにより、PaGEはいくつかの視線推定タスクで最先端のパフォーマンスを達成でき、9つの指標のうち7つで人間を上回り、残りの2つのうち少なくとも60%は人間とAIのギャップを減らした。
蒸留された学生モデルは、ロボットや消費者向けデバイスに実用的に配備するのに十分な軽量さを保ちながら、教師のパフォーマンスを保っている。
コードとモデルチェックポイントはプロジェクトのページで公開されています。
関連論文リスト
- LLaVA-Pose: Enhancing Human Pose and Action Understanding via Keypoint-Integrated Instruction Tuning [1.820765907065129]
現在の視覚言語モデル(VLM)は、一般的な視覚的理解タスクに適している。
本研究では,人間のキーポイントとキャプションやバウンディングボックスといった従来の視覚的特徴を統合することで,そのようなデータを生成する手法を提案する。
このデータセットを用いてLLaVA-1.5-7Bモデルを微調整し、得られたLLaVA-Poseモデルをベンチマーク上で評価し、大幅な改善を実現した。
論文 参考訳(メタデータ) (2025-06-26T14:32:56Z) - DICEPTION: A Generalist Diffusion Model for Visual Perceptual Tasks [61.16389024252561]
計算資源と限られた訓練データとの制約下で複数のタスクに対処できる頑健な一般認識モデルを構築した。
我々は、何十億もの画像に事前訓練されたテキスト・画像拡散モデルを活用し、ビジュアル・ジェネラリスト・モデルであるDICEPTIONの導入に成功した。
DICEPTIONは、SOTAシングルタスクスペシャリストモデルに匹敵するパフォーマンスを達成しつつ、様々な知覚タスクに効果的に取り組むことを示す。
論文 参考訳(メタデータ) (2025-02-24T13:51:06Z) - Keypoint-Integrated Instruction-Following Data Generation for Enhanced Human Pose and Action Understanding in Multimodal Models [1.9890559505377343]
現在の視覚言語マルチモーダルモデルは、一般的な視覚的理解タスクに適している。
本研究では,人間のキーポイントとキャプションやバウンディングボックスといった従来の視覚的特徴を統合することで,そのようなデータを生成する手法を提案する。
このデータセットを用いてLLaVA-1.5-7Bモデルを微調整し、ベンチマークで評価し、大幅な改善を実現した。
論文 参考訳(メタデータ) (2024-09-14T05:07:57Z) - Data-efficient Large Vision Models through Sequential Autoregression [58.26179273091461]
限られたデータセットに基づいて,効率的な自己回帰に基づく視覚モデルを構築する。
このモデルは,高レベル・低レベルのセマンティック理解の両方にまたがる視覚的タスクにおいて,その習熟度をいかに達成するかを実証する。
我々の経験的評価は、モデルが様々なタスクに適応する際の機敏さを強調し、パラメータフットプリントの大幅な削減を図った。
論文 参考訳(メタデータ) (2024-02-07T13:41:53Z) - Effective Whole-body Pose Estimation with Two-stages Distillation [52.92064408970796]
全体ポーズ推定は、画像内の人体、手、顔、足のキーポイントをローカライズする。
textbfWhole-body textbfPose 推定器の2段階ポーズ textbfDistillation を提案し,その有効性と効率性について検討した。
論文 参考訳(メタデータ) (2023-07-29T03:49:28Z) - Prototype-guided Cross-task Knowledge Distillation for Large-scale
Models [103.04711721343278]
クロスタスクの知識蒸留は、競争力のあるパフォーマンスを得るために小さな学生モデルを訓練するのに役立ちます。
本稿では,大規模教師ネットワークの内在的ローカルレベルのオブジェクト知識を様々なタスクシナリオに転送するための,プロトタイプ誘導型クロスタスク知識蒸留(ProC-KD)アプローチを提案する。
論文 参考訳(メタデータ) (2022-12-26T15:00:42Z) - Naive-Student: Leveraging Semi-Supervised Learning in Video Sequences
for Urban Scene Segmentation [57.68890534164427]
本研究では,未ラベル映像シーケンスと追加画像の半教師付き学習を利用して,都市景観セグメンテーションの性能を向上させることができるかどうかを問う。
我々は単にラベルのないデータに対して擬似ラベルを予測し、人間の注釈付きデータと擬似ラベル付きデータの両方でその後のモデルを訓練する。
我々のNaive-Studentモデルは、このような単純で効果的な反復的半教師付き学習で訓練され、3つのCityscapesベンチマークで最先端の結果を得る。
論文 参考訳(メタデータ) (2020-05-20T18:00:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。