論文の概要: Coordinate Singularities Break Conformal Coverage for Gaze and Head Pose
- arxiv url: http://arxiv.org/abs/2607.02565v1
- Date: Mon, 29 Jun 2026 15:10:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.326629
- Title: Coordinate Singularities Break Conformal Coverage for Gaze and Head Pose
- Title(参考訳): 配向特異性は迷路とヘッドポースの等角被覆を破る
- Abstract要約: コンフォーマル予測は、ビジョンシステムに対して、配布不要な信頼性を保証する。
しかし、中間予測ヘッド、残差、不確実性推定、コンフォメーションスコアはしばしば平坦な座標チャートで定義される。
このスコアリング選択は座標特異点近傍の体系的な幾何学的歪みをもたらすことを示す。
- 参考スコア(独自算出の注目度): 2.823228784044236
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Conformal prediction provides distribution-free reliability guarantees for vision systems, but these guarantees depend on how prediction errors are measured in the output space. Many vision tasks produce outputs on curved spaces (e.g. gaze directions on the sphere or 3D head rotations), yet intermediate prediction heads, residuals, uncertainty estimates, or conformal scores are often defined in flat coordinate charts such as yaw-pitch or Euler angles. We show that this scoring choice introduces systematic geometric distortion near coordinate singularities (large pitch angles on the sphere and poses approaching gimbal lock in 3D rotations). Across four datasets (ETH-XGaze, Gaze360, BIWI, AFLW2000-3D), slice-conditional coverage at a nominal 90% target drops by 30-50 percentage points in these regions, falling to 38.9% on ETH-XGaze and 42.0% on Gaze360 at gaze pitch above 70 degrees, and to 57.5% on BIWI and 55.2% on AFLW2000-3D at head pose pitch above 60 degrees near gimbal lock, despite marginal coverage remaining near 90%. We prove that this is structural. Scalar thresholding changes the size of chart-coordinate prediction sets but leaves their distorted axis ratios unchanged. To diagnose this hidden failure mode, we show that a simple geometric quantity, the Riemannian volume density, strongly correlates with where coverage collapse occurs. Finally, we show that coordinate-free geodesic scoring removes this distortion. It requires no retraining and adds negligible computational cost.
- Abstract(参考訳): コンフォーマル予測は、視覚系に対して分布のない信頼性を保証するが、これらの保証は、出力空間における予測エラーの計測方法に依存する。
多くの視覚タスクは曲線空間(例えば球面上の視線方向や3次元ヘッド回転)で出力を生成するが、中間予測ヘッド、残差、不確実性推定、コンフォメーションスコアはヤウピッチやオイラー角のような平らな座標チャートでしばしば定義される。
このスコアリング選択は、座標特異点(球面上の大きなピッチ角と3次元回転においてジンバルロックに近づくポーズ)の近くで、体系的な幾何学的歪みをもたらすことを示す。
4つのデータセット (ETH-XGaze, Gaze360, BIWI, AFLW2000-3D) の合計で、これらの領域で定値90%の目標値が30~50ポイント減少し、ETH-XGazeが38.9%、Gaze360が42.0%、視線ピッチが70度以上、BIWIが57.5%、AFLW2000-3Dが55.2%に低下した。
これが構造であることを証明します。
スカラー閾値付けはチャート座標予測セットのサイズを変えるが、歪んだ軸比は変わらない。
この隠れ障害モードを診断するために,単純な幾何学的量であるリーマン体積密度は,被覆崩壊の発生源と強く相関していることを示す。
最後に、座標自由測地値のスコアリングがこの歪みを除去することを示す。
再トレーニングは不要で、計算コストは無視できる。
関連論文リスト
- GeoPhysAdapter: Scale-Matched Geophysical Adaptation for Cross-Domain Landslide Mapping with Vision Foundation Models [9.327743485494892]
GeoPhysAdapterは凍結したビジョン基盤モデルにアンカーする。
ピクセルと候補地すべり体という2つの決定単位に有界適応を適用する。
55の地すべりのイベントと7,890のサンプルのPILDデータセットでは、ドメイン間の偽陽性の質量の70.3%が、中央値の直径207mのほぼ純真に近い急激な天体に存在している。
論文 参考訳(メタデータ) (2026-08-10T09:07:20Z) - CrossProjection: Geometric Grounding Beyond Viewpoint Change in Architectural Drawings [13.010314444320384]
CrossProjectionは、視覚言語モデルがコンポーネントのアイデンティティを保持し、不均一なビューにわたって幾何学を外部化するかどうかをアンカーグラウンドで診断する。
分類的判断、候補選択、自由点、線、領域のローカライゼーションを通じてマッチング、登録、幾何学的グラウンドを評価する。
論文 参考訳(メタデータ) (2026-08-01T06:51:38Z) - GeoID-PINN: Identifiability-Aware Regional Epidemic Inference with Geographic Coupling [1.0875426095207128]
本稿では,物理インフォームドニューラルネットワーク(PINN)を導入する。
我々は、距離、隣接性、通勤性、およびリードラグ情報から構築された空間先行を正規化する。
Forecast-Trained Geo-PINNは自己回帰的な負二項基底に対して、平均二乗誤差(MSE)を32,957から11,468、平均絶対誤差(MAE)を70.60から57.73に減少させる。
論文 参考訳(メタデータ) (2026-07-28T05:59:23Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Adaptive Geodesic Conformal Prediction for Egocentric Camera Pose Estimation [15.199350753007339]
標準共形予測(CP)は、最も難しい25%のフレーム(Q4)を60%しかカバーしていないが、名目上90%の全体カバレッジを実現している。
そこで我々は,DINOv2-Bridge適応CPを提案する。DINOv2-Bridge適応CPは,テスト時にイメージを使わずに参加者間を移動させる,単一のソース参加者に訓練された2段階の難易度推定器である。
論文 参考訳(メタデータ) (2026-04-30T21:09:55Z) - Measuring 3D Spatial Geometric Consistency in Dynamic Generated Videos [67.7364297817535]
ビデオにおける3D textbfSpatial textbfGeometric textbfConsistencyを評価するためのメトリクスであるSGCを紹介する。
SGCは幾何的不整合を頑健に定量化し、既存のメトリクスで欠落した臨界故障を効果的に特定する。
論文 参考訳(メタデータ) (2026-03-19T15:44:39Z) - Geometry-Aware Uncertainty Quantification via Conformal Prediction on Manifolds [3.2848713528308817]
本研究では, ユークリッド残差を測地的非整合性スコアに置き換え, 異方性雑音に対処するためのクロスバリデード困難度推定器を用いて正規化する枠組みを提案する。
得られた予測領域は、球面上の測地的キャップであり、位置に依存しない領域を持ち、その大きさを局所的な予測困難に適応させ、非適応的な領域よりもはるかに均一な条件付きカバレッジをもたらす。
論文 参考訳(メタデータ) (2026-02-17T21:12:47Z) - GLOBE: Accurate and Generalizable PDE Surrogates using Domain-Inspired Architectures and Equivariances [0.0]
GLOBEは、学習可能なグリーン関数のようなカーネルの重ね合わせとして、境界面からターゲットへ評価されるソリューションである。
AirFRANSでは、GLOBEは相当な精度向上を実現している。
結果は、厳密な物理学とドメインにインスパイアされた帰納的バイアスが、精度、一般化可能性、実用性に大きな利益をもたらすことを示した。
論文 参考訳(メタデータ) (2025-11-19T20:23:51Z) - Rethinking the Encoding and Annotating of 3D Bounding Box: Corner-Aware 3D Object Detection from Point Clouds [69.84768614060559]
中心方向の回帰はLiDARベースの3Dオブジェクト検出において依然として支配的だが、基本的な不安定さに悩まされている。
本稿では,予測対象を不安定な中心から幾何学的情報的コーナーへシフトするコーナーアライン回帰を提案する。
我々は、既存の検出器に差し込むことができる、シンプルで効果的なコーナー認識検出ヘッドを設計する。
論文 参考訳(メタデータ) (2025-11-18T13:49:30Z) - SGFormer: Spherical Geometry Transformer for 360 Depth Estimation [52.23806040289676]
パノラマ歪みは360度深度推定において大きな課題となる。
本稿では,SGFormer という球面形状変換器を提案し,上記の問題に対処する。
また、様々な解像度で空間構造を補うために、クエリベースの大域的条件位置埋め込みを提案する。
論文 参考訳(メタデータ) (2024-04-23T12:36:24Z) - 3DGazeNet: Generalizing Gaze Estimation with Weak-Supervision from
Synthetic Views [67.00931529296788]
本稿では,適応を伴わない新しい環境に直接適用可能な一般的な視線推定モデルを訓練することを提案する。
視覚的擬似アノテーションを用いた多彩な顔の大規模データセットを作成し、シーンの3次元形状に基づいて抽出する。
本研究では,本手法を視線一般化タスクにおいて検証し,真理データが得られない場合の最先端技術と比較して最大30%の改善を実証する。
論文 参考訳(メタデータ) (2022-12-06T14:15:17Z) - BoxGraph: Semantic Place Recognition and Pose Estimation from 3D LiDAR [22.553026961366005]
意味的に特定されたコンポーネントの完全連結グラフとして、3Dポイントクラウドをモデル化する。
グラフ間の最適アソシエーションにより、完全な6自由度(DoF)のポーズ推定と位置認識が可能になる。
この表現は非常に簡潔で、最先端に対して25の因子で写像のサイズを縮める。
論文 参考訳(メタデータ) (2022-06-30T09:39:08Z) - PropagationNet: Propagate Points to Curve to Learn Structure Information [79.65125870257009]
熱マップ回帰に基づく構造注入型顔アライメントアルゴリズムを提案する。
また,地中条件下での採鉱・採鉱の難しさを強調したFocal Wing Lossを提案する。
提案手法では,WFLWでは平均誤差が4.05%,300Wでは平均誤差が2.93%,COFWでは平均誤差が3.71%となる。
論文 参考訳(メタデータ) (2020-06-25T11:08:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。