論文の概要: Beyond Landmark Extraction: A Framework for Robust Geometric Feature Construction in Structured Image Classification
- arxiv url: http://arxiv.org/abs/2609.00634v1
- Date: Tue, 01 Sep 2026 03:10:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.264473
- Title: Beyond Landmark Extraction: A Framework for Robust Geometric Feature Construction in Structured Image Classification
- Title(参考訳): ランドマーク抽出を超えて:構造化画像分類におけるロバストな幾何学的特徴構築のためのフレームワーク
- Authors: Saravana Mauree, Sakshi Arya,
- Abstract要約: 識別情報は個々のピクセルよりも、意味的部分間の空間的関係の方が少ない。
本稿では,ランドマーク後の特徴写像を解析の中心的対象として検討する。
摂動・アブレーション実験により,座標,距離,角度,ハイブリッド表現を評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Much of the literature on structured image recognition has disproportionately focused on the comparison of classification algorithms. Rather than investigating which classifier performs best, this paper instead asks: what should a classifier know before it ever makes a prediction? In structured vision problems such as gesture recognition, facial expression categorization, and medical image analysis, discriminative information lies less in individual pixels and more in spatial relationships between semantic parts. Raw pixel spaces are high-dimensional, sensitive to nuisance variation, and often obfuscate the geometric structures that make visual tasks interpretable. Landmark extraction provides one form of dimension reduction, but it does not by itself determine the information preserved. This paper studies the post-landmark feature map as the central object of analysis and proposes a systematic framework for constructing and interpreting landmark-derived representations as an, informed, feature-based ``dimension reduction'' step. Using static hand gesture recognition as a case study, we evaluate coordinate, distance, angle, and hybrid representations through perturbation and ablation experiments. The results show that visually variable data exposes substantial gaps between raw coordinate features and their geometrically invariant counterparts, while hybrid representations achieve the strongest overall performance by combining complementary geometric components. These findings frame feature construction as a fundamental modeling decision and ultimately suggests that the question of what representation should a classifier learn from is one worth asking. The code used for feature construction and evaluation is available at https://github.com/ShivMaureeCWRU/Feature_based_dimension_reduction
- Abstract(参考訳): 構造化画像認識に関する文献の多くは、分類アルゴリズムの比較に焦点を当てている。
この論文では、どの分類器が最も優れているかを調査する代わりに、分類器が予測する前に何を知っておくべきかを問う。
ジェスチャー認識、表情分類、医用画像解析などの構造的視覚問題においては、識別情報は個々のピクセルや意味部分間の空間的関係よりも少ない。
生画素空間は高次元であり、ニュアンス変動に敏感であり、視覚的タスクを解釈できる幾何学的構造を難読化することが多い。
ランドマーク抽出は次元の縮小の一形態を提供するが、それ自体が保存されている情報を決定するわけではない。
本稿では,ランドマーク後特徴写像を解析対象として検討し,ランドマークから派生した表現を「次元縮小」ステップとして構築・解釈するための体系的枠組みを提案する。
静的手動作認識をケーススタディとして,摂動・アブレーション実験による座標,距離,角度,ハイブリッド表現の評価を行った。
その結果、視覚的変動データは、原座標の特徴と幾何学的に不変な特徴との間の大きなギャップを露呈し、一方、ハイブリッド表現は相補的な幾何学的成分を組み合わせることで、最も優れた総合的な性能を達成することが示された。
これらの知見は、基本的なモデリング決定としての特徴構成を基礎とし、究極的には、分類器がどの表現を学べばよいのかという疑問は、質問に値するものであることを示唆している。
機能の構築と評価に使われるコードはhttps://github.com/ShivMaureeCWRU/Feature_based_dimension_reductionで公開されている。
関連論文リスト
- Guided Interpretable Facial Expression Recognition via Spatial Action Unit Cues [55.97779732051921]
オーキューを分類器学習に明示的に組み込むための新しい学習戦略が提案されている。
分類性能を劣化させることなく階層的解釈性を向上させることができることを示す。
論文 参考訳(メタデータ) (2024-02-01T02:13:49Z) - Explicitly Disentangled Representations in Object-Centric Learning [0.0]
本稿では, オブジェクト中心のモデルを, 密接な形状やテクスチャ成分に偏在させる新しいアーキテクチャを提案する。
特に, オブジェクト中心のモデルを, 密接な形状やテクスチャ成分に偏在させる新しいアーキテクチャを提案する。
論文 参考訳(メタデータ) (2024-01-18T17:22:11Z) - Self-Supervised Learning from Non-Object Centric Images with a Geometric
Transformation Sensitive Architecture [7.825153552141346]
本稿では幾何学的変換に敏感な幾何学的変換感性アーキテクチャを提案する。
本手法は, 回転予測や変換の異なる目標の利用により, 学生に敏感になるよう促す。
提案手法は,非対象中心画像を事前学習データとして用いる際の性能向上を示す。
論文 参考訳(メタデータ) (2023-04-17T06:32:37Z) - Zero-shot point cloud segmentation by transferring geometric primitives [68.18710039217336]
ゼロショットポイントクラウドセマンティックセマンティックセマンティックセマンティクスについて検討し、そこではネットワークが見えないオブジェクトに対してトレーニングされ、見えないオブジェクトをセマンティクスできる。
本研究では,視覚的および視覚的カテゴリーのオブジェクトで共有される幾何学的プリミティブを学習し,言語と学習された幾何学的プリミティブとの微粒なアライメントを利用する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2022-10-18T15:06:54Z) - Unsupervised Part Discovery from Contrastive Reconstruction [90.88501867321573]
自己監督型視覚表現学習の目標は、強く伝達可能な画像表現を学習することである。
対象部分の発見とセグメンテーションに対する教師なしアプローチを提案する。
本手法は, 細粒度, 視覚的に異なるカテゴリ間でセマンティックな部分を生成する。
論文 参考訳(メタデータ) (2021-11-11T17:59:42Z) - Exploring Set Similarity for Dense Self-supervised Representation
Learning [96.35286140203407]
本研究では,高密度自己教師型表現学習のためのtextbfset textbfsimilarity (SetSim) を提案する。
ピクセルワイドの類似性学習をセットワイドに一般化し,よりセマンティックな情報や構造的な情報を含むため,ロバスト性を向上させる。
具体的には、ビューの注意的特徴に頼って対応する集合を定め、不適切な対応を引き起こす可能性のあるノイズの多い背景をフィルタリングする。
論文 参考訳(メタデータ) (2021-07-19T09:38:27Z) - Graph Sampling Based Deep Metric Learning for Generalizable Person
Re-Identification [114.56752624945142]
我々は、最も一般的なランダムサンプリング手法である有名なpkサンプリングは、深層メトリック学習にとって有益で効率的ではないと主張する。
大規模計量学習のためのグラフサンプリング(GS)と呼ばれる効率的なミニバッチサンプリング手法を提案する。
論文 参考訳(メタデータ) (2021-04-04T06:44:15Z) - High-Order Information Matters: Learning Relation and Topology for
Occluded Person Re-Identification [84.43394420267794]
本稿では,高次関係とトポロジ情報を識別的特徴とロバストなアライメントのために学習し,新しい枠組みを提案する。
我々のフレームワークはOccluded-Dukeデータセットで最先端の6.5%mAPスコアを大幅に上回っている。
論文 参考訳(メタデータ) (2020-03-18T12:18:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。