論文の概要: CuBAS: Information Geometric Curvature-Based Adaptive Sampling for Supervised Classification
- arxiv url: http://arxiv.org/abs/2607.03145v1
- Date: Fri, 03 Jul 2026 09:36:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.532765
- Title: CuBAS: Information Geometric Curvature-Based Adaptive Sampling for Supervised Classification
- Title(参考訳): CuBAS: 教師付き分類のための情報幾何学的曲率に基づく適応サンプリング
- Abstract要約: CuBASは、教師付き分類における適応データ選択のための情報幾何学的フレームワークである。
ラベル付きデータセットは統計多様体と見なすことができ、局所曲率は2階と1階の観測されたフィッシャー情報の比率で推定され、データの分布の幾何学的複雑さを忠実にエンコードする。
- 参考スコア(独自算出の注目度): 52.452902154360565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The informativeness of a training set is as consequential as its size, yet most sampling strategies remain agnostic to the intrinsic geometry of the data distribution. We introduce CuBAS (Curvature-Based Adaptive Sampling), an information-geometric framework for adaptive data selection in supervised classification, grounded in the q-state Potts Markov random field (MRF) model. The central insight is that a labeled dataset can be viewed as a statistical manifold, on which local curvature, estimated via the ratio of second to first-order observed Fisher information, faithfully encodes the geometric complexity of the data distribution. We construct a k-nearest-neighbor graph over the labeled data and derive a closed-form curvature score at each vertex from the Potts sufficient statistics. This curvature signal partitions the graph into two complementary regimes: low-curvature regions, corresponding to smooth, homogeneous clusters, and high-curvature regions, concentrated around decision boundaries that are disproportionately informative for classification. By selecting nodes from both regimes, CuBAS constructs compact yet maximally informative training subsets. Empirical evaluation across more than 60 benchmark datasets demonstrates consistent and statistically significant improvements over random sampling and uncertainty-based baselines, across a wide range of labeling budgets and classifier architectures. CuBAS is computationally efficient (linear in the number of k-NN graph edges), theoretically grounded in the differential geometry of statistical manifolds, and interpretable in terms of the local shape operator of the data manifold.
- Abstract(参考訳): トレーニングセットのインフォマティクスは、そのサイズと同じくらいに正確であるが、ほとんどのサンプリング戦略は、データ分布の本質的な幾何学とは無関係である。
教師付き分類における適応データ選択のための情報幾何学的フレームワークであるCuBAS(Curvature-Based Adaptive Smpling)を,q-state Potts Markov random Field (MRF)モデルに基づいて導入する。
中心的な洞察は、ラベル付きデータセットを統計多様体と見なすことができ、局所曲率を2階目と1階目のフィッシャー情報の比率で推定し、データ分布の幾何学的複雑さを忠実にエンコードする。
我々はラベル付きデータの上にk-nearest-neighborグラフを構築し、ポッツの十分な統計量から各頂点における閉形式曲率スコアを導出する。
この曲率信号はグラフを、滑らかで均質なクラスターに対応する低曲率領域と高曲率領域の2つの相補的な状態に分割する。
両方のレシエーションからノードを選択することで、CuBASはコンパクトだが最大限に情報を提供するトレーニングサブセットを構成する。
60以上のベンチマークデータセットに対する実証的な評価は、広範囲のラベル付け予算と分類器アーキテクチャにおいて、ランダムサンプリングと不確実性に基づくベースラインよりも一貫性があり統計的に有意な改善を示している。
CuBAS は計算的に効率的であり(k-NNグラフのエッジ数では線形)、理論上は統計多様体の微分幾何学に基礎を置いており、データ多様体の局所形状作用素の観点で解釈可能である。
関連論文リスト
- Active Learning with Low-Rank Structure for Data Selection [85.43185363043362]
低ランク近似と残差に基づくサンプリングに基づく新しいデータ選択フレームワークを提案する。
平均損失がデータセット全体の平均損失を近似した$tildeOleft(k + frac1varepsilon2right)$データポイントの重み付きサブセットを選択することができることを示す。
論文 参考訳(メタデータ) (2026-06-14T22:29:59Z) - SEED: Targeted Data Selection by Weighted Independent Set [76.68391670109433]
我々はSEEDと呼ばれる堅牢でスケーラブルなデータ選択パイプラインを開発した。
SEEDは、命令チューニング、視覚的命令チューニング、セマンティックセグメンテーションにおける最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-15T07:26:54Z) - A Mean Curvature Approach to Boundary Detection: Geometric Insights for Unsupervised Learning [52.452902154360565]
本稿では,幾何学的機械学習に基づく新しい幾何学的フレームワークであるMean Curvature Boundary Points (MCBP)を紹介する。
MCBPはデータ多様体の固有曲率を明示的にモデル化し、原理化された多様体のパラメトリゼーションを必要としない点平均曲率を計算する。
合成および実世界のデータセットの実験により、MCBPはクラスタリング性能を一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-05-05T20:19:09Z) - Curvature-Aware PCA with Geodesic Tangent Space Aggregation for Semi-Supervised Learning [52.452902154360565]
GTSA-PCAは主成分分析の幾何学的拡張である。
曲率認識と測地的整合性を統合されたスペクトルフレームワークに統合する。
以上の結果から,GTSA-PCAは次元減少に対する統計的および幾何学的アプローチの原則的ブリッジとして位置づけられた。
論文 参考訳(メタデータ) (2026-04-20T20:36:36Z) - GRIP: Geometric Refinement and Adaptive Information Potential for Data Efficiency [28.832806758251607]
textbfGRIP (Geometric Refinement and Adaptive Information Potential) は、コーパスを情報密度幾何学空間としてモデル化することにより、これらの次元を統一するフレームワークである。
我々の研究は、大規模事前学習における適応データキュレーションのための堅牢な幾何学的基礎を確立する。
論文 参考訳(メタデータ) (2026-02-04T15:23:24Z) - Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation [109.13471554184554]
最適輸送(OT)距離最小化問題としてデータセット蒸留を再構成する。
OTは分布マッチングのための幾何学的に忠実なフレームワークを提供する。
提案手法は, 常に最先端の手法を効率よく上回っている。
論文 参考訳(メタデータ) (2025-11-29T04:04:05Z) - EVINGCA: Adaptive Graph Clustering with Evolving Neighborhood Statistics [0.0]
クラスタリングアルゴリズムは、しばしば制限的な仮定に依存する。
EVINGCAは、クラスタ形成を適応的な非線形グラフ進化プロセスとして扱うグラフベースのクラスタリングアルゴリズムである。
論文 参考訳(メタデータ) (2025-10-29T03:44:05Z) - Metric Distribution to Vector: Constructing Data Representation via
Broad-Scale Discrepancies [15.40538348604094]
本稿では,各データに対するベクトル表現に分布特性を抽出するために, $mathbfMetricDistribution2vec$ という新しい埋め込み方式を提案する。
本研究では,広範囲な実世界構造グラフデータセット上での教師付き予測タスクにおける表現法の適用と有効性を示す。
論文 参考訳(メタデータ) (2022-10-02T03:18:30Z) - Learning non-Gaussian graphical models via Hessian scores and triangular
transport [6.308539010172309]
連続分布と非ガウス分布のマルコフ構造を学習するアルゴリズムを提案する。
このアルゴリズムは三角トランスポートマップによって誘導される決定論的結合を用いて密度を推定し、グラフのスパース性を明らかにするために地図内のスパース構造を反復的に活用する。
論文 参考訳(メタデータ) (2021-01-08T16:42:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。