論文の概要: Cut-ViT: Task-Specific Model Pruning via Gram Anchoring Subspace Consistency
- arxiv url: http://arxiv.org/abs/2608.28205v1
- Date: Fri, 28 Aug 2026 11:25:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.298899
- Title: Cut-ViT: Task-Specific Model Pruning via Gram Anchoring Subspace Consistency
- Title(参考訳): Cut-ViT:Gram Anchoring Subspace Consistencyによるタスク特化モデルプルーニング
- Authors: Jianjian Yin, Liulei Li, Tao Chen, Yi Chen, Yazhou Yao, Wenguan Wang,
- Abstract要約: そこで本稿では,視覚基盤モデルのプルーニングのためのタスク固有のプルーニングパイプラインであるCut-ViTを提案する。
基底非依存および残留制約は、ネイティブモデルとプルーニングされたDINOv3モデルのグラム部分空間を整列するために採用される。
実験によると、Cut-ViTは1つのA100 GPU上で1分程度必要であり、様々な範囲で作業を行うことができる。
- 参考スコア(独自算出の注目度): 71.81785123423516
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pruning visual foundation models has attracted considerable attention. However, existing methods focus on rigid point-to-point token alignment on a single dataset for pruning, suffering from two limitations: i) robustness degradation, and ii) task-specificity deficiency. To address these limitations, we propose a task-specific pruning pipeline, named Cut-ViT. Specifically, we first construct gram anchoring matrices from both spatial and semantic perspectives, and perform the subspace decomposition to extract the corresponding subspace bases. Basis-agnostic and residual constraints are then adopted to align the gram subspaces between the native and pruned DINOv3 models along spatial and channel dimensions, enabling subnetworks to inherit robust feature representations of native DINOv3. Furthermore, we design spectral entropy adaptation, which quantifies the information density of feature manifolds along spatial and channel dimensions, thereby adapting the pruning objective to specific downstream tasks. Experiments show that Cut-ViT requires approximately one minute on a single A100 GPU to obtain subnetworks at various sparsity levels, using only 20.9% of the time and 45.5% of the GPU memory compared with previous methods, while achieving SOTA performance on six tasks across nine datasets.
- Abstract(参考訳): 視覚基礎モデルの計画が注目されている。
しかし、既存の手法では、プルーニングのための単一のデータセットに厳格なポイント・ツー・ポイントのトークンアライメントにフォーカスしている。
一 頑丈さの低下、及び
二 タスク特化度の欠如
これらの制約に対処するため,タスク固有のプルーニングパイプラインであるCut-ViTを提案する。
具体的には,まず空間的視点と意味的視点の両方からグラムアンカリング行列を構築し,部分空間分解を行い,対応する部分空間基底を抽出する。
基本非依存的かつ残留的制約は、DINOv3モデルと刈り取ったDINOv3モデルのグラム部分空間を空間次元とチャネル次元に沿って整列させるために採用され、サブネットワークはネイティブDINOv3の堅牢な特徴表現を継承することができる。
さらに, スペクトルエントロピー適応を設計し, 特徴多様体の情報密度を空間次元およびチャネル次元に沿って定量化し, 特定の下流タスクにプルーニング目標を適応させる。
実験の結果、Cut-ViTは1つのA100 GPUで1分程度必要であり、20.9%の時間と45.5%のGPUメモリを使用し、9つのデータセットで6つのタスクでSOTAパフォーマンスを達成する。
関連論文リスト
- SEED: Targeted Data Selection by Weighted Independent Set [76.68391670109433]
我々はSEEDと呼ばれる堅牢でスケーラブルなデータ選択パイプラインを開発した。
SEEDは、命令チューニング、視覚的命令チューニング、セマンティックセグメンテーションにおける最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-15T07:26:54Z) - Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence [78.1406635199656]
Holi-Spatialは、人間の介入なしに生のビデオ入力から構築された、初めて完全に自動化され、大規模で、空間対応のマルチモーダルデータセットである。
Holi-Spatial-4Mは、12K最適化された3DGSシーン、1.3Mの2Dマスク、320Kの3Dバウンディングボックス、320Kのインスタンスキャプション、1.2Mの3Dグラウンドインスタンス、1.2Mの空間QAペアを含む、最初の大規模で高品質な3Dセマンティックデータセットである。
論文 参考訳(メタデータ) (2026-03-08T14:49:20Z) - Through the Perspective of LiDAR: A Feature-Enriched and Uncertainty-Aware Annotation Pipeline for Terrestrial Point Cloud Segmentation [5.173182375745059]
地上レーザー走査(TLS)点雲の正確なセマンティックセマンティックセマンティクスは、高価な手動アノテーションによって制限される。
球面投影,特徴強調,アンサンブル学習,ターゲットアノテーションを統合した半自動不確実性対応パイプラインを提案する。
提案手法は,2次元球面格子を投影し,マルチソース特徴量で画素を拡大し,擬似ラベルと不確実性マップを生成するためにセグメンテーションネットワークのアンサンブルを訓練する。
論文 参考訳(メタデータ) (2025-10-08T02:25:59Z) - X-PDNet: Accurate Joint Plane Instance Segmentation and Monocular Depth
Estimation with Cross-Task Distillation and Boundary Correction [9.215384107659665]
X-PDNetは平面インスタンス分割と深さ推定のマルチタスク学習のためのフレームワークである。
我々は、境界回帰損失を増大させるために、基底真理境界を用いることの現在の限界を強調した。
境界領域分割を支援するために深度情報を利用する新しい手法を提案する。
論文 参考訳(メタデータ) (2023-09-15T14:27:54Z) - PointOcc: Cylindrical Tri-Perspective View for Point-based 3D Semantic
Occupancy Prediction [72.75478398447396]
本稿では,点雲を効果的かつ包括的に表現する円筒型三重対視図を提案する。
また,LiDAR点雲の距離分布を考慮し,円筒座標系における三点ビューを構築した。
プロジェクション中に構造の詳細を維持するために空間群プーリングを使用し、各TPV平面を効率的に処理するために2次元バックボーンを採用する。
論文 参考訳(メタデータ) (2023-08-31T17:57:17Z) - Adaptive Context-Aware Multi-Modal Network for Depth Completion [107.15344488719322]
我々は,観測された空間コンテキストを捉えるために,グラフ伝搬を採用することを提案する。
次に、注意機構を伝搬に適用し、ネットワークが文脈情報を適応的にモデル化することを奨励する。
最後に、抽出したマルチモーダル特徴を効果的に活用するための対称ゲート融合戦略を導入する。
本稿では,Adaptive Context-Aware Multi-Modal Network (ACMNet) を2つのベンチマークで評価した。
論文 参考訳(メタデータ) (2020-08-25T06:00:06Z) - Scan-based Semantic Segmentation of LiDAR Point Clouds: An Experimental
Study [2.6205925938720833]
最先端の手法では、深いニューラルネットワークを使用して、LiDARスキャンの各点のセマンティッククラスを予測する。
LiDAR測定を処理するための強力で効率的な方法は、2次元の画像のような投影を使うことである。
メモリの制約だけでなく、パフォーマンスの向上やランタイムの改善など、さまざまなテクニックを実証する。
論文 参考訳(メタデータ) (2020-04-06T11:08:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。