論文の概要: GRAFT: Growing Agglomerative Foundation Models via Continual Teacher Distillation
- arxiv url: http://arxiv.org/abs/2610.02597v1
- Date: Thu, 01 Oct 2026 23:49:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.127688
- Title: GRAFT: Growing Agglomerative Foundation Models via Continual Teacher Distillation
- Title(参考訳): GRAFT:継続的な教師蒸留によるアグロマリティブ・ファンデーション・モデルの構築
- Abstract要約: 多教師の知識蒸留は、単一の凝集性バックボーンに機能を統合するための道を提供する。
GRAFTは、統合されたバックボーンが徐々に能力を獲得することを可能にする連続的なマルチティーチンガー蒸留フレームワークである。
GRAFTは、以前に蒸留したモデルを学習能力を維持するための教師として扱い、現在の学生は、前のモデルと入ってくる教師の両方から共同で学習する。
- 参考スコア(独自算出の注目度): 5.8142551651717085
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision foundation models such as DINOv2, SigLIP2, and MASt3R develop complementary capabilities from different pretraining objectives, yet their knowledge remains distributed across separate, specialized models. Multi-teacher knowledge distillation offers a path toward consolidating these capabilities into a single agglomerative backbone, but existing approaches assume a fixed set of teachers, and incorporating a new teacher requires repeating expensive joint distillation over the entire teacher set. We introduce GRAFT, a continual multi-teacher distillation framework that enables a unified backbone to progressively acquire capabilities from an open-ended sequence of foundation models. When a new teacher arrives, GRAFT treats the previously distilled model as a teacher for preserving learned capabilities, while the current student jointly learns from both the previous model and the incoming teacher. Furthermore, to reconcile the incompatible representation geometries of heterogeneous teachers, we introduce Teacher Specific Readout Tokens, which grant each teacher an independent read-out of the shared encoder, together with Geometry Agnostic Relational Loss that aligns a vision-language teacher by matching image-text similarity structures rather than raw feature values. We provide GRAFT model, which is a single, continually extensible backbone that unifies five domains, including image understanding, 2D dense prediction, 3D human pose estimation, 3D vision, and vision-language, delivering strong performance across all of them while acquiring each new capability at the cost of a single distillation rather than a full re-distillation.
- Abstract(参考訳): DINOv2、SigLIP2、MASt3Rといったビジョン基礎モデルは、異なる事前学習目標から補完能力を開発するが、その知識は別個の専門モデルに分散している。
マルチ教師の知識蒸留は、これらの機能を単一の集合的なバックボーンに統合するための道筋を提供するが、既存のアプローチでは、固定された教師セットを前提としており、新しい教師の導入には、教師セット全体にわたって高価なジョイント蒸留を繰り返す必要がある。
GRAFTは,基礎モデルのオープンエンドシーケンスから,統一されたバックボーンを段階的に獲得することを可能にする,連続的なマルチティーチンガー蒸留フレームワークである。
新しい教師が到着すると、GRAFTは以前に蒸留したモデルを学習能力を維持する教師として扱い、現在の学生は、前者モデルと入学者の両方から共同で学習する。
さらに,不均一な教師の非互換な表現空間を整理するために,教師ごとに共有エンコーダの独立した読み出しを許可するTeacher Specific Readout Tokensと,生の特徴値ではなく画像テキスト類似性構造を一致させて視覚言語教師を整合させるGeometry Agnostic Relational Lossを紹介する。
GRAFTモデルは,画像理解,2次元密集予測,3次元ポーズ推定,3次元ビジョン,視覚言語を含む5つの領域を統一した,連続的に拡張可能な単一のバックボーンであり,全蒸留ではなく,単一蒸留のコストでそれぞれの新たな能力を獲得しつつ,それら全てに強い性能を提供する。
関連論文リスト
- Heterogeneous and Adept Snapshot Distillation for 3D Semantic Segmentation [71.94615164565589]
マルチモーダル融合とマルチモデルアンサンブルは3次元セマンティックセグメンテーションの性能向上に有効である。
本稿では,マルチモーダルモデル(すなわち点雲と画像)と複数のモデルエキスパートから,知識蒸留を通じてポイントクラウドベースのネットワークにリッチな知識を移行することを提案する。
Heterogeneous and Adept Snapshot Knowledge Distillationは、HAS-KDと呼ばれ、ScanNetV2とS3DISデータセットの最先端の結果を得る。
論文 参考訳(メタデータ) (2026-06-24T01:31:22Z) - UNIEGO: Proxies as Mediators for Unified Egocentric Video Representation Learning [20.624929008039402]
UNIEGOは、エゴ・エゴの視点、RGB、深さ、骨格のモダリティにまたがる9人の教師と4つの基礎モデルで訓練された統合型エゴセントリック・エンコーダである。
構造化されたプロキシによる知識伝達は、より豊かで差別的なエゴセントリックな表現をもたらすことを実証する。
論文 参考訳(メタデータ) (2026-06-18T17:59:45Z) - AMoE: Agglomerative Mixture-of-Experts Vision Foundation Model [23.785186661138734]
本研究では,視覚基礎モデルの多教師蒸留について検討し,計算コストの低いトレーニングを可能にする重要な要因を同定する。
本稿では,SigLIP2 と DINOv3 から知識を同時に抽出する AMOE (Agglomerative Mixture-of-Experts Vision Foundation Models) について紹介する。
非対称な関係知識蒸留損失は,教師の幾何学的特性を保ちながら,効果的な知識伝達を可能にしていることを示す。
論文 参考訳(メタデータ) (2025-12-23T08:37:11Z) - Asymmetric Decision-Making in Online Knowledge Distillation:Unifying Consensus and Divergence [18.640219880439062]
本稿では,中間空間表現を活用する革新的な手法を提案する。
本稿では,学生モデルの特徴コンセンサス学習を強化するために,非対称意思決定(ADM)を提案する。
論文 参考訳(メタデータ) (2025-03-09T16:32:25Z) - RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models [60.596005921295806]
集約モデルは、ビジョンファウンデーションモデルをトレーニングするための強力なアプローチとして現れています。
我々は、解像度モードシフト、教師の不均衡、慣用的教師アーティファクト、過剰な出力トークンなど、重要な課題を識別する。
本稿では,マルチレゾリューショントレーニング,モザイク強化,教師の損失関数のバランスの改善など,いくつかの新しいソリューションを提案する。
論文 参考訳(メタデータ) (2024-12-10T17:06:41Z) - AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One [47.58919672657824]
このアプローチをAM-RADIO(Agglomerative Model -- すべてのドメインを1に還元する)と名付けます。
教師モデルより少なくとも7倍高速な新しいアーキテクチャ(E-RADIO)を開発した。
包括的なベンチマークプロセスでは、ImageNet分類、ADE20kセマンティックセグメンテーション、COCOオブジェクト検出、LLaVa-1.5フレームワークなどの下流タスクをカバーしています。
論文 参考訳(メタデータ) (2023-12-10T17:07:29Z) - Self-Supervised Monocular Depth Estimation with Self-Reference
Distillation and Disparity Offset Refinement [15.012694052674899]
自己教師付き単分子深度推定を改善するための2つの新しいアイデアを提案する。
我々は,教師が訓練の時期に合わせて更新したパラメータ最適化モデルを用いて,さらなる指導を行う。
我々は,高次特徴量と低次特徴量とのコンテキスト整合性を利用して,マルチスケールの相違オフセットを得る。
論文 参考訳(メタデータ) (2023-02-20T06:28:52Z) - Distilling Knowledge from Self-Supervised Teacher by Embedding Graph
Alignment [52.704331909850026]
我々は、自己指導型事前学習モデルから他の学生ネットワークへ知識を伝達するための新しい知識蒸留フレームワークを定式化した。
自己教師型学習におけるインスタンス識別の精神に触発され,特徴埋め込み空間におけるグラフ定式化によるインスタンスとインスタンスの関係をモデル化する。
蒸留方式は, 学生ネットワーク上での表現学習を促進するために, 自己指導型知識の伝達に柔軟に適用できる。
論文 参考訳(メタデータ) (2022-11-23T19:27:48Z) - Representation Consolidation for Training Expert Students [54.90754502493968]
マルチヘッド多タスク蒸留法は,タスク固有の教師の表現を集約し,下流のパフォーマンスを向上させるのに十分であることを示す。
また,本手法では,複数のドメインで訓練された複数の教師の表現的知識を1つのモデルに組み合わせることができる。
論文 参考訳(メタデータ) (2021-07-16T17:58:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。