論文の概要: Fusion: A Framework for Unified Sequential Token AdaptatIon in VisiOn TraNsformers
- arxiv url: http://arxiv.org/abs/2607.02612v1
- Date: Wed, 01 Jul 2026 15:51:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.353722
- Title: Fusion: A Framework for Unified Sequential Token AdaptatIon in VisiOn TraNsformers
- Title(参考訳): Fusion: VisiOn TraNsformersにおける統合シーケンストークンアダプタIonのフレームワーク
- Authors: Aravind Pradeep, Samira Nazari, Mahdi Taheri, Christian Herglotz,
- Abstract要約: 視覚変換器は強い画像分類精度を達成するが、ほぼ同じ計算で全ての画像領域を処理する。
近年の適応推論法では、トークンを選択的に圧縮したり、早期に推論を終了することで、このコストを削減している。
トークンマージ、早期終了、トークンプルーニングをコーディネートする統合適応型推論フレームワークであるFusionを導入する。
- 参考スコア(独自算出の注目度): 2.604903535691346
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Vision Transformers achieve strong image classification accuracy but process all image regions with nearly the same computation, even when many regions are redundant or uninformative. Recent adaptive inference methods reduce this cost by selectively compressing tokens or terminating inference early, but combining these mechanisms often causes unstable intermediate representations and accuracy degradation. We introduce Fusion, a unified adaptive inference framework that coordinates token merging, early exiting, and token pruning through a simple staged design: tokens are merged first, confidence is evaluated next, and pruning is applied only to samples that continue inference. This ordering allows the three mechanisms to operate cooperatively rather than competitively. Fusion further includes lightweight routing modules that adapt compression strength to each input and support inference-time adjustment of the accuracy--latency trade-off without retraining. On ImageNet-1k with DeiT-S, Fusion matches or surpasses state-of-the-art adaptive ViT methods at comparable compute budgets while reducing calibration error by up to $4\times$ and inference energy by $48\%$. Experiments across ImageNet-100, CIFAR-100, and ImageNette with multiple ViT backbones demonstrate consistent transferability without dataset-specific tuning.
- Abstract(参考訳): 視覚変換器は強い画像分類精度を達成するが、多くの領域が冗長あるいは非形式的である場合でも、ほぼ同じ計算で全ての画像領域を処理する。
近年の適応推論法では、トークンを選択的に圧縮したり、早期に推論を終了させることにより、このコストを削減しているが、これらのメカニズムを組み合わせると、不安定な中間表現や精度の低下が発生することが多い。
トークンをまずマージし、次に信頼性を評価し、推論を継続するサンプルのみにプルーニングを適用する。
この順序付けにより、3つのメカニズムは競争ではなく協力的に動作する。
Fusionには、各入力に圧縮強度を適用する軽量なルーティングモジュールが含まれており、再トレーニングせずに精度-遅延トレードオフの推論時間調整をサポートする。
ImageNet-1kとDeiT-Sでは、Fusionは最先端の適応型ViTメソッドと同等の計算予算で一致または超過し、キャリブレーションエラーを最大4\times$と推論エネルギーを480\%$に削減する。
複数のViTバックボーンを備えたImageNet-100、CIFAR-100、ImageNette間の実験は、データセット固有のチューニングなしで一貫した転送性を示している。
関連論文リスト
- Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding [56.38477453373368]
LazyMCoTは動的でトレーニング不要なフレームワークで、サンプルの難易度に基づいて視覚的接地作業を適応的に割り当てる。
LazyMCoTは、推論精度を同時に改善し、平均推論レイテンシを低減することで、トレーニングベースのアプローチと競合する。
論文 参考訳(メタデータ) (2026-06-15T03:17:44Z) - AdaMerge: Salience-Aware Adaptive Token Merging for Training-Free Acceleration of Vision Transformers [5.739405014622565]
AdaMergeは2つの補完メカニズムに基づいたトークンマージフレームワークである。
ToMe、PiToMe、DSMよりずっと優れています。
論文 参考訳(メタデータ) (2026-05-26T05:35:39Z) - Joint Post-Training Quantization of Vision Transformers with Learned Prompt-Guided Data Generation [5.75627633588113]
我々は、ImageNetで訓練されたビジョントランスフォーマーの合体量子化のためのフレームワークを提案する。
我々はImageNet上で最先端のW4A4とW3A3の精度を実現する。
また,ラベルのない多種多様なサンプルを合成するデータフリーキャリブレーション手法を導入する。
論文 参考訳(メタデータ) (2026-02-21T15:02:21Z) - FUSER: Feed-Forward MUltiview 3D Registration Transformer and SE(3)$^N$ Diffusion Refinement [39.19949818461193]
Fは、全てのスキャンを統一されたコンパクトな潜在空間で処理する最初のフィードフォワードマルチビュー登録変換器である。
F はペアワイズ推定なしでグローバルなポーズを予測する。
3DMatch, ScanNet, ArkitScenesの実験により, 本手法が優れた登録精度と優れた計算効率を実現することを示す。
論文 参考訳(メタデータ) (2025-12-10T07:11:22Z) - Efficient Token Compression for Vision Transformer with Spatial Information Preserved [59.79302182800274]
トーケン圧縮は、トランスモデルの計算およびメモリ要求の低減に不可欠である。
本稿では,Prune と Merge という,効率的なハードウェア互換のトークン圧縮手法を提案する。
論文 参考訳(メタデータ) (2025-03-30T14:23:18Z) - FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion [92.4205087439928]
画像強調共同深度推定法は、頑健な知覚に相補的なモダリティを利用するが、一般化可能性の課題に直面している。
自己監督型転送(PST)と周波数デカップリング型フュージョンモジュール(FreDF)を提案する。
PSTは、画像基盤モデルとの遅延空間アライメントによるクロスモーダルな知識伝達を確立し、データ不足を効果的に軽減する。
FreDFは、低周波構造成分から高周波エッジ特性を明示的に分離し、モード比周波数ミスマッチを解消する。
この組み合わせのアプローチにより、FUSEはターゲットデータセットに対する軽量デコーダ適応のみを必要とするユニバーサルなイメージイベントを構築することができる。
論文 参考訳(メタデータ) (2025-03-25T15:04:53Z) - FASTer: Focal Token Acquiring-and-Scaling Transformer for Long-term 3D Object Detection [9.291995455336929]
我々はFAST(Focal Token Acquring-and-Scaling Transformer)を提案する。
FASTerは、適応的で軽量な方法でトークンシーケンスを凝縮する。
性能と効率の両方で、他の最先端の検出器よりも大幅に優れています。
論文 参考訳(メタデータ) (2025-02-28T03:15:33Z) - Implicit Grid Convolution for Multi-Scale Image Super-Resolution [6.8410780175245165]
我々は,Implicit Grid Convolution(IGConv)と連携して,単一エンコーダを用いたマルチスケールフレームワークを提案する。
本フレームワークは,既存の固定スケール手法に匹敵する性能を達成しつつ,トレーニング予算を削減し,パラメータを3倍に抑える。
論文 参考訳(メタデータ) (2024-08-19T03:30:15Z) - Token Fusion: Bridging the Gap between Token Pruning and Token Merging [71.84591084401458]
ビジョントランスフォーマー(ViT)はコンピュータビジョンの強力なバックボーンとして登場し、多くの伝統的なCNNを上回っている。
計算オーバーヘッドは、主に自己アテンション機構によるもので、リソース制約のあるエッジデバイスへのデプロイが困難になる。
トークンプルーニングとトークンマージの両方のメリットを両立させる手法であるToken Fusion(ToFu)を紹介する。
論文 参考訳(メタデータ) (2023-12-02T04:29:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。