論文の概要: Later Is Better: Token Reduction for ViTs Under Distribution Shift
- arxiv url: http://arxiv.org/abs/2610.07758v1
- Date: Tue, 06 Oct 2026 04:54:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.815988
- Title: Later Is Better: Token Reduction for ViTs Under Distribution Shift
- Title(参考訳): ディストリビューションシフトによるViTのトークン削減
- Abstract要約: トレーニング不要なトークン削減は、レイヤ間の冗長トークンを取り除き、計算のごく一部で元の精度を回復することで、ビジョントランスフォーマーを加速させる。
このギャップは、通常実装の詳細として固定された除去の深さプロファイルである削減スケジュールによって制御されていることを示す。
提案手法では, 余分な推論コストを伴わずに, 平板上における配電精度を常に向上する一パラメータ遅延型パワーロースケジュールを導入する。
- 参考スコア(独自算出の注目度): 11.387438418053586
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training-free token reduction accelerates vision transformers by removing redundant tokens across layers, recovering most of the original accuracy at a fraction of the compute. These methods, however, are designed and evaluated primarily on clean data, and under real-world distribution shift their accuracy gap to the uncompressed model widens with the removal rate. We show that this gap is governed by the reduction schedule, the depth profile of removal, usually left fixed as an implementation detail. Concretely, we introduce a one-parameter late-concentrated power-law schedule that consistently improves out-of-distribution accuracy over flat at no extra inference cost. On ImageNet-C with DeiT-S, the late schedule closes 83% of that gap at a 26% compute reduction (+1.17pp), and 99% of it at a lighter 7% reduction (+0.26pp). The gain cannot be attributed to retaining more tokens or using extra compute: held to flat's compute, the late schedule removes more tokens in total and leaves fewer tokens at the end, yet still wins. Single-layer probes point to a mechanism: earlier reductions perturb features that pass through more remaining layers, front-loading reduction error in depth. The effect is broad, holding across five token-reduction methods (ToMe, EViT, ATS, ATC, PiToMe), nine backbones, all ImageNet-C corruption types, eight further shift suites, and two further modalities, video and vision-language QA. It is also specific to shift, still positive on clean and rising monotonically to ~4x that at the highest severity 5. The schedule keeps its gain under six test-time adaptation methods, and needs no per-input or per-domain tuning.
- Abstract(参考訳): トレーニング不要なトークン削減は、レイヤ間の冗長トークンを取り除くことで視覚変換器を加速し、計算のごく一部で元の精度を回復する。
しかし、これらの手法は主にクリーンなデータに基づいて設計され評価され、実世界の分布下では、その精度のギャップを除去率で拡大する非圧縮モデルにシフトする。
このギャップは、通常実装の詳細として固定された除去の深さプロファイルである削減スケジュールによって制御されていることを示す。
具体的には,1パラメートル遅れのパワーロースケジュールを導入し,余分な推論コストを伴わずにフラットでの配電精度を常に改善する。
ImageNet-C with DeiT-Sでは、遅延スケジュールはそのギャップの83%を26%の計算削減(+1.17pp)で終了し、99%はより軽い7%の削減(+0.26pp)で終了する。
利得は、より多くのトークンを保持したり、余分な計算を使ったりすることはできない:フラットの計算に保持された後続のスケジュールでは、合計でより多くのトークンが取り除かれ、最後にトークンが少なくなるが、それでも勝利する。
単一層プローブはメカニズムを示唆している: 以前の縮小は、より多くの残りの層を通過するパーターブ特性を、前装還元誤差を深く通過させる。
この効果は5つのトークン還元方法(ToMe、EViT、ATS、ATC、PiToMe)、9つのバックボーン、すべてのImageNet-C汚職タイプ、8つのシフトスイート、さらに2つのモダリティ、ビデオとビジョン言語QAにまたがる。
また、きれいで単調に上昇し、最も重篤な5倍から4倍に変化することが特異である。
スケジュールは6つのテストタイムアダプティブメソッドで増加し、インプット単位やドメイン単位のチューニングは不要である。
関連論文リスト
- LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization [60.59339465850602]
本論文では、8ビットのリカレント状態量子化の下で、ほぼ無作為な性能を実現する学習不要なLeapQuantを提案する。
LeapQuantは、推論中にメモリと計算コストを大幅に削減することを示す。
FP32ベースラインに匹敵する精度で、カーネルレベルでは2.05--3.70$times$、エンドツーエンドの推論では1.47$times$となる。
論文 参考訳(メタデータ) (2026-09-29T17:59:34Z) - DORA: Dynamic Online Reinforcement Agent for Token Pruning in Vision Transformers [6.235887167172886]
DORAは、凍結したViTに対して入力適応型プルーニングポリシー自体を学ぶ。
DeiT-BaseのImageNet-1Kでは、FLOPを38.4%削減している。
平均して4つのViT型バックボーンの精度が一致し、DORAは13.2%のFLOPを使用する。
論文 参考訳(メタデータ) (2026-09-28T05:02:41Z) - M+Adam: Low-Precision Training via Additive-Multiplicative Optimization [69.5989114185868]
量子化された重量のトレーニングはコストを削減できるが、しばしば精度が低下する。
本稿では,2つの更新タイプを組み合わせたM+Adamを提案する。
60M-1Bのモデルと1x-8xのチンチラ、BF16、FP8、FP4のマスターウェイトを使用したLLaMA型プレトレーニングでは、M+アダムは一貫して低精度トレーニングを改善している。
論文 参考訳(メタデータ) (2026-07-12T07:15:47Z) - ESPO: Early-Stopping Proximal Policy Optimization [78.79610718910628]
ESPO(Early-Stopping Proximal Policy Optimization)は、軌道上の障害を検出し、ロールアウトを早期に終了する。
DeepSeek-R1-Distill-Qwen-7Bでは、ESPOはAIME2024(46.28%対45.25%)、AMC2023(85.83%対82.94%)、MATH-500(87.42%対85.43%)でPPOを上回っている。
論文 参考訳(メタデータ) (2026-05-28T12:40:22Z) - RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models [24.3914653184824]
LVLM(Large Vision-Language Models)は、言語デコーダによって処理される膨大な数の視覚トークンによって、推論の禁止コストに悩まされる。
既存のプルーニング法は、視覚トークンの可逆的な除去が、事前訓練されたフルトケン状態から逸脱した隠れ状態の分布シフトを引き起こすため、大きな性能劣化を引き起こすことが多い。
本稿では,累積的視覚トークンプルーニングと遅延修復機構を統合した一貫性表現プルーナを提案する。
論文 参考訳(メタデータ) (2026-04-04T13:31:45Z) - REPA Works Until It Doesn't: Early-Stopped, Holistic Alignment Supercharges Diffusion Training [58.33728862521732]
Diffusion Transformer (DiTs)は最先端の画像品質を提供するが、訓練は依然として遅い。
最近の治療 -- DiT の隠された特徴と非生成的教師(例えば DINO)の特徴とを一致させる表現アライメント(REPA) -- は、初期のエポックを劇的に加速させるが、その後パフォーマンスを低下させる。
生成学習者が共同データ分布をモデル化し始めると、教師の低次元埋め込みと注意パターンがガイドではなくストラトジャケットになる。
HASTEを紹介する
論文 参考訳(メタデータ) (2025-05-22T15:34:33Z) - PaPr: Training-Free One-Step Patch Pruning with Lightweight ConvNets for Faster Inference [11.112356346406365]
PaPrは、軽量なConvNetを使用して、最小限の精度で冗長なパッチを実質的に刈り取る方法である。
FLOPカウントの低減に類似した、最先端のパッチリダクション法よりもはるかに高い精度を実現している。
論文 参考訳(メタデータ) (2024-03-24T05:50:00Z) - TPC-ViT: Token Propagation Controller for Efficient Vision Transformer [6.341420717393898]
ビジョントランス (ViT) は様々なコンピュータビジョンタスクにおいて有望な結果を得た。
この課題に対処するために、段階的なトークン削減を採用する以前のアプローチでは、ひとつのレイヤにおけるトークンの冗長性は、以下のすべてのレイヤにおける冗長性を意味すると仮定されている。
本稿では、2つの異なるトークン分布を組み込んだ新しいトークン伝搬制御器(TPC)を提案する。
論文 参考訳(メタデータ) (2024-01-03T00:10:33Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。