論文の概要: Beyond Selection: Token Parameterization for Extreme Visual Token Compression
- arxiv url: http://arxiv.org/abs/2609.35232v2
- Date: Tue, 29 Sep 2026 14:19:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.803125
- Title: Beyond Selection: Token Parameterization for Extreme Visual Token Compression
- Title(参考訳): 選択を超えて:極度の視覚的トーケン圧縮のためのトークンパラメータ化
- Abstract要約: 視覚言語圧縮のための軽量コーダであるBracoを設計する。
Bracoは、23times$-64times$圧縮で好適な経験的精度効率フロンティアを形成する。
Bracoは、エンドツーエンドのスピードアップを最大36%達成しながら、精度を向上する。
- 参考スコア(独自算出の注目度): 12.423580164783004
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual-token compression is effective for improving the efficiency of vision-language models, but under extreme compression budgets, token pruning can break visual grounding while learned resamplers increase parameter count, attention cost, and training complexity. We revisit compression through a token parameterization lens, separating (i) basis transformation and structured truncation (retained subspace/compressibility) from (ii) coordinate organization (optimization and cross-modal alignment). This view yields two coupled objectives, compressibility and learnability, which we formalize as unified functionals. Guided by these objectives, we design Braco, a lightweight four-step coder that combines transform-basis truncation, input-independent basis-coordinate embeddings, budget-dependent orthogonal re-parameterization, and learned spatial residual tokens from lightweight pooling. Experiments show that Braco forms the favorable empirical accuracy-efficiency frontier under $23\times$--$64\times$ compression and remains competitive at $144\times$, reaching 95.2% accuracy while reducing prefill FLOPs by 84.2%--86.7% relative to the uncompressed upper bound. Against prior methods, Braco matches or improves accuracy while achieving up to approximately 36% end-to-end speedup and using $16.6\times$/$78.8\times$ lower compressor latency/FLOPs.
- Abstract(参考訳): 視覚的トーケン圧縮は視覚言語モデルの効率を改善するのに有効であるが、極端な圧縮予算の下では、トークンプルーニングは視覚的基盤を損なう可能性がある。
我々はトークンパラメタライゼーションレンズを通して圧縮を再考し、分離する
(i)基底変換と構造的トランケーション(保持部分空間/圧縮性)
(二)コーディネート組織(最適化及びクロスモーダルアライメント)
この視点は、圧縮性と学習性という2つの結合した目的を導出し、これを統一関数として定式化する。
これらの目的によってガイドされたBracoは、トランスベーショントランケーション、入力非依存ベースコーディネート埋め込み、予算依存直交再パラメータ化、および軽量プールから空間的残留トークンを学習する軽量4ステップコーダである。
実験の結果、ブラコは23\times$--64\times$圧縮で好適な経験的精度・効率のフロンティアを形成し、144\times$で競争力を維持し、プレフィルFLOPを84.2%--86.7%減らし、95.2%の精度に達した。
従来の手法に対して、Bracoは最大で36%のエンドツーエンドのスピードアップを実現し、16.6\times$/78.8\times$低い圧縮機遅延/FLOPを使用する。
関連論文リスト
- TAP-Path: Task-Adaptive Structural and Token Pruning for Efficient and Trustworthy Pathology Foundation Models [3.7851234061033856]
本稿では,タスク適応型圧縮フレームワークであるTAP-Pathを提案する。
3つのタスクヘッド最適化シードの中で、TAP-Pathはテスト精度が87.98 pm 0.067%、バランスの取れた精度が81.26 pm 0.49%、32クラスの病理組織検査で8.38 pm 0.48%$ macro-F1を達成した。
その結果、タスク適応型構造とトークンスペーシングは、大きな病理基盤モデルの精度と効率のトレードオフを改善することができることがわかった。
論文 参考訳(メタデータ) (2026-09-03T16:43:36Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Fusion: A Framework for Unified Sequential Token AdaptatIon in VisiOn TraNsformers [2.604903535691346]
視覚変換器は強い画像分類精度を達成するが、ほぼ同じ計算で全ての画像領域を処理する。
近年の適応推論法では、トークンを選択的に圧縮したり、早期に推論を終了することで、このコストを削減している。
トークンマージ、早期終了、トークンプルーニングをコーディネートする統合適応型推論フレームワークであるFusionを導入する。
論文 参考訳(メタデータ) (2026-07-01T15:51:25Z) - Compress Then Adapt? No, Do It Together via Task-aware Union of Subspaces [19.906572926925026]
圧縮と適応を統一するフレームワークであるJACTUSを紹介する。
視界では、JACTUSは平均89.2%の精度でViT-Baseに到達している。
言語では、JACTUSはLlama2-7B Commonsenseの平均80.9%を達成している。
論文 参考訳(メタデータ) (2026-05-04T17:05:45Z) - Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity [54.95089105944234]
視覚言語モデル(VLM)は、過剰な視覚トークンの生成によって引き起こされる計算の非効率性に直面する。
2段階パイプラインを特徴とする訓練不要なSynergistic Importance-DiversityアプローチPruneSIDを提案する。
LLaVA-NeXTでは11.1%のトークン保持率で96.3%の精度、極端な圧縮速度(5.6%)で92.8%の精度を実現した。
論文 参考訳(メタデータ) (2026-03-10T10:31:58Z) - DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference [14.714791872881397]
DUET-VLMは汎用的なプラグアンドプレイデュアル圧縮フレームワークである。
精度を犠牲にすることなく、視覚的(イメージ/ビデオ)入力を小さくする堅牢な適応を可能にする。
本研究は,DUET-VLMによるエンドツーエンドトレーニングに焦点を当てた。
論文 参考訳(メタデータ) (2026-02-21T14:22:49Z) - Extreme Model Compression for Edge Vision-Language Models: Sparse Temporal Token Fusion and Adaptive Neural Compression [0.0]
2つの適応圧縮技術は、アルゴリズムの革新とハードウェア対応の最適化を統合するために提案されている。
イベントベースの視覚タスクでは、STTFは平均トークン数を84%削減する。
ANCは低モーションシーンでFLOPを最大90%カットする。
論文 参考訳(メタデータ) (2025-11-23T15:43:00Z) - Efficient Token Compression for Vision Transformer with Spatial Information Preserved [59.79302182800274]
トーケン圧縮は、トランスモデルの計算およびメモリ要求の低減に不可欠である。
本稿では,Prune と Merge という,効率的なハードウェア互換のトークン圧縮手法を提案する。
論文 参考訳(メタデータ) (2025-03-30T14:23:18Z) - Token Compensator: Altering Inference Cost of Vision Transformer without Re-Tuning [63.43972993473501]
視覚変換器(ViT)の訓練と推論を高速化するトークン圧縮
しかし、下流タスクに適用した場合、圧縮度はトレーニングと推論の段階で不一致となる。
本稿では,2段階間の圧縮度を分離するモデル演算フレームワークを提案する。
論文 参考訳(メタデータ) (2024-08-13T10:36:43Z) - Parameterization of Cross-Token Relations with Relative Positional
Encoding for Vision MLP [52.25478388220691]
視覚多層パーセプトロン(MLP)はコンピュータビジョンタスクにおいて有望な性能を示す。
トークンミキシングレイヤを使用して、トランスフォーマーが使用するマルチヘッド自己保持機構とは対照的に、クロストークンインタラクションをキャプチャする。
トークン混合のためのクロストークン関係を効率的に符号化する新しい位置空間ゲーティングユニット(PoSGU)を提案する。
論文 参考訳(メタデータ) (2022-07-15T04:18:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。