論文の概要: Clustering and Token Denoising for Faster and More Robust VLMs
- arxiv url: http://arxiv.org/abs/2608.19285v1
- Date: Wed, 19 Aug 2026 11:20:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.357116
- Title: Clustering and Token Denoising for Faster and More Robust VLMs
- Title(参考訳): 高速でロバストなVLMのためのクラスタリングとToken Denoising
- Abstract要約: 我々は、ロバストトークンプルーニングのための2部構成のトレーニングフリーアルゴリズムであるClustRSを紹介する。
ScienceQA-IMG と MM-VET のベンチマークによる実験結果から,本手法が注目度および多様性に基づく手法より優れていることが示された。
我々の研究は、スコアオンリーとダイバーシティオンリーの両方のプルーニングルールに対して、単純ながら強力な代替手段を示し、計算効率とノイズ耐性のVLMデプロイメントへの道を開いた。
- 参考スコア(独自算出の注目度): 0.6999740786886536
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent Visual-Language Models (VLMs) have enhanced the capabilities of pre-trained LLMs by adding vision tokens alongside text, with approaches like LLaVA showing impressive results. However, the computational burden of processing up to 576 or 729 visual tokens makes edge deployment challenging. While various token pruning techniques require retraining, some are training-free and thus can easily adapt to architecture changes. We introduce ClustRS, a two-part, training-free algorithm for robust token pruning. Its first component is an attention-weighted, clustering algorithm that selects representative tokens from each semantic cluster. The second component, Residual Shrinkage, is a one-pass denoising step on the selected tokens. These training-free lightweight steps make LLaVA ready for real-world data, improving robustness to a wide range of image-noise types and intensities. Experimental results on the ScienceQA-IMG and MM-VET benchmarks show our method outperforms attention- and diversity-based methods by up to 20\% under extreme noise and token conditions (reducing tokens by 97\%, down to 16 tokens) on LLaVA 1.5 7b and achieves exceptional results on LLaVA-OneVision, where we match baseline performance with fewer than one-third of their tokens under mild noise conditions. Our study demonstrates a simple yet powerful alternative to both score-only and diversity-only pruning rules, paving the way for compute-efficient and noise-resilient VLM deployment.
- Abstract(参考訳): 最近のVisual-Language Models (VLM)は、テキストと並行して視覚トークンを追加することで、事前訓練されたLLMの能力を向上し、LLaVAのようなアプローチは印象的な結果を示している。
しかし、576または729のビジュアルトークンまで処理する計算負担は、エッジデプロイメントを困難にしている。
さまざまなトークンプルーニング技術は再トレーニングを必要とするが、トレーニング不要なものもあるため、アーキテクチャの変更に容易に適応できる。
我々は、ロバストトークンプルーニングのための2部構成のトレーニングフリーアルゴリズムであるClustRSを紹介する。
その最初のコンポーネントは、各セマンティッククラスタから代表トークンを選択する、注目度の高いクラスタリングアルゴリズムである。
第2のコンポーネントであるResidual Shrinkageは、選択されたトークンの1パスのdenoisingステップである。
これらのトレーニング不要の軽量ステップにより、LLaVAは実世界のデータに対応でき、幅広い画像ノイズタイプや強度に対する堅牢性を向上させることができる。
ScienceQA-IMG と MM-VET ベンチマークによる実験結果から,LLaVA 1.5 7b 上の極端ノイズおよびトークン条件(トークンを 97 % まで減少させ,LLaVA-OneVision における例外的な結果を得た。
我々の研究は、スコアオンリーとダイバーシティオンリーの両方のプルーニングルールに対して、単純ながら強力な代替手段を示し、計算効率とノイズ耐性のVLMデプロイメントへの道を開いた。
関連論文リスト
- AdaVSkip: Adaptive Visual Token Skipping Across Layers For Efficient MLLMs Inference [14.50173720268662]
マルチモーダル・大規模言語モデル(MLLM)は、すべてのトランスフォーマー層にまたがる多数の視覚トークンを処理するために、かなりの計算を必要とする。
本稿では,AdaVSkipを提案する。AdaVSkipは各層に2つの軽量ルータを装備し,視覚トークンが通過するか否かを独立に判断する。
AdaVSkipは、計算量を大幅に減らしながら、強いタスク性能を維持している。
論文 参考訳(メタデータ) (2026-09-14T07:07:51Z) - One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs [18.48496973561215]
LVLM(Large Vision-Language Models)は様々なマルチモーダルタスクにまたがって大きな成功を収めているが、その実際の展開は長い視覚トークンから生じる計算負担によって制約されている。
本稿では,従来の静的トークンプルーニングパラダイムから切り離された新しいフレームワークであるAdaptive Layer-wise Visual Token Selection (ALVTS)を提案する。
89%のトークン圧縮比で、ALVTSはオリジナルのモデルの96.7%の精度を維持しており、LVLM推論の効率と精度のトレードオフが優れている。
論文 参考訳(メタデータ) (2026-06-12T08:58:58Z) - ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning [4.929399529593515]
画像の複雑度に適応したプルーニング戦略により、正常なトークンを識別し、保持する2段階の視覚トークンプルーニングフレームワークであるERASEを提案する。
実験の結果,ERASEは精度を保ちながら視覚トークンを著しく減少させることがわかった。
論文 参考訳(メタデータ) (2026-05-11T04:50:05Z) - Unified Spatio-Temporal Token Scoring for Efficient Video VLMs [61.08183446817756]
トケンプルーニングは視覚言語モデルの計算効率を高めるために不可欠である。
本稿では,視覚トークンを ViT と LLM の両方にわたってプルークする,シンプルで軽量なモジュールである Spatio-Temporal Token Scoring (STTS) を紹介する。
STTSはアーキテクチャ全体の視覚トークンの50%を突破し、トレーニングと推論の両方で効率が62%向上した。
論文 参考訳(メタデータ) (2026-03-18T17:59:56Z) - CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models [75.88232735646018]
LVLM(Large Vision-Language Models)は、画像やビデオから抽出されたテキストトークンとビジョントークンからなるマルチモーダル入力を処理する。
既存の手法は冗長な視覚トークンを創りだそうとしており、視覚表現のかなりの冗長性を明らかにしている。
我々は,LVLMで処理される前に冗長な視覚トークンを予測・削除するために,Plug-and-Play Pruning Module (PPM) を用いるレイヤワイズなコンテキスト対応型視覚トークンプルーニング手法であるCoViPALを提案する。
論文 参考訳(メタデータ) (2025-08-24T07:47:00Z) - DyMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs [124.52164183968145]
視覚言語モデル(VLM)の計算負担を軽減する,効率的なトレーニング不要なフレームワークであるDyMUを提案する。
まず、動的トークンマージ(DToMe)は、画像の複雑さに基づいて類似のトークンをマージすることで、視覚トークンの埋め込み数を削減します。
第二に、仮想トークンアンマージ(VTU)は、大きな言語モデル(LLM)の期待トークンシーケンスを、フルシーケンスの注意ダイナミクスを効率的に再構築することでシミュレートする。
論文 参考訳(メタデータ) (2025-04-23T18:38:18Z) - InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression [1.8893427856534721]
InternVL-Xは、性能と効率の両方で、InternVLモデルより優れている。
20%以下のビジュアルトークンを利用することで、InternVL-Xは7つのパブリックMLLMベンチマークで最先端のパフォーマンスを達成し、12タスクの平均メトリックを2.34%改善する。
論文 参考訳(メタデータ) (2025-03-27T09:31:35Z) - iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models [24.0346607116299]
iLLaVAは、現在のLVLM(Large Vision-Language Models)にシームレスにデプロイできるシンプルな方法である。
iLLaVAは、冗長トークンを正確で高速なアルゴリズムで発見し、徐々にマージすることでこれを達成している。
単一イメージ、マルチイメージ、ビデオを含むさまざまな領域にわたるタスクにおいて、iLLaVAは一貫して有望な効率で強力な一般化性を示す。
論文 参考訳(メタデータ) (2024-12-09T07:22:19Z) - Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction [62.8375542401319]
MLLM(Multimodal Large Language Models)は、入力イメージを視覚トークンとしてエンコードし、それらを言語バックボーンに入力する。
画像解像度が大きくなるにつれて、視覚トークンの数は2次的に増加し、膨大な計算コストがかかる。
本稿では,各層を浅層から深層まで保持する最小限の視覚トークンを求めるために,欲求探索アルゴリズム(G-Search)を提案する。
論文 参考訳(メタデータ) (2024-11-30T18:54:32Z) - Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters [54.01228554126122]
視覚言語モデル(VLM)は、様々な視覚的理解と推論タスクにまたがる強力な能力を示している。
推論コストを削減するために、LLM(Large Language Models)を縮小するか、イメージを表すのに必要な入力トークンの数を削減できる。
高速圧縮に適したトークン圧縮アルゴリズムを設計する第一歩を踏み出す。
論文 参考訳(メタデータ) (2024-11-05T18:54:21Z) - ELIP: Efficient Language-Image Pre-training with Fewer Vision Tokens [75.09406436851445]
本稿では,言語出力の監督による影響の少ないトークンを除去するために,視覚トークンのプルーニングとマージ手法ELIPを提案する。
実験により、12層のViT層に30$%のビジョントークンが削除されたことにより、ELIPは著しく同等のパフォーマンスを維持した。
論文 参考訳(メタデータ) (2023-09-28T05:31:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。