論文の概要: Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs
- arxiv url: http://arxiv.org/abs/2607.27700v1
- Date: Thu, 30 Jul 2026 05:36:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.405368
- Title: Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs
- Title(参考訳): 推論前の校正:VLMにおける意味的ドリフトに対するロバストな視力低下
- Abstract要約: CaReは,1)多方向摂動下で安定なモデル側の影響を持つアンカーを識別する摂動ロバストアンカリング,2)未選択トークンから信頼性の高い校正信号を抽出しアンカーに注入する信頼性ゲートトケンの2つの相互補完モジュールから構成される。
視覚トークンの94.4%をプルーニングする一方で、本手法は元のフルトーケン性能の96.4%を保持し、未使用バニラモデルと比較して最大2.30倍高速なエンドツーエンド推論速度を実現する。
- 参考スコア(独自算出の注目度): 26.936352183867854
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Vision-Language Models (VLMs) suffer from prohibitive inference overhead due to long sequences of visual tokens. However, existing visual token reduction methods mainly improve efficiency by pruning or compressing redundant tokens without examining whether the resulting representation remains semantically consistent with the original representation. Mapping the original N-token visual sequence to K tokens may discard, dilute, or misassign critical visual cues, triggering severe semantic drift that deviates the VLM's understanding. In this paper, we first introduce the principle of 'Calibrate Before Reason' to visual token reduction and propose CaRe, a training-free robust framework that calibrates compact visual representations before reasoning to preserve semantic fidelity in VLMs. CaRe consists of two mutually complementary modules: 1) Perturbation-Robust Calibration Anchoring, which identifies calibration anchors with stable model-side influence under multi-directional perturbations; 2) Confidence-Gated Token Calibration, which extracts reliable calibration signals from unselected tokens and injects them into anchors. Extensive evaluations across diverse VLM architectures and benchmarks verify that CaRe outperforms state-of-the-art token reduction baselines. While pruning 94.4% of visual tokens, our method retains 96.4% of the original full-token performance, delivering up to 2.30 times faster end-to-end inference speed relative to unpruned vanilla models.
- Abstract(参考訳): VLM(Large Vision-Language Models)は、視覚トークンの長いシーケンスによって、推論のオーバーヘッドが禁じられている。
しかし、既存の視覚トークン削減手法は、結果の表現が元の表現と意味的に一致しているかどうかを調べることなく、冗長トークンをプルーニングまたは圧縮することで効率を向上する。
元のN-tokenビジュアルシーケンスをKトークンにマッピングすると、重要な視覚的手がかりを破棄、希薄化、あるいは誤割り当てし、VLMの理解を損なう深刻な意味的ドリフトを引き起こす可能性がある。
本稿では,まず,視覚的トークンの低減に"Calibrate Before Reason"の原理を導入し,VLMにおける意味的忠実性を維持するための推論の前に,コンパクトな視覚表現を校正する訓練自由頑健なフレームワークCaReを提案する。
CaReは2つの相互補完的な加群から構成される。
1)多方向摂動下における安定なモデル側の影響を有するキャリブレーションアンカーを識別する摂動・ロバスト校正アンカリング
2)未選択トークンから信頼性の高い校正信号を抽出し,アンカーに注入する信頼性保証型トークン校正。
多様なVLMアーキテクチャやベンチマークの広範な評価は、CaReが最先端のトークン削減ベースラインを上回っていることを検証する。
視覚トークンの94.4%をプルーニングする一方で、本手法は元のフルトーケン性能の96.4%を保持し、未使用バニラモデルと比較して最大2.30倍高速なエンドツーエンド推論速度を実現する。
関連論文リスト
- ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs [77.57757084153083]
本稿では,効率的なMLLMを実現するために,Rectified Attention を用いたエントロピー誘導型ビジュアルトークン解析フレームワーク ERA を提案する。
ERAはDEP(Dual-view Entropy Pruning)、BTR(Bias-Aware Tokencycle)、LAR(Logit-Reserving Attention Rectification)の3つの重要な構成要素から構成される。
論文 参考訳(メタデータ) (2026-06-30T17:20:29Z) - OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning [24.164883144694656]
OccamTokenは、絶対トークンランキングを登録された相対的エビデンステストに置き換える、トレーニング不要のフレームワークである。
我々はOccamTokenが、追加のトレーニングなしで精度と効率のトレードオフを継続的に改善していることを示します。
論文 参考訳(メタデータ) (2026-05-28T09:20:47Z) - Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models [52.78477729846771]
本稿では,COAST(Contrastive Adaptive Semantic Token Pruning)について紹介する。
COASTはトークン予算をまたいだ強力なプルーニングベースラインを一貫して上回り、複数のLVLMファミリをまたいだ一般化を実現している。
論文 参考訳(メタデータ) (2026-05-10T09:07:04Z) - Towards Joint Quantization and Token Pruning of Vision-Language Models [53.978753457744055]
トークンプルーニングと低ビット量子化は、推論コストの削減を補完する。
我々は、低ビット推論と決定論的視覚トーケンプルーニングを統一する協調量子化&プルーニングフレームワークを提案する。
標準VLMベンチマークの実験では、同じ低ビット状態下でのステージワイドベースラインよりもロバスト性が改善された。
論文 参考訳(メタデータ) (2026-04-19T08:18:29Z) - RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models [24.3914653184824]
LVLM(Large Vision-Language Models)は、言語デコーダによって処理される膨大な数の視覚トークンによって、推論の禁止コストに悩まされる。
既存のプルーニング法は、視覚トークンの可逆的な除去が、事前訓練されたフルトケン状態から逸脱した隠れ状態の分布シフトを引き起こすため、大きな性能劣化を引き起こすことが多い。
本稿では,累積的視覚トークンプルーニングと遅延修復機構を統合した一貫性表現プルーナを提案する。
論文 参考訳(メタデータ) (2026-04-04T13:31:45Z) - One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination [46.864482139261675]
現在のトレーニングフリー手法は、MLLM幻覚に異なる戦略で取り組む。
本稿では,コアアセットであるビジョントークンに着目した統一フレームワークを提案する。
これら2つの役割を調和させることで、我々のフレームワークは視覚言語バランスを効果的に回復する。
論文 参考訳(メタデータ) (2026-03-11T03:19:46Z) - CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization [122.88484422855934]
本稿では,MeanFlowデコーダを備えた1次元因果画像トークンであるCaTokを紹介する。
時間間隔でトークンを選択することで、CaTokは高速なワンステップ生成と高忠実なマルチステップサンプリングの両方をサポートする因果1D表現を学ぶ。
実験により、CaTokはImageNet再構成の最先端の結果を達成し、0.75 FID、22.53 PSNR、0.674 SSIMに達した。
論文 参考訳(メタデータ) (2026-03-06T16:39:17Z) - Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models [16.540220733551823]
VLM(Large Vision-Language Models)は、強力なマルチモーダル推論を実現するが、冗長な視覚トークンから重い推論コストを発生させる。
注意に基づく手法は、しばしばレイヤやヘッド間で不安定な生の注意スコアに依存する。
簡単な直感に基づいて構築されたトレーニング不要のフレームワークとして,我々の提案する。
論文 参考訳(メタデータ) (2025-09-29T14:20:05Z) - TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model [56.43860351559185]
高速かつ低メモリの textbfVLM に対する推論時間最適化を備えた textbfToken textbfPruning の互換性である textbfTopV を導入する。
我々のフレームワークは、各ソースの視覚的トークンの重要性を測定するために、視覚的なコスト関数を組み込んでおり、低重要トークンの効果的なプルーニングを可能にしている。
論文 参考訳(メタデータ) (2025-03-24T01:47:26Z) - "Principal Components" Enable A New Language of Images [79.45806370905775]
証明可能なPCAのような構造を潜在トークン空間に組み込む新しい視覚トークン化フレームワークを導入する。
提案手法は、最先端の再構築性能を実現し、人間の視覚システムとの整合性を向上する。
論文 参考訳(メタデータ) (2025-03-11T17:59:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。