論文の概要: Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression
- arxiv url: http://arxiv.org/abs/2608.09176v1
- Date: Mon, 10 Aug 2026 06:40:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.105723
- Title: Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression
- Title(参考訳): すべての視覚トークンは、削除しても安全ではない:連続感性視覚トークン圧縮
- Authors: Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang,
- Abstract要約: 本稿では,その潜在的なエラーコストに応じて,要求間の計算を割り当てる,結果に敏感なビジュアルトークン圧縮を提案する。
現実的な混合ワークロードでは、結果に敏感なアロケーションは、コスト重み付けエラーを38%削減すると同時に、フル解像度の推論よりも約21%のレイテンシを実現する。
- 参考スコア(独自算出の注目度): 8.746356552694094
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual token compression for vision--language models (VLMs) has largely relied on criteria such as attention, redundancy, and uncertainty to maximize average accuracy under a fixed compute budget, implicitly assuming that all errors carry equal cost. However, the consequence of an incorrect prediction on downstream tasks is rarely symmetric: misreading an invoice amount can be far more costly than misclassifying a background color. Motivated by this, we introduce consequence-sensitive visual token compression, which allocates visual computation across requests according to their potential error costs. Our method follows a calibrate-then-allocate procedure, estimating consequence-specific error-budget curves offline and applying the calibrated token budgets online using consequence signals available from question or task information. On a controlled within-task benchmark, high- and low-consequence questions are drawn from the same document images, so content alone cannot reveal which questions are costly to get wrong. In this setting, our method reduces high-stakes errors from 0.300 to 0.133 under the same total token budget, whereas a content-driven allocator performs no better than uniform allocation. Measuring how error rates change with token budget across different cost ratios, we derive an allocation frontier: uniform allocation is optimal when errors are equally costly, and token transfer toward high-consequence questions becomes increasingly beneficial as the cost gap grows. This allocation principle generalizes well across three dense vision-language benchmarks, two budget realization mechanisms (token deletion and resolution reallocation), two VLM architectures, and multiple token selection strategies. On a realistic mixed workload, consequence-sensitive allocation reduces cost-weighted error by 38% while achieving approximately 21% lower latency than full-resolution inference.
- Abstract(参考訳): 視覚言語モデル(VLM)の視覚トークン圧縮は、注意力、冗長性、不確実性などの基準に大きく依存しており、全てのエラーが同等のコストを負担すると暗黙的に仮定している。
しかし、下流タスクにおける誤った予測の結果が対称であることは滅多になく、請求額の誤読は背景色を誤分類するよりもはるかにコストがかかる。
そこで我々は,その潜在的なエラーコストに応じて,要求に対して視覚的計算を割り当てる,結果に敏感な視覚トークン圧縮を導入する。
提案手法は, 正当性評価手法に従って, 結果特異的な誤差予算曲線をオフラインで推定し, 質問情報やタスク情報から得られる結果信号を用いて, 正当性評価トークン予算をオンラインに適用する。
制御されたタスク内ベンチマークでは、同じドキュメントイメージから高頻度および低頻度の質問が引き出されるため、コンテンツだけでは間違いを犯すのにどの質問がコストがかかるかを明らかにすることはできない。
この設定では, コンテント駆動アロケータは均一なアロケータのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータが一様であるのに対して, トークンのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータのアロケータは, 最大値のアロケータのアロケータのアロケータのアロケータ
異なるコスト比でトークンの予算がどう変わるかを測定することで、割り当てフロンティアを導きます: 均一な割り当ては、エラーが等しくコストがかかるときに最適であり、コストギャップが大きくなるにつれて、高頻度の質問へのトークン転送が益々多くなります。
この割り当て原理は、3つの高密度ビジョン言語ベンチマーク、2つの予算実現機構(トークン削除と解像度再配置)、2つのVLMアーキテクチャ、および複数のトークン選択戦略をうまく一般化する。
現実的な混合ワークロードでは、結果に敏感なアロケーションは、コスト重み付けエラーを38%削減すると同時に、フル解像度の推論よりも約21%のレイテンシを実現する。
関連論文リスト
- Not All Errors Are Equal: Consequence-Aware Reasoning Compute Allocation [5.523004155648451]
本稿では,結果認識型テスト時間計算アロケーションを提案する。
我々はSWE-bench Liteの実験を行い、Multi-SWE-bench mini上でのクロスデータセット動作を評価する。
論文 参考訳(メタデータ) (2026-06-03T03:29:57Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - Instance-Optimal Estimation with Multiple LLM Judges on a Budget [84.31744861038106]
我々は、この問題を*予算付きヘテロスケダティックなマルチジャッジ推定*として定式化する。
K$のプロンプト-レスポンスペア、J$の既知のコストと未知のクエリ-ジャッジ分散が与えられた場合、目標は、$ell_p$-errorを最小化しながら、有界スコアベクトルを推定することである。
EST-IVWEは,予算の低次項までのオラクルIVWEレートと一致していることを示す。
論文 参考訳(メタデータ) (2026-05-22T08:26:08Z) - Instance-Level Costs for Nuanced Classifier Evaluation [1.0481606990674208]
コンテンツモデレーション、医療スクリーニング、安全クリティカルなアプリケーションでは、明確なケースのミスは曖昧なケースのエラーよりもはるかにコストがかかる。
本研究では, 正規化過剰コスト (NEC) を提案する。これは, サンプル毎のコストによる分類誤差を重み付けし, コストが均一な場合に標準誤差率に還元する指標である。
論文 参考訳(メタデータ) (2026-05-04T20:19:21Z) - Agentic AI Systems Should Be Designed as Marginal Token Allocators [2.629665653283008]
エージェントAIシステムは,電子トークン割り当て経済として設計・評価されるべきである,と我々は主張する。
これら4つの層がいずれも,Emphsame 1次条件を解決していることを示す。
論文 参考訳(メタデータ) (2026-05-02T03:06:02Z) - e1: Learning Adaptive Control of Reasoning Effort [88.51897900019485]
AIモデルの思考予算の増大は、精度を大幅に向上させるが、すべての質問が同じ量の推論を保証しているわけではない。
ユーザは、アウトプットの品質を、レイテンシやコストに対してどのように評価するかによって、さまざまな理由付けの労力を割り当てる傾向があります。
本稿では,ユーザが指定したトークン数を用いてモデルを学習する自己適応型強化学習手法であるAdaptive Effort Controlを提案する。
論文 参考訳(メタデータ) (2025-10-30T23:12:21Z) - R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning [80.104336426172]
CoT(Chain-of- Thought)は、大規模言語モデルの問題解決能力を高める。
CoTは長い自己回帰軌道のためにかなりの推論コストを発生させる。
トレーニング不要なハイブリッドデコーディングフレームワークであるR-Stitchを紹介する。
論文 参考訳(メタデータ) (2025-07-23T08:14:36Z) - Sparsity Forcing: Reinforcing Token Sparsity of MLLMs [40.93786579652003]
マルチモーダル大規模言語モデル(MLLM)におけるトークンの分散性を,単純なRLベースのポストトレーニングフレームワークであるtextitSparsity Forcing を用いて明示的に強化する。
本手法では,複数ロールアウトを異なるトークン予算で実行し,効率(トーケン還元率)と性能(回答正当性)の両方を共同報酬として定式化することにより,効率・正確性トレードオフを探索する。
論文 参考訳(メタデータ) (2025-04-23T01:45:55Z) - Orthogonal Causal Calibration [55.28164682911196]
我々は、因果校正作業を標準(非因果予測モデル)の校正作業に還元する一般的なアルゴリズムを開発する。
以上の結果から,既存のキャリブレーションアルゴリズムを因果的設定に応用できることが示唆された。
論文 参考訳(メタデータ) (2024-06-04T03:35:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。