論文の概要: GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.23913v1
- Date: Mon, 27 Jul 2026 01:06:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.266266
- Title: GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models
- Title(参考訳): GOTS:高分解能ビジョンランゲージモデルのためのGreedy Orthogonal Token選択
- Abstract要約: Greedy Orthogonal Token Selection (GOTS)は、視覚的トークン削減のためのトレーニング不要でクエリに依存しない方法である。
GOTSは最強評価ベースラインよりも高い平均性能保持を実現する。
OCR選択のオーバーヘッドを考慮した後、モデル側のタイム・ツー・ファースト・トークンを削減する。
- 参考スコア(独自算出の注目度): 9.490341327220987
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern vision-language models (VLMs) increasingly rely on dynamic or high-resolution visual encoding, producing thousands of visual tokens that substantially increase downstream language-model inference cost. Existing token-reduction methods assess token utility through token-wise importance, query relevance, coverage, pairwise diversity, or subset-level objectives. Our key insight is to view visual token reduction through selected-span complementarity: instead of scoring a token in isolation or through pairwise relations, we assess how much of its feature is orthogonal to the span of the already retained subset. Based on this perspective, we propose Greedy Orthogonal Token Selection (GOTS), a training-free and query-agnostic method. At each step, GOTS selects the token with the largest residual energy orthogonal to the current retained span. This rule exactly maximizes the one-step augmented Gram determinant among candidate additions, giving each greedy step a precise local geometric guarantee for subset expansion. Across five high-resolution VLM backbones from the Qwen-VL and InternVL families and eleven diverse benchmarks, GOTS achieves higher average performance retention than the strongest evaluated baselines, and a controlled OCRBench study shows that it reduces model-side time-to-first-token after accounting for selection overhead. Code is available at https://github.com/newLLing/GOTS.
- Abstract(参考訳): 現代の視覚言語モデル(VLM)は、動的または高解像度の視覚符号化にますます依存しており、下流の言語モデル推論コストを大幅に増加させる数千の視覚トークンを生み出している。
既存のトークン推論メソッドはトークンワイドの重要度、クエリ関連性、カバレッジ、ペアワイドの多様性、サブセットレベルの目的を通じてトークンの有用性を評価する。
我々の重要な洞察は、選択されたスパンの相補性による視覚的トークンの減少を眺めることである。トークンを分離またはペア関係でスコアする代わりに、すでに保持されているサブセットの幅に対して、その機能のどの程度が直交しているかを評価する。
この観点から,学習自由でクエリに依存しないGreedy Orthogonal Token Selection (GOTS)を提案する。
各ステップでGOTSは、現在の保持スパンに直交する最大の残留エネルギーを持つトークンを選択する。
この規則は、候補加法のうちの1段階の拡張グラム決定式を正確に最大化し、各グリーディステップは、部分集合拡大の正確な局所幾何学的保証を与える。
Qwen-VL と InternVL の 5 つの高分解能 VLM バックボーンと 11 の多様なベンチマークにおいて,GOTS は最強評価ベースラインよりも高い平均性能保持を達成する。
コードはhttps://github.com/newLLing/GOTS.comで入手できる。
関連論文リスト
- StackTok: Accelerating VLMs Inference with Budget-Adaptive Visual Token Selection [17.809800994999225]
StackTokはトレーニング不要のセレクタで、クエリ関連を客観的かつ視覚的なカバレッジとして扱い、予算の校正サポートとして扱う。
試験されたすべてのモデルにおいて、トレーニング不要のセレクタの中では、第1位である。
高解像度のLLaVA-NeXT-7Bでは、95.26%のフルトーケン性能を保ち、2,880 (5.6%) の視覚トークンしか持たない。
論文 参考訳(メタデータ) (2026-09-15T08:35:57Z) - Stepwise Token Selection for Efficient Multimodal Large Language Models [0.7233065479782755]
本稿では,情報トークンを反復的に選択し,事前に選択したトークンに対して各決定を条件付けし,いつ停止するかを動的に決定するポインタスタイルの選択機構を提案する。
視覚トークンの88.9%を除去するアグレッシブプルーニングでは、初期精度の94.6%を保ち、プリフィル遅延の1.88倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2026-06-14T23:50:08Z) - [CLS] is Not Enough: Multi-Label Recognition via Patch-Level Inference and Adaptive Aggregation [20.637119409165418]
PIAAは、アダプティブアグリゲーション(Adaptive Aggregation)によって、パッチレベルの推論として予測を定式化する。
パッチレベルのスコアを最終的なマルチラベル予測に集約するアダプティブアグリゲーションモジュールを導入する。
実験の結果,提案手法は最小限の余剰計算で強い改善を達成できることがわかった。
論文 参考訳(メタデータ) (2026-05-25T13:19:12Z) - Unlearning What Matters: Token-Level Attribution for Precise Language Model Unlearning [5.454773103061359]
TokenUnlearnはトークンレベルの属性フレームワークで、クリティカルトークンを特定し、選択的にターゲットする。
提案手法は,マスキングによる知識認識信号とエントロピー認識信号を組み合わせて,正確なトークン選択のための重要スコアを得る。
論文 参考訳(メタデータ) (2026-05-01T02:59:03Z) - Continuous Autoregressive Language Models [56.49239051750678]
我々はCALM(Continuous Autoregressive Language Models)を紹介する。
CALMは高忠実度オートエンコーダを使用して、Kトークンの塊を1つの連続ベクトルに圧縮する。
我々は、堅牢なトレーニング、評価、および制御可能なサンプリングを可能にする包括的可能性のないフレームワークを開発する。
論文 参考訳(メタデータ) (2025-10-31T17:58:11Z) - SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs [59.415473779171315]
textbfSaliency-textbfCoverage textbfOriented token textbfPruning for textbfEfficient MLLMs。
論文 参考訳(メタデータ) (2025-10-28T09:29:37Z) - ssToken: Self-modulated and Semantic-aware Token Selection for LLM Fine-tuning [51.133569963553576]
ssTokenは自己変調されたセマンティックなToken Selectionアプローチである。
自己変調の選択とセマンティック・アウェアの選択の両方が、フルデータの微調整よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-10-21T03:21:04Z) - ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models [7.7352936204066]
本稿では,タスク関連性と情報多様性のバランスとして,視覚トークンプルーニングをモデル化する新しいゼロショット手法を提案する。
本手法は,精度の低下を最小限に抑えて,最先端技術に適合または超越した性能を実現する。
これらのゲインには、GPUメモリフットプリントの大幅な削減と推論レイテンシが伴っている。
論文 参考訳(メタデータ) (2025-10-20T06:18:47Z) - IGD: Token Decisiveness Modeling via Information Gain in LLMs for Personalized Recommendation [79.22388408461458]
我々は,トークン決定性をチューニングと復号の両方に統合する情報ゲインに基づく決定性対応トークンハンドリング(IGD)戦略を導入する。
IGDはリコメンデーションの精度を一貫して改善し、強力なベースラインに比べて広く使われているランキングの指標で顕著に向上した。
論文 参考訳(メタデータ) (2025-06-16T08:28:19Z) - Reinforcing Video Reasoning with Focused Thinking [65.85683941058916]
本稿では,集中的思考と深い報酬の粒度で視覚的推論を強化する新しいフレームワークであるTW-GRPOを提案する。
具体的には,高情報密度のトークンを優先するトークン重み付け機構を用いる。
また,シングルチョイスからマルチチョイスQAタスクにシフトすることで,RLトレーニングを再構築する。
論文 参考訳(メタデータ) (2025-05-30T15:42:19Z) - Vector Quantized Wasserstein Auto-Encoder [57.29764749855623]
生成的視点から深層離散表現を学習する。
我々は,コードワード列上の離散分布を付与し,コードワード列上の分布をデータ分布に伝達する決定論的デコーダを学習する。
WS 距離のクラスタリングの観点と結びつけて,より優れた,より制御可能なクラスタリングソリューションを実現するための,さらなる理論を開発しています。
論文 参考訳(メタデータ) (2023-02-12T13:51:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。