論文の概要: RUTA: Principled Visual Token Allocation via Rate-Utility Optimization
- arxiv url: http://arxiv.org/abs/2608.04132v1
- Date: Tue, 04 Aug 2026 18:37:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.581217
- Title: RUTA: Principled Visual Token Allocation via Rate-Utility Optimization
- Title(参考訳): RUTA: 利率-ユーティリティ最適化による原則的ビジュアルトークン割り当て
- Authors: Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma,
- Abstract要約: 高解像度の画像と長いビデオは、マルチモーダル推論ときめ細かい知覚のためのリッチコンテキストの視覚言語モデルを提供する。
本稿では,トークンが保持するトークンを共同学習することでLLM前還元を行う,原則化された利率-実用トークン割当手法であるRUTAを紹介する。
RUTAは、ダウンストリームタスク損失と期待されるトークン使用量のバランスをとる、ペナルティ化されたレートユーティリティーの目標で最適化されている。
- 参考スコア(独自算出の注目度): 39.416519746709305
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-resolution images and long videos provide vision-language models with rich context for multimodal reasoning and fine-grained perception, but the resulting long visual token sequences make large language model-side computation and memory costly. Existing visual token reducers often operate at prescribed rates, while recent methods adapt token counts across inputs using method-specific learned thresholds or importance predictors. We introduce RUTA, a principled Rate-Utility Token Allocation method that performs pre-LLM reduction by jointly learning which tokens to retain and how many to allocate to each image-query pair. RUTA constructs query-conditioned candidate tokens and predicts a retention probability for each candidate. During training, these probabilities parameterize independent Bernoulli gates, while their sum provides a differentiable training-time estimate of the token count for each pair. Retained tokens serve as anchors that aggregate information from non-retained tokens according to semantic affinity and spatial proximity. RUTA is optimized with a penalized rate-utility objective that balances downstream task loss against expected token usage. Averaged across five benchmarks and measured relative to each backbone's full-token baseline, RUTA uses only $2.0\%$ and $4.2\%$ of visual tokens while preserving $88.2\%$ and $94.4\%$ of task performance on LLaVA-NeXT-7B and Qwen3-VL-8B, respectively.
- Abstract(参考訳): 高解像度の画像と長いビデオは、マルチモーダル推論と微粒化知覚のためのリッチなコンテキストを持つ視覚言語モデルを提供するが、結果として生じる長い視覚トークンシーケンスは、大きな言語モデルサイドの計算とメモリをコストがかかる。
既存のビジュアルトークンリデューサは、しばしば所定のレートで動作し、最近の手法では、メソッド固有の学習しきい値や重要な予測器を使用して、入力にトークン数を適用する。
本稿では,各画像クエリー対にどのトークンを割り当てるかを共同で学習し,LLM前還元を行う,原則付き利便トークン割当手法であるRUTAを紹介する。
RUTAはクエリ条件付き候補トークンを構築し、各候補に対する保持確率を予測する。
訓練中、これらの確率は独立したベルヌーイゲートをパラメータ化し、それらの和は各ペアのトークン数に対する異なる訓練時間推定を提供する。
保持トークンは、意味親和性と空間的近接性に応じて、保持されていないトークンから情報を集約するアンカーとして機能する。
RUTAは、ダウンストリームタスク損失と期待されるトークン使用量のバランスをとる、ペナルティ化されたレートユーティリティーの目標で最適化されている。
5つのベンチマークで評価され、各バックボーンのフルトーケンベースラインに対して測定されたRUTAは、それぞれLLaVA-NeXT-7B と Qwen3-VL-8B のタスクパフォーマンスを 88.2\% と 94.4\% に保存しながら、わずか$2.0\% と$4.2\% のビジュアルトークンしか使用していない。
関連論文リスト
- LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference [63.932718076408584]
LASTは、エッジクラウド協調MLLM推論におけるクエリ依存のビジュアルトークンプルーニングのための、トレーニング不要のフレームワークである。
完全な精度の95.4%を維持し、視覚トークンの12.5%しか保持せず、エッジ側の選択オーバーヘッドは低く、クラウド側の計算は少ない。
論文 参考訳(メタデータ) (2026-07-30T09:59:25Z) - AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference [7.243327337529763]
Vision-Language Models (VLM) は、比較的少数のテキストトークンとともに、画像ごとに数千のビジュアルトークンを処理する。
本稿では,前処理前の視覚トークンにアグレッシブプルーニングを適用したAsymVLMを提案する。
実験の結果,AsymVLMは最先端手法のうち,最大54%のFLOPを節約できることがわかった。
論文 参考訳(メタデータ) (2026-05-28T07:49:45Z) - SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs [59.415473779171315]
textbfSaliency-textbfCoverage textbfOriented token textbfPruning for textbfEfficient MLLMs。
論文 参考訳(メタデータ) (2025-10-28T09:29:37Z) - TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models [4.779482139419908]
テキストトークンと意味的に視覚トークンを除去する相互情報に基づくトークンプルーニング戦略を導入する。
LLaVA-15-7BやLLaVA-7Bといったモデルでは,テキストトークンを88.9%削減しながら高い性能を維持している。
論文 参考訳(メタデータ) (2025-08-30T02:43:50Z) - VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization [70.98122339799218]
LMM(Large Multimodal Models)は、多数の視覚トークンを微粒な視覚情報に活用することにより、視覚言語タスクに優れる。
推論中の視覚トークンを減らすことを目的とした以前の研究は、一般的に、視覚のみのトークンや視覚言語トークンの注意スコアから得られた重要マップを利用して、1つまたは複数のプルーニング段階にわたってトークンをプルーンする。
重要地図導出プロセスとリサイクル機構を備えたプログレッシブプルーニングモジュールを導入したトークンプルーニングフレームワークであるVFlowOptを提案する。
実験により、VFlowOptは、同等のパフォーマンスを維持しながら、90%のビジュアルトークンをプルークでき、KVキャッシュメモリが89%削減され、3.8になった。
論文 参考訳(メタデータ) (2025-08-07T09:47:21Z) - VQToken: Neural Discrete Token Representation Learning for Extreme Token Reduction in Video Large Language Models [35.38573641029626]
最小限の離散トークンを用いてビデオ全体を表現することを目的としたExtreme Short Token Reductionという新しいタスクを紹介した。
Extreme Short Token Reductionタスクでは、私たちのVQTokenはシーケンスをオリジナルの長さのわずか0.07パーセントまで圧縮し、NextQA-MCベンチマークでは0.6%の精度しか達成していません。
論文 参考訳(メタデータ) (2025-03-21T09:46:31Z) - Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters [54.01228554126122]
視覚言語モデル(VLM)は、様々な視覚的理解と推論タスクにまたがる強力な能力を示している。
推論コストを削減するために、LLM(Large Language Models)を縮小するか、イメージを表すのに必要な入力トークンの数を削減できる。
高速圧縮に適したトークン圧縮アルゴリズムを設計する第一歩を踏み出す。
論文 参考訳(メタデータ) (2024-11-05T18:54:21Z) - Adaptive Sparse ViT: Towards Learnable Adaptive Token Pruning by Fully
Exploiting Self-Attention [36.90363317158731]
最小限のコストで適応的なスパーストークンプルーニングフレームワークを提案する。
提案手法では,DeiT-Sのスループットを50%向上し,トップ1の精度は0.2%低下した。
論文 参考訳(メタデータ) (2022-09-28T03:07:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。