論文の概要: Query Independent Variable Rate Visual Token Coding
- arxiv url: http://arxiv.org/abs/2610.00204v1
- Date: Sun, 20 Sep 2026 15:54:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.396949
- Title: Query Independent Variable Rate Visual Token Coding
- Title(参考訳): クエリ独立変動率ビジュアルトークン符号化
- Abstract要約: 視覚モデルのための視覚言語圧縮は、ほとんどすべて選択問題として提案されている。
代わりに、古典的なトランスフォーメーションコーディングツールキットの残りの半分を取ります。
変換符号は各トークンの測定した歪み-レート曲線を公開し、固定ビット予算は正確な整数レート-歪み最適化によりトークン間で分散される。
- 参考スコア(独自算出の注目度): 8.475291160927828
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual-token compression for vision--language models is posed almost entirely as a selection problem: decide which tokens to keep and discard the rest. The criteria that work best rank tokens by the attention the language model pays them, which makes the ranking a function of the question being asked. That is invisible in a single-turn benchmark and decisive whenever a compressed representation is written once and read many times, as when it is cached across the turns of a conversation or transmitted between a device and a server. We take the other half of the classical transform-coding toolkit instead: keep every token and vary its rate. A transform code exposes each token's measured distortion--rate curve, and a fixed bit budget is distributed across tokens by exact integer rate--distortion optimisation on those curves. No text enters the pipeline, so one compressed representation serves any query. At equal bit budgets, on two datasets and two capacities, it preserves the model's output distribution and its answers better than uniform-rate coding, the closed-form water-fill and distortion-ranked pruning. It matches attention-ranked pruning on the question pruning was tuned for, and overtakes it once the compressed image must answer a different question about the same image.
- Abstract(参考訳): 視覚言語モデルに対する視覚的な圧縮は、ほとんど完全に選択の問題として提示される。
言語モデルの注意によって最もうまく機能する基準は、それらに支払うもので、ランク付けは質問される質問の機能となる。
これはシングルターンのベンチマークでは見えず、圧縮された表現が一度書き、何度も読み込まれると決定的になる。
代わりに、古典的なトランスフォーメーションコーディングツールキットの残りの半分を取ります。
変換符号は各トークンの測定した歪み率曲線を公開し、固定ビット予算はそれらの曲線上の正確な整数率-歪みの最適化によってトークンに分散される。
パイプラインにテキストは入らないので、圧縮された表現はどんなクエリにも役立ちます。
等ビットの予算では、2つのデータセットと2つの能力で、一様レートの符号化、クローズドフォームのウォーターフィル、歪みランクのプルーニングよりもモデルの出力分布と解を保存できる。
これは、プルーニングが調整された質問に対して、注目度の高いプルーニングと一致し、圧縮された画像が同じ画像に関する別の質問に答えなければならないと、それを上回ります。
関連論文リスト
- CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models [9.660619113725843]
我々はCRAFT: Resive Adaptive Fusion Video Tokensによる圧縮を提案する。
CRAFTは、最先端のトークン圧縮手法よりも一貫して優れている。
圧縮価格は約8ドルで、バックボーンの平均精度の約97%を保持します。
論文 参考訳(メタデータ) (2026-08-03T03:27:46Z) - Where Does Generative Difficulty Reside? An Empirical Study of Target Representations [62.54876287800644]
ターゲット表現は、イメージジェネレータが学ぶ必要がある分布を定義するが、しばしば交換可能なインターフェースとして扱われる。
マスク付き自己回帰整流モデルにおいて,生画素,SD-VAE潜伏剤,DINOv2,MAE表現-オートエンコーダの特徴について検討した。
その結果, 圧縮, 再構成忠実度, トークン次元, 可視的セマンティッククラスタリングは生成挙動を個別に予測できないことがわかった。
論文 参考訳(メタデータ) (2026-08-01T12:32:31Z) - CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding [13.113776703707634]
CodeShrinkは適応的なビジュアル圧縮フレームワークで、3つのコンポーネントがある。
Blank-Free Renderingは、ホワイトスペースに依存したレイアウトを、コンパクトなレイアウトと明示的な構造マーカーに置き換え、レイアウトによって引き起こされるトークンを削除する。
支配的トークン選択は、推論中にタスク非関連な視覚トークンをプーンするために、命令とコードイメージを共同で解析する。
論文 参考訳(メタデータ) (2026-07-31T17:15:51Z) - SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation [0.0]
大規模言語モデルは、メモリフットプリントがコンテキスト長とともに線形に増加するキー値(KV)キャッシュに依存して、テキストを自動回帰的に生成する。
最近の圧縮法はトークンマージによるコストを軽減している。
これらの制約に対処するKVキャッシュ圧縮のためのトレーニングフリーでデュアルコンポーネントのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-19T17:44:56Z) - QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compression [35.802647459700125]
視覚トークンを3つの協調ブランチを介して適応的に圧縮する新しいフレームワークを提案する。
QMoPはメモリ、計算、推論時間を大幅に節約する。
論文 参考訳(メタデータ) (2026-03-22T13:42:24Z) - Gramformer: Learning Crowd Counting via Graph-Modulated Transformer [68.26599222077466]
Gramformerはグラフ変調変換器で、それぞれ注意点と入力ノードの特徴を調整してネットワークを強化する。
ノードの集中位置や重要性を発見するために,特徴に基づく符号化を提案する。
提案手法の競争性を検証した4つの挑戦的群集カウントデータセットの実験を行った。
論文 参考訳(メタデータ) (2024-01-08T13:01:54Z) - Object Recognition as Next Token Prediction [99.40793702627396]
オブジェクト認識を次のトークン予測として提案する。
その考え方は、画像埋め込みからフォームラベルへのテキストトークンの自動回帰予測を行う言語デコーダを適用することである。
論文 参考訳(メタデータ) (2023-12-04T18:58:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。