論文の概要: Position Is All You Need: A Free Lunch Token Compression Strategy for MLLM-based Referring Expression Segmentation
- arxiv url: http://arxiv.org/abs/2608.26142v1
- Date: Fri, 26 Jun 2026 13:20:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.361681
- Title: Position Is All You Need: A Free Lunch Token Compression Strategy for MLLM-based Referring Expression Segmentation
- Title(参考訳): MLLMを用いた参照式セグメンテーションのためのフリーランチトークン圧縮戦略
- Abstract要約: Referring Expression (RES) は、複雑で暗黙的なテキストクエリからピクセル単位のセグメンテーションマスクを生成することを目的としている。
PAYNは、位置情報のみに依存する、プラグアンドプレイでトレーニング不要なトークン圧縮手法である。
- 参考スコア(独自算出の注目度): 38.604055698797715
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Referring Expression Segmentation (RES) aims to generate pixel-wise segmentation masks from complex and implicit textual queries. While recent advances in Multimodal Large Language Models (MLLMs) have substantially boosted RES performance, their prohibitive computational overhead remains a critical bottleneck, which, however, is rarely explored. To fill this gap, we first evaluate typical token compression methods on this task and observe a surprising performance degradation. In this paper, we aim to understand this phenomenon for a solution. By extensive experiments, we find that token compression for RES requires preserving the original position embeddings and local neighboring spatial structures, indicating that visual token position information is far more critical than in other tasks. Building on this insight, we ask: Can we design the token compression method purely based on the position information? Therefore, we propose PAYN, a plug-and-play, training-free token compression method that relies solely on position information. PAYN retains tokens that are adequately distributed in every local neighboring region while strictly preserving original positional indices, thereby maintaining spatial relational consistency. Experiments on multiple RES benchmarks demonstrate that our method outperforms existing token compression methods, verifying that position is indeed all you need for token compression in the MLLM-based RES task. Codes are avaliable at https://github.com/YuhanLiu231/PAYN.
- Abstract(参考訳): Referring Expression Segmentation (RES)は、複雑で暗黙的なテキストクエリからピクセルワイズセグメンテーションマスクを生成することを目的としている。
MLLM(Multimodal Large Language Models)の最近の進歩は、RESの性能を大幅に向上させたが、その禁止的な計算オーバーヘッドは依然として重大なボトルネックであり、調査はめったに行われていない。
このギャップを埋めるために、まずこのタスクにおける典型的なトークン圧縮手法を評価し、驚くべき性能劣化を観察する。
本稿では,この現象を解法として理解することを目的とする。
広範囲な実験により、RESのためのトークン圧縮には、元の位置埋め込みと局所的な空間構造を保存する必要があり、視覚的トークン位置情報は、他のタスクよりもはるかに重要であることを示す。
私たちは、位置情報に基づいて純粋にトークン圧縮法を設計できますか?
そこで我々は,位置情報のみに依存する,プラグアンドプレイでトレーニング不要なトークン圧縮方式PAYNを提案する。
PAYNは、元の位置の指標を厳格に保ちながら、近隣各地域に適切に分布するトークンを保持し、空間的関係性を維持する。
複数のRESベンチマークの実験により、我々の手法は既存のトークン圧縮手法よりも優れており、MLLMベースのRESタスクにおいてトークン圧縮に必要な位置が本当にすべてであることを検証している。
コードはhttps://github.com/YuhanLiu231/PAYNで検証可能である。
関連論文リスト
- PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding [88.17174909130188]
LVLM(Large Vision-Language Models)は、視覚的な入力を高密度なトークンシーケンスにマッピングし、推論に二次的な計算ボトルネックを与える。
特徴抽出の労力を動的に分配する視覚トークン化アーキテクチャであるPARCELを紹介する。
PARCELは、既存のマトリシカベースラインを「一度にトレーニングし、どこにでもデプロイする」パラダイムを保ちながら、視覚障害者の予算で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-28T15:57:31Z) - Detecting Overflow in Compressed Token Representations for Retrieval-Augmented Generation [49.48204107529758]
我々はトークンオーバーフローを、圧縮された表現が与えられたクエリに応答する十分な情報を含んでいない状態として定義する。
本稿では,非圧縮トークン表現から,クエリ非依存の飽和統計を確実に分離することを見出した。
クエリとコンテキストの両方のxRAG表現上の軽量なプローブ分類器は平均0.72 AUC-ROCでオーバーフローを検出する。
これらの結果は、クエリ非依存の診断からクエリ対応検出まで進歩し、低コストのプレLLMゲーティングにより、圧縮によるエラーを軽減できる。
論文 参考訳(メタデータ) (2026-02-12T18:15:08Z) - CORE: Compact Object-centric REpresentations as a New Paradigm for Token Merging in LVLMs [29.08277140543501]
視覚的トークン圧縮のための新しいパラダイムであるCORE(Compact Object-centric Representation)を紹介する。
COREは効率的なセグメンテーションデコーダを利用してオブジェクトマスクを生成する。
実験により、COREは固定レート圧縮のための6つの信頼性ベンチマークに対して新しい最先端のベンチマークを確立するだけでなく、適応レート設定において劇的な効率向上を達成することが示された。
論文 参考訳(メタデータ) (2025-11-18T03:02:23Z) - LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs [23.801172170798132]
LLaVA-Scissorは、マルチモーダルな大規模言語モデルのために設計された、トレーニング不要なトークン圧縮戦略である。
本稿では,セマンティック・コネクテッド・コンポーネント(SCC)のアプローチを活用し,包括的セマンティック・カバレッジを確保することを提案する。
我々は,LLaVA-Scissorのトークン圧縮性能を多様なビデオ理解ベンチマークで広範囲に評価する。
論文 参考訳(メタデータ) (2025-06-27T02:29:58Z) - VQToken: Neural Discrete Token Representation Learning for Extreme Token Reduction in Video Large Language Models [35.38573641029626]
最小限の離散トークンを用いてビデオ全体を表現することを目的としたExtreme Short Token Reductionという新しいタスクを紹介した。
Extreme Short Token Reductionタスクでは、私たちのVQTokenはシーケンスをオリジナルの長さのわずか0.07パーセントまで圧縮し、NextQA-MCベンチマークでは0.6%の精度しか達成していません。
論文 参考訳(メタデータ) (2025-03-21T09:46:31Z) - DAST: Context-Aware Compression in LLMs via Dynamic Allocation of Soft Tokens [20.044306399439265]
LLM(Large Language Models)は、長いコンテキスト入力を扱う際に、計算の非効率性と冗長な処理に直面する。
我々は,LLMの文脈関連性に関する本質的な理解を活用して圧縮を誘導する簡易かつ効果的な手法であるDAST(Dynamic Allocation of Soft Tokens)を提案する。
複数のベンチマークでの実験結果から、DASTが最先端の手法を超越していることが示されている。
論文 参考訳(メタデータ) (2025-02-17T06:55:13Z) - Position IDs Matter: An Enhanced Position Layout for Efficient Context Compression in Large Language Models [34.92897341188079]
文脈情報を圧縮するために特別なトークンを使うことは、大規模言語モデル(LLM)の一般的な慣習である。
位置IDの調整のみでLLMの文脈圧縮能力を向上させる手法であるtextbfEnhanced Position Layout (EPL) を提案する。
論文 参考訳(メタデータ) (2024-09-22T08:51:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。