論文の概要: GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models
- arxiv url: http://arxiv.org/abs/2607.09080v1
- Date: Fri, 10 Jul 2026 03:58:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.775903
- Title: GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models
- Title(参考訳): GeoTrace:ビデオ大言語モデルのための幾何学的軌道トーケン圧縮
- Authors: Guohuan Xie, Mengqi Lei, Chuan Shi, Wei Bao, Yue Gao, Siqi Li,
- Abstract要約: GeoTraceは、ビデオ大言語モデルのためのトレーニング不要なトークン圧縮フレームワークである。
ビデオ証拠を正確な骨格トークンと追跡可能な残留イベントトークンに分解する。
99.1%のバニラ性能を維持しながら(12.99タイム)のTFLOP削減を実現している。
- 参考スコア(独自算出の注目度): 25.376020984792845
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Although Video Large Language Models (Video LLMs) have shown strong performance in video understanding, their efficiency is still limited by the large number of visual tokens. Existing video token compression methods typically rely on frame-wise saliency or heuristic token merging, which can over-focus on locally salient regions and produce ambiguous fused features. To address these issues, we propose GeoTrace, a training-free spatiotemporal token compression framework that decomposes video evidence into exact skeleton tokens and traceable residual event tokens. Specifically, Contextual Farthest-Point Anchoring (CFPA) preserves salient, context-consistent, and high-coverage skeleton tokens, while Trajectory-Constrained Residual Condensation (TCRC) compresses residual tokens through one-to-one temporal trajectories and constrained near-manifold condensation, producing traceable event tokens with reduced ambiguity. We evaluate GeoTrace on four Video LLMs across four video understanding benchmarks, and the results demonstrate its effectiveness and generalization across different model architectures and scenarios. On LLaVA-OneVision, with only 10\% visual tokens retained, GeoTrace achieves a \(12.99\times\) TFLOPs reduction while preserving 99.1\% of the vanilla performance. Overall, GeoTrace offers a compact and traceable token representation for efficient and robust Video LLM inference. Code is available at \href{https://github.com/guohuan-xie/GeoTrace.git}{\texttt{Code}}.
- Abstract(参考訳): ビデオ大言語モデル (Video Large Language Models, ビデオLLM) はビデオ理解において高い性能を示しているが、その効率は多数の視覚トークンによって制限されている。
既存のビデオトークン圧縮法は、一般にフレームワイド・サリエンシ(英語版)やヒューリスティック・トークン・マージ(英語版)に頼っている。
これらの問題に対処するために,ビデオ証拠を正確なスケルトントークンとトレース可能な残留イベントトークンに分解する,トレーニング不要な時空間トークン圧縮フレームワークGeoTraceを提案する。
特に、CFPA(Contextual Farthest-Point Anchoring)は、正気性、文脈整合性、高被覆スケルトントークンを保存し、Trjectory-Constrained Residual Condensation(TCRC)は1対1の時間的軌跡を通して残留トークンを圧縮し、ほぼ1倍の縮合を制限し、曖昧さを低減したトレース可能なイベントトークンを生成する。
その結果,GeoTrace は 4 つのビデオ理解ベンチマークにおいて 4 つのビデオ LLM 上で評価し,その有効性と,異なるモデルアーキテクチャやシナリオにおける一般化を実証した。
LLaVA-OneVisionでは、10\%の視覚トークンしか保持していないが、GeoTraceは99.1\%のバニラ性能を維持しながら(12.99\times\) TFLOPsの削減を実現している。
全体としてGeoTraceは、高速で堅牢なビデオLLM推論のためのコンパクトでトレース可能なトークン表現を提供する。
コードは \href{https://github.com/guohuan-xie/GeoTrace.git}{\texttt{Code}} で公開されている。
関連論文リスト
- Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation [55.743701532984126]
我々はTrajSegを提案する。TrajSegはマルチモーダル大規模言語モデル上に構築されたシンプルで統一されたフレームワークである。
本研究では,MLLMが接頭辞(テキスト・トゥ・トラジェクティブ)と接頭辞(テキスト・トゥ・テキスト)の指示を受理する双方向テキスト・トラジェクティブアライメントを提案する。
このようにして、MLLMは、ビデオの対応性の向上と、より知覚的なオブジェクトの軌跡の恩恵を受けることができる。
論文 参考訳(メタデータ) (2026-03-23T02:25:51Z) - Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models [61.11154533305096]
ビデオ大言語モデル(VLLM)は、強力なビデオ理解を示すが、冗長な視覚トークンによる非効率性に悩まされる。
フレーム内およびフレーム間コンテキスト内でトークン textbfAnchors を詳述する新しい視点を提案する。
提案するAOTは,先行するビデオLLMのショート・ビデオベンチマークとロング・ビデオベンチマークの競合性能を比較検討する。
論文 参考訳(メタデータ) (2026-03-02T03:06:40Z) - TrajTok: Learning Trajectory Tokens enables better Video Understanding [63.1260672430712]
ビデオモデルのトークン化は、通常、パッチ化によって、過剰で冗長な数のトークンを生成する。
そこで我々は,ビデオモデルと完全に統合され,共にトレーニングされたビデオトークンモジュールであるTrajTokを提案する。
本稿では,前処理した視覚特徴量(TrajAdapter)の探索ヘッドとしてシームレスに統合できるか,特に長ビデオ推論において高い性能を持つ視覚言語モデル(TrajVLM)のアライメントコネクタとして利用できることを示す。
論文 参考訳(メタデータ) (2026-02-26T09:15:34Z) - MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding [13.02027465520324]
構造的検索とRLに基づく蒸留を統合したMARCを提案する。
MARCは1フレームのトークンのみを使用してほぼベースラインの精度を達成する。
これにより、リソース制約のある環境での効率的なリアルタイムビデオ理解の可能性を示す。
論文 参考訳(メタデータ) (2025-10-09T08:07:19Z) - LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs [23.801172170798132]
LLaVA-Scissorは、マルチモーダルな大規模言語モデルのために設計された、トレーニング不要なトークン圧縮戦略である。
本稿では,セマンティック・コネクテッド・コンポーネント(SCC)のアプローチを活用し,包括的セマンティック・カバレッジを確保することを提案する。
我々は,LLaVA-Scissorのトークン圧縮性能を多様なビデオ理解ベンチマークで広範囲に評価する。
論文 参考訳(メタデータ) (2025-06-27T02:29:58Z) - VQToken: Neural Discrete Token Representation Learning for Extreme Token Reduction in Video Large Language Models [35.38573641029626]
最小限の離散トークンを用いてビデオ全体を表現することを目的としたExtreme Short Token Reductionという新しいタスクを紹介した。
Extreme Short Token Reductionタスクでは、私たちのVQTokenはシーケンスをオリジナルの長さのわずか0.07パーセントまで圧縮し、NextQA-MCベンチマークでは0.6%の精度しか達成していません。
論文 参考訳(メタデータ) (2025-03-21T09:46:31Z) - HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models [63.65066762436074]
HiTVideoは、テキストからビデオ生成タスクにおける既存のビデオトークンの潜在的な制限を解決することを目的としている。
マルチレイヤの離散トークンフレームワークを備えた3D因果VAEを使用し、ビデオコンテンツを階層的に構造化されたコードブックにエンコードする。
論文 参考訳(メタデータ) (2025-03-14T15:36:39Z) - VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive
Learning [82.09856883441044]
ビデオ理解は、内部接続をモデル化するグローバルコンテンツを認識することに依存している。
空間領域と時間領域の両方で隣接するビデオトークンをマスクするブロックワイズ戦略を提案する。
また、グローバルコンテンツをさらにキャプチャするために、拡張不要なコントラスト学習手法も追加する。
論文 参考訳(メタデータ) (2021-06-21T16:48:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。