論文の概要: VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success
- arxiv url: http://arxiv.org/abs/2604.05323v1
- Date: Tue, 07 Apr 2026 01:52:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.568039
- Title: VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success
- Title(参考訳): VLA情報エントロピー(VLA-Info Entropy):ビジョン・ランゲージ・アクションモデル推論と成功のための学習自由ビジョン・アテンション情報エントロピーアプローチ
- Authors: Chuhang Liu, Yayun He, Zuheng Kang, Xiaoyang Qu, Jianzong Wang,
- Abstract要約: VLA(Vision-Language-Action)モデルは、視覚知覚、言語理解、行動決定を統合し、モーダルなセマンティックアライメントを実現する。
この問題に対処するために、画像エントロピーを用いて、各視覚トークンのグレースケール分布特性を定量化する。
提案手法は推論パラメータを減らし,推論速度を高速化し,既存の手法より優れていることを示す。
- 参考スコア(独自算出の注目度): 33.810242609054924
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models integrate visual perception, language understanding, and action decision-making for cross-modal semantic alignment, exhibiting broad application potential. However, the joint processing of high-dimensional visual features, complex linguistic inputs, and continuous action sequences incurs significant computational overhead and low inference efficiency, thereby hindering real-time deployment and reliability. To address this issue, we use image entropy to quantify the grayscale distribution characteristics of each visual token and introduce attention entropy to capture the distribution of attention scores over task-related text. Visual entropy identifies texture-rich or structurally informative regions, while attention entropy pinpoints semantically relevant tokens. Combined with timestep information, these metrics enable a dynamic transition strategy that shifts the model's focus from global visual features to attention-guided local informative regions. Thus, the resulting VLA-InfoEntropy method integrates spatial, semantic, and temporal cues to reduce redundancy while preserving critical content. Extensive experiments show that our method reduces inference parameters, accelerates inference speed, and outperforms existing approaches.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、視覚知覚、言語理解、行動決定を統合し、多種多様な応用可能性を示す。
しかし、高次元視覚特徴、複雑な言語入力、連続的な動作シーケンスの合同処理は、計算オーバーヘッドと推論効率の低下を招き、リアルタイムの展開と信頼性を損なう。
この問題に対処するために、画像エントロピーを用いて各視覚トークンのグレースケール分布特性を定量化し、注意エントロピーを導入し、タスク関連テキスト上での注目スコアの分布をキャプチャする。
視覚的エントロピーはテクスチャに富む領域や構造的に意味のある領域を識別し、注意エントロピーは意味的に関連するトークンを識別する。
タイムステップ情報と組み合わせることで、これらのメトリクスは、モデルの焦点をグローバルな視覚的特徴から注意を向けた局所的な情報領域にシフトする、動的移行戦略を可能にする。
したがって、VLA-InfoEntropy法は、空間的、意味的、時間的手がかりを統合して、臨界コンテンツを保存しながら冗長性を減少させる。
大規模な実験により,提案手法は推論パラメータを低減し,推論速度を加速し,既存手法より優れることが示された。
関連論文リスト
- VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions [51.41587958253802]
視覚情報を捨てることなく推論コストを削減するVISOR(VISion On Request)を導入する。
VISORは画像とテキストトークン間の相互作用をスパースすることで効率を向上する。
実験により、VISORは、最先端の結果を一致または超えながら、計算コストを大幅に削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T17:58:17Z) - Online Segment Any 3D Thing as Instance Tracking [60.20416622842975]
オンライン3Dセグメンテーションをインスタンス追跡問題として再認識する(AutoSeg3D)。
視覚基礎モデルに固有の断片化問題を緩和するために,空間整合性学習を導入する。
ScanNet200上でESAMを2.8 AP上回る新しい最先端技術を確立する。
論文 参考訳(メタデータ) (2025-12-08T14:48:51Z) - Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception [71.26728044621458]
DeCLIPは、CLIPを強化する新しいフレームワークで、自己認識モジュールを分離して、それぞれコンテンツ’と“コンテキスト’の機能を取得する。
2D検出とセグメンテーション、3Dインスタンスのセグメンテーション、ビデオインスタンスのセグメンテーション、6Dオブジェクトのポーズ推定など、幅広いタスクにわたる最先端のパフォーマンスを一貫して達成する。
論文 参考訳(メタデータ) (2025-08-15T06:43:51Z) - Make It Efficient: Dynamic Sparse Attention for Autoregressive Image Generation [8.624395048491275]
適応動的スパース注意(adaptive Dynamic Sparse Attention, ADSA)と呼ばれる新しい学習自由コンテキスト最適化手法を提案する。
ADSAは、局所的なテクスチャの整合性を維持するのに欠かせない歴史的トークンと、グローバルなセマンティック・コヒーレンスを確保するのに欠かせないトークンを特定し、効率的に注意を合理化する。
また、ADSAに適した動的KV-cache更新機構を導入し、推論中のGPUメモリ消費量を約50%削減する。
論文 参考訳(メタデータ) (2025-06-23T01:27:06Z) - Mitigating Hallucination in Large Vision-Language Models through Aligning Attention Distribution to Information Flow [9.561772135477883]
LVLM(Large Vision-Language Models)は同じアーキテクチャに従っており、視覚情報は徐々に意味表現に統合される。
我々は,モデルの注意分布が意味表現に十分に重点を置いていないことを観察する。
このミスアライメントはモデルの視覚的理解能力を損なうものであり、幻覚に寄与する。
論文 参考訳(メタデータ) (2025-05-20T12:10:13Z) - Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning [70.57180215148125]
ビジュアルインストラクションチューニングは、大きな言語モデルで視覚世界を理解できるようにすることを目的としている。
既存の手法は、精度と効率の間の難解なトレードオフに悩まされることが多い。
LLaVA-Meteorは,コア情報を妥協することなく,視覚トークンを戦略的に圧縮する手法である。
論文 参考訳(メタデータ) (2025-05-17T10:22:29Z) - Variational Structured Attention Networks for Deep Visual Representation
Learning [49.80498066480928]
空間的注意マップとチャネル的注意の両方を原則的に共同学習するための統合的深層フレームワークを提案する。
具体的には,確率的表現学習フレームワークに注目度の推定と相互作用を統合する。
ニューラルネットワーク内で推論ルールを実装し,確率パラメータとcnnフロントエンドパラメータのエンドツーエンド学習を可能にする。
論文 参考訳(メタデータ) (2021-03-05T07:37:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。