論文の概要: VL2Spike: Spike-driven Distillation from VLMs for Low-Power Visual Perception in Embodied AI
- arxiv url: http://arxiv.org/abs/2606.15898v1
- Date: Sun, 14 Jun 2026 16:29:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 18:36:04.92506
- Title: VL2Spike: Spike-driven Distillation from VLMs for Low-Power Visual Perception in Embodied AI
- Title(参考訳): VL2Spike: 身体的AIにおける低消費電力視覚知覚のためのVLMからのスパイク駆動蒸留
- Abstract要約: スパイキングニューラルネットワーク(SNN)は、スパーススパイクで計算する、脳にインスパイアされたイベント駆動モデルである。
スパイク自己注意を伴うスパイキング・トランスフォーマーモデルの出現は、純粋なSNNの学習能力を大幅に向上させた。
本稿では,コンパクトなスパイクフォーマーモデルを用いた視覚言語モデルからマルチモーダルな知識をブリッジする,スパイクベースの知識蒸留フレームワークを提案する。
- 参考スコア(独自算出の注目度): 17.283270065431235
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Spiking neural networks (SNNs) are brain-inspired, event-driven models that compute with sparse spikes, which enables highly efficient visual perception in resource-constrained embodied AI models. The emergence of Spiking-Transformer models with spike self-attention has substantially improved the learning capacity of pure SNNs. Although SNNs are energy efficient, their performance is still limited by the spike-based architecture and optimization challenges, as standard gradient descent rules cannot be directly applied. Recently, vision-language models (VLMs) have shown rich multi-modal knowledge representation capabilities for visual perception. Thus, it is promising to leverage VLMs for better Spikformer training. To this end, we present VL2Spike, a novel spike-based knowledge distillation (KD) framework that bridges multi-modal knowledge from VLMs with compact Spikformer models. This design enhances the learning capacity of Spikformer models while preserving their energy-efficiency merits, thereby offering a practical pathway toward low-power robotic perception. Our VL2Spike brings two key technical contributions. To align with spiking dynamics, we first propose spatial-temporal visual spike (SVS) distillation, which achieves (1) shared manifold alignment between VLM image features and spike tokens, and (2) warm-started temporal consistency on membrane potentials and spike rates. We then design a novel spike prototype-guided linguistic (SPL) distillation strategy that aligns Spikformer's class prototypes and logits with promptable VLM text embeddings. Extensive experiments show that VL2Spike achieves 6.81% gain across three static datasets with only 15.7% energy consumption. It also exhibits strong generalization capacity on robotic visual place recognition (VPR) with a gain of 6.63%, highlighting its potential for low-power perception in embodied AI.
- Abstract(参考訳): スパイキングニューラルネットワーク(SNN)は、スパーススパイクで計算する、脳にインスパイアされたイベント駆動モデルである。
スパイク自己注意を伴うスパイキング・トランスフォーマーモデルの出現は、純粋なSNNの学習能力を大幅に向上させた。
SNNはエネルギー効率が高いが、標準的な勾配降下規則を直接適用できないため、スパイクベースのアーキテクチャと最適化の課題によって性能は依然として制限されている。
近年、視覚言語モデル (VLM) は視覚知覚のための多モーダルな知識表現能力を示している。
このようにして、VLMをスパイクフォーマートレーニングの改善に活用することが約束されている。
この目的のために、VL2Spikeは、スパイクベースの知識蒸留(KD)フレームワークであり、コンパクトなスパイクフォーマーモデルでVLMからマルチモーダルな知識をブリッジする。
この設計により、Spikformerモデルの学習能力は向上し、省エネ効果を保ちながら、低消費電力ロボット知覚への実践的な経路を提供する。
VL2Spikeには2つの重要な技術貢献があります。
本研究では,(1)VLM画像特徴とスパイクトークンの共有多様体アライメントを実現し,(2)膜電位とスパイクレートの時間的整合性を示す空間時空間的スパイク(SVS)蒸留法を提案する。
次に、スパイクフォーマーのクラスプロトタイプとロジットをVLMテキスト埋め込みと整合させる新しいスパイクプロトタイプ誘導言語(SPL)蒸留戦略を設計する。
大規模な実験では、VL2Spikeは3つの静的データセットでわずか15.7%のエネルギー消費で6.81%のゲインを達成している。
また、ロボット視覚位置認識(VPR)に6.63%の精度で強力な一般化能力を示し、AIの低消費電力認識の可能性を強調している。
関連論文リスト
- Spike-driven Large Language Model [49.52947423982696]
スパイキングニューラルネットワーク(SNN)はスパイク駆動特性を持つ。
現在のLarge Language Models (LLM) は主に大規模密度行列乗法に基づいている。
本研究では,スパース加算操作により高密度行列乗算を除去するスパイク駆動型大規模言語モデルであるSDLLMを提案する。
論文 参考訳(メタデータ) (2026-04-11T17:58:35Z) - DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA [72.9197085473598]
DIALはハイレベルな意思決定と低レベルなモーター実行を、差別化可能な潜在意図ボトルネックを通じてブリッジするフレームワークである。
VLMベースのSystem-2は、VLMのネイティブな特徴空間内で、潜伏した視覚的フォレストによって潜伏世界モデリングを行う。
軽量のSystem-1ポリシーでは、この予測された意図と現在の観測結果を正確にロボットの動作にデコードする。
論文 参考訳(メタデータ) (2026-03-31T15:02:27Z) - Event-Driven Neuromorphic Vision Enables Energy-Efficient Visual Place Recognition [1.410209203415769]
バイオインスパイアされたニューロモルフィックなアプローチであるSpikeVPRを導入し、コンパクトで不変な場所記述子を生成する。
SpikeVPRは、代理勾配学習を使用してエンドツーエンドでトレーニングされ、新しい拡張戦略であるEventDilationが組み込まれている。
SpikeVPRは、50倍のパラメータを使用し、30~250倍のエネルギーを消費しながら、最先端のディープネットワークに匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-24T10:26:20Z) - Shallow-π: Knowledge Distillation for Flow-based VLAs [4.329496613618976]
本稿では,VLMバックボーンとフローベースアクションヘッドの両方のトランスフォーマー深さを積極的に低減する知識蒸留フレームワークであるShallow-piを提案する。
Shallow-piは標準的なベンチマークで1%未満の成功率で2倍以上の高速化を実現している。
複数のロボットプラットフォームにまたがるJetson OrinとJetson Thorの産業規模での実世界の実験を通して、我々のアプローチを検証する。
論文 参考訳(メタデータ) (2026-01-28T05:16:26Z) - EdgeVLA: Efficient Vision-Language-Action Models [0.4005096060512278]
本稿では,VLA(Vision-Language-Action)モデルの推論速度を大幅に向上する新しい手法であるEdge VLAを紹介する。
1)エンドエフェクタ位置予測の自己回帰要求を排除し,推論の7倍の高速化を実現し,2)小言語モデル(SLM)の効率を向上する。
我々の初期の結果は、EVLAがOpenVLAに匹敵するトレーニング特性を達成し、推論速度とメモリ効率を大幅に向上させることを示した。
論文 参考訳(メタデータ) (2025-07-18T16:15:09Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z) - Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models [30.7855782696894]
VLA(Vision-Language-Action)モデルは、自然言語による汎用ロボット制御の強力なパラダイムとして登場した。
VLAモデルにおけるアクション再利用を可能にする最初のトレーニングフリーかつプラグアンドプレイアクセラレーションフレームワークであるFlashVLAを提案する。
論文 参考訳(メタデータ) (2025-05-27T13:47:18Z) - VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models [84.84277196012907]
VLsI: Verbalized Layers-to-Interactions, a new VLM family in 2B and 7B model size。
GPT-4Vよりも優れた性能向上(2Bは11.0%、7Bは17.4%)を達成した。
論文 参考訳(メタデータ) (2024-12-02T18:58:25Z) - An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models [65.37846460916042]
視覚的トークンに対する注意計算は,LVLMの深い層において極めて非効率であることがわかった。
本稿では,計算効率の最適化を目的とした多用途プラグアンドプレイ方式であるFastVを紹介する。
論文 参考訳(メタデータ) (2024-03-11T14:35:32Z) - SpikeCLIP: A Contrastive Language-Image Pretrained Spiking Neural Network [39.54624592783459]
従来のニューラルネットワーク(ANN)の代替として、スパイキングニューラルネットワーク(SNN)が登場した。
本稿ではスパイクベースの計算におけるモダリティギャップを埋める新しいフレームワークであるSpikeCLIPを提案する。
論文 参考訳(メタデータ) (2023-10-10T09:57:17Z) - Spikformer: When Spiking Neural Network Meets Transformer [102.91330530210037]
本稿では,スパイキングニューラルネットワーク(SNN)と自己認識機構という,生物学的にもっとも有効な2つの構造について考察する。
我々は、スパイキング・セルフ・アテンション(SSA)と、スパイキング・トランスフォーマー(Spikformer)という強力なフレームワークを提案する。
論文 参考訳(メタデータ) (2022-09-29T14:16:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。