論文の概要: Steering Vision-Language Models with Joint Sparse Autoencoders
- arxiv url: http://arxiv.org/abs/2606.25657v1
- Date: Wed, 24 Jun 2026 10:11:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.306595
- Title: Steering Vision-Language Models with Joint Sparse Autoencoders
- Title(参考訳): ジョイントスパースオートエンコーダを用いたステアリングビジョンランゲージモデル
- Authors: Huizhen Shu, Xuying Li, Hongxu Lin, Wenjie Sun, Hui Li,
- Abstract要約: 連成スパースオートエンコーダ(JSAE)を導入し、シーケンスプールされた視覚と言語アクティベーションを、共用、解釈可能な画像/カプセルレベルの特徴に分解する。
JSAEを視覚言語モデル(VLM)に適用すると、制御可能なクロスモーダルステアリングの方向として使うのが難しい表現が得られる。
- 参考スコア(独自算出の注目度): 2.367986397868328
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Sparse Autoencoders (SAEs) have shown promise for analyzing language models, but applying them to vision-language models (VLMs) often yields representations that are difficult to use as controllable cross-modal steering directions. We introduce the Joint Sparse Autoencoder (JSAE), which uses an explicit alignment constraint to jointly factorize sequence-pooled vision and language activations into shared, interpretable image/caption-level features. Applied to LLaVA, JSAE recovers cross-modal features for recognizable concepts (e.g., food and animals). Through bidirectional interventions (additive steering and suppression), we observe a layer-dependent asymmetry under our protocol: additive steering peaks at mid-to-late (pre-output) layers and weakens at both ends, whereas suppression scores remain within a comparable range across all probed layers within statistical noise. Experiments on three VLMs, namely LLaVA-v1.6-Mistral-7B, Llama3-LLaVA-8B, and the MoE-based Qwen3-VL-30B, show related layer-localized effects across architectures. Together, these results suggest that explicitly aligned sparse representations support more controllable intervention-based analysis of multimodal features, within an identifiable layer range, than the unconstrained alternatives tested here.
- Abstract(参考訳): スパースオートエンコーダ (SAEs) は言語モデルの解析を約束しているが、視覚言語モデル (VLMs) に適用すると、制御可能なクロスモーダルな操舵方向としての使用が難しい表現が得られることが多い。
そこで,JSAE (Joint Sparse Autoencoder) を導入し,シーケンスプール型視覚と言語アクティベーションを共用化するためのアライメント制約を適用した。
LLaVAに適用されたJSAEは、認識可能な概念(例えば、食物や動物)の横断的な特徴を回復する。
双方向の介入(追加のステアリングと抑制)を通じて、我々はプロトコルの下で層依存性の非対称性を観察する: 付加的なステアリングピークは中間から直前(出力前)の層で、両端で弱く、一方、抑制スコアは統計ノイズ内の全てのプローブ層で同等の範囲内に留まる。
LLaVA-v1.6-Mistral-7B、Llama3-LLaVA-8B、およびMoEベースのQwen3-VL-30Bという3つのVLMの実験は、アーキテクチャ全体にわたって、関連する層局在効果を示している。
これらの結果は、明示的に整合したスパース表現は、ここでテストされた非制約の代替よりも、識別可能な層の範囲内で、多モード特徴の制御可能な介入に基づく分析を支援することを示唆している。
関連論文リスト
- SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning [99.49739831030388]
このインタフェースの設計は,オープンエンド空間推論のためのエージェントのキャパシティをいかに形作るかを検討する。
本研究では,アクションインタフェースとしてコードを採用する空間推論のためのトレーニングフリーフレームワークであるSpatialClawを提案する。
論文 参考訳(メタデータ) (2026-06-11T17:59:36Z) - Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models [35.34635490741956]
視覚的潜在推論により、マルチモーダルな大言語モデル(MLLM)は、中間的な視覚的エビデンスを連続トークンとして生成する。
視覚潜在モデルのためのtextbfGranular textbfAlignment textbfParadigm を提案する。
Qwen2.5-VL 7Bでは,教師付き変種のうち,最高の平均集合認識と推論性能が得られる。
論文 参考訳(メタデータ) (2026-05-12T16:41:09Z) - MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models [70.34265674686516]
マルチモーダル埋め込みモデルは、テキスト、画像、ビデオ、オーディオなどの異種入力を共有意味空間にマッピングすることを目的としている。
本稿では,テキスト,画像,ビデオ,オーディオ,エージェント中心のシナリオにまたがる埋め込みを評価するベンチマークであるMMEB-V3を紹介する。
本研究は, 完全モダリティ埋め込みの系統的解析を行い, 3つの重要な知見を同定する。
論文 参考訳(メタデータ) (2026-04-25T14:15:05Z) - OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models [69.2503510410147]
予め訓練されたVLM上に構築した統合自動運転フレームワークを提案する。
トレーニング済みのVLMアテンションは、純粋言語モデリング以上の強い伝達性を示すことを示す。
エンドツーエンドの自動運転ベンチマークの実験は、最先端のパフォーマンスを示している。
論文 参考訳(メタデータ) (2026-04-20T07:50:00Z) - From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion [91.35078719566472]
VLM(Vision-Language Models)は、粗い非対称接続を使用することで、深刻な視覚的特徴のボトルネックを生み出す。
CLI(Cross-Layer Injection)は,2つのモダリティの間に動的に多対多の橋を架ける,斬新で軽量なフレームワークである。
論文 参考訳(メタデータ) (2026-01-15T18:59:10Z) - HEDGE: Hallucination Estimation via Dense Geometric Entropy for VQA with Vision-Language Models [4.099133096025821]
視覚言語モデル(VLM)は、オープンエンドの視覚的質問応答を可能にするが、幻覚に苦しむ傾向にある。
我々は、制御された視覚摂動、セマンティッククラスタリング、堅牢な不確実性メトリクスを組み合わせた幻覚検出のための統合フレームワークであるHEDGEを提案する。
論文 参考訳(メタデータ) (2025-11-16T17:16:31Z) - IUT-Plug: A Plug-in tool for Interleaved Image-Text Generation [23.61167100602915]
IUT-Plugはイメージ理解ツリー(IUT)に基盤を置くモジュールである
動的IUT-Plug抽出モジュールは、視覚シーンを階層的なシンボル構造に解析する。
協調した物語フローと画像合成機構は、相互整合性を保証する。
論文 参考訳(メタデータ) (2025-10-13T03:19:45Z) - Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation [59.40886078302025]
マルチモーダル大規模言語モデル(MLLM)は、視覚入力と自然言語出力の整合性を示す。
しかし、生成したトークンが視覚的モダリティに依存する範囲は、いまだに理解されていない。
MLLMにおける自己回帰トークン生成を説明するための軽量なブラックボックスフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-26T15:38:42Z) - GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs [56.93583799109029]
GrAInSは推論時ステアリングのアプローチで、言語のみのモデルと視覚言語の両方のモデルとタスクで動作する。
推論中、GrAInSはトークンレベルの属性信号によって誘導されるトランスフォーマー層で隠されたアクティベーションを隠蔽し、アクティベーションを正規化し、表現スケールを保存する。
微調整と既存のステアリングベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2025-07-24T02:34:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。