論文の概要: A Distributional View for Visual Mechanistic Interpretability: KL-Minimal Soft-Constraint Principle
- arxiv url: http://arxiv.org/abs/2605.17504v1
- Date: Sun, 17 May 2026 15:31:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 23:51:08.372939
- Title: A Distributional View for Visual Mechanistic Interpretability: KL-Minimal Soft-Constraint Principle
- Title(参考訳): 視覚力学的解釈可能性の分布的視点:KL-最小ソフト制約原理
- Authors: Guancheng Zhou, Yisi Luo, Zhengfu He, Zhenyu Jin, Xuyang Ge, Wentao Shu, Deyu Meng, Xipeng Qiu,
- Abstract要約: 本稿では,視覚力学的解釈可能性に関する理論的分布ビューを提案する。
このビューは、自然な画像分布に対する特徴アクティベーションの影響をモデル化する。
理論的に解釈可能性と忠実性のバランスをとる視覚的MIに対して,KL最小ソフト制約原理を用いたモデルを提案する。
- 参考スコア(独自算出の注目度): 77.72852487795772
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Most current paradigms in visual mechanistic interpretability (MI) remain confined to interpreting internal units of the vision model via heuristic methods (e.g., top-$K$ activation retrieval or optimization with regularization). In this work, we establish a theoretical distributional view for visual MI, which models the influence of a feature activation on the natural image distribution, thereby formulating a Kullback-Leibler (KL)-minimal optimization problem to model the MI task. Under this framework, statistical biases are identified within previous MI paradigms, which reveal that they may either be perceptually uninterpretable to humans (i.e., deviate from the natural image distribution), or mechanistically unfaithful to the vision models (i.e., unable to activate model features). To resolve the biases under the distributional view, we propose a model with a KL-minimal soft-constraint principle for visual MI that theoretically balances interpretability and faithfulness. We realize this principle via energy-guided diffusion posterior sampling. Extensive experiments validate the theoretical soundness of the proposed distributional view and demonstrate the practical effectiveness of our paradigm on the DINOv3 vision model.
- Abstract(参考訳): 視覚力学的解釈可能性(MI)の現在のパラダイムは、ヒューリスティックな方法(例えば、トップ$K$アクティベーションの検索や正規化による最適化など)を通して視覚モデルの内部単位を解釈することに限定されている。
本研究では,視覚的MIに対する理論的分布ビューを構築し,特徴アクティベーションが自然画像分布に与える影響をモデル化し,そのMIタスクをモデル化するためのKL最小最適化問題を定式化する。
この枠組みの下では、統計バイアスは以前のMIパラダイムの中で識別され、知覚的に人間に解釈できない(すなわち、自然像の分布から逸脱する)か、あるいは視覚モデルに機械的に不信(つまり、モデルの特徴を活性化できない)であるかを明らかにする。
分布的視点下でのバイアスを解決するために、理論的に解釈可能性と忠実性のバランスをとる視覚的MIに対して、KL最小ソフト制約原理を用いたモデルを提案する。
我々はこの原理をエネルギー誘導拡散後サンプリングにより実現した。
広汎な実験により,提案した分布ビューの理論的健全性を検証し,DINOv3ビジョンモデル上でのパラダイムの有効性を実証した。
関連論文リスト
- Large Vision-Language Models Get Lost in Attention [51.851592109135716]
本稿では,情報理論と幾何に基づく統合フレームワークを提案し,残差更新の幾何的およびエントロピー的性質を定量化する。
注意は再設定に焦点を当てたサブスペース言語演算子として機能し、FFNはセマンティックイノベーションを駆動するサブスペース言語演算子として機能します。
論文 参考訳(メタデータ) (2026-05-07T04:45:52Z) - Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization [89.68681087743876]
MLLM(Multimodal Large Language Models)は,マルチターン推論において視覚ツールを積極的に呼び出すことによって,イメージで考えるモデルにインセンティブを与えている。
結果に基づく報酬を頼りにする一般的な強化学習の実践は、テキストの妥当性が経営幹部の失敗を隠蔽するという事実を無視します。
マルチモーダルエージェントポリシー最適化(MAPO)を導入し、テキスト推論とモデルが生成する視覚行動のギャップを埋める。
論文 参考訳(メタデータ) (2026-04-08T07:48:07Z) - Unsupervised Synthetic Image Attribution: Alignment and Disentanglement [55.853285140682665]
そこで我々は,アライメント・アンド・ディスタングルメント(Alignment and Disentanglement)という,シンプルで効果的な教師なしの手法を提案する。
具体的には、コントラッシブな自己教師あり学習を用いて基本的な概念アライメントを実行することから始める。
次に、Infomax損失による表現のゆがみを促進することにより、モデルの属性能力を高める。
論文 参考訳(メタデータ) (2026-01-30T07:31:53Z) - A Theoretical Lens for RL-Tuned Language Models via Energy-Based Models [9.324642081509756]
KL正規化強化学習によって訓練された大規模言語モデル(LLM)は、強い指示、自己補正、推論能力を示す。
我々は、最適KL規則化ポリシの閉形式エネルギーベースモデル(EBM)構造を利用して、LLMの統一的変分解析を行う。
論文 参考訳(メタデータ) (2025-12-21T13:28:58Z) - Beyond the Black Box: Identifiable Interpretation and Control in Generative Models via Causal Minimality [52.57416398859353]
因果的最小性は、明確な因果的解釈と頑健でコンポーネント単位で識別可能な制御を持つ拡散視覚と自己回帰言語モデルの潜在表現を許容できることを示す。
我々は階層的選択モデルのための新しい理論的枠組みを導入し、より高レベルな概念は低レベルの変数の制約された構成から生まれる。
これらの因果的基礎を持つ概念は、きめ細かいモデルステアリングのレバーとして機能し、透明で信頼性の高いシステムへの道を開く。
論文 参考訳(メタデータ) (2025-12-11T14:59:14Z) - Diffusion Models for Low-Light Image Enhancement: A Multi-Perspective Taxonomy and Performance Analysis [8.323736085126386]
低照度画像強調(LLIE)は、監視、自律ナビゲーション、医療画像などの安全上重要な応用に不可欠である。
拡散モデルがLLIEの有望な生成パラダイムとして登場したのは、反復的 denoising による複雑な画像分布のモデル化能力のためである。
本調査は, 次世代の拡散型LLIE研究の指針として, トレンドに注目し, オープンな研究課題を提起することを目的としている。
論文 参考訳(メタデータ) (2025-10-07T14:30:36Z) - Cognitive Activation and Chaotic Dynamics in Large Language Models: A Quasi-Lyapunov Analysis of Reasoning Mechanisms [6.375329734462518]
本稿では,大規模言語モデルの推論機構の本質を明らかにする「認知活性化理論」を提案する。
実験により、モデルの情報の蓄積は非線形指数法則に従っており、Multilayer Perceptron (MLP) は最終的な出力においてより高い割合を占めることが示された。
本研究は, LLMの推論の解釈可能性に関するカオス理論の枠組みを提供し, モデル設計における創造性と信頼性のバランスをとるための潜在的経路を明らかにする。
論文 参考訳(メタデータ) (2025-03-15T08:15:10Z) - Model-free Methods for Event History Analysis and Efficient Adjustment (PhD Thesis) [55.2480439325792]
この論文は、モデルフリーの観点から統一された統計学への独立した貢献のシリーズである。
第1章では、機械学習から予測技術を活用する柔軟なメソッドを定式化するために、モデルフリーの視点をどのように利用できるか、詳しく説明している。
第2章では、あるプロセスの進化が他のプロセスに直接影響されるかどうかを記述した地域独立の概念を研究している。
論文 参考訳(メタデータ) (2025-02-11T19:24:09Z) - Sparks of Explainability: Recent Advancements in Explaining Large Vision Models [6.1642231492615345]
この論文は、ディープニューラルネットワークによって利用される特徴を分析し、モデル化することにより、コンピュータビジョンにおける説明可能性を改善するための高度なアプローチを探求する。
アルゴリズム的安定性に基づく計量とソボル指標を用いたアプローチを導入することにより、帰属法、特にサリエンシマップを評価する。
モデルと人間の推論を一致させ、概念的説明可能性アプローチを採用するという2つの仮説が検討されている。
論文 参考訳(メタデータ) (2025-02-03T04:49:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。