論文の概要: Neuroscience-Inspired Analyses of Visual Interestingness in Multimodal Transformers
- arxiv url: http://arxiv.org/abs/2605.08188v1
- Date: Tue, 05 May 2026 12:45:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.444403
- Title: Neuroscience-Inspired Analyses of Visual Interestingness in Multimodal Transformers
- Title(参考訳): マルチモーダルトランスにおける視覚的興味の神経科学による分析
- Authors: Mathis Immertreu, Fitim Abdullahu, Thomas Kinfe, Helmut Grabner, Patrick Krauss, Achim Schilling,
- Abstract要約: 視覚的関心の概念はマルチモーダル視覚言語モデルQwen3-VL-8Bで検討された。
神経科学の手法を用いて視覚と言語コンポーネント間の内部表現を分析した。
- 参考スコア(独自算出の注目度): 3.07869141026886
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Human attention is the gateway to conscious perception, memory and decision-making. However, its role in modern transformer models remains largely unexplored. As these systems increasingly influence what people see, prefer and buy, the question arises as to whether they encode principles of human interest or merely exploit large-scale correlations. Addressing this issue is crucial for understanding cognition and ensuring the responsible use of AI in communication and marketing. In order to address this issue, the concept of visual interest was examined within the multimodal vision-language-model Qwen3-VL-8B, using a pre-defined Common Interestingness (CI) score derived from large-scale human engagement data on the photo-sharing platform Flickr. Here, we analyzed internal representations across vision and language components using methods from the neurosciences. Our analyses revealed that CI information is linearly decodable from final-layer embeddings, indicating that it is aligned with human-derived measures of visual interestingness. Dimensionality reduction and Generalized Discrimination Value (GDV) analyses demonstrate that CI-related hidden representations emerge in intermediate vision transformer layers and becomes progressively more distinguishable across language model layers. Concept vectors derived using geometric, probe, and Sparse Auto-Encoder based methods converge in higher layers, as confirmed by representational similarity analysis. This indicates a robust and structured encoding of visual interestingness without explicit supervision. Future work will seek to identify shared computational principles linking human brain dynamics and transformer architectures, with the ultimate goal of uncovering the organizing mechanisms that give rise to attention and interest in both biological and artificial systems.
- Abstract(参考訳): 人間の注意は意識的な認識、記憶、意思決定への入り口である。
しかし、現代のトランスモデルにおけるその役割はほとんど解明されていない。
これらのシステムが人々の見るもの、好むもの、購入にますます影響を及ぼすにつれて、人間の関心の原則を符号化するか、あるいは単に大規模な相関を活用しているのかという疑問が生まれてくる。
この問題に対処することは、認識を理解し、コミュニケーションとマーケティングにおけるAIの責任ある使用を保証するために不可欠である。
この問題に対処するために、写真共有プラットフォームFlickr上の大規模人間エンゲージメントデータから予め定義された共通関心度(CI)スコアを用いて、マルチモーダル視覚言語モデルQwen3-VL-8Bの視覚的関心の概念を検討した。
そこで我々は,脳科学の手法を用いて,視覚と言語コンポーネント間の内部表現を分析した。
解析の結果,CI情報は最終層埋め込みから直線的にデオード可能であり,人間の視覚的面白さの指標と一致していることが明らかとなった。
次元減少と一般化識別値(GDV)解析により、中間視覚変換器層にCI関連隠蔽表現が出現し、言語モデル層間で徐々に識別しやすくなっていることが示された。
幾何学的・プローブ的・スパースオートエンコーダ的手法を用いて導出された概念ベクトルは、表現的類似性解析によって確認されるように、高層に収束する。
これは、明示的な監督を伴わない、堅牢で構造化された視覚的面白さの符号化であることを示している。
今後の研究は、人間の脳力学とトランスフォーマーアーキテクチャを結びつける共有計算原理を、生物学的および人工システムの両方に注意と関心をもたらす組織機構を明らかにするという究極の目標として、特定することを目指している。
関連論文リスト
- An extremely coarse feedback signal is sufficient for learning human-aligned visual representations [2.9506547907696006]
学習信号の粗さが人間の視覚との表現的アライメントをどのように形成するかを検討する。
これらの粗い分類タスクに基づいて、畳み込みアーキテクチャとトランスフォーマーアーキテクチャをまたいだ数百のニューラルネットワークをトレーニングします。
訓練されたネットワークは、1000クラスのモデルのニューラルアライメントと一致するか、あるいは超えている表現を、最大8つのワイドカテゴリで学習する。
論文 参考訳(メタデータ) (2026-05-07T01:02:21Z) - Causal Interpretation of Neural Network Computations with Contribution Decomposition [13.992892699439023]
我々は、隠れたニューロンがどのようにネットワーク出力を駆動するかを直接的に調べる。
CODECは、スパースオートエンコーダを用いて、ネットワークの振る舞いを隠されたニューロンの寄与のスパースモチーフに分解する手法である。
論文 参考訳(メタデータ) (2026-03-06T18:46:06Z) - Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning [56.24016465596292]
視覚的メタファーは、抽象概念をインパクトのある視覚的レトリックに変換するために、クロスドメインなセマンティックフュージョンを用いて、人間の創造性の高階形式を構成する。
本稿では,参照画像から「創造的本質」を自律的に分離し,その抽象論理をユーザ特定対象に再物質化する,視覚メタファー伝達(VMT)の課題を紹介する。
提案手法は, メタファーの整合性, アナロジーの適切性, 視覚的創造性においてSOTAのベースラインを著しく上回り, 広告・メディアにおける高度にインパクトのある創造的アプリケーションを自動化するための道を開いた。
論文 参考訳(メタデータ) (2026-02-01T17:01:36Z) - Learning Human-Object Interaction as Groups [52.28258599873394]
GroupHOIは、幾何学的近接性および意味的類似性の観点から文脈情報を伝播するフレームワークである。
これは、より困難な非言語間相互作用検出タスクにおいて、主要なパフォーマンスを示す。
論文 参考訳(メタデータ) (2025-10-21T07:25:10Z) - Convergent transformations of visual representation in brains and models [0.0]
認知神経科学における根本的な疑問は、視覚的知覚(外界の構造や脳の内部構造)をどう形成するかである。
人間の視覚と人工視覚の両方において、外界の構造によって駆動される視覚的エンコーディングのための収束した計算解を示す。
論文 参考訳(メタデータ) (2025-07-18T14:13:54Z) - Concept-Guided Interpretability via Neural Chunking [64.6429903327095]
ニューラルネットワークは、トレーニングデータの規則性を反映した生の集団活動のパターンを示す。
神経集団レベルで繰り返しチャンクを抽出する3つの方法を提案する。
私たちの研究は、認知原則と自然主義的データの構造の両方を活用する、解釈可能性の新しい方向性を指し示しています。
論文 参考訳(メタデータ) (2025-05-16T13:49:43Z) - Mechanistic understanding and validation of large AI models with SemanticLens [13.712668314238082]
航空機のような人間工学的なシステムとは異なり、AIモデルの内部動作はほとんど不透明である。
本稿では、コンポーネントによって符号化された隠れた知識をマッピングするニューラルネットワークの普遍的説明法であるSemanticLensを紹介する。
論文 参考訳(メタデータ) (2025-01-09T17:47:34Z) - Neural Clustering based Visual Representation Learning [61.72646814537163]
クラスタリングは、機械学習とデータ分析における最も古典的なアプローチの1つである。
本稿では,特徴抽出をデータから代表者を選択するプロセスとみなすクラスタリング(FEC)による特徴抽出を提案する。
FECは、個々のクラスタにピクセルをグループ化して抽象的な代表を配置し、現在の代表とピクセルの深い特徴を更新する。
論文 参考訳(メタデータ) (2024-03-26T06:04:50Z) - Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models [56.257840490146]
ConCueは、HOI検出における視覚的特徴抽出を改善するための新しいアプローチである。
コンテクストキューをインスタンスと相互作用検出器の両方に統合するマルチトウワーアーキテクチャを用いたトランスフォーマーベースの特徴抽出モジュールを開発した。
論文 参考訳(メタデータ) (2023-11-26T09:11:32Z) - Neural-Logic Human-Object Interaction Detection [67.4993347702353]
本稿では,ニューラルロジック推論を利用した新しいHOI検出器であるL OGIC HOIと,実体間の相互作用を推測するTransformerを提案する。
具体的には,バニラトランスフォーマーの自己保持機構を改変し,人間,行動,対象>三重項を推論し,新たな相互作用を構成する。
我々はこれらの2つの特性を一階述語論理で定式化し、それらを連続空間に基底にして、我々のアプローチの学習過程を制約し、性能とゼロショットの一般化能力を向上させる。
論文 参考訳(メタデータ) (2023-11-16T11:47:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。