論文の概要: The Visual Target Matters: Learning across the Visual Hierarchy for Brain-to-Image Retrieval
- arxiv url: http://arxiv.org/abs/2609.24136v1
- Date: Mon, 21 Sep 2026 05:41:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.086305
- Title: The Visual Target Matters: Learning across the Visual Hierarchy for Brain-to-Image Retrieval
- Title(参考訳): 視覚的目標事項:脳と画像の検索のための視覚的階層的学習
- Abstract要約: 脳と画像の検索は、非侵襲的な神経反応を引き起こす視覚刺激を特定することを目指している。
既存の方法は通常神経エンコーダを訓練し、固定された最終層視覚目標を回復させる。
本稿では,凍結した視覚バックボーンの深度から,実験非依存の視覚目標を学習するNeuroGlyphを紹介する。
- 参考スコア(独自算出の注目度): 14.563169168401727
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Brain-to-image retrieval seeks to identify the visual stimulus that elicited a non-invasive neural response. Candidate images are typically represented by pretrained vision models, whose internal representations vary in abstraction across depth. Existing methods usually train the neural encoder to recover a fixed final-layer visual target. Under this formulation, the visual hierarchy is reduced to a single prescribed endpoint, preventing representations at other depths from directly shaping the visual target. This limitation motivates learning how information across visual depths should contribute to the retrieval target. To this end, we introduce NeuroGlyph, which learns a trial-independent visual target from multiple depths of a frozen visual backbone. NeuroGlyph decomposes the target into factor-specific subspaces. Each subspace learns an image-conditioned allocation over visual depth. The resulting subspaces are fused into a single embedding for retrieval. Across THINGS-EEG and THINGS-MEG, NeuroGlyph outperforms final-layer supervision in all controlled comparisons. It also surpasses the post hoc best fixed-layer oracle in three of four comparisons. Parameter-matched ablations support both factorized target construction and image-conditioned depth allocation. Under comparable 200-way retrieval protocols, NeuroGlyph achieves the strongest system-level performance in six of eight reported metrics. These results support learning retrieval targets across the visual hierarchy rather than prescribing one visual depth.
- Abstract(参考訳): 脳と画像の検索は、非侵襲的な神経反応を引き起こす視覚刺激を特定することを目指している。
候補画像は通常、事前訓練された視覚モデルで表現され、内部表現は奥行きの抽象化によって異なる。
既存の方法は通常神経エンコーダを訓練し、固定された最終層視覚目標を回復させる。
この定式化の下では、視覚的階層は1つの所定のエンドポイントに縮小され、他の深さでの表現が視覚的ターゲットを直接形作るのを防ぐ。
この制限は、視覚深度にまたがる情報が検索対象にどのように貢献するかを学ぶ動機となる。
そこで我々は,凍結した視覚バックボーンの複数の深さから,実験非依存の視覚目標を学習するNeuroGlyphを紹介した。
NeuroGlyphはターゲットを因子特異的な部分空間に分解する。
各サブスペースは、視覚深度上のイメージ条件付きアロケーションを学習する。
結果として得られる部分空間は、検索のために単一の埋め込みに融合される。
THINGS-EEGとTHINGS-MEG全体では、NeuroGlyphは全ての制御された比較において最終層の監督よりも優れている。
また、4つの比較のうち3つでポストホックの最高固定層オラクルを上回っている。
パラメータマッチングアブリゲーションは、因子化されたターゲット構築と画像条件の深さ割り当ての両方をサポートする。
同等の200ウェイ検索プロトコルの下で、NeuroGlyphは、報告された8つのメトリクスのうち6つの最も強力なシステムレベルのパフォーマンスを達成する。
これらの結果は、1つの視覚深度を規定するのではなく、視覚階層全体にわたる学習対象の検索を支援する。
関連論文リスト
- Hi-DREAM: Brain Inspired Hierarchical Diffusion for fMRI Reconstruction via ROI Encoder and visuAl Mapping [5.019958634393433]
Hi-DREAMは、皮質組織を明確にする条件拡散フレームワークである。
軽量で深度にマッチしたControlNetは、デノイング中にスケール固有のヒントを注入する。
実験により、Hi-DREAMは高レベルのセマンティックメトリクスで最先端のパフォーマンスを得ることができた。
論文 参考訳(メタデータ) (2025-11-14T16:05:44Z) - ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs [98.27348724529257]
ViCrit (Visual Caption Hallucination Critic) は、VLMを訓練し、人間の手書き画像キャプションの段落に挿入された微妙で合成的な視覚幻覚をローカライズするRLプロキシタスクである。
ViCrit Taskでトレーニングされたモデルは、さまざまなビジョン言語モデルベンチマークで大幅に向上している。
論文 参考訳(メタデータ) (2025-06-11T19:16:54Z) - Decoding Visual Experience and Mapping Semantics through Whole-Brain Analysis Using fMRI Foundation Models [10.615012396285337]
我々は脳全体の活性化マップを組み込むことで視覚過程の理解を高めるアルゴリズムを開発した。
まず,視覚処理を復号化するための最先端手法と比較し,予測意味精度を43%向上させた。
論文 参考訳(メタデータ) (2024-11-11T16:51:17Z) - Top-Down Guidance for Learning Object-Centric Representations [30.06924788022504]
Top-Down Guided Network (TDGNet)は、オブジェクト中心の表現を改善するためのトップダウンパスである。
TDGNetは、様々な複雑さを持つ複数のデータセットにおいて、現在のオブジェクト中心モデルよりも優れていることを示す。
論文 参考訳(メタデータ) (2024-05-17T07:48:27Z) - Wills Aligner: Multi-Subject Collaborative Brain Visual Decoding [19.538200208523467]
Wills Alignerは、多目的協調脳視覚デコーディングを実現するための新しいアプローチである。
Wills Aligner氏はまず、解剖学的レベルで異なる被験者のfMRIデータを調整することから始める。
次に、微妙なブライン・オブ・ブライン・エキスパート・アダプターと、個々のfMRIパターンの違いを考慮に入れたメタラーニング戦略を用いる。
論文 参考訳(メタデータ) (2024-04-20T06:01:09Z) - Understanding the Role of Pathways in a Deep Neural Network [4.456675543894722]
分類タスクで訓練された畳み込みニューラルネットワーク(CNN)を分析し,個々の画素の拡散経路を抽出するアルゴリズムを提案する。
画像からの個々のピクセルの最も大きな経路は、分類に重要な各層の特徴マップを横断する傾向にある。
論文 参考訳(メタデータ) (2024-02-28T07:53:19Z) - Does Visual Pretraining Help End-to-End Reasoning? [81.4707017038019]
汎用ニューラルネットワークを用いて視覚的推論のエンドツーエンド学習を実現することができるかを検討する。
本稿では,ビデオフレームを小さなトークン集合に"圧縮"する,シンプルで汎用的な自己教師型フレームワークを提案する。
終末の視覚的推論のための構成的一般化を実現するためには,事前学習が不可欠である。
論文 参考訳(メタデータ) (2023-07-17T14:08:38Z) - What Can You Learn from Your Muscles? Learning Visual Representation
from Human Interactions [50.435861435121915]
視覚のみの表現よりも優れた表現を学べるかどうかを調べるために,人間のインタラクションとアテンション・キューを用いている。
実験の結果,我々の「音楽監督型」表現は,視覚のみの最先端手法であるMoCoよりも優れていた。
論文 参考訳(メタデータ) (2020-10-16T17:46:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。