論文の概要: It Depends on the Dataset: When a Brain-Encoding Model's Predicted Responses Beat Their Visual Backbone for Video Memorability
- arxiv url: http://arxiv.org/abs/2607.16292v2
- Date: Tue, 21 Jul 2026 09:36:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.280545
- Title: It Depends on the Dataset: When a Brain-Encoding Model's Predicted Responses Beat Their Visual Backbone for Video Memorability
- Title(参考訳): それはデータセットに依存する:脳エンコーディングモデルの予測応答が、ビデオの覚醒性のために彼らの視覚バックボーンに当たったとき
- Abstract要約: 我々は,各クリップをTRIBE v2の予測皮質空間に投影し,リッジ回帰による短期記憶性を予測する。
Memento10kでは背骨が勝利し(Spearman 0.594 vs 0.544)、ビデオMemでは脳投射が勝利する(0.415 vs 0.368, delta +0.047, 95% CI [+0.009, +0.088])。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Brain-encoding foundation models predict fMRI responses to video, audio, and text well enough to win the Algonauts 2025 challenge. We ask whether their predicted responses, obtained with no scanner, are a useful feature lens for a downstream human-behavior task: forecasting the memorability of short videos. We project each clip into TRIBE v2's predicted cortical space and forecast short-term memorability with ridge regression, against a matched control: the model's own V-JEPA2 visual backbone taken before the brain projection. The answer is dataset-dependent, and cleanly so. Within Memento10k the backbone wins (Spearman 0.594 vs 0.544 for the brain projection); within VideoMem the brain projection wins (0.415 vs 0.368, delta +0.047, 95% CI [+0.009, +0.088]). Both within-dataset gaps have bootstrap intervals excluding zero, in opposite directions. Cross-dataset transfer inherits the split: trained on Memento10k and tested on VideoMem the brain projection beats the backbone (+0.076), while the reverse loses heavily (-0.311). Each representation transfers best onto the dataset it already fits better. The VideoMem advantage is not a sample-size artifact (it survives matched training size and a PCA-then-ridge pipeline) and not mere compression of the backbone (a compressed or heavily regularized backbone tops out below the brain projection, which also beats a transfer-tuned backbone, +0.053). So predicted-brain features carry a small but real memorability signal the backbone misses on one dataset and not the other: not a domain-general prior, but a dataset-specific representation. A vision-orthogonal component (partial Spearman 0.19, permutation p=2.5e-4) localizes to ventral occipito-temporal cortex. Analysis code is released; the datasets and the predicted-response arrays derived from them are not redistributed, because the VideoMem licence forbids it without prior written approval.
- Abstract(参考訳): ブレインエンコーディングの基礎モデルは、ビデオ、オーディオ、テキストに対するfMRI応答を予測し、Algonauts 2025チャレンジに勝つのに十分である。
我々は,スキャナーを使わずに得られた予測応答が,下流の人間行動タスクに有用な機能レンズであるかどうかを問う。
我々は、各クリップをTRIBE v2の予測皮質空間に投影し、尾根回帰による短期記憶可能性を予測し、モデル独自のV-JEPA2視覚バックボーンを脳投射前に撮影する。
答えはデータセットに依存しており、クリーンにそうである。
Memento10kでは背骨が勝利し(Spearman 0.594 vs 0.544)、ビデオMemでは脳投射が勝利する(0.415 vs 0.368, delta +0.047, 95% CI [+0.009, +0.088])。
両方のデータセット内のギャップは、反対方向にゼロを除くブートストラップ間隔を持つ。
Memento10kでトレーニングされ、VideoMemでテストされた脳投射は、バックボーン(+0.076)を破り、逆は、大きく失われる(-0.311)。
各表現は、すでに適合しているデータセットにベストに転送する。
VideoMemの利点は、サンプルサイズのアーティファクト(トレーニングサイズとPCA-then-ridgeパイプラインにマッチする)ではなく、バックボーンの単なる圧縮(脳投射の下部に圧縮された、あるいは非常に規則化されたバックボーントップがあり、転送調整されたバックボーン(+0.053)も打ち負かす)である。
したがって、予測脳機能は、小さなが実際の記憶可能性信号を持ち、バックボーンは1つのデータセットでミスし、もう1つのデータセットでは失敗する。
視交叉成分 (Partial Spearman 0.19, permutation p=2.5e-4) は腹側頭葉側頭葉皮質に局在する。
解析コードはリリースされ、データセットとそれらから派生した予測応答配列は再配布されない。
関連論文リスト
- Rethinking Data Efficiency in Industrial Dense Prediction: Pretraining Coherence, Not Inductive Bias, Determines ViTs Low-Data Advantage [0.0]
ヴィジュアルトランスフォーマー(ViT)は産業密集予測のためにCNNよりもラベル付きデータを必要とすると広く信じられている。
データ効率のギャップは、事前学習の不整合に起因することを示す。
ピラミッドレベルの特徴再構成のための軽量なAlignBlockファミリを提案する。
論文 参考訳(メタデータ) (2026-08-11T07:17:59Z) - Frozen Brain-MRI Foundation Models Are Site Fingerprints [0.0]
凍結ファンデーションモデル埋め込みは、オフザシェルフ脳MRI表現としてますます使われている。
私たちは、彼らが実際にエンコードしたものを監査し、そのサイトが表現の大きな、本質的なコンポーネントであることに気付きます。
我々は,凍結脳MRI FM の使用とオープン監査ツールキットの公開を推奨する。
論文 参考訳(メタデータ) (2026-08-10T23:03:21Z) - A global predicted-fMRI drive signal from TRIBE does not predict YouTube replay heatmaps [0.0]
マルチモーダル脳エンコーディングモデルは、自然なビデオに対するfMRI応答を高精度に予測する。
TRIBEを48本のYouTubeビデオで実行し、秒単位のエンゲージメント曲線に対する予測された皮質反応を削減します。
TRIBEの入力ストリームでプローブを実行すると、少なくとも小さな境界線視覚ストリーム信号が明らかになる。
我々は、YouTubeのSABRストリーミングに堅牢なコード、ビデオIDマニフェスト、ヒートマップ取得方法をリリースする。
論文 参考訳(メタデータ) (2026-07-01T19:03:17Z) - LLMs Can Get "Brain Rot"! [68.08198331505695]
ジャンクウェブテキストへの連続曝露は、大規模言語モデル(LLM)の持続的認知低下を誘導する
実Twitter/Xコーパスで制御された実験を行い、ジャンクと逆制御されたデータセットを構築します。
その結果、データ品質がLLM能力の崩壊の原因であることを示す重要な多視点的証拠が得られた。
論文 参考訳(メタデータ) (2025-10-15T13:28:49Z) - MindGrab for BrainChop: Fast and Accurate Skull Stripping for Command Line and Browser [0.5983020804545164]
我々はパラメータとメモリ効率の深い完全畳み込みモデルであるMindGrabを開発した。
MindGrabはSynthStripデータセットから得られた606個のマルチモーダル成人脳スキャン(T1, T2, DWI, MRA, PDw MRI, EPI, CT, PET)を用いて評価した。
MindGrabは標準偏差(SD)1.6で95.9のDiceスコアを達成し、古典的手法よりも優れていた。
論文 参考訳(メタデータ) (2025-06-13T15:09:15Z) - DecoFuse: Decomposing and Fusing the "What", "Where", and "How" for Brain-Inspired fMRI-to-Video Decoding [82.91021399231184]
既存のfMRI-to-video法は、しばしば空間情報や動き情報を見下ろしながら意味的内容に焦点を当てる。
そこで我々は,fMRI信号から映像をデコードするための,脳にインスパイアされた新しいフレームワークであるDecoFuseを提案する。
まず、ビデオはセマンティック、空間、動きの3つのコンポーネントに分解し、次に各コンポーネントを別々にデコードしてから、ビデオを再構成する。
論文 参考訳(メタデータ) (2025-04-01T05:28:37Z) - It Takes Two: Masked Appearance-Motion Modeling for Self-supervised
Video Transformer Pre-training [76.69480467101143]
自己監督型ビデオトランスフォーマーの事前トレーニングは、最近マスク・アンド・予測パイプラインの恩恵を受けている。
本稿では,映像中の動きの手がかりを余分な予測対象として明示的に調査し,マスケッド・出現運動モデリングフレームワークを提案する。
一般的なビデオ表現を学習し、Kinects-400で82.3%、Something V2で71.3%、UCF101で91.5%、HMDB51で62.5%を達成する。
論文 参考訳(メタデータ) (2022-10-11T08:05:18Z) - Self-Supervised U-Net for Segmenting Flat and Sessile Polyps [63.62764375279861]
大腸ポリープの発達は、がんの最も初期の兆候の1つである。
ポリープの早期検出と切除は生存率を90%に大きく向上させる。
大腸内視鏡画像の処理によりポリープを検出するコンピュータ支援診断システム(CADx)が提案されている。
論文 参考訳(メタデータ) (2021-10-17T09:31:20Z) - Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction
without Convolutions [103.03973037619532]
この研究は、畳み込みのない多くの密な予測タスクに有用な単純なバックボーンネットワークを調査します。
画像分類用に特別に設計された最近提案されたトランスフォーマーモデル(例: ViT)とは異なり、Pyramid Vision Transformer(PVT)を提案する。
PVTは、高出力の解像度を達成するために画像の高密度分割をトレーニングするだけでなく、高密度の予測に重要である。
論文 参考訳(メタデータ) (2021-02-24T08:33:55Z) - VAE^2: Preventing Posterior Collapse of Variational Video Predictions in
the Wild [131.58069944312248]
本稿では,VAE-in-VAEまたはVAE$2の新規なVAE構造を提案する。
我々は、観察されたビデオシーケンスの一部を、その過去と未来を橋渡しするランダムな遷移状態として扱い、あらゆる可能な遷移状態の下で、ビデオシーケンス上のマルコフ連鎖の可能性を最大化する。
VAE$2$は、未来と観測の間の直接的な依存を断ち切るため、後方崩壊問題を広範囲に緩和することができ、トレーニングデータによって提供される決定的な未来を直接遅らせることはない。
論文 参考訳(メタデータ) (2021-01-28T15:06:08Z) - Neuron Merging: Compensating for Pruned Neurons [3.441021278275805]
構造的ネットワークプルーニングは、ニューロン全体やフィルターを破棄し、精度を低下させる。
完全連結層と畳み込み層の両方に適用可能なニューロン融合の概念を提案する。
我々は93.16%の精度を達成し、微調整なしで総パラメータの64%を削減した。
論文 参考訳(メタデータ) (2020-10-25T16:50:26Z) - Anatomy-aware 3D Human Pose Estimation with Bone-based Pose
Decomposition [92.99291528676021]
3次元関節位置を直接回帰するのではなく,骨方向予測と骨長予測に分解する。
私たちのモチベーションは、人間の骨格の骨の長さが時間とともに一定であることにあります。
我々の完全なモデルは、Human3.6MとMPI-INF-3DHPデータセットにおいて、以前の最高の結果よりも優れています。
論文 参考訳(メタデータ) (2020-02-24T15:49:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。