論文の概要: LAYERSCOPE: A Layerwise Characterization of Video and Multimodal Learned Representations
- arxiv url: http://arxiv.org/abs/2609.28086v2
- Date: Thu, 24 Sep 2026 05:05:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.363775
- Title: LAYERSCOPE: A Layerwise Characterization of Video and Multimodal Learned Representations
- Title(参考訳): LAYERSCOPE:ビデオとマルチモーダル学習表現の階層的特徴付け
- Abstract要約: LAYERSCOPEは、ビデオおよびマルチモーダル設定において、モデルの学習した表現を特徴付けることを目的としている。
ビデオおよびマルチモーダル分類,クラスタリング,MVEB/MVEB+からのテキスト・ツー・ビデオ検索の7つのモデルを評価する。
中間層表現は最終層およびモデルデフォルト出力より優れることがわかった。
- 参考スコア(独自算出の注目度): 57.281591486516504
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose LAYERSCOPE, a label-free, layerwise framework that aims to characterize a model's learned representations in video and multimodal settings. Evaluating downstream performance using representations from final or intermediate layers typically requires large amounts of labeled data, repeated task-specific evaluations, and substantial computation. To address these limitations, LAYERSCOPE uses local, global, distributional, and correspondence-based geometric metrics to compare layerwise representation structure within and across models without requiring task-specific labels. We evaluate seven architecturally diverse models across video and multimodal classification, clustering, and text-to-video retrieval tasks from MVEB/MVEB+. We find that intermediate-layer representations can outperform final-layer and model-default outputs. We also find that no single geometric metric consistently predicts downstream performance, but note that distinct layerwise geometric signatures emerge across model families. LID shows task-dependent relationships with performance, while RankMe provides the strongest measure for classification and clustering, but is not a universal layer selector. We also find that pairing-aware metrics explain retrieval better than distributional distances alone. LAYERSCOPE therefore offers a framework for comparing representations across models and layers, enabling a more systematic evaluation in video and multimodal settings.
- Abstract(参考訳): ビデオおよびマルチモーダル設定において,モデルが学習した表現を特徴付けることを目的とした,ラベルフリーで階層的なフレームワークであるLAYERSCOPEを提案する。
最終層または中間層からの表現を用いて下流のパフォーマンスを評価するには、通常大量のラベル付きデータ、繰り返しタスク固有の評価、および相当な計算が必要である。
これらの制限に対処するため、LAYERSCOPEは局所的、グローバル的、分布的、および対応性に基づく幾何学的メトリクスを使用して、タスク固有のラベルを必要とせずに、モデル内およびモデル間の階層的表現構造を比較する。
MVEB/MVEB+によるビデオ・マルチモーダル分類,クラスタリング,テキスト・ツー・ビデオ検索の7つのアーキテクチャモデルについて検討した。
中間層表現は最終層およびモデルデフォルト出力より優れることがわかった。
また、1つの幾何学的メートル法が常に下流のパフォーマンスを予測することはないが、階層的に異なる幾何学的シグネチャがモデルファミリに現れることに留意する。
LIDはタスク依存とパフォーマンスの関係を示すが、RangeMeは分類とクラスタリングにおいて最強の指標を提供するが、普遍的な層セレクタではない。
また、ペアリングを意識したメトリクスは、分布距離だけでは説明できない。
したがって、LAYERSCOPEは、モデルとレイヤ間の表現を比較するためのフレームワークを提供し、ビデオおよびマルチモーダル設定においてより体系的な評価を可能にする。
関連論文リスト
- RECALL: REpresentation-aligned Catastrophic-forgetting ALLeviation via Hierarchical Model Merging [33.22889542330089]
大規模言語モデル(LLM)の内部表現は、学習知識の信頼できるプロキシとして機能する。
本稿では,過去データにアクセスせずに連続的な学習を行うための表現認識モデル統合フレームワークRECALLを提案する。
論文 参考訳(メタデータ) (2025-10-23T12:17:37Z) - HEAS: Hierarchical Evolutionary Agent Simulation Framework for Cross-Scale Modeling and Multi-Objective Search [4.807104001943257]
階層シミュレーションエージェント(Hierarchical Simulation Agent, HEAS)は、階層化されたエージェントベースのモデリングを進化的最適化とトーナメント評価で統合するPythonフレームワークである。
HEASは、共有コンテキストを読み書きする決定論的レイヤにスケジュールされた軽量プロセス(ストリーム)の階層としてモデルを表現する。
compact APIとCLIは、シングルオブジェクトとマルチオブジェクトの進化をシミュレートし、最適化し、評価します。
論文 参考訳(メタデータ) (2025-08-21T13:35:46Z) - Layer by Layer: Uncovering Hidden Representations in Language Models [28.304269706993942]
中間層がよりリッチな表現をエンコードできることを示し、ダウンストリームタスクの幅広いパフォーマンスを改善することがよくある。
我々のフレームワークは、各層が情報圧縮と信号保存のバランスをとる方法を強調し、なぜ中層埋め込みが最終層の性能を上回るのかを明らかにする。
論文 参考訳(メタデータ) (2025-02-04T05:03:42Z) - Tracing Representation Progression: Analyzing and Enhancing Layer-Wise Similarity [20.17288970927518]
本研究では,各変圧器の隠蔽層間の表現の類似性について検討する。
層間の表現が正の相関を示し、層が近づくと類似度が増加する。
浅い層の有効性を向上させるためのアライメント・トレーニング手法を提案する。
論文 参考訳(メタデータ) (2024-06-20T16:41:09Z) - RGM: A Robust Generalizable Matching Model [49.60975442871967]
RGM(Robust Generalist Matching)と呼ばれる疎密マッチングのための深部モデルを提案する。
合成トレーニングサンプルと実世界のシナリオのギャップを狭めるために、我々は、疎対応基盤真理を持つ新しい大規模データセットを構築した。
さまざまな密集したスパースなデータセットを混ぜ合わせることができ、トレーニングの多様性を大幅に改善しています。
論文 参考訳(メタデータ) (2023-10-18T07:30:08Z) - Efficient and Effective Deep Multi-view Subspace Clustering [9.6753782215283]
E$2$MVSC(Efficient and Effective Deep Multi-View Subspace Clustering)と呼ばれる新しいディープフレームワークを提案する。
パラメータ化されたFC層の代わりに、より計算効率のよいサンプル数からネットワークパラメータスケールを分離するRelation-Metric Netを設計する。
E$2$MVSCは既存のメソッドに匹敵する結果を出し、様々なタイプのマルチビューデータセットで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-10-15T03:08:25Z) - RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation [53.4319652364256]
本稿では,ビデオオブジェクトのセグメンテーションを参照するためのSAMの可能性を探るRefSAMモデルを提案する。
提案手法は,Cross-RValModalを用いることで,モダリティ学習を向上させるためにオリジナルのSAMモデルに適応する。
我々は、言語と視覚の特徴を効果的に調整し、融合させるために、パラメータ効率のチューニング戦略を採用している。
論文 参考訳(メタデータ) (2023-07-03T13:21:58Z) - Segmenting Moving Objects via an Object-Centric Layered Representation [100.26138772664811]
深層表現を用いたオブジェクト中心セグメンテーションモデルを提案する。
複数のオブジェクトで合成トレーニングデータを生成するスケーラブルなパイプラインを導入する。
標準的なビデオセグメンテーションベンチマークでモデルを評価する。
論文 参考訳(メタデータ) (2022-07-05T17:59:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。