論文の概要: Representation as a Bottleneck for Mechanistic Interpretability: The Manifestation Unit Protocol
- arxiv url: http://arxiv.org/abs/2607.00089v1
- Date: Tue, 30 Jun 2026 19:26:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.608048
- Title: Representation as a Bottleneck for Mechanistic Interpretability: The Manifestation Unit Protocol
- Title(参考訳): 機械的解釈可能性のためのボトルネックとしての表現:操作単位プロトコル
- Abstract要約: 機械的解釈可能性には、どのニューラルネットワークコンポーネントがエンコードするか、どのようにエンコードするかを特徴付ける、コンポーネントレベルの分析の豊富な在庫がある。
テーブル、回路選択性、特徴リストは、スタディ毎のノートブックにロックされている。
独立して評価できるボトルネックについて検討し、型付き表現プロトコルを導入する。
このプロトコルは、生成視覚(β-VAE)、離散視覚(CNN)、言語(GPT-2)にまたがって確立され、2つの発見をサポートする。
- 参考スコア(独自算出の注目度): 2.6454356167892166
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mechanistic interpretability has produced a rich inventory of component-level analyses that characterise what neural-network components encode and how they interact. Their outputs, however, are not easily reusable: selectivity tables, circuit diagrams, and feature lists remain locked in per-study notebooks - non-composable, not queryable in natural language, and not directly actionable for downstream audit or intervention. We study the representation layer that sits between these analyses and downstream use as a bottleneck that can be evaluated independently, and introduce Manifestation Units, a typed tuple protocol (E, S, R, D, G) extended with attention-head primitives (T) for transformer architectures, organising per-component statistics into structured fields populated automatically and queried through hybrid retrieval. Instantiated across generative vision (beta-VAE), discriminative vision (CNN), and language (GPT-2), the protocol supports two findings: typed structure substantially outperforms unstructured baselines on retrieval, and CNN filters retrieved by the schema satisfy causal sufficiency and necessity criteria under matched-budget controls. The schema absorbs attention-head primitives without modification, set-recovers known IOI circuit members under retrieval-budget-matched controls, and reveals an irreducible two-field core (S+R) with remaining fields either redundant or actively interfering. We present this as schema infrastructure for mechanistic interpretability rather than frontier-scale validation.
- Abstract(参考訳): 機械的解釈可能性(Mechanistic Interpretability)は、どのニューラルネットワークコンポーネントがエンコードするか、どのように相互作用するかを特徴付ける、コンポーネントレベルの分析の豊富なインベントリを生み出している。
選択性テーブル、サーキットダイアグラム、フィーチャーリストは、スタディごとのノートブックにロックされ、非コンパイル可能であり、自然言語ではクエリ可能で、下流の監査や介入では直接動作できない。
本稿では,これらの分析と下流利用の中間に位置する表現層を独立に評価可能なボトルネックとして検討し,トランスフォーマーアーキテクチャの注目頭プリミティブ(T)を拡張したタイプ付きタプルプロトコル(E,S,R,D,G)であるManifestation Unitsを導入し,構成単位ごとの統計データを自動で集約し,ハイブリッド検索によってクエリする手法を提案する。
このプロトコルは、生成的視覚(beta-VAE)、識別的視覚(CNN)、言語(GPT-2)にまたがって確立されており、型付き構造は検索において非構造的ベースラインを大幅に上回っている。
スキーマは、修正することなく注目ヘッドプリミティブを吸収し、検索予算設定された制御の下で、既知のIOI回路メンバーをリカバリし、余剰フィールドが冗長またはアクティブに干渉する既約2フィールドコア(S+R)を明らかにする。
我々はこれをフロンティアスケールの検証ではなく,機械的解釈可能性のためのスキーマ基盤として提示する。
関連論文リスト
- Structuring Semantic Embeddings for Principle Evaluation: A Prototype-Guided Contrastive Learning Approach [58.15427952222424]
汎用的なテキスト埋め込みはそのようなタスクに広くデプロイされているが、意味的類似性は意味的に似ているがタスク固有の例を示すことができる。
本稿では,凍結したテキスト埋め込み上に構築された幾何正規化モジュールであるPGCL(Prototype-Guided Contrastive Learning)を紹介する。
論文 参考訳(メタデータ) (2026-08-15T13:19:25Z) - SPORT: Structure-Aware Prototype Disentanglement for Incomplete Multi-View Clustering [51.01038967474103]
プロトタイプベースの不完全なマルチビュークラスタリングは、不足ビュー計算のためのセマンティックアンカーとしてプロトタイプを活用することで注目を集めている。
構造対応PrOtotype disentanglement foR incomplete multi-view clusTering (Sport) と呼ばれる新しいフレームワークを提案する。
SPORTは、クラスタレベルのリレーショナル構造を保持しながら、プロトタイプの共有コンポーネントとビュー固有のコンポーネントを明示的に分離する。
論文 参考訳(メタデータ) (2026-07-11T17:40:22Z) - The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context [22.202409807556517]
帰属盲点に対処するために,計算現実モニタリングを導入する。
CRMは、認知科学の現実監視フレームワークから適応した原則を運用する。
プレトレーニングされた露光が測定可能な内部軌道シグネチャを残すかどうかを検出する。
論文 参考訳(メタデータ) (2026-05-26T09:48:51Z) - Unlocking Biological Workflows for Robust Protein-Text Question Answering: A Dual-Dimensional RAG Framework [60.82334952881798]
タンパク-テキスト質問回答(QA)は、自然言語による生物学的配列の解釈に不可欠である。
2D-ProteinRAGは,大規模言語モデル(LLM)を金本位生物研究ワークフロー内で動作させる新しいフレームワークである。
本研究では,2D-Proteinが常に最先端の性能を達成し,微調整ベースラインや他のRAG法よりも優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2026-05-17T05:03:24Z) - Reasoning-Based Refinement of Unsupervised Text Clusters with LLMs [8.06425428468097]
本稿では,大規模言語モデル(LLM)を組み込みジェネレータとしてではなく,推論に基づく改良フレームワークを提案する。
本フレームワークでは, (i) コヒーレンス検証, (ii) 冗長性判断, (iii) ラベル接地という3つの推論段階を導入する。
インタラクションモデルが異なる2つのプラットフォームから,実世界のソーシャルメディアコーパスの枠組みを評価する。
論文 参考訳(メタデータ) (2026-04-08T20:02:48Z) - Weight-Informed Self-Explaining Clustering for Mixed-Type Tabular Data [63.62853416081748]
WISEは表現、特徴重み付け、クラスタリング、解釈を統一するフレームワークである。
クラスタリングを駆動する同じプリミティブに根ざした、忠実で人間解釈可能な説明を生成する。
論文 参考訳(メタデータ) (2026-04-07T13:18:31Z) - Heuristic-inspired Reasoning Priors Facilitate Data-Efficient Referring Object Detection [53.988759250627425]
HeROD(Heuristic-inspired ROD)は、明示的で解釈可能な空間的および意味的推論を注入する軽量でモデルに依存しないフレームワークである。
HeRODは、スカーセラベル体制において強い接地ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-03-25T10:33:22Z) - Sparse but not Simpler: A Multi-Level Interpretability Analysis of Vision Transformers [5.6842776317118835]
We evaluate the relationship between weight sparsity and interpretability in Vision Transformers using DeiT-III B/16 models pruned with Wanda。
その結果, 構造的効果は明らかだが, 解釈可能性の向上は限られていることがわかった。
これらの結果は、構造的疎結合だけでは、より解釈可能な視覚モデルが確実に得られないことを示唆している。
論文 参考訳(メタデータ) (2026-03-16T21:13:49Z) - CLAIRE: Compressed Latent Autoencoder for Industrial Representation and Evaluation -- A Deep Learning Framework for Smart Manufacturing [51.56484100374058]
CLAIREは、教師なしの深層表現学習と、スマート製造システムにおけるインテリジェントな品質管理のための教師付き分類を統合したハイブリッドエンドツーエンド学習フレームワークである。
最適化されたディープオートエンコーダを使用して、生の入力をコンパクトな潜伏空間に変換し、不適切な特徴やノイズを抑えながら本質的なデータ構造を効果的にキャプチャする。
提案したフレームワークは、堅牢な障害検出のために、説明可能なAIと機能認識の正規化を統合する可能性を強調している。
論文 参考訳(メタデータ) (2026-03-06T15:11:58Z) - Generating Highly Structured Test Inputs Leveraging Constraint-Guided Graph Refinement [4.121384394709256]
本研究では,グラフベース表現を用いて,構造化ドメインに対するテスト入力を統一できるかどうかを検討する。
我々は,8つのAIシステムにおける入力妥当性とセマンティックな保存性を高めるために,このアプローチの有効性を評価する。
論文 参考訳(メタデータ) (2025-07-28T18:54:04Z) - CSE-SFP: Enabling Unsupervised Sentence Representation Learning via a Single Forward Pass [3.0566617373924325]
プレトレーニング言語モデル(PLM)の最近の進歩は、この分野において顕著な進歩をもたらした。
CSE-SFPは,生成モデルの構造的特徴を利用する革新的な手法である。
CSE-SFPは高品質な埋め込みを実現するだけでなく、トレーニング時間とメモリ消費を著しく削減する。
論文 参考訳(メタデータ) (2025-05-01T08:27:14Z) - CART: A Generative Cross-Modal Retrieval Framework with Coarse-To-Fine Semantic Modeling [53.97609687516371]
クロスモーダル検索は、異なるモーダルデータの相互作用を通じて、クエリと意味的に関連するインスタンスを検索することを目的としている。
従来のソリューションでは、クエリと候補の間のスコアを明示的に計算するために、シングルトウワーまたはデュアルトウワーのフレームワークを使用している。
粗大なセマンティックモデリングに基づく生成的クロスモーダル検索フレームワーク(CART)を提案する。
論文 参考訳(メタデータ) (2024-06-25T12:47:04Z) - End-to-End Object Detection with Transformers [88.06357745922716]
本稿では,オブジェクト検出を直接セット予測問題とみなす新しい手法を提案する。
我々のアプローチは検出パイプラインを合理化し、手作業で設計された多くのコンポーネントの必要性を効果的に除去する。
この新しいフレームワークの主な構成要素は、Detection TRansformerまたはDETRと呼ばれ、セットベースのグローバルな損失である。
論文 参考訳(メタデータ) (2020-05-26T17:06:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。