論文の概要: Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability
- arxiv url: http://arxiv.org/abs/2608.19338v1
- Date: Wed, 19 Aug 2026 18:02:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.372746
- Title: Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability
- Title(参考訳): メカニスティック・トモグラフィー:制御指向の解釈可能性のための設計計測
- Abstract要約: 機械的解釈可能性(Mechanistic interpretability)は、モデルが直接公開しない量を求める。
共有計測構造をメカニスティックトモグラフィーとして定式化する。
この言語は、最もコストのかかる測定から始まり、意図されたスケールでのホールドアウト介入をテストし、単純なミスマッチを校正し、測定ファミリを拡張するという、実用的な手順を提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mechanistic interpretability seeks quantities that models do not expose directly: represented states, component effects, interactions, and responses to interventions. Patching, gradients, Hessian-vector products, and subset interventions provide different measurements under different access assumptions and may target different quantities. We formulate their shared measurement structure as mechanistic tomography: designed measurement for recovering internal mechanisms and intervention effects. For a chosen basis and intervention family, measurements take the form y = Ax + w, where A describes the interventions, x is the target map, and w contains nonlinear response, sampling error, and basis misspecification. This language gives a practical procedure: start with the least costly measurements, test on held-out interventions at the intended scale, calibrate simple mismatch, and expand the measurement family when structured residuals remain. Control provides a demanding validation setting because an estimate that guides an intervention acts as an observer. In a two-HMM model, control error rises with observer error, while target improvement can hide nuisance-state movement. Under forward-only access, sparse aggregate measurements recover a finite-effect map with fewer interventions than coordinate patching. With gradient access, finite probes improve a local attribution map. Lifted measurements and Hessian-vector products recover interactions missed by first-order maps, while Tracr shows that the required family depends on the basis. On GPT-2-small IOI, the Name Mover-Negative Name Mover interaction is the largest held-out predictive term among three tested cross-group pairs. On Qwen-2.5-7B, finite calibration makes an additive refusal-response map adequate, so held-out error does not support pairwise lifting.
- Abstract(参考訳): 機械的解釈可能性(Mechanistic Interpretability)は、モデルが直接公開しない量を求める:表現された状態、コンポーネント効果、相互作用、介入に対する応答。
パッチング、勾配、ヘッセン・ベクター製品、およびサブセット介入は異なるアクセス仮定の下で異なる測定値を提供し、異なる量をターゲットにすることができる。
我々は,その共有計測構造をメカニスティックトモグラフィーとして定式化し,内部機構と介入効果の回復のための測定を設計した。
選択された基底と介入の族に対して、測定は y = Ax + w の形を取るが、A は介入を記述し、x は対象の写像であり、w は非線形応答、サンプリング誤差、基底の不特定を含む。
この言語は、最もコストのかかる測定から始まり、意図されたスケールでのホールドアウト介入をテストし、単純なミスマッチを校正し、構造化された残留物が残っているときに測定ファミリを拡張するという、実用的な手順を提供する。
制御は、介入を導く見積もりがオブザーバとして機能するため、要求される検証設定を提供する。
2-HMMモデルでは、制御誤差はオブザーバエラーとともに上昇し、目標改善はニュアンス状態の動きを隠すことができる。
前方のみのアクセスでは、スパースアグリゲーション測定は座標パッチよりも介入が少ない有限効果マップを復元する。
勾配アクセスにより、有限プローブは局所帰属写像を改善する。
リフテッド測定とヘッセン・ベクター生成物は、一階地図の欠落した相互作用を回復する一方、トラクラは、要求された家族は基礎に依存することを示した。
GPT-2- small IOI では、Mover-Negative Name Mover 相互作用は、3つのテストされたクロスグループペアの中で最大のホールドアウト予測項である。
Qwen-2.5-7Bでは、有限キャリブレーションは追加の拒絶応答写像を適切にするので、ホールドアウト誤差はペアリフトをサポートしない。
関連論文リスト
- Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling [65.03665015319457]
本稿では,マルチターン障害を2つのモードに分解するアクションクラス指向診断フレームワークを提案する。
複数のマルチターンベンチマークにまたがるツールコールモデルのパネル上で検証を行う。
論文 参考訳(メタデータ) (2026-09-01T09:08:15Z) - The Quadrilateral Loss: Additivity as a Measurable Behavior of Dense Neural Networks [0.0]
積算性を測定可能な振る舞いとして扱う4次的損失,すなわち微分可能なペナルティを導入する。
我々は, 正確な添加率, 構造マスク, 行動的ペナルティ, 体重減少, バックフィッティング, 共有断面モデル, バンチ強化切り株の経路を比較した。
論文 参考訳(メタデータ) (2026-07-22T14:23:37Z) - DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation [50.584834483403675]
新しい視覚概念を学習するか、望ましくないものを消去するか、事前学習したテキスト・画像拡散モデルに適応させることは、意図した効果だけで日常的に評価される。
適応が意味論的に無関係な概念を、構造的にメトリクスを集約することができない方法で体系的に損なうことを実証する。
DriftScopeは、任意の2つのモデルチェックポイントを取り込み、視覚的概念が最も移行したトークンのランクリストを返す、プロンプトレベルの診断ツールである。
論文 参考訳(メタデータ) (2026-06-30T20:57:51Z) - Calibration Is Not Control: Why LLM-Agent Oversight Needs Intervention [14.376426170653707]
2つのトラジェクトリプレフィックスは、異なるアクションを必要とする間、同じリスク見積を持つことができる。
我々は、このミスマッチをターゲットエラーとして形式化し、介入の利点を特定する。
論文 参考訳(メタデータ) (2026-06-19T13:08:17Z) - Input-schema identifiability limits in physics-informed surrogates for mechanics-governed flow [0.0]
本稿では,計算サロゲートに対する入力スキーマ識別性証明を提案する。
Cosserat-rodリダクションを用いた非圧縮性管状流れのキャラクタリゼーションを行う。
その結果、サロゲートモデリングタスクが物理的に識別可能であるか否かを判定するためのメカニックベースの診断を提供する。
論文 参考訳(メタデータ) (2026-06-08T23:22:18Z) - Measurement Geometry and Design for Trustworthy Generative Inverse Problems [9.927046475467204]
本研究では,測度・測度の観点から生成的逆問題について検討する。
中心的な問題は、固定測定オペレータが、生成前の条件下で可視である近傍の画像を識別できるかどうかである。
本稿では,操作者が先行関係の接点方向をいかによく観察するかを定量化する局所的な測定・次元整合性尺度を提案する。
論文 参考訳(メタデータ) (2026-06-01T14:28:24Z) - An Exponential Advantage for Adaptive Tomography of Structured States under Pauli Basis Measurements [20.661777397879792]
適応性が量子状態トモグラフィーの助けになるかどうかについての広義の主張は、状態ファミリー、測定アーキテクチャ、エラーメトリックが慎重に特定されない限り、誤解を招く可能性がある。
局所的なパウリ基底測定に基づく単一コピー量子状態トモグラフィーについて検討する。
論文 参考訳(メタデータ) (2026-04-28T18:26:47Z) - On the Paradoxical Interference between Instruction-Following and Task Solving [50.75960598434753]
次の命令は、大規模言語モデル(LLM)を、タスクの実行方法に関する明示的な制約を指定することで、人間の意図と整合させることを目的としている。
我々は,LLMのタスク解決能力にパラドックス的に干渉する命令に従うという,直感に反する現象を明らかにした。
本稿では,タスク解決に追従する命令の干渉を定量化する指標として,SUSTAINSCOREを提案する。
論文 参考訳(メタデータ) (2026-01-29T17:48:56Z) - Nonparametric Identifiability of Causal Representations from Unknown
Interventions [63.1354734978244]
本研究では, 因果表現学習, 潜伏因果変数を推定するタスク, およびそれらの変数の混合から因果関係を考察する。
我々のゴールは、根底にある真理潜入者とその因果グラフの両方を、介入データから解決不可能なあいまいさの集合まで識別することである。
論文 参考訳(メタデータ) (2023-06-01T10:51:58Z) - Score-based Causal Representation Learning with Interventions [54.735484409244386]
本稿では,潜在因果変数を間接的に観察する際の因果表現学習問題について検討する。
目的は、 (i) 未知の線形変換(スケーリングまで)を回復し、 (ii) 潜在変数の下の有向非巡回グラフ(DAG)を決定することである。
論文 参考訳(メタデータ) (2023-01-19T18:39:48Z) - Uncertainty-Aware Adaptation for Self-Supervised 3D Human Pose
Estimation [70.32536356351706]
本稿では、2つの出力ヘッドを2つの異なる構成にサブスクライブする共通のディープネットワークバックボーンを構成するMPP-Netを紹介する。
ポーズと関節のレベルで予測の不確実性を定量化するための適切な尺度を導出する。
本稿では,提案手法の総合評価を行い,ベンチマークデータセット上での最先端性能を示す。
論文 参考訳(メタデータ) (2022-03-29T07:14:58Z) - Robust Self-Supervised LiDAR Odometry via Representative Structure
Discovery and 3D Inherent Error Modeling [67.75095378830694]
そこで我々は,2段階のオドメトリ推定ネットワークを構築し,一連の部分領域変換を推定してエゴモーメントを求める。
本稿では,トレーニング,推論,マッピングフェーズにおける信頼できない構造の影響を軽減することを目的とする。
我々の2フレームのオードメトリーは、翻訳/回転誤差の点で、過去の芸術の状態を16%/12%上回っている。
論文 参考訳(メタデータ) (2022-02-27T12:52:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。