論文の概要: A Pre-Specified Construction-Confirmation Test of Operation-Level Causal Transfer Across Finite Isomorphic Symbolic Domains
- arxiv url: http://arxiv.org/abs/2608.15809v1
- Date: Sun, 16 Aug 2026 15:37:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.430189
- Title: A Pre-Specified Construction-Confirmation Test of Operation-Level Causal Transfer Across Finite Isomorphic Symbolic Domains
- Title(参考訳): 有限同型シンボリックドメイン間の操作レベル因果転移の事前確認試験
- Abstract要約: 2つの操作間の隠れ状態の違いが、ソース入力毎に別々に推定されているかどうかを問う。
この設計は、入力固有の介入を、不正操作、ノルムマッチングランダム、ノーオップ制御と比較し、個別に分離された確認分割から候補構築を分離する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Behavioral accuracy, linear decodability, and successful activation interventions do not by themselves show that a model carries an operation-level structure from one symbolic domain to another. We ask a narrower question in finite isomorphic state spaces: if the hidden-state difference between two operations is estimated separately for each source input, does adding that difference to a mapped recipient input move the model toward the corresponding recipient answer? The design compares this input-specific intervention with wrong-operation, norm-matched random, and no-op controls, and separates candidate construction from an independently isolated confirmation split. On a frozen Qwen2.5-7B-Instruct model at layers 20--21, one route--domain--operation candidate from a family pre-specified and frozen before confirmation access, transparent | integer_mod16--letters16 | successor->predecessor, passed both PyVene splits; its confirmation intersection--union p-value was 0.000198 and its 36-family Holm-adjusted p-value was 0.006943. A subsequent NNsight 0.7.0 experiment, pre-specified and frozen before its confirmation access, tested only this selected prompt route, without candidate or layer reselection. It reproduced all 12 confirmation effect estimates, confidence intervals, and exact sign-flip p-values numerically; its 36-family Holm-adjusted p-value was 0.007141. The result is therefore limited to one prompt route and one candidate, replicated across two intervention implementations on one model revision and one layer interval. It does not establish cross-model generalization, full-family backend independence, domain-general transfer, or algebraic invariance.
- Abstract(参考訳): 振舞い精度、線形陰極性、そして成功した活性化介入は、モデルが1つの記号領域から別の記号領域への操作レベル構造を持つことを示すものではない。
2つの操作間の隠れ状態の差が各ソース入力ごとに別々に推定された場合、その差分をマップされた受信者入力に追加すると、対応する受信者応答に向けてモデルが移動されますか?
この設計は、入力固有の介入を、不正操作、ノルムマッチングランダム、ノーオップ制御と比較し、個別に分離された確認分割から候補構築を分離する。
20-21層における凍結Qwen2.5-7B-インストラクタモデルでは,PyVeneとPyVeneの両分割をパスし,それぞれ0.000198,Holm-adjusted p-valueが0.006943であった。
その後のNNsight 0.7.0実験は、その確認アクセスの前に事前に特定され凍結され、候補や層の再選択なしに、選択されたプロンプト経路のみをテストした。
12の確認効果推定値、信頼区間、正確なサインフリップp値を数値的に再現し、36ファミリーのホルム調整p値は0.007141である。
そのため、結果は1つのプロンプトルートと1つの候補に制限され、1つのモデルリビジョンと1つの層間隔で2つの介入実装で複製される。
クロスモデル一般化、フルファミリーのバックエンド独立性、ドメイン・ジェネラル移動、代数的不変性を確立しない。
関連論文リスト
- Two tests of phase-structure features for transition prediction [0.0]
本報告では, 2つの設定において, 位相特性が統合ベースライン上での終端予測を改善するか否かを検討する。
研究1は、封印されたスコアの前に矛盾カテゴリーパイプラインを凍結する。
研究2では,1,415の回答-変化比較と20の繰り返し,5倍の群によるクロスバリデーションを用いて,ブロックb0-b4に対する15の治療法を開発した。
論文 参考訳(メタデータ) (2026-08-31T20:29:18Z) - Cross-View Correspondence Is a Measurement Intervention: Two-Sided Validation for Agent Evaluation and Credit Assignment [3.2479665905442645]
クロスビュー対応は、エージェントの評価やクレジットの割り当てがポイントの結論を支持する前に、宣言、検証、不確実性に伝播されなければならない。
本研究では,2側によるニュアンス除去と応答保存の検証,下流の結論のオールオプティマ同定,有効性確立後の不確実性伝播の3つの要素による妥当性理論と監査を開発する。
論文 参考訳(メタデータ) (2026-08-18T12:39:21Z) - Topology-Aware Query Selection for Surgical Instrument Instance Segmentation [8.051653068935332]
最終クエリ選択は、独立した候補決定の集合ではなく、リレーショナルで可変性の問題である。
我々は、固定されたMask2Formerの空でない候補を完全なグラフとして表現したトポロジ対応クエリ選択を評価する。
評価された完全パスは、特定ネイティブインスタンス契約における固定されたMask2Former候補からの一貫性のあるインスタンスセット構築を改善したことを示す。
論文 参考訳(メタデータ) (2026-08-12T03:29:47Z) - Does the way we write a theory change the program an LLM builds from it? A prospective randomized study of renderer format in LLM theory-to-program translation [0.0]
言語理論は実行可能モデルに翻訳するには変数、介入、相互作用に関する選択が必要である。
我々は,理論言語モデルによるプログラムを体系的に変更するかどうかを検証した。
論文 参考訳(メタデータ) (2026-08-10T23:37:47Z) - SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification [71.9783246097687]
SEERは、ペアローカライゼーション中の候補関係を隠蔽し、明示的な主観的/対象的役割を持つクエリ固有ビューを構築し、補完的な証拠として完全なイメージとスパースボックス幾何学を保持する。
正確な逆サポートを持つ関係選択プロトコルでは、オプションリファインメントがエンティティロールを交換し、正確に1つの視覚状態が対応する逆関係に従う場合にのみ前方決定を変更する。
変更されていないプロトコルは、3つのモデルにまたがる2,434個のフィルター付きEmbSpatialペア関係質問に対して +4.35 から +11.79 を得る。
論文 参考訳(メタデータ) (2026-08-04T13:16:15Z) - Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - Agent Step Value: Auditing Evaluator-Channel Reversals in Black-Box Agent Traces [2.4293637634506404]
評価器由来のステップ報酬がスコアリングチャネル間でプールされたり比較されたりした場合、それらのサインは輸送可能なものとして扱われる。
エージェントステップ値(ASV)をチャネルインデクシングされたターゲットマージンゲインとして定義し、チャネル間相互作用の欠如を識別する。
論文 参考訳(メタデータ) (2026-07-05T17:27:56Z) - Bayesian Wind Tunnels for Model Selection [0.4779196219827507]
変圧器は固定仮説クラス内で正確にベイズフィルタを行うことができることを示す。
離散統計学が算術を必要とする場合、モデル選択は整数トークンで成功する。
定常性制御は、安定なセマンティクスであり、整数のアイデンティティではなく回路のコンパイルを可能にする。
論文 参考訳(メタデータ) (2026-07-01T04:05:08Z) - TERRA: Task-Embedded Reasoning and Representation Architecture for Cross-Domain Applications [0.0]
単一の動作条件付き潜伏予測アーキテクチャは、運転シーン、ロボットワークスペース、金融注文帳の構造状態に基づいて訓練することができる。
ある構造化状態領域で学習された表現や予測器が、構造的に類似しているが、そうでなければ無関係な領域、そしてどれだけの量で受け継がれるのか。
次数付き潜在格子上で各ドメインを制御マルコフ過程としてモデル化し、任意のインスタンス化を薄いドメインアダプタと共有ドメイン不変コアに分解し、近似マルコフ決定プロセス準同型とクロスドメイン対応を同定する。
論文 参考訳(メタデータ) (2026-06-01T00:50:59Z) - Counterfactual Likelihood Tests for Indirect Influence in Private Reasoning Channels [51.56484100374058]
本稿では,私的推論チャネル間の影響を測定するための実証実験について述べる。
この方法は、上流のプライベートブロックを長さマッチングドナーブロックに置き換え、公開トークンシーケンスと下流ターゲットを固定し、下流ターゲットの負のログに似たシフトを測定する。
論文 参考訳(メタデータ) (2026-05-18T20:27:43Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Semi-DETR: Semi-Supervised Object Detection with Detection Transformers [105.45018934087076]
半教師付き物体検出(SSOD)におけるDETRに基づくフレームワークの解析
本報告では,第1次変圧器を用いたエンド・ツー・エンド半教師対象検出器であるSemi-DETRについて述べる。
我々の手法は、最先端の手法をクリアマージンで上回る。
論文 参考訳(メタデータ) (2023-07-16T16:32:14Z) - QuTE: decentralized multiple testing on sensor networks with false discovery rate control [93.1040521878626]
本稿では、偽発見率(FDR)の証明可能な保証を備えたグラフ上での分散多重仮説検定法を設計する。
異なるエージェントが無向グラフのノードに存在し、各エージェントはそのノードに局所的な1つ以上の仮説に対応するp値を持つ。
各エージェントは、グラフ全体の大域的FDRが予め定義されたレベルで制御されなければならないという共同目的のもと、隣人とのみ通信することで、それぞれのローカル仮説の1つ以上の拒絶を個別に決めなければならない。
論文 参考訳(メタデータ) (2022-10-09T19:48:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。