論文の概要: A Calibrated Test of Internal Action Maps: State Signals Without Global Affine Closure
- arxiv url: http://arxiv.org/abs/2608.13626v1
- Date: Thu, 13 Aug 2026 05:41:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.170904
- Title: A Calibrated Test of Internal Action Maps: State Signals Without Global Affine Closure
- Title(参考訳): 内部アクションマップの校正テスト:グローバルアフィン閉鎖のない状態信号
- Abstract要約: 我々は、ソースのないアクションマップが自然なポストアクションアクティベーションに達するかどうかを検証し、構成する。
実験をエビデンス格子として整理し,既知のアフィンS_5キャリア上の幾何学的分岐を検証する。
- 参考スコア(独自算出の注目度): 0.16921396880325776
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A hidden state signal can be decodable or causally usable without supporting a reusable action map. We test whether action maps fitted without a source reach its natural post-action activation and compose. We organize the tests as an evidence lattice and validate the geometric branch on a known affine S_5 carrier: all held-source folds pass one-step, composition, inverse, decoding, and commutativity gates. Structured curvature and held-domain conjugacy raise error monotonically, but only 23/30 strongest cells flip a closure gate, bounding rather than universalizing calibration. In post-trained Qwen/Qwen3-4B, frozen final-token h28 affine maps have mean held-entity error .519, versus .398 for within-test-domain cross-fit. Seven randomized entity splits and map geometry do not support a purely entity-specific account. Earlier h4/h16 layers fit one-step transitions better, but h4 conflict-state decoding is weak and lexical controls remain unresolved. Three matched intervention datasets regenerated from one frozen checkpoint show causal effects only at h28/h36. Outcome-aware refitting improves h28 one-step error to .474 (.469 with weighting), yet no refit passes composition. Learned finite worlds likewise preserve relative algebraic signals or shared charts without held-source affine closure. Within the tested carriers, state availability, causal use, local geometry, and reusable closure are separable. The result is limited to one pretrained model, sampled final-token layers, two finite worlds, and the tested affine or diagnostic function classes.
- Abstract(参考訳): 隠された状態信号は、再利用可能なアクションマップをサポートすることなく、復調可能または因果的に使用することができる。
我々は、ソースのないアクションマップが自然なポストアクションアクティベーションに達するかどうかを検証し、構成する。
実験をエビデンス格子として整理し、既知のアフィンS_5キャリア上の幾何学的分岐を検証する。
構造的曲率と保持領域の共役性は単調にエラーを引き起こすが、キャリブレーションを普遍化するのではなく、クロージャーゲートをひっくり返すのは23/30の強い細胞のみである。
訓練後のQwen/Qwen3-4Bでは、冷凍された最終トーケンのh28アフィンマップは、テスト領域のクロスフィットに対して.519、.398のホールドエンタリティ誤差を持つ。
7つのランダム化されたエンティティ分割とマップ幾何学は、純粋にエンティティ固有のアカウントをサポートしない。
初期のh4/h16層は1段階の遷移に適合するが、h4の競合状態の復号は弱く、語彙制御は未解決のままである。
凍結したチェックポイントから再生された3つの一致する介入データセットは、h28/h36でのみ因果効果を示す。
アウトカム・アウェアのリフィットにより、h28のワンステップエラーは.474(重み付き.469)に改善される。
学習された有限世界は、同様に相対代数的信号や共有チャートを、ホールドソースのアフィン閉包なしに保存する。
テスト対象キャリア内では、状態可用性、因果利用、局所幾何学、再利用可能なクロージャが分離可能である。
結果は、事前訓練された1つのモデル、サンプル化された最終トーケン層、2つの有限世界、テストされたアフィンまたは診断機能クラスに限られる。
関連論文リスト
- Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores [31.709549159768727]
多様な推論ベンチマーク間で一貫した読み出しギャップを観察する。
隠れ状態プローブは、ネイティブシークエンススコアが完全に崩壊しても正解を復号することに成功した。
以上の結果から,無作為な内部論理を隠蔽する表現障害が明らかにゼロショット推論の欠点であることが明らかとなった。
論文 参考訳(メタデータ) (2026-08-31T16:43:55Z) - Feature Priming in Online Linear Regression: Sparse-Regret Lower Bounds and a Tight Univariate Rate [47.36630149538994]
高次元のオンライン予測では、最良の予測子はいくつかの機能にのみ依存する可能性があるため、後悔は周囲の次元ではなく、疎らさでスケールすべきである。
WarmuthとAmidはCOLT 2023で、これらの3つのルールのいずれかが競合するオンライン後悔の保証を認めているかどうかを尋ねた。
安価なニュアンスは、リフィットが真の予測座標を過度に重くする原因となる。
論文 参考訳(メタデータ) (2026-08-18T09:32:03Z) - Why Does the Future Branch? Identifiable Closure Tests for Stochastic Physical World Models [0.0]
ClosurePairsは、繰り返し発生する障害を伴う互換性のあるマイクロステートを横断します。
ソースの属性は確実に回復する。
非線形相互作用ベンチマークにおける等予算分解誤差を低減する。
論文 参考訳(メタデータ) (2026-08-01T11:07:24Z) - Knowledge before Reasoning: EC-Reason-Bench, a Training-Free Diagnostic Benchmark for LLM Enzyme Classification [36.44850004100564]
本稿では,EC-Reason-Benchを提案する。
第一に、外部知識は決定的であり、推論に先立っていなければならない。
第二に、クローズドブックの設定では、カスケードやチェーン・オブ・シンクが役に立つか傷つくかは、モデルが控える傾向に依存する。
論文 参考訳(メタデータ) (2026-07-29T02:16:09Z) - TwistedMerge: Certified Higher-Order Diagnostics and Abstention for Model Merging [0.48086260459837454]
我々は、チェックポイントが局所対象、アライメントマップが遷移、サイクル積が残留する有限降下問題としてマージを定式化する。
提案手法は, 定数エッジのNo-go結果, フリーズ・コンプレックスの3方向およびプレファミリーの誤差制御定理, 比較・複雑感度の精査試験である。
訓練された低ランク適応型監査では, 平均化係数は選択したGLr代表に依存するが, 大域的因子同期と高密度デルタSVDは安定である。
論文 参考訳(メタデータ) (2026-07-23T03:24:50Z) - Forgetting Is Not a Fix: Path Dependence in Sequential Engram Editing [35.76482964927589]
本研究では,概念固有のメモリトレースが1回,1回,1回を算術的に組み合わせて抽出できる線形オブジェクトとなるという仮説を検証した。
そのテストは、著者自身の参照実装に基づいて、報告された最高の編集強度で実行します。
アンラーニング・アズ・コンプライアンス:今日認定された消去は、次の編集後にアーティファクトを認定しない。
論文 参考訳(メタデータ) (2026-07-06T23:45:06Z) - EnTrust: Modeling Inter-Modal Conflict for Trustworthy Multimodal Medical Image Analysis [41.67522319355107]
EnTrustは、モーダル間紛争を予測の不確実性の主要な原因として扱うフレームワークである。
最強のベースラインに比べてキャリブレーション誤差を40%削減しつつ、最先端のセグメンテーション精度を実現する。
論文 参考訳(メタデータ) (2026-06-19T12:43:50Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - PBT-Bench: Benchmarking AI Agents on Property-Based Testing [29.035258104995204]
PBT-Benchは、40の実際のPythonライブラリにまたがる100のプロパティベースのテスト問題のベンチマークである。
各問題は1つ以上のセマンティックなバグ(総数365、平均3.65)を注入し、デフォルトのストラテジーなランダムな入力がほとんど起こらないように設計する。
PBT指導によるバグリコールは42.1%から83.4%の範囲で、オープンエンドベースラインでは31.4%から76.7%である。
論文 参考訳(メタデータ) (2026-05-13T18:01:05Z) - ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data [0.0]
構成条件付きポストトレーニングは、モデルが学習した表現幾何学の構造化摂動として分析することができる。
グラフ, モデル, 基板間の構成による隠れ状態構造をトレースする, 幾何学第一のプログラムATLASを紹介する。
論文 参考訳(メタデータ) (2026-04-19T23:26:02Z) - The Attribution Impossibility: No Feature Ranking Is Faithful, Stable, and Complete Under Collinearity [0.0]
機能がコリニアである場合には,機能ランキングを忠実に,安定的に,かつ完全なものにすることはできない。
この不合理性を証明し、4つのモデルクラスを定量化し、アンサンブル平均化(DASH)によってそれを解決し、305のLean 4定理でそれをマシン検証する。
設計空間の定理、診断、そして不合理性はLean 4(16の公理から305の定理、残念なことに0の定理)で機械的に検証されます。
論文 参考訳(メタデータ) (2026-04-08T10:11:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。