論文の概要: Two tests of phase-structure features for transition prediction
- arxiv url: http://arxiv.org/abs/2609.00335v2
- Date: Wed, 09 Sep 2026 15:02:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 15:10:00.81266
- Title: Two tests of phase-structure features for transition prediction
- Title(参考訳): 遷移予測のための相構造特性の2つの試験
- Abstract要約: 本報告では, 2つの設定において, 位相特性が統合ベースライン上での終端予測を改善するか否かを検討する。
研究1は、封印されたスコアの前に矛盾カテゴリーパイプラインを凍結する。
研究2では,1,415の回答-変化比較と20の繰り返し,5倍の群によるクロスバリデーションを用いて,ブロックb0-b4に対する15の治療法を開発した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Following arXiv:2607.25507, this report examines whether phase-derived features improve endpoint prediction over a combined baseline in two settings: a sealed contradiction comparison and a retrospective analysis of answer changes across matched pressure prompts. Study 1 froze a contradiction-category pipeline before sealed scoring. On 1,136 eligible primary cases, adding PC-2 produced a paired AUROC difference of +0.00087. The 99% bias-corrected accelerated interval included zero, and the prespecified +0.05 threshold was not met. A replication role with 1,063 cases showed a same-direction increment of +0.00019. The replication-direction condition passed, but both primary conditions failed, so advancement failed. Study 2 developed fifteen treatments on blocks b0-b4 using 1,415 eligible answer-change comparisons and twenty-repeat, five-fold grouped cross-validation. An execution on 9 September 2026 recomputed development statistics from saved prediction units and applied a three-condition gate; no treatment advanced. Layer 25 had the only positive mean-repeat PC-2 increment, approximately +0.00027, with a favorable sign in three of five seed blocks. These statistics measure development consistency, not whole-seed-block holdout performance. Agreement with earlier selection records does not establish an earlier notebook execution or that the rule was fixed before inspecting development results. The planned b5 selection and b6 evaluation were not completed through this gate. Neither study demonstrated the incremental benefit required by its applied advancement rule. The findings limit support for the evaluated feature constructions; they do not test the rotary score identity, its local pre-softmax bound, or the effectiveness of execution-boundary governance.
- Abstract(参考訳): arXiv:2607.25507 に従えば,相分離した特徴が相結合ベースライン上での終端予測を改善するか否かを,密閉された矛盾比較と,一致した圧力プロンプト間の応答変化の振り返り解析という2つの設定で検討する。
研究1は、封印されたスコアの前に矛盾カテゴリーパイプラインを凍結する。
1,136例でPC-2を添加するとペアのAUROC差は+0.00087であった。
99%の偏差補正加速間隔は0であり, 予め規定された+0.05閾値は満たされなかった。
1,063例の複製では+0.00019が同じ方向の増分を示した。
複製方向条件は通過したが、両方の一次条件は失敗し、進行は失敗した。
研究2では,1,415の回答-変化比較と20の繰り返し,5倍の群によるクロスバリデーションを用いて,ブロックb0-b4に対する15の治療法を開発した。
2026年9月9日、保存された予測ユニットから開発統計を再計算し、3つの条件ゲートを適用した。
層25は5つのシードブロックのうち3つで好意的な符号を持つ、正のPC-2インクリメント(約0.00027)しか持たなかった。
これらの統計は、全シードブロックのホールドアウト性能ではなく、開発一貫性を測定する。
以前の選択レコードとの合意は、初期のノートブックの実行を確立したり、開発結果を検査する前にルールが修正されたりしない。
計画された b5 の選択と b6 の評価はこのゲートで完了しなかった。
いずれの研究も、適用された進歩規則で要求される漸進的な利益は示さなかった。
評価された特徴構造に対するサポートは制限され、ロータリースコアの同一性、その局所的ソフトマックス境界、実行境界ガバナンスの有効性はテストされない。
関連論文リスト
- Guardrailed Meta-Agent Loops: Stress-Testing Policy Pinning, Budget Bounds, and Crash Recovery [7.414694666903067]
GuardrailLoopはシミュレーションベースのテストベッドで、3つの運用契約を共同でテスト可能にする。
ハッシュピン付ポリシーは、目標、スコープ、評価アイデンティティ、予算、リリース条件を修正します。
有用な適応、状態回復、反復実行を分離する。
論文 参考訳(メタデータ) (2026-09-10T21:22:08Z) - Neither Precision Nor Architecture Alone: Controlled Tests of Failure Remedies for Physics-Informed Neural Networks [5.6611769062164905]
物理インフォームドニューラルネットワーク(PINN)は、しばしば固いまたは対流に支配されたPDEで失敗する。
FP32からFP64に切り替え、L-BFGSアーティファクトの停止を修復するか、あるいはバックボーンをステートスペースモデルに置き換える。
既登録144回の対流, 反応, および85回の対流/波浪実験において, 一致した種対流制御と種対流制御の両面を試験した。
論文 参考訳(メタデータ) (2026-08-26T03:20:24Z) - Beyond Tokens: Probing Higher-Order Epistasis in Learned Protein Representations [3.1035948531044912]
ORBITは、相互作用の存在、表現のアクセシビリティ、機能回復を分離する相互作用変換フレームワークである。
我々は、リッジ回帰、標準の独立トークン、非線形独立トークン、残留相互作用トークン化(RIT)を比較した。
RITは、トークン段階でのペアワイズアクセシビリティを、双方の独立した制御と比較して著しく向上させた。
論文 参考訳(メタデータ) (2026-08-24T23:35:36Z) - Feature Priming in Online Linear Regression: Sparse-Regret Lower Bounds and a Tight Univariate Rate [47.36630149538994]
高次元のオンライン予測では、最良の予測子はいくつかの機能にのみ依存する可能性があるため、後悔は周囲の次元ではなく、疎らさでスケールすべきである。
WarmuthとAmidはCOLT 2023で、これらの3つのルールのいずれかが競合するオンライン後悔の保証を認めているかどうかを尋ねた。
安価なニュアンスは、リフィットが真の予測座標を過度に重くする原因となる。
論文 参考訳(メタデータ) (2026-08-18T09:32:03Z) - A Pre-Specified Construction-Confirmation Test of Operation-Level Causal Transfer Across Finite Isomorphic Symbolic Domains [0.0]
2つの操作間の隠れ状態の違いが、ソース入力毎に別々に推定されているかどうかを問う。
この設計は、入力固有の介入を、不正操作、ノルムマッチングランダム、ノーオップ制御と比較し、個別に分離された確認分割から候補構築を分離する。
論文 参考訳(メタデータ) (2026-08-16T15:37:26Z) - Probing and steering biology across Boltz-1s trunk-diffusion boundary [32.505127447635864]
我々は、線形プローブ、スパースオートエンコーダ、因果介入を用いて、Pairformer trunkおよびBoltz-1の拡散モジュールからの残基当たりの活性化を分析する。
訓練されたトランクおよび拡散SAE,Boltz-1/residueアクティベーションおよび解析コードをリリースする。
論文 参考訳(メタデータ) (2026-08-11T22:25:42Z) - Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning [0.6999740786886536]
MGT-Bは、事前サンプリングの不確かさと変性の特徴の重なり合う窓を、位置条件による経験的尾の確率にマップする。
ログしきい値h=10のマニュアル選択後に最初に観察された問題同一性に対して,その効果が持続するかどうかを検証した。
どちらの分析も確証がなく、実証的要因は有効な電子プロセスや電子検出器として確立されていない。
論文 参考訳(メタデータ) (2026-07-22T13:34:17Z) - Forgetting Is Not a Fix: Path Dependence in Sequential Engram Editing [35.76482964927589]
本研究では,概念固有のメモリトレースが1回,1回,1回を算術的に組み合わせて抽出できる線形オブジェクトとなるという仮説を検証した。
そのテストは、著者自身の参照実装に基づいて、報告された最高の編集強度で実行します。
アンラーニング・アズ・コンプライアンス:今日認定された消去は、次の編集後にアーティファクトを認定しない。
論文 参考訳(メタデータ) (2026-07-06T23:45:06Z) - Measuring the Symmetry--Data Exchange Rate [0.2538209532048867]
同一の軌道サイズと一致した計算値を持つ間違った群制御は制約を伴わないよりも悪いことを示す。
相対交換率beta_diff = 1.28は、理論ブートストラップ1.0と符号と桁違いに一致している。
手法的貢献 -- 共有拡散の欠点をキャンセルする相対レート推定器、間違ったグループ制御、および予め特定された失敗分類 - は、強度をパラメータ化できる帰納バイアスに転送される。
論文 参考訳(メタデータ) (2026-05-31T08:17:40Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Most Transformer Modifications Still Do Not Transfer at 1-3B: A 2020-2026 Update to Narang et al. (2021) with Downstream Evaluation and a Noise Floor [32.18134535997269]
我々は,厳密なアイソデータ,アイソコンピュート,アイソレシピ制御,マルチシードベースラインノイズフロアとCLIMB-12下流評価を主指標として,1.2Bおよび3Bで20個のトランスフォーマーを検証した。
20の修正のうち、2つの明確なボンフェロニ補正は1.2Bであり、そのうちの1つは、共有レシピの下で3Bで安定的に訓練することができない。
我々は,1-3Bのアーキテクチャ比較において,ノイズフロアの報告,下流評価,大規模安定性試験が必須であると結論付けている。
論文 参考訳(メタデータ) (2026-05-20T06:43:34Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Affinity Is Not Enough: Recovering the Free Energy Principle in Mixture-of-Experts [0.0]
Sfinity MoEは、現在のトークンが1つの分布に属し、次に別の分布に属するドメイン遷移で失敗する。
3つの軽量ゲート修正により、0.748 +/-0.002(124x)に上昇する。
ベータルーチン化は遷移ステップBを6.56+/-0.01から4.01+/-0.15(β-MoE)に還元することを示す。
論文 参考訳(メタデータ) (2026-05-01T12:18:55Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - When Does Margin Clamping Affect Training Variance? Dataset-Dependent Effects in Contrastive Forward-Forward Learning [0.0]
コントラストフォワード(Contrastive Forward-Forward, CFF)学習は、教師付きコントラスト目標に対して、ビジョントランスフォーマーを層別に層状化する。
比較損失における正対辺のマージンは、類似度クランプの飽和により適用される。
対数確率の後にマージンを減じる別の定式化が、平均-上-正の還元の下で勾配ニュートラルであることを証明する。
論文 参考訳(メタデータ) (2026-03-01T07:00:38Z) - Understanding Contrastive Representation Learning from Positive Unlabeled (PU) Data [28.74519165747641]
本稿では,少数のラベル付き正のセットと大きなラベル付きプールのみを利用できる,正のラベル付き学習(PU)の課題について検討する。
比較対象を減少させる非バイアスで分散した正の非ラベル型コントラスト学習(puCL)を導入する。
本稿では, 未ラベルのサンプルをソフトな正の混合物として再重み付けする, 事前認識型拡張である Positive Unlabeled InfoNCE (puNCE) を提案する。
論文 参考訳(メタデータ) (2024-02-08T20:20:54Z) - Bidirectional Transformer Reranker for Grammatical Error Correction [34.94144153504719]
本稿では,事前学習したseq2seqモデルにより生成された候補文の確率を再推定する双方向トランスフォーマー・リランカ(BTR)を提案する。
BTRはSeq2seqスタイルのトランスフォーマーアーキテクチャを保持するが、BERTスタイルの自己アテンション機構を使用して各トークンの確率を計算する。
実験結果から、事前訓練されたセク2セックモデルT5ベースから候補をランク付けすると、T5ベース上のBTRは、CoN上で65.47と71.27F0.5のスコアを得ることができた。
論文 参考訳(メタデータ) (2023-05-22T13:04:48Z) - Comparing Sequential Forecasters [35.38264087676121]
2つの予測器を考えてみましょう。それぞれが時間とともに一連のイベントを予測します。
オンラインでもポストホックでも、予測と結果がどのように生成されたかの検証不可能な仮定を避けながら、これらの予測をどのように比較すればよいのか?
予測スコアの時間差を推定するための新しい逐次推論手法を提案する。
実世界の野球と天気予報機を比較することで,我々のアプローチを実証的に検証する。
論文 参考訳(メタデータ) (2021-09-30T22:54:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。