論文の概要: Small Enough to Know Everything: The Fully-Enumerable Transformer as an Instrument for the Science of Delayed Generalization
- arxiv url: http://arxiv.org/abs/2609.20166v2
- Date: Fri, 18 Sep 2026 01:37:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.621043
- Title: Small Enough to Know Everything: The Fully-Enumerable Transformer as an Instrument for the Science of Delayed Generalization
- Title(参考訳): すべてを知るには十分すぎる: 遅れた一般化の科学のための道具としての完全無数変圧器
- Abstract要約: 完全に計算可能なタスクで訓練されたティニートランスフォーマーは、グルーキングの研究において異常な位置を占める。
あらゆる入力を評価し、一般化天井を正確に計算し、数百の種が数分かかる。
この仕組みは、おおよそのセッティングが提供できない4つの能力を持つ科学機器である、と我々は主張する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tiny transformers trained on fully-enumerable tasks occupy an unusual position in the study of grokking: every input can be evaluated, every generalization ceiling can be computed exactly, and hundreds of seeds cost minutes. We argue this regime is a scientific instrument with four capabilities that approximate settings cannot offer: (a) exact, falsifiable generalization ceilings; (b) task surgery that manipulates one structural variable while provably fixing all others; (c) direct observation of every weight; and (d) survival-time statistics over many seeds that recast "does not grok" as a censored observation. The obvious objection is that laws characterized at 10^4 parameters may not mean anything beyond them. We answer it with a preregistered conservation study: three task-side laws established at 12K parameters -- a recoverability-ceiling law, a role-conflict delay law, and a weight-decay response law -- are re-measured under an identical from-scratch protocol at 12K, 1M, and 50M parameters (a 4,000x span; 360 runs plus a 44-run control arm). The ceiling law and the delay law are conserved (0/144 Holm-corrected ceiling violations; Spearman rho >= 0.75 at every scale, permutation p < 1e-4), while the weight-decay law deforms systematically, steepening with scale. Preregistered controls show the 50M role-conflict deficit survives learning-rate adjustment and a tripled budget. Conservation was tested against criteria frozen before data collection, and the third relationship fails that test even at the original scale, which is what tells us the test could have failed. The series scales the model while the tasks stay enumerable, so what it licenses is specific: the quantities this regime computes from a task keep predicting once the model has outgrown the regime itself.
- Abstract(参考訳): 全ての入力を評価でき、すべての一般化天井を正確に計算でき、数百の種が数分かかる。
この体制は、およそ設定が提供できない4つの能力を持つ科学的手段である、と我々は主張する。
(a)正確に、偽りやすい一般化天井
b) 1つの構造変数を操り、かつ、他の全てを確実に固定する作業手術
(c)すべての重量の直接観察、及び
(d)"does not grok"を検閲された観察として再放送する多くの種子の生存時間統計。
明らかな反対は、10^4のパラメータで特徴づけられる法則は、それら以外の何の意味も持たないということである。
12Kパラメータで確立された3つのタスク側法則(リカバリ可能性決定法、ロールコンフリクト遅延法、ウェイトデカイ応答法)は、12K, 1M, 50Mパラメータ(4000倍、360ランと44ランの制御アーム)で同一のトラスクラッチプロトコルの下で再測定される。
天井法則と遅延法則は保存され(0/144ホルム補正天井法則、Spearman rho >= 0.75、置換p < 1e-4)、重量デカイ法則は体系的に変形し、スケールが急激になる。
事前登録された規制は、5000万のロール・コンフリクトの不足が学習率調整と3倍の予算を維持できることを示している。
データ収集の前に凍結された基準に対して保存性テストが行われ、第3の関係は元のスケールでもテストに失敗する。
このシリーズは、タスクがエナメル性を維持しながらモデルをスケールするので、それがライセンスする内容は明確である。
関連論文リスト
- Calibrating Interpretability Instruments Before Trusting Their Verdicts [1.0829694003408499]
Causal氏は、大きな言語モデル(LLM)の内部は測定にかかっていると主張している。
これらの測定は、エラーではなく可算数を返す特定の診断可能な方法で失敗する。
このノートは、拒絶と道徳的表現に関する因果的解釈可能性プログラムの6つの失敗を文書化している。
論文 参考訳(メタデータ) (2026-09-13T19:37:02Z) - An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models [0.0]
GPT-5.xは111モードを含む合成ドローのうち105個の省略された1Dクランプを修復する。
2D領域では、ルールを回復するアーティファクトは存在しない(0/156)。
我々は、入場規則のクラスを、演奏中の全てのサンプルと正確に一致しているが、無害であることを示すので、識別性は楽器の計測可能な特性である。
論文 参考訳(メタデータ) (2026-08-18T16:09:51Z) - Validated Adaptation for Aerial Crowd Monitoring at Mass Gathering Scale: A Deployment Protocol, a Severity Law, and a Diagnostic for Label-Free Drone Crowd Counting, Toward the FIFA World Cup 2034 (Saudi Arabia) [0.0]
サウジアラビアは2034年のFIFAワールドカップを開催する。
ドローンによるカウントは、ラベルのないトレーニングコーパスとは異なり、映像の精度を保たなければならず、破砕前に危険な流入を警告しなければならない。
525の制御されたランで構築された検証済みの回答,フルレゾリューションコーパス研究,5つのファルシフィケーション改善,および5条件のセーフ・インターロック評価を提供する。
論文 参考訳(メタデータ) (2026-08-18T10:42:05Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families [1.1506549878621528]
この研究は、Nelson-Narens監視制御ループのモデルに依存しないランタイム制御層であるGubernaut Cognitive Controller(GCC)につながった。
我々は,4つのフロンティアモデルの4x4行列に対して,事前登録されたジェネレーションオンス/ジャッジマンプロトコルを用いてGCCを評価した。
論文 参考訳(メタデータ) (2026-07-27T12:17:21Z) - Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment [53.913175773174636]
既存のパイプラインは、自己リセット、VLM検証、言語指導による修正を通じて、人間の労力を減らす。
Zero2Skill(ゼロ2スキル)は、人ロボットの共生型エージェントシステムで、丸ごとの修正を維持・再利用する。
論文 参考訳(メタデータ) (2026-07-15T17:16:24Z) - Forgetting Is Not a Fix: Path Dependence in Sequential Engram Editing [35.76482964927589]
本研究では,概念固有のメモリトレースが1回,1回,1回を算術的に組み合わせて抽出できる線形オブジェクトとなるという仮説を検証した。
そのテストは、著者自身の参照実装に基づいて、報告された最高の編集強度で実行します。
アンラーニング・アズ・コンプライアンス:今日認定された消去は、次の編集後にアーティファクトを認定しない。
論文 参考訳(メタデータ) (2026-07-06T23:45:06Z) - What Actually Works for Spacecraft Fault-Tolerant Control: An Honest Settled-Gate Benchmark of Learned and Classical Methods [2.28438857884398]
近年のFTCの研究は、宇宙船のアクチュエーターの故障で高い成功を収めたことを報告している。
我々は、成功がトレーニングで見たことのない欠陥にそれを保持することを意味しているとき、宇宙船が何を指しているのかを尋ねる。
私たちは、落ち着いたゲートの周りに構築されたベンチマークで回答します。
論文 参考訳(メタデータ) (2026-06-24T04:08:39Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - Quantum-Like Correlations from Local Hidden-Variable Theories Under Conservation Law [45.88028371034407]
ベルの不等式に反する局所隠れ変数モデルを構築する方法を示す。
このモデルはまた、実験的にテストできる量子力学に微妙に異なる予測を与える。
論文 参考訳(メタデータ) (2025-11-08T15:32:13Z) - Pretraining Scaling Laws for Generative Evaluations of Language Models [30.6654523997984]
生成評価にパス-at-k$を適合させ、最も高価なモデルのパス-at-k$を予測するための3つの異なるスケーリング法則を示す。
我々のフレームワークは、研究者や実践者に対して、生成性能を予測するための洞察と方法論を提供します。
論文 参考訳(メタデータ) (2025-09-28T18:04:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。