論文の概要: The Conflict Between Logic and Memory: Training Conditions for Optimizer-Dependent Rule Acquisition
- arxiv url: http://arxiv.org/abs/2610.00403v2
- Date: Fri, 02 Oct 2026 14:00:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:29.979392
- Title: The Conflict Between Logic and Memory: Training Conditions for Optimizer-Dependent Rule Acquisition
- Title(参考訳): 論理と記憶の矛盾--最適化者依存型ルール獲得のための訓練条件
- Abstract要約: 単層ReLUネットワークにおける差分を規定する訓練条件について検討する。
ニュアンス・コネクテッド・トレーナビリティは、共有障害と相対的優位性の両方に反する。
- 参考スコア(独自算出の注目度): 11.323131201168572
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Optimizers can fit the same task while acquiring different generalizing relations. We study the training conditions governing these differences in single-hidden-layer ReLU networks, combining composite evidence tasks, parameter-level interventions, and a three-seed strict-parity scan. Our central finding is that nuisance-connected trainability reshapes both shared failures and relative optimizer advantages. In a nuisance-heavy task, all twenty tested optimizer configurations remain near chance on the hardest stage. Retaining every input but fixing nuisance-connected first-layer weights at initialization raises that stage's accuracy from approximately 50\% to 70.56\%, 68.47\%, and 69.00\% for momentum SGD, Adam, and Muon. Masking the same inputs only after full training does not recover this performance. On a separate pairwise-mode task, background freezing reduces Muon's rare-mode advantage over momentum SGD by 12.48 percentage points, while the target and mode frequencies remain fixed. Each intervention is evaluated under a common validation-selection protocol with condition-specific learning rates and checkpoints. A strict-parity sweep over orders 1--20 provides a complementary reference without spurious cues or extra nuisance coordinates: the optimizers separate at orders 9--11, then approach chance despite substantial remaining Bayes predictability. A mixed task establishes a recovery boundary, and CIFAR-10 supplies an external architecture comparison. Together, these findings connect optimizer comparison to the acquisition and use of specified relations, identifying permitted adaptation as a concrete training variable that changes what a fixed architecture learns.
- Abstract(参考訳): 最適化者は、異なる一般化関係を取得しながら、同じタスクに適合することができる。
本研究では, 複合エビデンスタスク, パラメータレベルの介入, 厳密な三列スキャンを組み合わせることで, 単層ReLUネットワークにおけるこれらの違いを規定する訓練条件について検討する。
我々の中心的な発見は、ニュアンス・コネクテッド・トレーナビリティは共有障害と相対的なオプティマイザの利点の両方に反するものである。
厄介な作業では、テストされた20のオプティマイザ構成はすべて、最も難しい段階でほぼ偶然に残っている。
初期化時に全ての入力を保持するが、ニュアンス接続された第一層重みを固定すると、そのステージの精度は約50\%から70.56\%、68.47\%、運動量SGD、Adam、Muonの69.00\%に上昇する。
フルトレーニング後にのみ同じ入力をマスキングしても、このパフォーマンスは回復しない。
異なるペアワイドモードのタスクでは、背景凍結は、ターゲット周波数とモード周波数が固定されている間、ムオンの運動量SGDに対する希少モードの優位性を12.48ポイント減少させる。
各介入は、条件固有の学習率とチェックポイントを持つ共通の検証-選択プロトコルで評価される。
1--20の厳密なスイープは、スプリアスキューや余分なニュアンス座標を使わずに補足的な参照を与える: 最適化器は9--11で分離され、ベイズ予測可能性はかなり残っているにもかかわらずチャンスに近づく。
混合タスクはリカバリバウンダリを確立し、CIFAR-10は外部アーキテクチャの比較を提供する。
これらの知見は、特定の関係の取得と使用と比較して最適化器を結合し、固定されたアーキテクチャが学習するものを変更する具体的な訓練変数として許容される適応を識別する。
関連論文リスト
- DMAD: Distribution Matching as Adversarial Distillation for Fast Visual Generation [50.43969311607643]
DMAD, Distribution Matching as Adversarial Distillationを導入し, 分布マッチングを分類として再放送する。
判別器では,これらの損失が分布マッチングの基礎となるDMDを回復することを示す。
DMADはFréchet Inception Distance (FID) 1.04、ImageNet-64x64 14.47、COCO-10Kの4ステップSDXL、VBenchの合計スコアは85.15、Wan2.1-T2V-14Bである。
論文 参考訳(メタデータ) (2026-10-01T17:59:01Z) - Why Deterministic PRM Guidance Underperforms in Discrete Diffusion Reasoning [0.2676349883103404]
この結果から,前払いパスと同じ予算で denoising, PRM score, outcome reward model (ORM) スコアを突破すると, 決定論的形式ははるかに単純なベースラインに低下することがわかった。
我々のPRMは中間的認知状態を記録し、最終回答の正しさを訓練する。
論文 参考訳(メタデータ) (2026-09-28T15:54:05Z) - Learn Now, Use Next, Trust Later: Prequential Test-Time Learning for LLM Agents [55.440058537827134]
StepLearnは、永続的な信頼から即時の使用を分離する非パラメトリックフレームワークである。
情報的な遷移を仮説に変え、次のステップを導く。
GPT-5-miniでの平均成功率は59.9%、84.0%、Qwen3.5-35B-A3Bで57.8%、88.1%である。
論文 参考訳(メタデータ) (2026-09-28T08:06:03Z) - Greedy Decoding Is Not Precision-Invariant: Cross-Precision Output Divergence in LLM Inference [13.137699166830322]
大規模言語モデルからのグレディ復号は、一般に決定論的として扱われる。
同一のモデル,プロンプト,デコードアルゴリズムは同一のハードウェア上で,BF16とFP16の異なる出力を生成する。
実験により,22層に蓄積したボディーエラーは,浮動小数点数と浮動小数点数とを区別しないことがわかった。
論文 参考訳(メタデータ) (2026-09-22T15:54:16Z) - Correct Tests Are Not Enough: Measuring and Training Oracle Conversion in Specification-Based Test Generation [14.44743150931186]
自然言語仕様からテストを生成するには、異常な振る舞いを公開する入力と、正しい期待出力の両方が必要である。
我々は,この相互作用を,実行可能報酬分解とスイートレベルのオラクル変換測定を通じて研究する。
生成器は1つの応答で5つの入出力試験を共同で出力する。
論文 参考訳(メタデータ) (2026-09-05T04:56:31Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models [59.51249894128724]
マスク付き拡散言語モデルは、反復を識別するごとに複数のトークンを明らかにすることで推論ステップを削減することができる。
パラレルマスク拡散復号法のためのトレーニング不要な復号法であるADASを提案する。
論文 参考訳(メタデータ) (2026-06-09T13:17:27Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback [1.2362187555287152]
ファイナンスにおける予測評価は、ポイント予測エラーに基づく集計精度測定と予測精度テストに依存している。
本稿では,中間決定プロセス自体を評価することによって,精度試験を補完する行動予測評価手法を提案する。
論文 参考訳(メタデータ) (2026-05-07T06:31:34Z) - Relational Preference Encoding in Looped Transformer Internal States [0.0]
ループ変換器は内部の反復状態においてどのように人間の嗜好を符号化するかを検討する。
繰り返し洗練された2.6Bパラメータループ変換器であるOuro-2.6B-Thinkingを用いて,各ループ繰り返しから隠れた状態を抽出する。
我々は、HH-RLHFデータセット上で人間の嗜好を予測するために軽量評価器ヘッドを訓練する。
我々のペアワイズ評価器は8,552個の未確認例に対して95.2%の精度を達成し、ベースモデルは完全に凍結されている間に全バッチのL-BFGSプローブ(84.5%)を上回った。
論文 参考訳(メタデータ) (2026-04-10T20:00:49Z) - Semi-supervised Contrastive Learning with Similarity Co-calibration [72.38187308270135]
SsCL(Semi-supervised Contrastive Learning)と呼ばれる新しいトレーニング戦略を提案する。
ssclは、自己教師付き学習におけるよく知られたコントラスト損失と、半教師付き学習におけるクロスエントロピー損失を組み合わせる。
SsCLはより差別的な表現を生じさせ,ショット学習に有益であることを示す。
論文 参考訳(メタデータ) (2021-05-16T09:13:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。