論文の概要: Stabilized Best-of-$K$ Training for Neural Combinatorial Optimization
- arxiv url: http://arxiv.org/abs/2608.00296v1
- Date: Fri, 31 Jul 2026 21:11:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.567504
- Title: Stabilized Best-of-$K$ Training for Neural Combinatorial Optimization
- Title(参考訳): ニューラルネットワーク最適化のためのBest-of-K$トレーニングの安定化
- Authors: Melveena Jolly, Midhun Xavier,
- Abstract要約: Leader Reward氏はPOMOトレーニングを修正し、繰り返し推論によって生成される最良の軌道を強調する。
私たちは、そのバイナリリーダー/非リーダの区別を、サンプリング予算$K$でインデックス付けされた安定化されたランク信号に置き換える、狭い拡張をテストする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Leader Reward modifies POMO training to emphasize the best trajectory produced by repeated inference. We test a narrow extension: replace its binary leader/non-leader distinction with a stabilized rank signal indexed by a sampling budget $K$. With the POMO architecture, 3,050-epoch schedule, and TSP-100 test set held fixed, the Leader Reward reimplementation obtains $7.7662$ under 100-start, 8-augmentation greedy decoding, matching the reported $7.766$ at its displayed precision. Under independent sampling, the stabilized $K=8$ recipe lowers realized Best-of-8 cost in all three paired training seeds: $7.7944$ versus $7.8136$. This observation is estimation-only and decoder-specific: three seeds are below the six-seed testing floor, Leader Reward is better at sampled $K=1$, and it remains slightly better under its original augmented-greedy protocol. We make no unbiased-estimator, universal superiority, or state-of-the-art claim.
- Abstract(参考訳): Leader Reward氏はPOMOトレーニングを修正し、繰り返し推論によって生成される最良の軌道を強調する。
私たちは、そのバイナリリーダー/非リーダの区別を、サンプリング予算$K$でインデックス付けされた安定化されたランク信号に置き換える、狭い拡張をテストする。
POMOアーキテクチャ、3,050エポックスケジュール、TSP-100テストセットが固定されたことにより、Lead Rewardの再実装は、100回の起動で7.7662ドル、100回の起動で8倍のグレディ復号を行い、表示精度で報告された7.766ドルと一致する。
独立したサンプリングで、安定化されたK=8ドルレシピーは、3組のトレーニング種すべてで最高8ドル(7944ドル対7.8136ドル)のコストを実現した。
この観察は推定のみであり、デコーダ固有のものだ: 3つの種が6シードのテストフロアの下にあり、Lead Reward氏はサンプルのK=1$の方が良い。
偏見のない見積もり、普遍的な優位性、あるいは最先端の主張は行いません。
関連論文リスト
- Round-Trip Consistency: Bidirectional Diffusion Models Can Predict Their Own Rollout Errors [51.56484100374058]
自動回帰モデルは、長時間のロールアウトでエラーを蓄積しますが、デプロイ時には、それを測定するための基本的な真実はありません。
我々は、方向フラグを介して動的システムを前方または後方にステップする単一の条件付き潜在拡散モデルを訓練する。
この双方向性は測定不要なテスト時間誤差信号を提供することを示す。
論文 参考訳(メタデータ) (2026-08-01T13:49:46Z) - TabPFN beyond Tabular Data: Calibration and Accuracy on Multimodal Embeddings [2.4483752182160954]
我々はTabPFNを,凍結画像,テキスト,オーディオエンコーダのためのプラグアンドプレイ,ゼログレートな分類ヘッドとして評価する。
TabPFNは14のデータセット、11のエンコーダ、3つのモダリティにまたがる22,820回の評価エピソードにおいて、負の対数類似度(NLL)と期待の校正誤差(ECE)の双方において、9つの分類長の中で最高の平均ランクを達成している。
その精度の利点は条件付きであり、中程度から高いショット数と低からモデレートの特徴次元に集中している。
論文 参考訳(メタデータ) (2026-07-13T02:11:27Z) - Directional Curvature from Armijo Backtracking: A Low-Cost Sharpness Probe and a Calibration-Free Learning-Rate Safeguard for Adam [0.16283634001181238]
単一のArmijoバックトラックラインサーチが、この情報を数回のフォワードパスのコストですでに持っているのを観察する。
初期化時に一度使うと、この測定値が学習率の上限となり、Adamはあまりに大きな初期学習率に頑健になる。
論文 参考訳(メタデータ) (2026-07-04T19:49:01Z) - ChainzRule: Sample-Efficient, Robust Deep Learning Across Tabular, NLP, and Vision Tasks [0.0]
エンタープライズドメイン全体にわたるディープラーニングシステムは、学術ベンチマークが不明瞭な制約の下で運用される。
本稿では、典型的なアクティベーションを微分正規化(DREG)によって制御される学習可能な層に置き換えるニューラルネットワークChainzRule(CR)を提案する。
CRは、ピマ糖尿病で85.71% pm 2.01%$、凍結エンコーダでSST-5の感情分類で46.20% pm 0.37%$、パラメータが3.2Mの完全順序回帰で70.17%$を達成している。
論文 参考訳(メタデータ) (2026-05-23T01:52:50Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Robust Reinforcement Learning from Corrupted Human Feedback [86.17030012828003]
人間からのフィードバックからの強化学習(RLHF)は、AIシステムと人間の嗜好データを調整するための原則化されたフレームワークを提供する。
我々はRLHFのロバストなアプローチ-$R3M$を提案し、これは、潜在的に破損した選好ラベルをスパースアウトリーとしてモデル化する。
大規模言語モデル(LLM)を用いたロボット制御と自然言語生成の実験により、R3M$は、好みデータに対する様々な摂動に対する報酬の堅牢性を向上することを示した。
論文 参考訳(メタデータ) (2024-06-21T18:06:30Z) - A Quadratic Synchronization Rule for Distributed Deep Learning [66.68264684667562]
本研究は、擬似同期規則(QSR)と呼ばれる$H$を決定するための理論基底法を提案する。
ResNet と ViT の実験により、QSR を用いた局所勾配法は、他の同期戦略よりもテスト精度を一貫して向上することが示された。
論文 参考訳(メタデータ) (2023-10-22T21:38:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。