論文の概要: Learning Not to Optimize: Physics-Informed Action-Space Reshaping for Intent-Based Network Control
- arxiv url: http://arxiv.org/abs/2608.00908v1
- Date: Sun, 02 Aug 2026 00:27:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.004605
- Title: Learning Not to Optimize: Physics-Informed Action-Space Reshaping for Intent-Based Network Control
- Title(参考訳): 最適でない学習: インテントベースネットワーク制御のための物理インフォームドアクション空間再構成
- Authors: Zuyuan Zhang, Vaneet Aggarwal, Tian Lan,
- Abstract要約: LNOQRD は小物候補を75.9% で削減し、90.8% でニアオラクルのカバレッジを維持している。
実験の結果、LNOQRDは実用性と意図の満足度が最も高く、かつ、法律違反が最低で、世代後レイテンシが低いことがわかった。
- 参考スコア(独自算出の注目度): 50.46501177871741
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern network policy control maps intent to sequential placement-control decisions. Bellman-style policy optimization primarily asks which action to optimize, while constraints are commonly handled through penalty, barrier, or Lagrangian mechanisms. We observe that before a value function can certify the best deployment, intermediate signals may already identify many candidates that should be excluded from further optimization. This motivates a complementary direction: \emph{Learning Not to Optimize}. Before a value function is accurate enough to select the best placement-control decision, intermediate signals may already show that candidates are equivalent under state--intent relabeling (quotienting), lead to a uniformly worse future state (dominance), or violate executable network laws (residual screening). \LNOQRD{} uses these computed or learned signals as a shadow process to reshape the domain on which primal policy optimization is performed, thereby reducing the action space. We prove lossless quotienting and dominance under explicit equivariance and monotonicity conditions, bound frontier size and ranking cost, and quantify losses from approximate certificates and primal estimates. Experiments show that \LNOQRD{} reduces small-instance candidates by $75.9\%$ while retaining $90.8\%$ near-oracle coverage and, on large instances, achieves the highest utility and intent satisfaction, the lowest hard-law violation and post-generation latency, and a $73.0\%$ average reduction among candidate-based baselines.
- Abstract(参考訳): 現代のネットワークポリシーコントロールは、シーケンシャルな配置制御の決定を意図している。
ベルマンスタイルのポリシー最適化は、主にどのアクションを最適化するかを問うが、制約はペナルティ、バリア、ラグランジアン機構を通じて一般的に扱われる。
我々は、値関数が最適なデプロイメントを認定する前に、中間信号がさらなる最適化から除外されるべき候補を既に特定していることを観察する。
これは補完的な方向である: \emph{Learning Not to Optimize}。
値関数が最適な配置制御決定を選択するのに十分正確になる前に、中間信号は、候補が状態-入出力ラベリング(引用)の下で等価であることを示し、一様に悪化する将来の状態(支配)、または実行可能なネットワーク法(残留スクリーニング)に違反する可能性がある。
LNOQRD{} は、これらの計算または学習された信号をシャドープロセスとして使用し、プライマリポリシー最適化が実行される領域を再生成し、アクション空間を減少させる。
我々は,有界フロンティアサイズおよびランク付けコストの明示的等式と単調性条件下での損失のない商法と優位性を証明し,近似証明書と一次推定値から損失を定量化する。
実験の結果、LNOQRD{} は小物候補を75.9 % に減らし、90.8 % 近い範囲を保ち、大ケースでは最も実用性と意図の満足度、最低の硬い違反とポストジェネレーションレイテンシ、および候補者ベースのベースライン間の平均73.0 % の減額を達成している。
関連論文リスト
- Agile Online Model Selection: Resolving Adaptation Lag via Safeguarded Large Learning Rates [9.463718838347955]
本稿では,保護された大規模学習率を最大$(T) まで活用する,新しい楽観的なオンラインミラー降下法を提案する。
私たちの重要な技術的貢献は、不安定な更新を動的に監視し、過度の後悔を招く学習率を排除する、ポストホックペナルティメカニズムです。
3つの合成および11の多様な実世界のデータセットに対する実証的な評価は、我々のアプローチが数百ラウンドから数ラウンドまでの適応ラグを減少させることを示している。
論文 参考訳(メタデータ) (2026-05-26T12:18:08Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Primal-Dual Policy Optimization for Linear CMDPs with Adversarial Losses [0.8984888893275712]
我々は、LogSumExpソフトマックスポリシーと呼ばれる新しいクラスのポリシーを導入し、実行します。
周期的ポリシーミキシングと正規化された二重更新という2つの新しいアルゴリズムコンポーネントは、被覆数と二重変数の両方を効果的に制御できる。
論文 参考訳(メタデータ) (2026-05-12T05:02:02Z) - Accelerating RL for LLM Reasoning with Optimal Advantage Regression [52.0792918455501]
本稿では,最適優位関数を直接近似する新しい2段階ポリシー最適化フレームワークを提案する。
A$*-POは、幅広い数学的推論ベンチマークで競合性能を達成する。
PPO、GRPO、REBELと比較して、トレーニング時間を最大2$times$、ピークメモリ使用率を30%以上削減する。
論文 参考訳(メタデータ) (2025-05-27T03:58:50Z) - Is Best-of-N the Best of Them? Coverage, Scaling, and Optimality in Inference-Time Alignment [54.787826863212146]
推論時間計算は、言語モデルのパフォーマンスをスケールするための強力な軸を提供する。
我々は, (i) 応答品質, (ii) 計算量の観点から, 推論時アライメントアルゴリズムの性能を解析する。
我々は$textttInferenceTimePessimism$を紹介した。これは推論時間計算の故意使用を通じて報酬ハッキングを緩和する新しいアルゴリズムである。
論文 参考訳(メタデータ) (2025-03-27T18:00:08Z) - Spatial Supply Repositioning with Censored Demand Data [10.797160099834306]
我々は、一方通行のオンデマンド車両共有サービスによるネットワーク在庫システムについて検討する。
このような一般的な在庫ネットワークにおいて最適なポリシーを見つけることは解析的にも計算的にも困難である。
我々の研究は、共有モビリティビジネスの生存性における在庫管理の重要性を強調している。
論文 参考訳(メタデータ) (2025-01-31T15:16:02Z) - Submodular Reinforcement Learning [38.40138241424851]
強化学習(RL)では、状態の報酬は通常加法的と見なされ、マルコフの仮定に従って、それらは以前に訪れた状態に対して$textitindependent$である。
カバー範囲制御、実験設計、情報経路計画といった多くの重要な応用において、報酬は自然にリターンを減少させ、すなわち、それらの価値は以前に訪れた同様の状態から減少する。
減少するリターンをキャプチャするサブモジュール集合関数をモデルとした,より汎用的で非付加的(かつ履歴に依存しない)報酬を最適化するパラダイムである$textitsubmodular RL$ (SubRL)を提案する。
論文 参考訳(メタデータ) (2023-07-25T09:46:02Z) - A Generalised Inverse Reinforcement Learning Framework [24.316047317028147]
逆強化学習(英: inverse Reinforcement Learning、IRL)とは、観測された軌跡に基づいて、あるMDPベースの未知のコスト関数を推定することである。
我々は、(最大エントロピー)IRL問題の修正をもたらす将来の状態により多くの重みを与える代替の訓練損失を導入する。
私たちが考案したアルゴリズムは、複数のOpenAIジム環境において、既製のものよりも優れたパフォーマンス(および類似のトラクタビリティ)を示しました。
論文 参考訳(メタデータ) (2021-05-25T10:30:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。