論文の概要: When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling
- arxiv url: http://arxiv.org/abs/2604.03562v1
- Date: Sat, 04 Apr 2026 03:04:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.642982
- Title: When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling
- Title(参考訳): LLM誘導LEO衛星スケジューリングにおける因果探索とスイッチング安定性ジレンマ
- Abstract要約: 衛星スケジューリングにおける深い強化学習のための適応的な報酬設計は、レギュラーアウェアの報酬重みが静的なよりも優れているという直感によって動機付けられている。
PPOは値関数収束のために定常的な報酬信号を必要とするため、ほぼ安定な報酬重み(342.1 Mbps)は慎重に調整された動的重み(103.396.8 Mbps)より優れていることを示す。
- 参考スコア(独自算出の注目度): 1.0152838128195467
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adaptive reward design for deep reinforcement learning (DRL) in multi-beam LEO satellite scheduling is motivated by the intuition that regime-aware reward weights should outperform static ones. We systematically test this intuition and uncover a switching-stability dilemma: near-constant reward weights (342.1 Mbps) outperform carefully-tuned dynamic weights (103.3+/-96.8 Mbps) because PPO requires a quasistationary reward signal for value function convergence. Weight adaptation-regardless of quality-degrades performance by repeatedly restarting convergence. To understand why specific weights matter, we introduce a single-variable causal probing method that independently perturbs each reward term by +/-20% and measures PPO response after 50k steps. Probing reveals counterintuitive leverage: a +20% increase in the switching penalty yields +157 Mbps for polar handover and +130 Mbps for hot-cold regimes-findings inaccessible to human experts or trained MLPs without systematic probing. We evaluate four MDP architect variants (fixed, rule-based, learned MLP, finetuned LLM) across known and novel traffic regimes. The MLP achieves 357.9 Mbps on known regimes and 325.2 Mbps on novel regimes, while the fine-tuned LLM collapses to 45.3+/-43.0 Mbps due to weight oscillation rather than lack of domain knowledge-output consistency, not knowledge, is the binding constraint. Our findings provide an empirically-grounded roadmap for LLM-DRL integration in communication systems, identifying where LLMs add irreplaceable value (natural language intent understanding) versus where simpler methods suffice.
- Abstract(参考訳): マルチビームLEO衛星スケジューリングにおける深い強化学習(DRL)のための適応的な報酬設計は、レギュラーアウェアの報酬重みが静的なよりも優れているという直感に動機付けられている。
我々はこの直感を体系的にテストし、PPOが値関数収束のために定性的な報酬信号を必要とするため、ほぼ安定な報酬重み(342.1 Mbps)が慎重に調整された動的重み(103.3+/-96.8 Mbps)より優れていることを明らかにした。
コンバージェンスの再再起動による品質劣化性能の軽量化
比重が重要である理由を理解するために,各報酬項を+/-20%独立に摂動し,50kステップ後にPPO応答を測定する一変量因果探索法を導入する。
スイッチングペナルティの20%増加は、極性ハンドオーバに対して+157 Mbps、ホットコールドレジームフィニングにおいて+130 Mbps、人間の専門家や訓練されたMLPには系統的なプローブなしでアクセスできない。
MDPアーキテクトの4つの変種(固定型,ルールベース,学習型MDP,微調整型LPM)を,既知,新奇な交通体制で評価した。
MLPは、既知のレジームで357.9 Mbps、新しいレジームで325.2 Mbpsを達成する一方、細調整されたLLMは、知識ではなく、ドメイン知識と出力の整合性の欠如よりも、重量振動により45.3+/-43.0 Mbpsに崩壊する。
本稿はLLM-DRL統合のための実証的なロードマップを提供し,LLMが不定値(自然言語の意図理解)を付加する場所と,単純な手法が十分である場所を同定する。
関連論文リスト
- Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC [17.152519147246842]
本稿では,RLをベースとしたオンラインMPCコスト重み付けのためのソルバ感度向上手法を提案する。
SG-RL in Proximal Policy Optimization (PPO) with four modular algorithm that inject solver-gradient guidance into actor-update scaling, policy loss, advantage estimation, and value-function learning。
意図的なモデルミスマッチを持つ2つのフルスケールの自律レースプラットフォームにおいて、SG-RLは最大70.6%のサンプルでPPOの最高のクローズドループリターンに達し、クローズドループリターンにおいてGB-PLベースラインを少なくとも54%上回り、ゼロショットを目に見えない環境に一般化する。
論文 参考訳(メタデータ) (2026-09-01T10:55:18Z) - SAGE: SLO-Aware Adaptive Retrieval for Production RAG Systems [12.570675776086608]
本稿では,クエリ毎の経路数kを動的に選択する学習SLO対応検索ポリシーであるSAGEを提案する。
Natural Questionsでは、5s P95レイテンシの下で、SAGEは95%のSLOコンプライアンスを達成し、最高の静的ベースライン(k)では30%、P95レイテンシを36%、検索コストを51%削減する。
論文 参考訳(メタデータ) (2026-08-08T17:05:36Z) - ISO: An RLVR-Native Optimization Stack [50.40395312897848]
アイソスペクトル最適化(ISO)としてスペクトル継承を運用する
オフラインでは、ISO-Mergerは共有ベーススペシャリストのフレーム変更を単一の固定スペクトルモデルに統合する。
オンラインのISO-Mergerは、AdamWやMuonを含む選択されたベースをフレーム変数に適用し、ベーススペクトルを固定する。
論文 参考訳(メタデータ) (2026-07-21T17:51:36Z) - Adaptive Inference Batching using Policy Gradients [0.0]
我々は、強化学習が適応的なルーティングポリシーを学習できるかどうかを検討する。
ReINFORCEおよびPPOエージェントをキューイング理論と生産トレースに対して離散イベントシミュレータで訓練する。
この結果から,RLは単一リソーススケジューリングではなく,マルチリソーススケジューリングに集中していることが示唆された。
論文 参考訳(メタデータ) (2026-07-06T16:20:19Z) - Regime-Conditional Stabilisation of LLM-Augmented Cooperative Multi-Agent Reinforcement Learning [1.889930012459364]
LLMLにおける報酬重み付けの動的更新は,確率ベース形状の定常性の仮定に反することを示す。
本研究では, トレーニングフェーズ内で厳密な定常性を実現する相ベース凍結スケジュールと, エポゾン移動平均(EMA)の2つの安定化戦略を提案する。
論文 参考訳(メタデータ) (2026-07-05T19:29:21Z) - LOLLA: Deep Reinforcement Learning for Closed-Loop Link Adaptation Towards a GPU-Accelerated AI-RAN [11.757392351799728]
外部ループリンク適応(OLLA)は、チャネルの変動を追跡するために5G NRに広く展開されている。
本稿では,従来の OLLA 階段を学習連続SINR オフセットに置き換える強化学習フレームワーク LOLLA を提案する。
このフレームワークは、GPUアクセラレーションされた5G NRスタック上で、最初のクローズループAIネイティブ制御dAppとして実現されている。
論文 参考訳(メタデータ) (2026-06-22T09:53:27Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - Stable Forgetting: Bounded Parameter-Efficient Unlearning in LLMs [30.089412595436585]
我々は,大規模な言語モデル (LLM) のフィードフォワード層において,左折集合の上昇がいかに最適化を不安定化させるかを説明する理論的枠組みを提供する。
本研究では, パラメータ効率のよい手法である境界境界アンラーニングを提案し, 適応子に有界関数を適用することにより微調整を安定化する。
提案手法は,LLMにおける非学習のための理論的基盤と実践的拡張性を備えた枠組みを確立するとともに,保持状態を維持しながら忘れることの大幅な改善を実現している。
論文 参考訳(メタデータ) (2025-09-29T01:30:15Z) - Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model [56.92219181993453]
本稿では,PPOやGRPOなどのオンラインRFT手法をオフ・ポリティクスデータに活用するために,Reincarnating Mix-policy Proximal Policy Gradient (ReMix)を提案する。
ReMix は,(1) 効率的なトレーニングのための更新データ(UTD)比が増大した混成政策勾配,(2) 安定性と柔軟性のトレードオフのバランスをとるためのKL-Convex 政策制約,(3) 効率的な早期学習から安定した改善へのシームレスな移行を実現するための政策再編成の3つの主要な構成要素から構成される。
論文 参考訳(メタデータ) (2025-07-09T14:29:45Z) - Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning [55.33984461046492]
現在、政策に基づく手法が大規模言語モデル(LLM)推論のための強化学習パイプラインを支配している。
本稿では,このアイデアを LLM に自然に適応させるアルゴリズムである Trajectory Bellman Residual Minimization (TBRM) を紹介する。
我々は、軌道の軌道変更-測度分析の改善により、任意のオフ政治から、最適に近いKL正規化政策への収束を証明した。
論文 参考訳(メタデータ) (2025-05-21T09:41:53Z) - Weighted-Reward Preference Optimization for Implicit Model Fusion [35.57286356489511]
提案手法は,ソースLLMとターゲットLLM間の優先最適化を有効に活用する暗黙融合方式を提案する。
WRPOは語彙アライメントやマトリックス融合の必要性を排除し、様々なLSMに対応するために効率的にスケールすることができる。
MT-Bench、AlpacaEval-2、Arena-Hardベンチマークの実験は、WRPOが既存の知識融合法より一貫して優れていることを示した。
論文 参考訳(メタデータ) (2024-12-04T10:15:12Z) - Dr. SoW: Density Ratio of Strong-over-weak LLMs for Reducing the Cost of Human Annotation in Preference Tuning [15.776175440446414]
本稿では,人間のアノテーションへの依存を解消するコスト効率の高い方法であるDr.SoW(Density Ratio of Strong over Weak)を紹介する。
Dr.SoW は報奨信号として、より整列した LLM と低整列の LLM の対数密度比を用いる。
Dr.SoWによるデータを用いたLlama-3-8B-インストラクタを選好する。
論文 参考訳(メタデータ) (2024-11-04T18:54:39Z) - Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning [55.65738319966385]
我々は、新しいオンラインアルゴリズム、反復的ナッシュポリシー最適化(INPO)を提案する。
従来の方法とは異なり、INPOは個々の応答に対する期待される勝利率を推定する必要性を回避している。
LLaMA-3-8BベースのSFTモデルで、INPOはAlpacaEval 2.0で42.6%、Arena-Hardで37.8%の勝利率を達成した。
論文 参考訳(メタデータ) (2024-06-30T08:00:34Z) - REBEL: Reinforcement Learning via Regressing Relative Rewards [59.68420022466047]
生成モデルの時代における最小限のRLアルゴリズムであるREBELを提案する。
理論的には、自然ポリシーグラディエントのような基本的なRLアルゴリズムはREBELの変種と見なすことができる。
我々はREBELが言語モデリングと画像生成に一貫したアプローチを提供し、PPOやDPOとより強くあるいは類似した性能を実現することを発見した。
論文 参考訳(メタデータ) (2024-04-25T17:20:45Z) - WARM: On the Benefits of Weight Averaged Reward Models [63.08179139233774]
Weight Averaged Reward Models (WARM) を提案する。
最良N法とRL法を用いた要約タスクの実験は、WARMがLLM予測の全体的な品質とアライメントを改善することを示す。
論文 参考訳(メタデータ) (2024-01-22T18:27:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。