論文の概要: When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling
- arxiv url: http://arxiv.org/abs/2604.03562v1
- Date: Sat, 04 Apr 2026 03:04:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.642982
- Title: When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling
- Title(参考訳): LLM誘導LEO衛星スケジューリングにおける因果探索とスイッチング安定性ジレンマ
- Authors: Yuanhang Li,
- Abstract要約: 衛星スケジューリングにおける深い強化学習のための適応的な報酬設計は、レギュラーアウェアの報酬重みが静的なよりも優れているという直感によって動機付けられている。
PPOは値関数収束のために定常的な報酬信号を必要とするため、ほぼ安定な報酬重み(342.1 Mbps)は慎重に調整された動的重み(103.396.8 Mbps)より優れていることを示す。
- 参考スコア(独自算出の注目度): 1.0152838128195467
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adaptive reward design for deep reinforcement learning (DRL) in multi-beam LEO satellite scheduling is motivated by the intuition that regime-aware reward weights should outperform static ones. We systematically test this intuition and uncover a switching-stability dilemma: near-constant reward weights (342.1 Mbps) outperform carefully-tuned dynamic weights (103.3+/-96.8 Mbps) because PPO requires a quasistationary reward signal for value function convergence. Weight adaptation-regardless of quality-degrades performance by repeatedly restarting convergence. To understand why specific weights matter, we introduce a single-variable causal probing method that independently perturbs each reward term by +/-20% and measures PPO response after 50k steps. Probing reveals counterintuitive leverage: a +20% increase in the switching penalty yields +157 Mbps for polar handover and +130 Mbps for hot-cold regimes-findings inaccessible to human experts or trained MLPs without systematic probing. We evaluate four MDP architect variants (fixed, rule-based, learned MLP, finetuned LLM) across known and novel traffic regimes. The MLP achieves 357.9 Mbps on known regimes and 325.2 Mbps on novel regimes, while the fine-tuned LLM collapses to 45.3+/-43.0 Mbps due to weight oscillation rather than lack of domain knowledge-output consistency, not knowledge, is the binding constraint. Our findings provide an empirically-grounded roadmap for LLM-DRL integration in communication systems, identifying where LLMs add irreplaceable value (natural language intent understanding) versus where simpler methods suffice.
- Abstract(参考訳): マルチビームLEO衛星スケジューリングにおける深い強化学習(DRL)のための適応的な報酬設計は、レギュラーアウェアの報酬重みが静的なよりも優れているという直感に動機付けられている。
我々はこの直感を体系的にテストし、PPOが値関数収束のために定性的な報酬信号を必要とするため、ほぼ安定な報酬重み(342.1 Mbps)が慎重に調整された動的重み(103.3+/-96.8 Mbps)より優れていることを明らかにした。
コンバージェンスの再再起動による品質劣化性能の軽量化
比重が重要である理由を理解するために,各報酬項を+/-20%独立に摂動し,50kステップ後にPPO応答を測定する一変量因果探索法を導入する。
スイッチングペナルティの20%増加は、極性ハンドオーバに対して+157 Mbps、ホットコールドレジームフィニングにおいて+130 Mbps、人間の専門家や訓練されたMLPには系統的なプローブなしでアクセスできない。
MDPアーキテクトの4つの変種(固定型,ルールベース,学習型MDP,微調整型LPM)を,既知,新奇な交通体制で評価した。
MLPは、既知のレジームで357.9 Mbps、新しいレジームで325.2 Mbpsを達成する一方、細調整されたLLMは、知識ではなく、ドメイン知識と出力の整合性の欠如よりも、重量振動により45.3+/-43.0 Mbpsに崩壊する。
本稿はLLM-DRL統合のための実証的なロードマップを提供し,LLMが不定値(自然言語の意図理解)を付加する場所と,単純な手法が十分である場所を同定する。
関連論文リスト
- Stable Forgetting: Bounded Parameter-Efficient Unlearning in LLMs [30.089412595436585]
我々は,大規模な言語モデル (LLM) のフィードフォワード層において,左折集合の上昇がいかに最適化を不安定化させるかを説明する理論的枠組みを提供する。
本研究では, パラメータ効率のよい手法である境界境界アンラーニングを提案し, 適応子に有界関数を適用することにより微調整を安定化する。
提案手法は,LLMにおける非学習のための理論的基盤と実践的拡張性を備えた枠組みを確立するとともに,保持状態を維持しながら忘れることの大幅な改善を実現している。
論文 参考訳(メタデータ) (2025-09-29T01:30:15Z) - Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model [56.92219181993453]
本稿では,PPOやGRPOなどのオンラインRFT手法をオフ・ポリティクスデータに活用するために,Reincarnating Mix-policy Proximal Policy Gradient (ReMix)を提案する。
ReMix は,(1) 効率的なトレーニングのための更新データ(UTD)比が増大した混成政策勾配,(2) 安定性と柔軟性のトレードオフのバランスをとるためのKL-Convex 政策制約,(3) 効率的な早期学習から安定した改善へのシームレスな移行を実現するための政策再編成の3つの主要な構成要素から構成される。
論文 参考訳(メタデータ) (2025-07-09T14:29:45Z) - Weighted-Reward Preference Optimization for Implicit Model Fusion [35.57286356489511]
提案手法は,ソースLLMとターゲットLLM間の優先最適化を有効に活用する暗黙融合方式を提案する。
WRPOは語彙アライメントやマトリックス融合の必要性を排除し、様々なLSMに対応するために効率的にスケールすることができる。
MT-Bench、AlpacaEval-2、Arena-Hardベンチマークの実験は、WRPOが既存の知識融合法より一貫して優れていることを示した。
論文 参考訳(メタデータ) (2024-12-04T10:15:12Z) - Dr. SoW: Density Ratio of Strong-over-weak LLMs for Reducing the Cost of Human Annotation in Preference Tuning [15.776175440446414]
本稿では,人間のアノテーションへの依存を解消するコスト効率の高い方法であるDr.SoW(Density Ratio of Strong over Weak)を紹介する。
Dr.SoW は報奨信号として、より整列した LLM と低整列の LLM の対数密度比を用いる。
Dr.SoWによるデータを用いたLlama-3-8B-インストラクタを選好する。
論文 参考訳(メタデータ) (2024-11-04T18:54:39Z) - Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning [55.65738319966385]
我々は、新しいオンラインアルゴリズム、反復的ナッシュポリシー最適化(INPO)を提案する。
従来の方法とは異なり、INPOは個々の応答に対する期待される勝利率を推定する必要性を回避している。
LLaMA-3-8BベースのSFTモデルで、INPOはAlpacaEval 2.0で42.6%、Arena-Hardで37.8%の勝利率を達成した。
論文 参考訳(メタデータ) (2024-06-30T08:00:34Z) - WARM: On the Benefits of Weight Averaged Reward Models [63.08179139233774]
Weight Averaged Reward Models (WARM) を提案する。
最良N法とRL法を用いた要約タスクの実験は、WARMがLLM予測の全体的な品質とアライメントを改善することを示す。
論文 参考訳(メタデータ) (2024-01-22T18:27:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。