論文の概要: Unthrottling the Tanh Jacobian in SAC: A Negative Result on Bang-Bang Control and MetaDrive
- arxiv url: http://arxiv.org/abs/2609.09478v1
- Date: Tue, 08 Sep 2026 21:53:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.825499
- Title: Unthrottling the Tanh Jacobian in SAC: A Negative Result on Bang-Bang Control and MetaDrive
- Title(参考訳): SACにおけるTanh Jacobianのアンスロットリング:Bang-BangコントロールとMetaDriveに対する否定的な結果
- Abstract要約: ソフト・アクター・クリティカル (Soft Actor-Critic, SAC) は、連続的な政策を、タンによってしゃがみ込まれる非有界ガウス主義(unbounded Gaussian)として表す。
欠落した信号を復元する最小限の介入をテストする。
取り除くためのバグとして扱うことは無料ではなく、ここで調べるタスクは役に立たない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Soft Actor-Critic (SAC) represents a continuous policy as an unbounded Gaussian that is squashed by tanh. The Jacobian of that map is $\partial a/\partial u = 1-a^2$, which vanishes as $|a|\to 1$. A natural concern is that this throttle starves the actor of critic signal exactly where extreme actions (full brake, full throttle) are optimal. We test a minimal intervention that restores the missing signal: one extra term in the actor loss whose gradient on the pre-tanh mean is the detached action-gradient of $Q$, with no gain parameter. On a minimum-time double integrator whose optimum is bang-bang at the action bounds, vanilla SAC already reaches near-optimal return ($-31.6$ vs. a calibrated optimum of $-30.3$) across ten paired seeds. An ungated bypass does saturate the policy (99% of eval steps with $|a|\ge 0.9$) and collapses return to $-195.5$. A gated bypass that fires only on the flat shoulder $|a|\in[0.9,0.999]$ also fails, and does so without leaving a saturated policy. Warm-started MetaDrive fine-tuning shows the same pattern: the bypass does not improve return, and where collision rate falls it is typically traded for out-of-road departures. Auto-tuned entropy coefficient rises against the bypass, which is a push toward the tails. The Jacobian effect is real. Treating it as a bug to be undone is not free, and on the tasks studied here it is not helpful. Saturating a bound is not the same as solving a problem whose optimum lives on that bound.
- Abstract(参考訳): ソフト・アクター・クリティカル (Soft Actor-Critic, SAC) は、連続的な政策を、タンによってしゃがみ込まれる非有界ガウス主義(unbounded Gaussian)として表す。
その写像のヤコビアンは $\partial a/\partial u = 1-a^2$ であり、これは $|a|\to 1$ として消える。
自然な懸念は、このスロットルは、極端な動作(フルブレーキ、フルスロットル)が最適であるように、批評家信号のアクターを餓死させることである。
我々は、欠落したシグナルを復元する最小限の介入をテストする。アクター損失の1つの余分な項は、プリタンの勾配が、利得パラメータなしで、$Q$の切り離されたアクショングラディエントである。
作用境界におけるバンバンバンの最適値を持つ最小時間ダブルインテグレータでは、バニラSACは10対の種子に対してほぼ最適値(31.6$対30.3$)に達する。
アンゲートバイパスはポリシーを飽和させ(evalの99%が$|a|\ge 0.9$)、崩壊は$195.5$に戻す。
平らな肩だけに発火するゲートバイパスは、|a|\in[0.9,0.999]$も失敗し、飽和ポリシーを残さずに失敗する。
ウォームスタートしたMetaDriveの微調整は、同じパターンを示している。バイパスはリターンを改善しておらず、衝突速度が落ちると、通常、オフ・オブ・ロードの出発のために取引される。
自動調整エントロピー係数は、尾部へのプッシュであるバイパスに対して上昇する。
ヤコビアン効果は実数である。
取り除くためのバグとして扱うことは無料ではなく、ここで調べるタスクは役に立たない。
境界の飽和は、その境界に最適が存在する問題を解決するのと同じではない。
関連論文リスト
- Constrained Online Learning with Noisy Constraint Values [55.29259818039367]
LEDGERは、非負のバランスでネット消費を観測した。
LEDGERは、$O(sqrt T/V)$期待の後悔と$O(sqrt V,T3/4+sqrt T)$期待の予算違反を$Vin[T-1/2,1]$で達成する。
論文 参考訳(メタデータ) (2026-09-07T01:38:41Z) - Does 1/2-Tsallis-INF Also Work Well for Best-Arm Identification? [11.223878908981725]
1/2$-Tsallis-INFは、標準的なFTRLアルゴリズムである。
盗賊の対数的擬似回帰を達成しつつ、敵の盗賊の最小限の後悔を保ちながら達成する。
これは自然な疑問を提起する:同じアルゴリズムは、追加の探索なしに、最高の腕を確実に特定できるのか?
論文 参考訳(メタデータ) (2026-08-15T18:38:36Z) - Breaking the Total Variance Barrier: Sharp Sample Complexity for Linear Heteroscedastic Bandits with Fixed Action Set [93.03556214432615]
本稿では,学習過程を通じて動作セットをプレフィックスするヘテロセシダスティックノイズによる線形帯域問題を再検討する。
本稿では,情報ゲインを最大化するアクションを積極的に探求する,大規模アクション集合のための分散適応アルゴリズムのtexttVAEEを提案する。
音素平均依存率が避けられないことを示す固定作用集合に対して、ほぼ一致する下界を確立する。
論文 参考訳(メタデータ) (2026-07-26T14:24:34Z) - Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence [54.59847568544922]
有限水平時間同質なマルコフ決定過程に対して、$A$状態、$A$アクション、hoighty $H$、および1ドルで有界なトラジェクティブ当たりの合計報酬について、地平自由な後悔について検討する。
失敗確率$$K$はエピソード数で$tilde O(sqrtSAK+S3K)$ hides $mathsfpolyである。
論文 参考訳(メタデータ) (2026-07-22T07:42:19Z) - Delightful Gradients Accelerate Corner Escape [6.396365507203636]
本研究は,emphDelightful Policy Gradient (DG) について考察する。
我々は、正確な反例を通して、このメカニズムが共有関数近似の下で失敗することを示した。
論文 参考訳(メタデータ) (2026-05-12T10:21:36Z) - Complexity of Classical Acceleration for $\ell_1$-Regularized PageRank [14.919427330415608]
FISTAは1/$ローカリティスケーリングを保ちながら$$への依存を改善することができることを示す。
我々はFISTAをわずかに過正規化された目的に基づいて解析し、チェック可能な閉じ込め条件下では、全ての刺激活性化が境界集合内に存在することを示す。
これにより、加速された$(sqrt)-1log(/varepsilon)$項と境界オーバーヘッド$sqrtvol(mathcalB)/(3/2)$からなるバウンダリが得られる。
論文 参考訳(メタデータ) (2026-02-24T17:35:46Z) - Scale-Invariant Regret Matching and Online Learning with Optimal Convergence: Bridging Theory and Practice in Zero-Sum Games [60.871651115241406]
ゼロサムゲームにおける理論と実践の間、何十年にもわたってかなりのシャズムが一階法によって浸食されてきた。
我々は、IREG-PRM$+$と呼ぶPRM$+$の新しいスケール不変かつパラメータフリーな変種を提案する。
ベンチマークゲームでは, PRM$+$と同等でありながら, 最適収束保証を$T-1/2$, $T-1$とする。
論文 参考訳(メタデータ) (2025-10-06T00:33:20Z) - Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback [49.84060509296641]
オンライン有限水平マルコフ決定過程を逆向きに変化した損失と総括的帯域幅フィードバック(フルバンド幅)を用いて研究する。
この種のフィードバックの下では、エージェントは、軌跡内の各中間段階における個々の損失よりも、軌跡全体に生じる総損失のみを観察する。
この設定のための最初のポリシー最適化アルゴリズムを紹介します。
論文 参考訳(メタデータ) (2025-02-06T12:03:24Z) - Improved Regret Bound for Safe Reinforcement Learning via Tighter Cost Pessimism and Reward Optimism [1.4999444543328293]
本稿では,新しいコストと報酬関数推定器に基づくモデルベースアルゴリズムを提案する。
我々のアルゴリズムは、$widetildemathcalO((bar C - bar C_b)-1H2.5 SsqrtAK)$の残念な上限を達成する。
論文 参考訳(メタデータ) (2024-10-14T04:51:06Z) - Horizon-free Reinforcement Learning in Adversarial Linear Mixture MDPs [72.40181882916089]
我々のアルゴリズムが $tildeObig((d+log (|mathcalS|2 |mathcalA|))sqrtKbig)$ regret with full-information feedback, where $d$ is the dimension of a known feature mapping is linearly parametrizing the unknown transition kernel of the MDP, $K$ is the number of episodes, $|mathcalS|$ and $|mathcalA|$ is the standardities of the state and action space。
論文 参考訳(メタデータ) (2023-05-15T05:37:32Z) - Towards Painless Policy Optimization for Constrained MDPs [46.12526917024248]
我々は、無限の地平線における政策最適化、$gamma$-discounted constrained Markov decision process (CMDP)について研究する。
我々の目標は、小さな制約違反で大きな期待された報酬を達成する政策を返却することである。
本稿では,任意のアルゴリズムに対して,報酬の準最適性と制約違反を拘束できる汎用的原始双対フレームワークを提案する。
論文 参考訳(メタデータ) (2022-04-11T15:08:09Z) - On Submodular Contextual Bandits [92.45432756301231]
作用が基底集合の部分集合であり、平均報酬が未知の単調部分モジュラ函数によってモデル化されるような文脈的包帯の問題を考える。
Inverse Gap Weighting 戦略により,提案アルゴリズムは推定関数の局所的最適度を効率よくランダム化することを示す。
論文 参考訳(メタデータ) (2021-12-03T21:42:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。