論文の概要: Learn-by-Wire Training Control Governance: Bounded Autonomous Training Under Stress for Stability and Efficiency
- arxiv url: http://arxiv.org/abs/2605.19008v1
- Date: Mon, 18 May 2026 18:32:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 15:03:08.918505
- Title: Learn-by-Wire Training Control Governance: Bounded Autonomous Training Under Stress for Stability and Efficiency
- Title(参考訳): ワイヤによる学習訓練制御ガバナンス:安定性と効率性に対するストレス下における境界付き自律訓練
- Authors: Anis Radianis,
- Abstract要約: Learnby-Wire Guard(LBW-Guard)は、AdamW上で動作する、自律的なトレーニング制御ガバナンス層である。
WikiText-103を用いたQwen2.5中心のストレス・アンド・ロバストネススイートにおけるLBW-Guardの評価を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Modern language-model training is increasingly exposed to instability, degraded runs, and wasted compute, especially under aggressive learning-rate, scale, and runtime-stress conditions. This paper introduces Learn-by-Wire Guard (LBW-Guard), a bounded autonomous training-control governance layer that operates above AdamW. Rather than replacing the optimizer update rule, LBW-Guard observes training telemetry, interprets instability-sensitive regimes, and applies bounded control to optimizer execution while preserving fixed training objectives. We evaluate LBW-Guard in a Qwen2.5-centered stress-and-robustness suite using WikiText-103, with Qwen2.5-7B as the empirical anchor, model-size comparisons against Qwen2.5-3B and Qwen2.5-14B, learning-rate stress tests, gradient-clipping baselines, and a no-LoRA TinyLlama-1B full-parameter sanity check. In the 7B reference setting, LBW-Guard reduces final perplexity from 13.21 to 10.74, an 18.7% improvement, while reducing end-to-end time from 392.54s to 357.02s, a 1.10x speedup. Under stronger learning-rate stress, AdamW degrades to 1885.24 final perplexity at LR=3e-3 and 659.76 at LR=1e-3, whereas LBW-Guard remains trainable at 11.57 and 10.33, respectively. Gradient-clipping baselines do not reproduce this effect. These results support a scoped systems conclusion that stability-sensitive LLM training can benefit from a governance plane above the optimizer. LBW-Guard provides evidence that bounded runtime control can preserve productive compute under stress while remaining distinct from optimizer replacement and local gradient suppression.
- Abstract(参考訳): 現代の言語モデルトレーニングは、不安定性、劣化した実行、特に積極的学習率、スケール、実行時ストレス条件下での無駄な計算にさらされている。
本稿では,AdamW上で動作する自律学習制御ガバナンス層であるLBW-Guardについて紹介する。
LBW-Guardは、オプティマイザ更新ルールを置き換えるのではなく、トレーニングテレメトリを観察し、不安定性に敏感なレシエーションを解釈し、固定されたトレーニング目標を維持しながら、オプティマイザ実行に境界制御を適用する。
WikiText-103を用いてLBW-Guardの評価を行い,Qwen2.5-3BとQwen2.5-14Bのモデルサイズ比較,学習速度ストレステスト,勾配クライッピングベースライン,非LoRA TinyLlama-1Bの正中濃度チェックを行った。
7Bの基準設定では、LBW-Guardは最終パープレキシティを13.21から10.74に18.7%改善し、エンドツーエンドの時間を392.54から357.02に短縮し、1.10倍のスピードアップを実現した。
学習速度の強いストレス下では、AdamWはLR=3e-3で1885.24、LR=1e-3で659.76、LBW-Guardは11.57、LBW-Guardは10.33である。
グラディエント・クリッピング・ベースラインは、この効果を再現しない。
これらの結果は、安定性に敏感なLLMトレーニングは、オプティマイザの上のガバナンスプレーンから恩恵を受けることができるという、スコープ化されたシステム結論を支持する。
LBW-Guardは、バウンドランタイム制御が、最適化された置換と局所的な勾配抑制とは異なるまま、ストレス下で生産的な計算を維持できるという証拠を提供する。
関連論文リスト
- Breaking Bad: Interpretability-Based Safety Audits of State-of-the-Art LLMs [12.500730166535105]
我々は8つのオープンソース大言語モデル(LLM)の総合的、解釈可能性駆動型ジェイルブレイク監査について述べる。
安全でない動作概念に対して最適なアクティベーション・ステアリング係数を同定する2段階グリッド探索アルゴリズムを提案する。
本研究は,系統的安全監査のための強力なツールとして,解釈可能性に基づくステアリングを確立し,その二重利用リスクを強調した。
論文 参考訳(メタデータ) (2026-04-22T16:51:49Z) - Revisiting Auxiliary Losses for Conditional Depth Routing: An Empirical Study [31.968379218484746]
ゲート決定は、言語モデリング(LM)の損失に影響を与える前に、多くのレイヤを通して伝播しなければならない。
補助的な損失はトレーニングを安定させるために積み重ねられることが多いが、それらの間の相互作用、特に予測的な補助的なスコアと明示的なスコアの監督の間の相互作用は、制御された条件下で体系的に比較されていない。
これは、後続のすべてのレイヤがフルに実行されると仮定する、オフポリティのオラクルラベルにトレースしますが、ゲートされた実行ルートはフルに1分しかありません。
論文 参考訳(メタデータ) (2026-04-19T03:20:40Z) - Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning [82.89535601592739]
マルチレベル検証を用いた自己進化型合成により,信頼性の高い基本ツール利用軌跡を生成する2段階パイプラインを提案する。
これらの拡張は、トラクタツール、間接的または曖昧なユーザクエリ、ノイズ、マルチフォーマット、あるいは誤ったツール出力を導入します。
本設計では,標準事例に対する参照マッチングによる報酬の自動計算と,エラー検出などの特別な動作に対する軽量な判断支援検証を実現する。
論文 参考訳(メタデータ) (2026-04-10T18:38:52Z) - SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling [54.276306194000405]
SortedRLを提案する。SortedRLは、強化学習をスケールするためのオンライン長対応スケジューリング戦略である。
SortedRLは、出力長に基づいてロールアウトサンプルをリオーダーし、短いサンプルが早期更新のためにグループを形成することを優先順位付けする。
LLaMA-3.1-8BとQwen-2.5-32Bを論理パズルを含む様々なタスクで実験した結果、SortedRLはRLトレーニングバブル比を50%以上削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T16:48:31Z) - Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates [53.3717573880076]
JitRL(Just-In-Time Reinforcement Learning、ジャスト・イン・タイム強化学習)は、テスト時間ポリシーの最適化を可能にするトレーニング不要のフレームワークである。
JitRLは、経験の動的で非パラメトリックな記憶を維持し、関連する軌跡を取得して、オンザフライでのアクションの利点を推定する。
WebArenaとJerrichoの実験では、JitRLがトレーニング不要メソッドの間に新しい最先端技術を確立していることが示されている。
論文 参考訳(メタデータ) (2026-01-26T14:16:51Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Efficient Differentially Private Fine-Tuning of LLMs via Reinforcement Learning [0.9861588522527782]
RLDPはDP最適化自体を近代的な深層強化学習(RL)に対応可能な閉ループ制御問題とみなす最初のフレームワークである。
GPT2-small、Llama-1B、Llama-3B、Mistral-7Bの1,600以上の実験で、RDDPは1.3-3.0.5%のパープレキシティ低減と平均5.6%のダウンストリームユーティリティゲインを実現している。
論文 参考訳(メタデータ) (2025-07-30T10:46:53Z) - Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models [15.218318229687242]
大規模言語モデルにおける極端なアクティベーションアウトレイアは量子化性能を著しく低下させる。
生成を積極的に防止する実用的なガイドラインであるOutlier-Safe Pre-Training (OSP)を紹介した。
我々の研究は、アウトリーチはLLMに固有のものではなく、トレーニング戦略の結果であることを示した。
論文 参考訳(メタデータ) (2025-06-24T15:03:57Z) - Stable Reinforcement Learning for Efficient Reasoning [2.838966689544288]
GRPO-$lambda$ は GRPO の効率的で安定な変種である。
正当率を監視して報酬戦略を動的に調整する。
平均精度は1.48%向上し、CoT配列の長さは47.3%削減された。
論文 参考訳(メタデータ) (2025-05-23T16:43:03Z) - Understanding R1-Zero-Like Training: A Critical Perspective [73.25430192337235]
ベースモデルとRLの2つのコアコンポーネントを分析し,R1-Zeroライクなトレーニングを批判的に検討した。
本稿では,DeepSeek-V3-Baseを含む幅広いベースモデルについて検討し,事前学習特性がRL性能に与える影響について考察する。
AIME 2024では7Bベースモデルで43.3%の精度を達成できる最小限のR1-Zeroレシピを提案する。
論文 参考訳(メタデータ) (2025-03-26T17:59:14Z) - Real-Time Model-Free Deep Reinforcement Learning for Force Control of a
Series Elastic Actuator [56.11574814802912]
最先端のロボットアプリケーションは、歩行、揚力、操作などの複雑なタスクを達成するために、閉ループ力制御を備えた連続弾性アクチュエータ(SEAs)を使用する。
モデルフリーPID制御法はSEAの非線形性により不安定になりやすい。
深層強化学習は連続制御タスクに有効なモデルレス手法であることが証明されている。
論文 参考訳(メタデータ) (2023-04-11T00:51:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。