論文の概要: Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Control
- arxiv url: http://arxiv.org/abs/2607.21626v1
- Date: Tue, 07 Jul 2026 17:14:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.95085
- Title: Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Control
- Title(参考訳): 小モデル連続制御におけるGRPO収束の前提条件としての離散的行動空間
- Authors: Dmytro Filatov, Valentyn Fedorov, Vira Filatova,
- Abstract要約: グループ相対ポリシー最適化は、シミュレートされた四重項連続制御タスクのための小さな言語モデルを微調整することができる。
このベンチマークでは、25Hzの4乗子速度制御のためのQwen-0.5BのバニラGRPO微調整が、自明なゼロ作用に崩壊する。
Crazyflie 2.1 ダイナミックスを用いた高忠実度シミュレーションは、ホバー領域のトレーニングと分配のギャップを表面化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: We study whether Group Relative Policy Optimization (GRPO) can fine-tune small language models for simulated quadrotor continuous-control tasks. In our benchmark, vanilla GRPO fine-tuning of Qwen-0.5B for 25 Hz quadrotor velocity control collapses to the trivial zero action: 0 percent success rate, with entropy falling from 0.35 to 0.03 within 60 steps. Two ablations - removing the jerk-penalty term and removing the KL anchor to the pretrained prior - each prevent entropy collapse, yet neither enables learning. When the action interface is replaced by a 5-way categorical choice over PID presets, training converges. The resulting controller traces a smoothness-reliability Pareto frontier along training duration; both endpoints are reported: 98.6 percent success with 0.656 m/s3 jerk at 64 steps, and 100 percent success with 1.103 m/s3 jerk, or 0.796 under a matched velocity cap, at 256 steps. The recipe is evaluated across three pretrained language models. As context, a re-tuned classical baseline, PID with Ki = 0.30 and vmax = 2.5, reaches the same 100 percent success rate at jerk 0.736 m/s3. A high-fidelity simulation using Crazyflie 2.1 dynamics surfaces a hover-region training-distribution gap.
- Abstract(参考訳): グループ相対政策最適化 (GRPO) が, 擬似四重項連続制御タスクに対して, 小言語モデルを微調整できるかどうかを検討する。
このベンチマークでは、25Hzの4乗子速度制御のためのQwen-0.5BのバニラGRPO微調整を行い、0パーセントの成功率で60ステップ以内にエントロピーが0.35から0.03に低下した。
2つの改善 - 厄介なペナルティ項を除去し、事前訓練された前のKLアンカーを除去する - はエントロピーの崩壊を防ぐが、どちらも学習はできない。
アクションインターフェースがPIDプリセットよりも5方向のカテゴリ選択に置き換えられると、トレーニングは収束する。
どちらのエンドポイントも、64ステップで0.656m/s3ジャークで98.6%成功、1.103m/s3ジャークで100%成功、256ステップで0.796。
レシピは、事前訓練された3つの言語モデルで評価される。
文脈として、改良された古典的ベースライン、Ki = 0.30 と vmax = 2.5 の PID は、ジャーク 0.736 m/s3 で同じ100%の成功率に達する。
Crazyflie 2.1 ダイナミックスを用いた高忠実度シミュレーションは、ホバー領域のトレーニングと分配のギャップを表面化する。
関連論文リスト
- PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation [17.919178151901573]
大規模言語モデルに対する標準オンライン蒸留 (OPD) は, 実際に厳しい訓練病理に苦しむことを示す。
PowerOPD は、Alpha > 0 でパラメータ化された Box-Cox 電力変換の符号一貫性の報酬であり、対数比は退化 α -> 0 の極限である。
ベンチマーク平均のAvg@8/Pass@8はバニラPDで+6.37/+5.71、ポストホック安定化で+3.01/+3.54、フルボキャブラリPDで+2.59/+8.90となる。
論文 参考訳(メタデータ) (2026-06-15T18:37:51Z) - TASR: Training-Free Adaptive Stopping for Iterative Retrieval [12.177557521540082]
反復的検索拡張生成エージェントは、モデルが解答に収束した後も検索を続けることで、一般的にオーバースペンドされる。
TASR(Training-Free Adaptive Stopping Rule)は,モデルが前ラウンドの正規化を繰り返すと発火する一行述語である。
論文 参考訳(メタデータ) (2026-06-11T18:35:14Z) - Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models [0.0]
グループ相対政策最適化は、推論タスク上で言語モデルを整合させる効果的な強化学習アルゴリズムとして登場した。
本稿では,Adaptive-Horizon GRPOとSelective-Advantage AH-GRPOの2つの補完拡張を導入する。
解析の結果、非対称割引は正しい解の完全な勾配信号を保持し、エントロピー崩壊を防止し、トレーニングを著しく安定化させることがわかった。
論文 参考訳(メタデータ) (2026-06-03T20:57:57Z) - ESPO: Early-Stopping Proximal Policy Optimization [78.79610718910628]
ESPO(Early-Stopping Proximal Policy Optimization)は、軌道上の障害を検出し、ロールアウトを早期に終了する。
DeepSeek-R1-Distill-Qwen-7Bでは、ESPOはAIME2024(46.28%対45.25%)、AMC2023(85.83%対82.94%)、MATH-500(87.42%対85.43%)でPPOを上回っている。
論文 参考訳(メタデータ) (2026-05-28T12:40:22Z) - CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models [7.489020109808801]
われわれは,クロスパラダイム・ビジョン・ランゲージ・アクション(VLA)のポストトレーニングに関する実証的研究であるCrossVLAを報告する。
i) 確率フローODE統合なしでDPOを連続動作バックボーンで操作できる代理フローマッチングログ確率推定器、(ii) VLA DPOのパラメータ係数層としてのLoRAとDoRAの頭と頭の比較、(iii) ノイズループを示す推論時間解剖学は、サンプル_actions遅延の78.6%、プレフィックス-K/Vキャッシングのラを支配している。
論文 参考訳(メタデータ) (2026-05-21T01:02:41Z) - Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device [0.0]
我々は,SEP-28k(Apple,20,131本の3秒クリップ)でCNNをトレーニングし,次の連続クリップに障害があるかどうかを予測する。
集合目的は、重大事象が韻律前駆体を持つため、重大選択予測器に収束する。
相互人口移動: 微調整無しで、同じチェックポイントが1024名の小児Who-Stutter発話に適用され、AUC 0.674 の検出と 0.655 の予測が達成される。
論文 参考訳(メタデータ) (2026-04-30T00:30:28Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model [56.92219181993453]
本稿では,PPOやGRPOなどのオンラインRFT手法をオフ・ポリティクスデータに活用するために,Reincarnating Mix-policy Proximal Policy Gradient (ReMix)を提案する。
ReMix は,(1) 効率的なトレーニングのための更新データ(UTD)比が増大した混成政策勾配,(2) 安定性と柔軟性のトレードオフのバランスをとるためのKL-Convex 政策制約,(3) 効率的な早期学習から安定した改善へのシームレスな移行を実現するための政策再編成の3つの主要な構成要素から構成される。
論文 参考訳(メタデータ) (2025-07-09T14:29:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。