論文の概要: On Language Drift during RLVR Post-Training
- arxiv url: http://arxiv.org/abs/2610.02015v1
- Date: Thu, 01 Oct 2026 16:39:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.301099
- Title: On Language Drift during RLVR Post-Training
- Title(参考訳): RLVR後学習における言語ドリフトについて
- Abstract要約: 理論的にはRLVR最適化圧力は言語ドリフトを許容するが、教師付き微調整は許さないことを示す。
次に、新しい推論タスクにおいて、RLVR中に言語ドリフトが特に発生することを実証的に示す。
- 参考スコア(独自算出の注目度): 57.637871234402944
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in LLM reasoning models---driven primarily by the paradigm of post-training via reinforcement learning with verifiable reward (RLVR)---have enabled them to accomplish impressively complex tasks. However, in parallel with their rising capabilities, LLMs have increasingly displayed signs of language drift in their chains of thought (CoTs): unusual, non-standard, and seemingly nonsensical language use. Although it is well-documented---and can potentially impair CoT monitorability---the causes of language drift are thus far poorly understood. In this paper, we identify the conditions under which language drift occurs: we prove theoretically that RLVR optimization pressure permits unbounded language drift, while supervised fine-tuning does not. We then show empirically that language drift specifically arises during RLVR on novel reasoning tasks---i.e. when the target behavior cannot be drawn out of the base model. Finally, we prove that it is not possible to constrain language drift without constraining expected reward, suggesting that CoT monitorability cannot be improved without harming performance during RLVR post-training at the frontier.
- Abstract(参考訳): LLM推論モデルの最近の進歩は、主に強化学習と検証可能な報酬(RLVR)によるポストトレーニングのパラダイムにより、驚くほど複雑なタスクを達成できた。
しかし、その能力の上昇と並行して、LLM は考えの連鎖 (CoT) において、異常、非標準、そして一見非感覚的な言語使用の兆候がますます現れている。
十分に文書化されているが、CoTの監視性を損なう可能性がある。
本稿では,RLVR最適化圧力が非有界言語ドリフトを許容するのに対して,教師付き微調整は許さないことを証明する。
次に,RLVRにおける新たな推論タスク,すなわち,ベースモデルから対象の振る舞いを引き出すことができない場合において,言語ドリフトが顕著に発生することを実証的に示す。
最後に、期待される報酬を拘束することなく言語ドリフトを制限できないことを証明し、フロンティアでのRLVR後トレーニングのパフォーマンスを損なうことなく、CoT監視性を改善することができないことを示唆する。
関連論文リスト
- Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving [8.920589816043298]
Vision-Language-Action(VLA)モデルが自動走行(AD)を改造
レイテンシとメモリの予算は厳しく、自動回帰デコーディングは本質的にシーケンシャルです。
この作業は、トレーニングコストが1回だけ支払われる間に、デプロイされたフレーム毎に推論コストが再帰するため、言語がいつ、いつ、どこで振る舞うべきかという中心的な疑問を再考する。
論文 参考訳(メタデータ) (2026-08-31T01:51:51Z) - RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation [11.501308555096605]
RT-VLAは, 最先端のSimLingoモデルの駆動と推論能力を, コンパクトな学生に伝達する軽量蒸留VLAモデルである。
RT-VLAは、言語ベースの推論を保持し、リアルタイム制御に遅延を加えることなく、安全クリティカルな運転モーメントのオフライン言語分析を通じて、ポストホックな説明をサポートする。
SimLingoの教師と比較すると、RT-VLAは競合するクローズループ駆動と言語推論性能を維持しつつ、視覚のみのモードでは44.8倍、視覚+言語モードでは7.9倍の推論時間を短縮している。
論文 参考訳(メタデータ) (2026-06-12T01:06:42Z) - Learning What to Say to Your VLA: Mostly Harmless Vision Language Action Model Steering [19.25748772628753]
VLA(Vision-Language-Action)モデルは、ロボット制御のための自然言語インタフェースを提供する。
クローズループVLAタスク性能を改善するための言語シーケンスを対話的に検索するフレームワークを提案する。
私たちは、いつ言語ステアリングがパフォーマンスを改善するかを予測する改善ヘッドを学びます。
論文 参考訳(メタデータ) (2026-06-10T16:34:49Z) - OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation [61.18260993245354]
Chain-of-Thought(CoT)推論は、VLAベースの自律運転において、軌道予測の強力なドライバである。
本稿では,2つの補助デコーダによって制御されるコンパクトな潜在トークンを通じて推論をルーティングする,統一VLAおよびワールドモデルフレームワークであるOneVLを提案する。
OneVLは、明示的なCoTを超える最初の遅延CoTメソッドとなり、応答のみのレイテンシで最先端の精度を提供する。
論文 参考訳(メタデータ) (2026-04-20T16:37:22Z) - More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models [74.10138874771852]
RLVR上で視覚知覚とテキスト推論を別々に改善する分離されたフレームワークであるPeRL-VL(Perception and Reasoning Learning for Vision-Language Models)を提案する。
知覚のために、PeRL-VLはVLMに基づく説明報酬を導入し、モデルの自己生成した画像記述を忠実さと満足度で評価する。
推論のために、PeRL-VLは論理に富んだチェーン・オブ・シントデータに関するテキストのみの推論SFTステージを追加し、コヒーレンスと論理的一貫性を視覚と独立に強化する。
論文 参考訳(メタデータ) (2025-12-13T23:06:18Z) - Do What? Teaching Vision-Language-Action Models to Reject the Impossible [53.40183895299108]
VLA(Vision-Language-Action)モデルは、さまざまなロボットタスクにおいて強力なパフォーマンスを示している。
Instruct-Verify-and-Act(IVA)を提案する。
実験の結果,IVAはベースラインよりも97.56%の精度で虚偽の前提検出精度を向上させることがわかった。
論文 参考訳(メタデータ) (2025-08-22T10:54:33Z) - VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning [77.34267241692706]
Vision-Language Navigation(VLN)は、エージェントが自然言語命令を使用して現実世界の環境をナビゲートする必要がある、AIの実施における中核的な課題である。
本稿では、LVLM(Large Vision-Language Models)を利用して、エゴセントリックな動画ストリームを連続的なナビゲーションアクションに変換するエンドツーエンドフレームワークであるVLN-R1を提案する。
論文 参考訳(メタデータ) (2025-06-20T17:59:59Z) - Large Language Models Can Learn Temporal Reasoning [11.599570446840547]
本稿では,言語に基づく時間的推論のための新しいフレームワークTG-LLMを提案する。
元の文脈を推論する代わりに、潜時表現、時間グラフ(TG)を採用する。
合成データセット(TGQA)は完全に制御可能であり、最小限の監督を必要とする。
論文 参考訳(メタデータ) (2024-01-12T19:00:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。