論文の概要: ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training
- arxiv url: http://arxiv.org/abs/2609.16639v2
- Date: Mon, 21 Sep 2026 09:26:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:28:59.840919
- Title: ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training
- Title(参考訳): ReDraft, Don't just distill: Reference-Driven Revision for Continual VLLM Post-Training
- Abstract要約: 大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
- 参考スコア(独自算出の注目度): 66.72708893922605
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Continual post-training of large multimodal models should add new capabilities while preserving those from pre-training, and the two goals pull in opposite directions. SFT gives explicit target supervision that learns a task from near-zero accuracy, but its off-policy targets move the model far enough to cause forgetting; on-policy methods such as RLVR and self-distillation preserve policy proximity yet supply little signal when the policy cannot yet solve the task. We introduce ReDraft (Reference-Driven Revision and Fine-Tuning), which obtains both from the model's own failures: using an expert response only as a reference, it has the model revise its own incorrect rollout, keeps the revision only if a verifier accepts it, and fine-tunes on what survives. Each retained target is therefore explicit, yet still close to the current policy. Across Counting, Clock Reading, and Jigsaw on Qwen2.5-VL-3B/7B, two of them with near zero accuracy, ReDraft gains 56.9 points on the target task against SFT's 52.9 while cutting prior-task loss from 16.6 to 1.5 points (11.3x less forgetting), and improves on OPSD along both axes (19.3 gain, 6.2 loss). Data- and parameter-space analyses match the design: revised targets are more probable under the base model, and the updates they induce stay compact and follow SFT's direction more closely than OPSD's. Repairing the model's own output, rather than replacing it with an expert's, is what lets one objective do both.
- Abstract(参考訳): 大規模マルチモーダルモデルの継続的な後トレーニングは、事前トレーニングからトレーニングを保ちながら新しい機能を追加し、2つの目標を反対方向に引き上げるべきである。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットは、モデルを忘れるのに十分な距離を移動させ、RLVRや自己蒸留のようなオンポリティクスの手法は、そのタスクがまだ解決できないときにほとんど信号を提供しない。
ReDraft (Reference-Driven Revision and Fine-Tuning)は、モデル自身の失敗から、専門家のレスポンスを参照としてのみ使用し、モデルが自身の誤ったロールアウトをリビジョンし、検証者がそれを受け入れた場合にのみリビジョンを保持し、何が生き残るのかを微調整する。
したがって、それぞれの保持対象は明確であるが、現在の方針に近い。
Qwen2.5-VL-3B/7BでのAcross Counting, Clock Reading, and Jigsaw on Qwen2.5-VL-3B/7B, two with almost zero accuracy, ReDraft gains 56.9 gain on the target task on SFT's 52.9 while cut pre-task loss to 16.6 to 1.5 points (11.3x less forgetting) and improves on OPSD alongs (19.3 gain, 6.2 loss)。
データとパラメータ空間の分析は設計と一致する: 修正されたターゲットはベースモデルの下でより確率が高く、それらが引き起こす更新はコンパクトであり、OPSDよりもSFTの方向に従う。
モデルのアウトプットを専門家のものと置き換えるのではなく、モデル自身のアウトプットを修復することです。
関連論文リスト
- REER-PT: Reverse-Engineered Reasoning for Perplexity-Guided Pre-training Data Augmentation [64.84437332310516]
我々は,Reverse-Engineered Reasoning (REER) を生の事前学習データに拡張するスケーラブルなフレームワークである textbfREER-PT を紹介する。
REER-PTは予測が難しいが、それ以前のコンテキストから推論できる継続を識別し、コンテキストと継続の間の欠落した接続を再構築する簡潔な推論アノテーションを挿入する。
このスパース変換は、ソーステキストを保存し、トレーニング前のオンライン推論ロールアウトを避けることで、標準的な次世代の予測と互換性を維持します。
論文 参考訳(メタデータ) (2026-08-31T11:34:19Z) - PROOF-Gen: From Optimized Data to Better Distillation [6.158612515104146]
ツール呼び出しエージェントを駆動するポストトレーニングパイプラインは、毎日または毎週のケイデンスでこのステージを再実行し、フロンティアと教師の費用を各サイクルに支払う。
2ベンチでは、教員試験の57%が失敗し、その3分の2がほぼミスである。
本稿では,これらの故障からゴールデントラジェクトリを回復するPROOF-Genを,シナリオごとのプロンプト最適化により導入する。
論文 参考訳(メタデータ) (2026-08-24T23:33:56Z) - Invocation-Level Reliability of Tool-Using Agents [0.7874708385247353]
クリーンな教師強化コンテキストと,モデル独自のフリーランニングコンテキストの両方の下で,その2つを分離する,正しい起動率を測定する。
深さ6では、モデル自身のクリーンコンテキスト能力の約70%が、以前の失敗に失われる。
論文 参考訳(メタデータ) (2026-08-23T09:04:59Z) - UpgradeBench: A Decision-Centric Benchmark for Upgrading Fine-Tuned LLM Specialists [10.23869027501654]
4つの連続したQwenリリースをカバーする決定駆動型縦断ベンチマークであるUpgradeを提示する。
アップグレードは、新しいチェックポイントが、固定準備された専門家のパフォーマンスを改善するかどうか、バージョン間での資産移動、そして、リカバリリソースが使用可能なものかどうか、という3つの中核的な疑問を解消する。
論文 参考訳(メタデータ) (2026-08-21T09:37:47Z) - RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - TASR: Training-Free Adaptive Stopping for Iterative Retrieval [12.177557521540082]
反復的検索拡張生成エージェントは、モデルが解答に収束した後も検索を続けることで、一般的にオーバースペンドされる。
TASR(Training-Free Adaptive Stopping Rule)は,モデルが前ラウンドの正規化を繰り返すと発火する一行述語である。
論文 参考訳(メタデータ) (2026-06-11T18:35:14Z) - PURGE: Projected Unlearning via Retain-Guided Erasure [5.069332646113575]
PURGEは、単純だが未発見の観測(継続学習(CL)と機械未学習(MU))に基づいて構築された機械学習アルゴリズムである。
CLは古いタスクを忘れずに新しいタスクを学習しようとします。MUは、反対方向に同じ根底にある緊張力を表す保持パフォーマンスを損なうことなく、特定のデータを消去しようとします。
PURGEは、MIA AUROCを0.5(理想)に近い精度で達成し、勾配上昇、KLユニフォーム、プライバシーユーティリティフロンティアのいくつかのベースラインを達成しながら、常に96%以上の精度を維持している。
論文 参考訳(メタデータ) (2026-06-02T15:53:01Z) - SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models [48.335262141752715]
拡散モデルのための後トレーニングパイプラインには、キュレートされたデータに対する教師付き微調整(SFT)と報酬モデルによる強化学習(RL)の2段階がある。
本稿では,このギャップを埋めるバイアス補正ポストトレーニング法であるSOAR(Self-Correction for Optimal Alignment and Refinement)を提案する。
オンライン政治であり、報酬なしであり、クレジット割り当ての問題なく、時間ごとの密集した監督を提供する。
論文 参考訳(メタデータ) (2026-04-14T11:45:15Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference [45.96968721472664]
我々は、よりスムーズで信頼性の高い報酬モデルを学ぶ方法であるTDRMを紹介する。
実験の結果、TD訓練プロセス報酬モデル(PRM)はBest-of-N(最大6.6%)とツリーサーチ(最大23.7%)でのパフォーマンスを向上させることが示された。
論文 参考訳(メタデータ) (2025-09-18T16:14:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。