論文の概要: RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection
- arxiv url: http://arxiv.org/abs/2607.24771v1
- Date: Wed, 10 Jun 2026 13:33:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.056203
- Title: RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection
- Title(参考訳): RoCo-ACE: 保持型知識注入のためのロールアウト型オンライン蒸留
- Abstract要約: 知識注入は、事前訓練されたMLLMを新しい事実またはドメイン固有の知識で更新するが、完全な権威的な回答を適合させることは、更新されていない振る舞いの漂流を引き起こす可能性がある。
オンライン蒸留は、モデル生成ロールアウトのトレーニングによってこのドリフトを緩和するが、均一な参照条件の蒸留は粗い監督を提供する。
本稿では,知識注入のためのオンライン蒸留のロールアウト条件であるRoCo-ACEを紹介する。
- 参考スコア(独自算出の注目度): 29.95538958634614
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Knowledge injection updates pretrained MLLMs with new factual or domain-specific knowledge, but fitting full authoritative answers can cause drift in non-updated behavior. Online distillation mitigates this drift by training on model-generated rollouts, yet uniform reference-conditioned distillation provides coarse supervision: it can under-emphasize reference-supported rollout tokens and supervise omitted facts only indirectly. We introduce RoCo-ACE, a rollout-conditioned online distillation objective for knowledge injection. RoCo uses same-rollout reference-free/reference-conditioned likelihood contrast to reallocate additional distillation weight to reference-supported rollout tokens, while ACE adds sparse reference-side anchored correction for authoritative anchors omitted from the rollout without full-answer imitation. Across three knowledge-injection settings, six retention benchmarks, multiple baselines, and multiple base models, RoCo-ACE achieves the best injected-knowledge accuracy among compared methods while keeping evaluated retention close to the base model.
- Abstract(参考訳): 知識注入は、事前訓練されたMLLMを新しい事実またはドメイン固有の知識で更新するが、完全な権威的な回答を適合させることは、更新されていない振る舞いの漂流を引き起こす可能性がある。
オンライン蒸留は、モデル生成ロールアウトのトレーニングによってこのドリフトを緩和するが、統一された参照条件の蒸留は、粗い監督を提供する。
本稿では,知識注入のためのオンライン蒸留のロールアウト条件であるRoCo-ACEを紹介する。
RoCoは、同じロールアウト参照フリー/参照条件のコントラストを使用して、参照サポートされたロールアウトトークンに追加の蒸留重量を割り当てる一方、ACEはロールアウトから省略された権威アンカーに対して、フルアンサーの模倣なしにスパースな参照側アンカー補正を追加する。
3つの知識注入設定、6つの保持ベンチマーク、複数のベースライン、および複数のベースモデルにおいて、RoCo-ACEは、ベースモデルに近い評価された保持を維持しながら、比較手法の中で最良のインジェクト知識の精度を達成する。
関連論文リスト
- RISE: Recursive Improvement via Self-Extrapolating Policy Distillation [47.92477203057629]
textbfRISE (textbfRecursive textbfImprovement via textbfSelf-textbfExtrapolating Policy Distillation)を提案する。
RISEは、モデル自身のRLVRトレーニング軌道から直接合成教師を構築する。
数学的推論、マルチドメインSTEM、コード生成、マルチターンエージェントタスクにまたがる実験により、RISEはRLVRのみのトレーニングや政治上の自己蒸留よりも優れていることが示された。
論文 参考訳(メタデータ) (2026-09-04T15:47:51Z) - Purified OPSD: On-Policy Self-Distillation Without Losing How to Think [52.879387744920415]
オンライン自己蒸留(OPSD)は長いチェーン・オブ・ソート(Long-CoT)推論モデルでは一貫して失敗する。
まず,教師が指導信号の非伝達可能成分を分離するために,参照のみの教師を構築する。
第2に、この残差をよく形成されたPMIターゲット分布に変換するメカニズムとして、ポイントワイズ相互情報(PMI)を用いる。
論文 参考訳(メタデータ) (2026-07-02T14:33:07Z) - Robust Trajectory Distillation: Hybrid Reweighting Meets Teacher-Inspired Targets [51.490743278360064]
本稿では,ノイズを共同で抑制し,伝達可能な知識を残さずに保持するトラジェクトリベースのDDフレームワークを提案する。
SGR(Selective Guidance Reweighting)とTIAT(Teacher-Inspireed Auxiliary Targets)の2つの補完的なコンポーネントで構成されている。
論文 参考訳(メタデータ) (2026-06-29T06:24:53Z) - ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains [40.558397280256685]
大規模言語モデル(LLM)の推論性能を向上するオンライン自己蒸留(OPSD)
既存のOPSD法はドメイン内推論において限定的な利得をもたらし、ドメイン外問題に悪影響を及ぼす。
本稿では,参照ソリューションの模倣を対象の推論補正に変換するフレームワークであるReflective On-policy Self-Distillation (ROSD)を提案する。
論文 参考訳(メタデータ) (2026-05-27T06:09:29Z) - AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment [39.63424981516754]
非対称メタ反射型自己蒸留(AMR-SD)
非対称なReLUゲートしきい値を持つ因果情報ゲイン(CIG)を導入し、これらの反射をスパースで高精度なトークンレベルの利点変調に変換する。
科学的、数学的、ツール使用のベンチマークによる実験は、AMR-SDが既存のベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-18T15:14:34Z) - Self-Distilled RLVR [57.37526213765131]
特権教師からのみ派生した学習信号が,情報漏洩と不安定な長期学習をもたらすことを示す。
textbfSelf-textbfDistillationを用いたtextbfRLSD(textbfRLVR)を提案する。
これにより、RSSDはRLVRとOPSDの両方の強度を同時に利用でき、高い収束天井と優れたトレーニング安定性を実現することができる。
論文 参考訳(メタデータ) (2026-04-03T15:50:07Z) - Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models [58.3184497327891]
蒸留自己回帰(AR)ビデオモデルは、効率的なストリーミング生成を可能にするが、しばしば人間の視覚的嗜好に反する。
蒸留ARモデルに適した効率的なオンライン強化学習フレームワークであるAstrolabeを提案する。
論文 参考訳(メタデータ) (2026-03-17T18:32:18Z) - Untwisting RoPE: Frequency Control for Shared Attention in DiTs [84.14005261938284]
位置符号化はトランスフォーマーベースの生成モデルに不可欠である。
ロータリー・ポジショナル・エンベディング (RoPE) は, 異なる位置感性を有する周波数成分に自然に分解されることを示す。
本稿では,厳密な位置アライメントよりも意味的類似性を反映するように,RoPE周波数帯域を選択的に変調する手法を提案する。
論文 参考訳(メタデータ) (2026-02-04T20:01:59Z) - Trust but Verify: Adaptive Conditioning for Reference-Based Diffusion Super-Resolution via Implicit Reference Correlation Modeling [42.10910149675583]
実世界の劣化は、低品質(LQ)入力と参照(Ref)イメージの対応を信頼できないものにする。
本稿では,一段階拡散フレームワークであるAda-RefSRを提案する。
複数のデータセットの実験では、Ada-RefSRは忠実さ、自然性、効率性の強いバランスを達成している。
論文 参考訳(メタデータ) (2026-02-02T09:34:57Z) - ILRR: Inference-Time Steering Method for Masked Diffusion Language Models [8.458339111154585]
単一の参照シーケンスを用いてDLMを操る学習自由フレームワークであるIterative Latent Representation Refinement (ILRR)を紹介する。
ILRRは、生成したシーケンスの内部アクティベーションを、デノナイジングプロセスを通して所定の参照のアクティベーションと動的に調整することで生成をガイドする。
さらに、短い参照を用いて長いテキストをステアリングできる拡張である空間変調ステアリングを導入し、シーケンス間のガイダンス強度を調節する。
論文 参考訳(メタデータ) (2026-01-29T12:48:59Z) - Tape: A Cellular Automata Benchmark for Evaluating Rule-Shift Generalization in Reinforcement Learning [0.0]
本稿では,遅延ルールシフト下でのOOD障害の分離を目的とした強化学習ベンチマークであるTapeを提案する。
我々は、(i)標準化されたOODプロトコル、(ii)統計報告要件、(iii)エントロピー還元と条件付き相互情報を結ぶ情報理論のアイデンティティを提供する。
論文 参考訳(メタデータ) (2026-01-08T08:05:42Z) - Restoration Score Distillation: From Corrupted Diffusion Pretraining to One-Step High-Quality Generation [82.39763984380625]
Score Distillation (DSD) の原理的一般化である textitRestoration Score Distillation (RSD) を提案する。
RSDは、ぼやけた画像、不完全画像、低解像度画像など、広範囲の汚職タイプに対応している。
自然と科学の両方のデータセットの様々な復元作業において、教師モデルを一貫して上回っている。
論文 参考訳(メタデータ) (2025-05-19T17:21:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。