論文の概要: EasyOPD: An Easy-to-use On-Policy Distillation Framework for Large Language Models
- arxiv url: http://arxiv.org/abs/2607.11012v1
- Date: Mon, 13 Jul 2026 02:27:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.303054
- Title: EasyOPD: An Easy-to-use On-Policy Distillation Framework for Large Language Models
- Title(参考訳): EasyOPD: 大規模言語モデルのための簡単に使えるオンライン蒸留フレームワーク
- Abstract要約: 本稿では,Verl上に構築されたオンライン蒸留フレームワークであるtextscEasyOPDについて述べる。
textscEasyOPDは、ユーザ側設定、メソッド固有の監視ロジック、Verlベースの実行を分離する。
我々は,3つのOPD設定(クロストケナイザOPD,オン・ポリティクス自己蒸留,ステップワイズPD)の代表的手法をインスタンス化する。
- 参考スコア(独自算出の注目度): 39.18361000090602
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Conventional language-model distillation often relies on fixed teacher-generated data, which may not cover the states encountered by an evolving student policy. On-policy distillation (OPD) instead collects teacher or evaluator supervision on student-generated rollouts. However, existing OPD methods differ substantially in supervision form, tokenizer compatibility, teacher access, and supervision granularity, leading to fragmented implementations that are difficult to reproduce and extend. We present \textsc{EasyOPD}, an on-policy distillation framework built on verl, a distributed reinforcement-learning framework for large language models. \textsc{EasyOPD} separates user-side configuration, method-specific supervision logic, and verl-based execution. Its method modules connect to the shared backend through extension boundaries for loss construction, rollout metadata, reward processing, tokenizer alignment, and teacher-side computation. We instantiate representative methods for three OPD settings -- cross-tokenizer OPD, on-policy self-distillation, and step-wise OPD. Experiments on reasoning, code-generation, scientific-knowledge, and tool-use benchmarks show that these implementations can be executed through the same verl-based backend while retaining their method-specific objectives and task-dependent performance profiles. We release \textsc{EasyOPD} with runnable YAML configurations, documentation, and an installable demonstration package and video.
- Abstract(参考訳): 従来の言語モデル蒸留は、しばしば教師が生成した固定データに依存しており、学生政策が直面する状態をカバーしていない可能性がある。
オンライン蒸留(On-policy distillation、OPD)は、学生が生み出すロールアウトに関する教師や評価者による監督を集める。
しかし、既存のPD手法は、監督形式、トークンライザの互換性、教師アクセス、監督の粒度が大きく異なり、再現や拡張が困難である断片化実装につながっている。
本稿では,大言語モデルのための分散強化学習フレームワークであるverl上に構築されたオンライン蒸留フレームワークであるtextsc{EasyOPD}を紹介する。
\textsc{EasyOPD} は、ユーザ側設定、メソッド固有の監視ロジック、Verlベースの実行を分離する。
そのメソッドモジュールは、損失構築、ロールアウトメタデータ、報酬処理、トークンライザのアライメント、教師側の計算のための拡張バウンダリを通じて共有バックエンドに接続する。
我々は,3つのOPD設定(クロストケナイザOPD,オン・ポリティクス自己蒸留,ステップワイズPD)の代表的手法をインスタンス化する。
推論、コード生成、科学的知識、ツール使用ベンチマークの実験では、これらの実装は、メソッド固有の目的とタスク依存のパフォーマンスプロファイルを維持しながら、同じVerlベースのバックエンドを通じて実行可能であることが示されている。
実行可能なYAML設定、ドキュメンテーション、インストール可能なデモパッケージとビデオを備えた \textsc{EasyOPD} をリリースします。
関連論文リスト
- DHRCL:Training Code LLMs with Dense Hierarchical Rewards and Curriculum Learning [15.421698703970167]
Dense Hierarchical Rewards and Curriculum Learning を用いた強化学習フレームワーク DHRCL を提案する。
DHRCLは、構文検証、実行の成功、単体テストのパスレート、ASTベースの構造的類似性にフィードバックを分解する。
我々は,Qwen3-4B,Qwen3-8B,Qwen3-14BのバックボーンにおけるDHRCLの評価を行った。
論文 参考訳(メタデータ) (2026-07-29T04:16:33Z) - dOPSD: On-Policy Self-Distillation for Diffusion Language Models [52.60302464420127]
拡散大言語モデルは、マスキングシーケンスを反復的に復調することでテキストを生成する。
監督された微調整は非政治的であり、露出バイアスに悩まされる一方、強化学習はわずかにシーケンスレベルの報酬しか与えない。
On-policy Self-distillation (OPSD)は、学生と教師の両方に1つのモデルを用いて、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2026-07-05T17:47:29Z) - Curriculum Learning-Guided Progressive Distillation in Large Language Models [18.961191510804134]
既存の蒸留アプローチでは、トレーニングデータの学習順序と、教師と学生のモデル間の容量ミスマッチという、2つの重要な要因を見落としていることが多い。
本稿では,教師の強度とデータ難易度を一致させることにより,両要因を統一したフレームワークであるCLPD(Curriculum Learning-Guided Progressive Distillation)を提案する。
私たちのフレームワークはモジュール化されており、最小限のオーバーヘッドで標準的な蒸留アルゴリズムに統合することができます。
論文 参考訳(メタデータ) (2026-05-11T21:37:20Z) - Rubric-based On-policy Distillation [62.11106822527392]
オンライン蒸留(OPD)はモデルアライメントの強力なパラダイムであるが、教師のロジットに依存しているため、ホワイトボックスのシナリオへの適用が制限される。
構造化された意味ルーブリックは教師のロジットに代わるスケーラブルな代替品として機能し,教師が生成した応答のみを用いてOPDを可能にする。
具体的には、ROPDは教師と学生のコントラストからプロンプト固有のルーリックを誘導し、これらのルーリックを使用して学生のロールアウトをオンライン最適化に活用する。
論文 参考訳(メタデータ) (2026-05-08T07:52:15Z) - Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe [53.40076304466524]
LLM(Large Language Models)とMLLM(Multimodal Large Language Models)をまたいで一般化する統一OPDフレームワークであるUni-OPDを提案する。
具体的には、学生の立場から、学習中の情報発信状態の探索を促進するために、2つのデータバランス戦略を採用する。
我々は,正しい軌道と間違った軌道の順序の整合性を取り戻すために,結果誘導マージンキャリブレーション機構を開発した。
論文 参考訳(メタデータ) (2026-05-05T12:15:21Z) - Data-Model Co-Evolution: Growing Test Sets to Refine LLM Behavior [10.041741229516141]
大きな言語モデル(LLM)により、開発者はプロンプト命令を編集することでモデルの振る舞いを制御できる。
我々はこのパラダイムを対話型システムで運用し、微妙でドメイン固有のポリシーをインシデントインストラクションにエンコードするという課題に対処する。
論文 参考訳(メタデータ) (2025-10-14T17:07:37Z) - AgenticIE: An Adaptive Agent for Information Extraction from Complex Regulatory Documents [1.338174941551702]
EUの規制により義務付けられ、建設製品の性能を認定する文書(DoP)の宣言。
自動キー値ペア抽出(KVP)と質問応答(QA)によって、DoPと人間をアクセス可能にするには2つの課題がある。
論文 参考訳(メタデータ) (2025-09-15T10:53:05Z) - Integrated Structural Prompt Learning for Vision-Language Models [15.002501540565781]
本稿では、視覚言語モデル(VLM)のための統合構造プロンプト(ISP)を提案する。
ISPは、学習可能なプロンプトと凍結トークンの間の構造関係をモデル化するために、自己構造的および相互構造的プロンプトモジュールを導入している。
ISPは最先端の手法に対して競争力を発揮する。
論文 参考訳(メタデータ) (2025-07-08T04:59:58Z) - Structured Agent Distillation for Large Language Model [56.38279355868093]
本研究では,LLMをベースとした大規模エージェントを小さな学生モデルに圧縮するフレームワークであるStructured Agent Distillationを提案する。
提案手法は, [REASON] と [ACT] にトラジェクトリを分割し, 各コンポーネントを教師の行動に合わせるためにセグメント特異的な損失を適用した。
ALFWorld、HotPotQA-ReAct、WebShopの実験は、我々のアプローチがトークンレベルと模倣学習のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-05-20T02:01:55Z) - CELA: Cost-Efficient Language Model Alignment for CTR Prediction [70.65910069412944]
CTR(Click-Through Rate)予測は、レコメンダシステムにおいて最重要位置を占める。
最近の取り組みは、プレトレーニング言語モデル(PLM)を統合することでこれらの課題を緩和しようとしている。
CTR予測のためのtextbfCost-textbfEfficient textbfLanguage Model textbfAlignment (textbfCELA)を提案する。
論文 参考訳(メタデータ) (2024-05-17T07:43:25Z) - Learning Multi-Objective Curricula for Deep Reinforcement Learning [55.27879754113767]
深部強化学習(DRL)のサンプル効率と最終性能を向上させるために,各種自動カリキュラム学習(ACL)手法が提案されている。
本稿では,多目的だがコヒーレントなカリキュラムを作成するための統合された自動カリキュラム学習フレームワークを提案する。
既存の手設計のカリキュラムパラダイムに加えて,抽象カリキュラムを学習するためのフレキシブルなメモリ機構を設計する。
論文 参考訳(メタデータ) (2021-10-06T19:30:25Z) - CINS: Comprehensive Instruction for Few-shot Learning in Task-oriented
Dialog Systems [56.302581679816775]
本稿では,タスク固有の命令でPLMを利用する包括的インストラクション(CINS)を提案する。
命令のスキーマ(定義、制約、プロンプト)と、ToDの3つの重要な下流タスクに対するカスタマイズされた実現を設計する。
これらのToDタスクに対して,小さな検証データを用いた現実的な数ショット学習シナリオで実験を行った。
論文 参考訳(メタデータ) (2021-09-10T03:23:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。