論文の概要: Improving OCR Faithfulness via Gated and Attenuated On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2609.38282v1
- Date: Tue, 29 Sep 2026 16:15:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.487163
- Title: Improving OCR Faithfulness via Gated and Attenuated On-Policy Distillation
- Title(参考訳): ガス化および減弱によるOCRの忠実度向上
- Abstract要約: GAD-RLは、学生の現在のタスクパフォーマンスと地域分布に応じて、共同研修中の教師の監督を適応的に調整する。
Qwen3.5-2Bでは、GAD-RL 59.92%のマイクロリコールがGRPOとGRPO+OPD(固定重量)をそれぞれ8.45および4.43ポイント上回っている。
- 参考スコア(独自算出の注目度): 16.017724257286854
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models may rewrite anomalous text in images into linguistically plausible expressions, compromising OCR transcription faithfulness. Sequence-level task rewards and local teacher guidance are complementary, but guidance from the same teacher may not remain equally effective as the student improves. Offline analysis shows that supervision from a fixed teacher becomes progressively less favorable as the student improves, both across training checkpoints and across response groups with different task rewards. Motivated by this observation, we introduce GAD-RL, which adaptively regulates teacher supervision during joint post-training according to the student's current task performance and local distributions. A frozen teacher conditions on reference transcriptions and student-generated prefixes. GAD-RL disables distillation for response groups containing an output with task reward at least 0.95 and continuously attenuates distillation strength as group-mean reward increases. It also weights forward KL by the student's probability of the teacher's Top-1 token, moderating local auxiliary updates when student support for that candidate is low. On Qwen3.5-2B, GAD-RL achieves 59.92% Micro Recall on CHAOS-Bench, surpassing GRPO and GRPO+OPD (fixed-weight) by 8.45 and 4.43 percentage points, respectively, while achieving an Overall score of 91.18 on OmniDocBench v1.6.
- Abstract(参考訳): 視覚言語モデルは、画像中の異常なテキストを言語学的に妥当な表現に書き直すことができ、OCR転写忠実度を損なう。
シーケンスレベルの課題報酬と地域教師指導は相補的であるが、同じ教師による指導は、生徒が改善するにつれて、等しく効果を保たない可能性がある。
オフライン分析は、学生がチェックポイントのトレーニングと、異なるタスク報酬を持つ回答グループの両方で改善するにつれて、固定教師の監督が徐々に好ましくないことを示している。
本研究は,学生の現在の課題パフォーマンスと地域分布に応じて,共同研修における教師の指導を適応的に規制するGAD-RLを紹介する。
凍結した教師は、参照書き起こしと生徒が生成した接頭辞について条件を定める。
GAD-RLは、少なくともタスク報酬を含む出力を含む応答群に対する蒸留を無効とし、グループ平均報酬の増加とともに蒸留強度を継続的に減衰させる。
また、教師のTop-1トークンの確率によってKLを重み付け、その候補に対する学生の支持が低い場合には、局所的な補助的更新を緩和する。
Qwen3.5-2Bでは、GAD-RLはCHAOS-Bench上で59.92%のマイクロリコールを達成し、GRPOとGRPO+OPD(固定重量)をそれぞれ8.45ポイント、GRPO+OPD(固定重量)を4.43ポイント上回り、OmniDocBench v1.6では91.18スコアを記録した。
関連論文リスト
- Reward-Aligned Reweighting for On-Policy Distillation [17.797224736120654]
オンライン蒸留は、学生が生み出す軌跡に関するより強い教師からの強いフィードバックで、学生言語モデルを訓練する。
決定の課題価値は、学生がその後の推論をどのように完了するかに依存する。
このミスマッチは、学生が確実に実行できないパスを補強したり、実行可能な学生戦略を抑えるために模倣を引き起こす可能性がある。
本稿では,教師の指導を継続的に再配置するために,結果の合意と教師の意見の不一致の程度を生かしたR$2-OPD(Reward-Aligned Reweighting for On-Policy Distillation)を紹介する。
論文 参考訳(メタデータ) (2026-09-28T16:09:06Z) - TeacherGRPO: Closing the Capacity Gap in Reasoning Distillation via Teacher Alignment [70.40748464576045]
強力な教師モデルから小さな学生への蒸留はギャップカースに面している。
教師がより高度に成長するにつれて、複雑な分布は生徒が近似できるものから多様化し、パフォーマンスが低下する。
本研究では,教師がデータを捨てたり,推論品質を劣化させたりすることなく,直接生徒の分布に適応する教師アライメントを提案する。
論文 参考訳(メタデータ) (2026-09-27T10:13:54Z) - Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models [23.382646724389545]
オンライン蒸留(OPD)は、現在の学生政策の軌跡をサンプリングし、学生と教師の次点分布のトークンレベルのばらつきを最小限にする。
本稿では,ローカルで実現可能な教師の訂正のみを蒸留するemphFisher-Projected On-Policy Distillation (FP-OPD)を提案する。
論文 参考訳(メタデータ) (2026-08-02T14:16:14Z) - Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance [50.77757355236912]
本稿では,RSTG(Recovering Learning Signals via Adaptive Teacher Guidance)を提案する。
RSTGは数学では+4.02%、コードでは+3.05%の速さでGRPO+OPDを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-08-01T17:29:14Z) - When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning [45.79647925282674]
On-policy Self-distillation (OPSD) は、特権教師を使って生徒を自身のロールアウトで訓練する。
既存のエントロピーに基づくPD手法は、教師エントロピーによるトークンレベルの監督を調節することで、この一様性を緩和する。
そこで我々は,PW-OPSD(Pight-Weighted On-Policy Self-Distillation)を提案する。
論文 参考訳(メタデータ) (2026-05-20T18:14:03Z) - Self-Distilled Agentic Reinforcement Learning [65.24201057390938]
自己蒸留型エージェント強化学習は、トークンレベルの信号をシグモノイドゲートにマップする。
SDARはモデルスケール全体のハイブリッドRL--OPSDベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-14T17:51:26Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - Reinforcement-aware Knowledge Distillation for LLM Reasoning [63.53679456364683]
強化学習(Reinforcement Learning, RL)ポストトレーニングは、最近、大型言語モデル(LLM)の長いチェーン・オブ・プリーティングにおいて、進歩をもたらした。
既存の知識蒸留法の多くは、教師による微調整(SFT)のために設計されており、固定された教師のトレースや教師の学生であるKulback-Leibler(KL)の発散に基づく正規化に依存している。
本稿では,RLにおける選択的な模倣を行うRL-aware distillation (RLAD)を提案する。
論文 参考訳(メタデータ) (2026-02-26T00:20:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。