論文の概要: CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual Prediction
- arxiv url: http://arxiv.org/abs/2609.02401v1
- Date: Wed, 02 Sep 2026 10:11:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.231443
- Title: CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual Prediction
- Title(参考訳): CA-OPD:構造化視覚予測のための信頼度を意識したオンポリシィ蒸留
- Authors: Menghao Li, Linjie Mu, Yin Wang, Haotian Hu, Yannian Gu, Lujiayi Xue, Fanyi Wang,
- Abstract要約: 信頼できるオン・ポリシィ蒸留(CA-OPD)は、信頼性の高いロールアウト構築と適応的な監視を結合するフレームワークである。
GUIグラウンディングと光学文字認識のためのマルチ教師設定で評価され、CA-OPDはQwen3.5-0.8Bベースラインを大幅に改善する。
- 参考スコア(独自算出の注目度): 11.357421051585272
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autoregressive vision language models unify heterogeneous perception tasks but are highly susceptible to compounding errors. On-policy distillation (OPD) bridges the training-inference mismatch by training students on their own rollouts. However, unreliable student predictions, especially early in training, can derail the trajectory and degrade the quality of teacher supervision. While recent interleaved distillation methods allow the teacher to verify and replace student tokens, they primarily rely on rigid ranking metrics rather than exact teacher confidence, and they overlook how intervention decisions can inform token-level supervision. To address this, we introduce Confidence-Aware On-Policy Distillation (CA-OPD), a framework that couples reliable rollout construction with adaptive supervision. CA-OPD utilizes teacher confidence to selectively correct unreliable student transitions, gradually transferring rollout control to the student via a strict-to-relaxed schedule. Crucially, CA-OPD aligns knowledge transfer with these intervention decisions: corrected positions receive direct cross-entropy supervision from the teacher's prediction, while retained positions benefit from the teacher's full predictive distribution. Evaluated in a multi-teacher setting for GUI grounding and optical character recognition, CA-OPD substantially improves the Qwen3.5-0.8B baseline across all six target benchmarks, including gains of $9.50$ points on ScreenSpot-Pro and $6.72$ points on OCRBench-v2 English. Controlled studies further show that the gains depend on intervention placement, progressive rollout control, and intervention-aligned supervision, rather than intervention frequency alone.
- Abstract(参考訳): 自己回帰視覚言語モデルは異種認知タスクを統一するが、複雑なエラーに非常に影響を受けやすい。
オンライン蒸留(OPD)は、学生が自身のロールアウトでトレーニングするトレーニングミスマッチを橋渡しする。
しかし、特に教育の初期段階において、信頼性の低い学生予測は、その軌道を脱線させ、教師の監督の質を低下させる可能性がある。
最近のインターリーブ蒸留法では、教師は学生のトークンを検証し、置き換えることができるが、彼らは主に教師の信頼度よりも厳格なランクの指標に依存しており、介入決定がトークンレベルの監督にどのように影響するかを見落としている。
そこで本研究では、信頼性の高いロールアウト構築と適応的な監視を両立するフレームワークである、信頼性に配慮したオン・ポリシィ蒸留(CA-OPD)を導入する。
CA-OPDは教師の信頼度を利用して、信頼性の低い生徒の移行を選択的に修正し、厳格なスケジュールで段階的に学生にロールアウト制御を移行する。
補正された位置は教師の予測から直接のクロスエントロピーの監督を受け、教師の完全な予測的分布からの利益を保ったままである。
GUIグラウンディングと光学文字認識のためのマルチ教師設定で評価され、CA-OPDは6つのベンチマークすべてでQwen3.5-0.8Bベースラインを大幅に改善し、ScreenSpot-Proでは9.50ドル、OCRBench-v2では6.72ドルとなった。
制御された研究により、利得は介入頻度のみではなく、介入配置、プログレッシブロールアウト制御、介入整合性監視に依存することが示されている。
関連論文リスト
- Adaptive Supervised Anchoring for On-Policy Self-Distillation [15.445625053566244]
オンライン自己蒸留は、学生から採取した軌道上の凍結教師からの指導を蒸留することにより、言語モデルに適応する。
本研究は,学生が目標軌跡から遠ざかると,教師の目標外接頭辞の条件がタスク関連監督を著しく弱めることを示す。
本稿では,2つの補完的な指導経路を分離する統合トレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-08T05:46:32Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation [25.25989941933095]
マルチターンOPD用に設計された検証不要な選択的介入フレームワークであるSAGE-OPDを提案する。
SAGE-OPDは、教師の監督を全ターンで均一に行うのではなく、まず環境フィードバックを観察し、各生徒の反応をスキップするか介入するかを決定するために教師の判断を使用する。
エージェントタスクの実験では、SAGE-OPDはベースラインよりも一貫して改善され、ALFWorldの13.3%の相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-06-17T23:58:14Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning [19.98950359294245]
本研究は,教師の特権分布を自己の自給自足軌道に沿って蒸留することにより,言語モデルによる推論能力の向上を図ることを目的とする。
OPSDの性能向上にもかかわらず,教師と生徒の反応のミスマッチがよく見過ごされがちである。
論文 参考訳(メタデータ) (2026-05-12T17:00:53Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation [67.26315138466312]
モデルロールアウトから経験的信頼性を推定するキャリブレーション対応のOPDフレームワークであるCaOPDを提案する。
本研究は, 能力蒸留が信頼性を示唆するものではないこと, 信頼性をポストトレーニングの本質的な目的として扱うべきであることを明らかにする。
論文 参考訳(メタデータ) (2026-04-18T04:43:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。