論文の概要: StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding
- arxiv url: http://arxiv.org/abs/2608.16320v1
- Date: Mon, 17 Aug 2026 09:25:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.619128
- Title: StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding
- Title(参考訳): StreamOPD: ストリーミングビデオ理解のための時空間キューゲーティングを備えたポストトレーニングレシピ
- Abstract要約: 検証可能な報酬を伴う強化学習は、この体制に不適合であり、長い思考と答えの世代を奨励する。
オンライン蒸留は、学生の軌跡に密集したトークンレベルの教師の監督を提供するが、どちらのモデルも思考モードで訓練した場合のみ安定している。
オープンソースストリーミングビデオ研究のための透過的で再現可能なリファレンスを提供する。
- 参考スコア(独自算出の注目度): 16.629848186775718
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Streaming video understanding demands direct responses from the causally observed prefix of an unfolding video. Existing systems add inference-time memory, retrieval, and compression, yet a training-free sliding-window baseline already matches them. We therefore fix a memory-free recent-window protocol and ask how far post-training alone can go. Reinforcement learning with verifiable rewards fits this regime poorly, encouraging long ``think-then-answer'' generations, while on-policy distillation (OPD) supplies dense token-level teacher supervision on student trajectories but is stable only when both models train in thinking mode. These observations lead to \textsc{StreamOPD}, a recipe combining verifiable streaming-video data, thinking-mode OPD, and instruct-mode deployment. It raises StreamingBench from $77.9\%$ to $83.9\%$---within $0.3$ points of the 9B teacher---and improves OVO-Bench excluding its hallucination-detection subtask (HLD) by $9.1$ points under unchanged inference. As a teacher-privilege extension, \emph{Spatio-Temporal CueGate (ST-CueGate)} aggregates cue-versus-no-cue teacher likelihood ratios into a group-relative response score that reweights OPD. It reaches $71.9\%$ on OVO-Bench (excluding HLD) and $64.9\%$ on Video-MME, and is the only variant that stays above the base model on all four benchmarks. Replacing the teacher with a frozen copy of the student's initial policy---on-policy self-distillation---retains most of these gains and lifts HLD to $57.0\%$, above both the untrained student and the 9B teacher, so abstention loss is not intrinsic to the recipe. We provide a transparent and reproducible reference for open-source streaming-video research.
- Abstract(参考訳): ストリーミングビデオ理解は、展開されたビデオの因果的に観察されたプレフィックスからの直接応答を要求する。
既存のシステムは推論時間メモリ、検索、圧縮を追加するが、トレーニング不要のスライディングウィンドウベースラインはすでにそれらと一致している。
したがって、メモリフリーの最近のウインドウプロトコルを修正し、ポストトレーニング単独でどこまで進めるかを問う。
検証可能な報酬を伴う強化学習は、この体制に不適合であり、長期の「思考=回答」世代を奨励する一方、オンライン蒸留(OPD)は、学生の軌跡に密集したトークンレベルの教師監督を提供するが、どちらのモデルも思考モードで訓練した場合のみ安定する。
これらの観察は、検証可能なストリーミングビデオデータ、思考モードOPD、インストラクションモードデプロイメントを組み合わせたレシピである‘textsc{StreamOPD} につながる。
StreamingBench は 7.9 %$ から 8.9 %$ に上昇し、9B 教師の 0.0.3 ドルポイントを伴い、幻覚検出サブタスク (HLD) を除いた OVO-Bench を9.1 ドルまで改善している。
教師と教師のプライベートな拡張として、 \emph{Spatio-Temporal CueGate (ST-CueGate) は、cue-versus-no-cue の教師の確率比を、OPDを再重み付けするグループ相対応答スコアに集約する。
OVO-Bench(HLDを除く)で711.9\%、Video-MMEで644.9\%、および4つのベンチマークでベースモデルより上位に留まる唯一の変種である。
教師を学生の初期方針の凍結したコピーで置き換える - 政治自己蒸留 ― は、これらの利益のほとんどを保持し、HLDを57.0 %まで引き上げ、未学習の生徒と9Bの教師のどちらよりも高くするので、禁忌の損失はレシピに固有のものではない。
我々は、オープンソースのストリーミングビデオ研究のための透過的で再現可能なリファレンスを提供する。
関連論文リスト
- Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision [22.058460912910125]
S$3$T (Self-Supervised Self-Distillation over Time) は、継続的ビデオ状態追跡のための最初の完全自己完結型フレームワークである。
LLaVA-OneVision-2-8Bでは、S$3$TはVSTATの精度を1モデル$+1.74$、スープ付き$+2.38$、追加のビジョンエンコーダ対応$+2.70$で改善している。
VSTAT-YouTubeのステートトラッキング質問では、ラベルなしの合成クリップが実際のビデオに転送され、パフォーマンスが7.95ドル向上し、さらに4.50ドル向上した。
論文 参考訳(メタデータ) (2026-09-03T17:59:55Z) - Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models [58.45264308304815]
On-policy Self-distillation (OPSD)は、最近、特権的な自己教育者から密集したトークンレベルの監督を通じて政策最適化を改善する効果的なポストトレーニングパラダイムとして登場した。
我々は,自己学習者構築と知識伝達の両方の特権的な視覚的証拠を利用するOPSDフレームワークであるtextbfVideo-OPSD$を提示する。
論文 参考訳(メタデータ) (2026-08-27T12:51:32Z) - ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation [25.69241346799495]
我々は,教師が生徒の接頭辞から正しい回答を得られる確率として,プロンプトレベルの教師継続信頼性を$R$と定義する。
我々は、高いR$プロンプトがより大きなOPDゲインをもたらし、下降するR$トレーニングがランダムな順序と上昇順序より優れていることを示す。
論文 参考訳(メタデータ) (2026-08-11T13:27:56Z) - Visual Contrastive Self-Distillation [61.298159957622886]
本稿では,視覚的コントラスト自己蒸留法を提案する。
これと対照的に,本研究では,教師の具体的イメージ分布の明確化を図り,その結果のフルディストリビューション目標を学生に蒸留する。
論文 参考訳(メタデータ) (2026-07-23T17:37:37Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators [68.69611976783243]
OPSD-Vは、数ステップの自己回帰(AR)ビデオ拡散モデルの訓練後の自己蒸留パラダイムである。
鍵となるアイデアは、トレーニング中の時間的文脈として実際の長時間ビデオデータを導入し、それを高密度な軌跡レベルの監視に使用することである。
実験では、視覚的品質、運動力学、VBenchLongスコアが一貫した改善を示している。
論文 参考訳(メタデータ) (2026-07-09T17:59:11Z) - Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning [30.851590309402436]
統一マルチモーダルモデル (UMM) は、空間的タスクを改善するためにテキスト推論で'視覚的思考' (VT) を生成する。
これは、多段階拡散から大まかにマグニチュード推論コストを発生させる。
本稿では、この問題を解決するために、ビジュアルオンポリシィ自己蒸留(Visual-OPSD)を提案する。
論文 参考訳(メタデータ) (2026-06-17T11:59:15Z) - ViCuR: Visual Cues as Recoverable Privilege for Multimodal On-Policy Distillation [5.131753844398592]
ViCuRは視覚的に接地された特権型蒸留フレームワークである。
答え側の特権を視覚的手がかりに置き換える。
答えに基づく自己蒸留よりも継続的に改善される。
論文 参考訳(メタデータ) (2026-06-04T05:18:13Z) - Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation [81.10000755917712]
オンライン蒸留は,教師からのトークンレベルのフィードバックを用いて,学生モデルを自作の軌道上で訓練することにより,推論能力を伝達する。
生徒が生成した接頭辞が長くなるにつれて、教師の次点の分布は自信を減らし、差別性が低下する。
SFDを緩和するため, textbfLookahead Group Reward (ours) を導入する。
論文 参考訳(メタデータ) (2026-05-29T04:39:20Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。