論文の概要: Efficient Video Dataset Distillation via Cluster-Guided Prototype Blending
- arxiv url: http://arxiv.org/abs/2608.03269v1
- Date: Tue, 04 Aug 2026 07:46:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.084424
- Title: Efficient Video Dataset Distillation via Cluster-Guided Prototype Blending
- Title(参考訳): クラスタ誘導型プロトタイプブレンディングによる高効率ビデオデータセット蒸留
- Authors: Chongle Ren, Guang Li, Wenbo Huang, Naoki Saito, Takahiro Ogawa, Miki Haseyama,
- Abstract要約: ビデオデータセットの蒸留は、大規模なビデオデータセットを、トレーニングユーティリティを保持するコンパクトなサロゲートセットに圧縮することを目的としている。
本研究では, 保存ビデオの勾配に基づく最適化を行なわずに, 有効蒸留ビデオを構築できるかどうかを検討する。
建設ベースのアプローチでは、情報的時間セグメントの選択、クラス毎のビデオ予算の制限によるクラス内変動の多様さ、各サンプルが保持する情報の増加という3つの課題に対処する必要がある。
- 参考スコア(独自算出の注目度): 35.590507469576984
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video dataset distillation aims to compress a large video dataset into a compact surrogate set that preserves its training utility. Most existing approaches synthesize condensed videos through iterative optimization, whose cost is amplified by the temporal dimension. Rather than further reducing the number of optimized variables, we investigate whether effective distilled videos can be constructed without gradient-based optimization of the stored videos. Such a construction-based approach must address three challenges: selecting informative temporal segments, covering diverse intra-class variations under a limited videos-per-class budget, and increasing the information carried by each stored sample. To this end, we propose ProtoBlend, an efficient select-allocate-blend framework. First, teacher-guided temporal clip selection retains a high-confidence segment from each source video. Second, cluster-guided prototype allocation partitions the selected clips in the teacher feature space and assigns one distilled slot to each intra-class cluster. Third, each prototype is blended with an in-cluster anchor, while their teacher predictions are combined using the same coefficient to provide mixture-source supervision. Experiments on four trimmed action-recognition benchmarks demonstrate that ProtoBlend achieves a competitive accuracy-efficiency trade-off without iterative optimization of the distilled videos.
- Abstract(参考訳): ビデオデータセットの蒸留は、大規模なビデオデータセットを、トレーニングユーティリティを保持するコンパクトなサロゲートセットに圧縮することを目的としている。
既存のほとんどのアプローチは、時間次元によってコストが増幅される反復最適化を通じて、凝縮されたビデオを合成する。
最適化された変数の数をさらに減らすのではなく、保存されたビデオの勾配に基づく最適化なしに、有効な蒸留ビデオが構築できるかどうかを検討する。
このような構成に基づくアプローチは、情報的時間セグメントの選択、クラス毎の限られた予算下での多様なクラス内変動のカバー、各格納されたサンプルが持つ情報の増加という3つの課題に対処する必要がある。
この目的のために,効率的な選択割当ブレンドフレームワークであるProtoBlendを提案する。
まず、教師指導による時間的クリップ選択は、各ソースビデオから高信頼セグメントを保持する。
第2に、クラスタ誘導型プロトタイプアロケーションは、選択したクリップを教師機能空間に分割し、各クラス内のクラスタに1つの蒸留スロットを割り当てる。
第3に、各プロトタイプはクラスタ内のアンカーと混合され、教師の予測は同じ係数を使って混合ソースの監視を行う。
4つのトリミングされた行動認識ベンチマークの実験により、ProtoBlendは蒸留ビデオの反復的最適化なしに、競合する精度と効率のトレードオフを達成することを示した。
関連論文リスト
- VideoWeave: A Data-Centric Approach for Efficient Video Understanding [54.5804686337209]
我々は、合成長文学習サンプルを構築して、データ効率を改善するためのシンプルで効果的な方法であるVideoWeaveを提案する。
VideoWeaveは、利用可能なビデオテキストペアを再編成して、固定計算内で時間的多様性を拡大する。
我々の結果は、アーキテクチャを変更するのではなく、トレーニングデータを再編成することで、ビデオ言語モデルをトレーニングするためのシンプルでスケーラブルなパスを提供できることを強調している。
論文 参考訳(メタデータ) (2026-01-09T20:55:26Z) - Distill Video Datasets into Images [28.61426017935629]
単一フレームビデオセット蒸留(Single-Frame Videoset Distillation, SFVD)は、各クラスに対して高い情報フレームにビデオを蒸留するフレームワークである。
SFVDは従来の手法よりも大幅に優れており、MiniUCFでは最大5.3%の改善が達成されている。
論文 参考訳(メタデータ) (2025-12-16T17:33:41Z) - SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment [76.60024640625478]
拡散ベースまたはフローベースモデルは、ビデオ合成において大きな進歩を遂げているが、複数の反復サンプリングステップが必要である。
本稿では, トラジェクトリ保存と分散マッチングの利点を組み合わせた, 統一かつ安定な蒸留フレームワークを提案する。
提案手法は高品質なビデオ生成を維持しつつ,推論ステップの数を著しく削減する。
論文 参考訳(メタデータ) (2025-08-08T07:26:34Z) - Learning from Streaming Video with Orthogonal Gradients [62.51504086522027]
本稿では,映像の連続的ストリームからの表現学習を自己指導的に行うという課題に対処する。
これは、トレーニング中にビデオが切り刻まれ、シャッフルされ、非冗長なバッチを生成する、ビデオ学習の標準的なアプローチとは異なる。
3つのタスクでシャッフルからシーケンシャルな学習に移行する際のパフォーマンスの低下を実演する。
論文 参考訳(メタデータ) (2025-04-02T17:59:57Z) - Transform-Equivariant Consistency Learning for Temporal Sentence
Grounding [66.10949751429781]
ビデオ毎により差別的な表現を学習するために,新しい同変一貫性規則学習フレームワークを導入する。
私たちのモチベーションは、クエリ誘導アクティビティの時間的境界を一貫して予測することにある。
特に,ビデオの完全性と滑らか性を高めるために,自己教師付き一貫性損失モジュールを考案した。
論文 参考訳(メタデータ) (2023-05-06T19:29:28Z) - Spatio-Temporal Crop Aggregation for Video Representation Learning [33.296154476701055]
本モデルは,事前学習したバックボーンで抽出したビデオクリップレベルの特徴セットから学習することで,長距離ビデオ機能を構築する。
ビデオ表現は, 線形, 非線形, および$k$-NNを用いて, 共通の行動分類データセットを探索することにより, 最先端の性能が得られることを示す。
論文 参考訳(メタデータ) (2022-11-30T14:43:35Z) - 3D-CSL: self-supervised 3D context similarity learning for
Near-Duplicate Video Retrieval [17.69904571043164]
NDVR(Near-Duplicate Video Retrieval)のためのコンパクトパイプラインである3D-SLを導入する。
ネットワークを最適化するための2段階の自己教師型類似性学習戦略を提案する。
本手法は,クリップレベルのNDVRにおける最先端の性能を実現する。
論文 参考訳(メタデータ) (2022-11-10T05:51:08Z) - Beyond Short Clips: End-to-End Video-Level Learning with Collaborative
Memories [56.91664227337115]
本稿では,ビデオの複数のサンプルクリップにまたがる情報を,トレーニングイテレーション毎にエンコードするコラボレーティブメモリ機構を提案する。
これにより、単一のクリップ以上の長距離依存関係の学習が可能になる。
提案するフレームワークはエンドツーエンドでトレーニング可能で,計算オーバーヘッドが無視できないビデオ分類精度が大幅に向上する。
論文 参考訳(メタデータ) (2021-04-02T18:59:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。