論文の概要: Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning
- arxiv url: http://arxiv.org/abs/2609.16255v1
- Date: Mon, 14 Sep 2026 19:21:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.208144
- Title: Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning
- Title(参考訳): 効率的な推論蒸留:合成CoTと難易度を考慮した微調整による小型ビデオ言語モデル
- Abstract要約: ビデオ質問応答のためのビデオ言語モデル(VLM)に推論能力を留意する効率的な方法を提案する。
提案手法は,900ドルの不確実性選択例のみを用いて,2B-パラメータモデルを微調整する。
計算コストは最小で、1つのA100 GPUで2時間以下であるにも関わらず、2Bモデルは最大4$times$大のVLMを上回ります。
- 参考スコア(独自算出の注目度): 0.0024792470319550896
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present an efficient method to distill reasoning capabilities into compact video-language models (VLMs) for video question answering (VideoQA). Our approach fine-tunes a 2B-parameter model using only $\sim$900 uncertainty-selected examples, each augmented with synthetic chain-of-thought (CoT) rationales generated by a 4B teacher. Despite its minimal compute cost - under two hours on a single A100 GPU - our method enables the 2B model to outperform VLMs up to 4$\times$ larger, and generalize across CinePile, ActivityNet-QA, and MLVU, approaching the performance of its own 4B teacher. A key finding is that placing CoT rationales after the answer - contrary to standard prompting - substantially improves reasoning in compact models. This insight challenges prevailing CoT conventions and reveals new alignment strategies under limited model capacity. Our findings offer a practical blueprint for training deployable, reasoning-rich VLMs suited for mobile and edge applications.
- Abstract(参考訳): 本稿では,ビデオ質問応答(VideoQA)において,推論能力をビデオ言語モデル(VLM)に抽出する効率的な方法を提案する。
提案手法は,4B教師が生成した合成チェーン・オブ・シークレット(CoT)論理を付加した,$\sim$900の不確実性選択例のみを用いて,2Bパラメータモデルを微調整する。
計算コストは最小限ですが、A100 GPUで2時間未満で、2Bモデルは最大4$\times$でVLMを上回り、CinePile、ActivityNet-QA、MLVUにまたがって一般化し、独自の4B教師のパフォーマンスに近づきます。
重要な発見は、標準のプロンプトとは対照的に、CoT が答えの後に有理性を置くことは、コンパクトモデルにおける推論を大幅に改善するということである。
この洞察は、CoTの慣習を克服し、限られたモデルキャパシティの下で新しいアライメント戦略を明らかにします。
我々の発見は、モバイルおよびエッジアプリケーションに適した、推論に富んだVLMをデプロイ可能な、実践的な青写真を提供する。
関連論文リスト
- Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation [57.22064715346608]
本稿では、計算とデータに対する低需要で構築されたコンパクトで効果的で統一されたマルチモーダルモデルであるArgus-Unifiedを提案する。
具体的には、凍結した統合視覚エンコーダから生成のための離散トークンを学習しながら、理解のための連続トークンを保存するハイブリッド視覚トークンを紹介する。
統合マルチモーダルモデルは、理解と生成の両方において高い性能を達成しつつ、経済的に訓練できることを実証する。
論文 参考訳(メタデータ) (2026-07-28T10:12:06Z) - How Far Are Video Models from True Multimodal Reasoning? [32.10821745418955]
CLVG-Benchは、ビデオモデルのゼロショット推論能力を調査するために設計された評価フレームワークである。
高品質で手動で注釈付けされたメタデータが6つのカテゴリと47のサブカテゴリにまたがっている。
最小限のアノテーションを用いて人間の専門家の認識と一致した適応的ビデオ評価器(AVE)を提案する。
論文 参考訳(メタデータ) (2026-04-21T08:04:02Z) - VDOT: Efficient Unified Video Creation via Optimal Transport Distillation [70.02065520468726]
本稿では,VDOT という名前の効率的な統合ビデオ生成モデルを提案する。
我々は,実測値分布と偽測値分布の差分を最適化するために,新しい計算最適輸送(OT)技術を用いる。
統合ビデオ生成モデルの訓練を支援するため,ビデオデータアノテーションとフィルタリングのための完全自動パイプラインを提案する。
論文 参考訳(メタデータ) (2025-12-07T11:31:00Z) - KAT-V1: Kwai-AutoThink Technical Report [50.84483585850113]
Kwaipilot-AutoThink (KAT) はオープンソースの40B大言語モデルであり、推論集約タスクにおける過大な問題に対処するために開発された。
KATはタスクの複雑さに基づいて推論モードと非推論モードを動的に切り替える。
また、GRPOフレームワークに中間管理を組み込んだ強化学習アルゴリズムであるStep-SRPOを提案する。
論文 参考訳(メタデータ) (2025-07-11T04:07:10Z) - SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution [46.311223206965934]
後続の超解像モデルの設計原理について検討し,その設計原理について検討する。
まず、ベースモデルの出力特性をよりよく模倣し、VSRモデルと上流ジェネレータとの整合性を確保するための2つのトレーニングペアを生成する方法を提案する。
第2に,(1)時間ステップサンプリング戦略,(2)低分解能(LR)入力に対する雑音増強効果の系統的解析を通じて,VSRモデル行動に対する批判的洞察を提供する。
論文 参考訳(メタデータ) (2025-06-24T17:57:26Z) - Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models [3.207886496235499]
検証可能な報酬(RLVR)に基づく強化学習で学習した推論モデルを用いて,新たな問題を解決する方法について検討する。
RLVRは、(1)pass@$k$をpass@1に圧縮し、(2)"capability gain"を介して、モデルが以前、$k$で解決できなかった新しい問題を解決することを学習する、という2つの主な方法でパフォーマンスを駆動する。
論文 参考訳(メタデータ) (2025-06-16T19:03:06Z) - TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning [7.818698554631196]
我々は,小規模モデルの推論能力の探索は,限られた計算資源を持つ研究者にとって重要な課題であると主張している。
本稿では,小型ビデオ推論モデルTinyLLaVA-Video-R1を提案する。
論文 参考訳(メタデータ) (2025-04-13T16:32:49Z) - InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model [80.93387166769679]
IXC-2.5-Rewardは、大規模視覚言語モデルと人間の好みを一致させる、単純で効果的なマルチモーダル報酬モデルである。
IXC-2.5-Rewardは、最新のマルチモーダル報酬モデルベンチマークにおいて優れた結果を得るとともに、テキストのみの報酬モデルベンチマーク上での競合性能を示す。
論文 参考訳(メタデータ) (2025-01-21T18:47:32Z) - When Parameter-efficient Tuning Meets General-purpose Vision-language
Models [65.19127815275307]
PETALは、一意のモード近似技術によって達成される全パラメータの0.5%しか必要とせず、トレーニングプロセスに革命をもたらす。
実験の結果,PETALは現状の手法をほとんどのシナリオで上回るだけでなく,完全な微調整モデルよりも優れていることがわかった。
論文 参考訳(メタデータ) (2023-12-16T17:13:08Z) - Transcending Scaling Laws with 0.1% Extra Compute [128.13903265447675]
言語モデルをスケールすることでパフォーマンスが向上するが、計算コストは大幅に向上する。
本稿では,既存の言語モデルとそのスケーリング曲線を,比較的少量の余剰計算で大幅に改善するUL2Rを提案する。
ほぼ無視可能な余分な計算コストと新しいデータソースがなければ、ダウンストリームメトリクス上の大規模言語モデルのスケーリング特性を大幅に改善できることを示す。
論文 参考訳(メタデータ) (2022-10-20T16:46:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。