論文の概要: HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization
- arxiv url: http://arxiv.org/abs/2607.17994v1
- Date: Mon, 20 Jul 2026 14:27:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.659502
- Title: HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization
- Title(参考訳): HAS:マルチモーダルLDM映像要約のためのハイライト誘導アテンションステアリング
- Authors: Rui Chu, Yingjie Lao,
- Abstract要約: 映像要約のためのハイライト誘導アテンションステアリング法であるHASを提案する。
我々は,様々なベンチマークでHASを評価し,映像要約において説得力のある性能を示した。
- 参考スコア(独自算出の注目度): 16.58089288863005
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video understanding has become more and more important with the growth of Artificial Intelligence (AI) for video generation. Recently, Multimodal Large Language Model(M-LLM) has shown its capability in video understanding. Video summarization, a specific domain of video understanding, has proven its importance for efficient navigation and retrieval. Both video understanding and video summarization require a good selection of key frames in a video. Current video summarization methods heavily focus on the selected key frames and correlated segment captions. However, existing approaches overlook the perspective of treating the importance of the frames globally. We argue that using discrete selected frames for summarization will not only reduce the understanding coherence, but also lost important information in the video, as well as wasting the original capacity of the MLLMs. In this paper, we propose HAS, a Highlight-guided Attention Steering method for video summarization. We consider a challenging but practical setting where the video given to MLLMs for summarize should be continuous but with highlight guidance. HAS mainly consists of two parts: The first part is to find a continuous frame-level highlight distribution for the video globally. The second part is to apply the highlight distribution as an attention steering vector for the MLLM, targeting a better understanding of the video, and thus during the model inference time, putting more attention on the highlighted frames, while avoiding lost entire information on less highlighted frames through putting less attention instead of forgetting them. We evaluated HAS on a variety of benchmarks, and it has shown convincing performance in video summarization.
- Abstract(参考訳): ビデオ生成のための人工知能(AI)の成長に伴い、ビデオ理解はますます重要になっている。
近年,Multimodal Large Language Model (M-LLM) がビデオ理解におけるその能力を示している。
映像理解の特定の領域である映像要約は、効率的なナビゲーションと検索の重要性を証明している。
ビデオの理解と要約の両方は、ビデオのキーフレームを適切に選択する必要がある。
現在のビデオ要約手法は、選択されたキーフレームと関連するセグメントキャプションに重点を置いている。
しかし、既存のアプローチは、フレームの重要性を世界規模で扱うという観点から見落としている。
要約のために個別に選択したフレームを使用することは、理解の一貫性を損なうだけでなく、ビデオにおいて重要な情報を失うだけでなく、MLLMの本来の能力も無駄にしてしまうと論じる。
本稿では,映像要約のためのハイライト誘導アテンションステアリング法であるHASを提案する。
MLLMに提供した動画を要約するためには、連続するが、ハイライトのガイダンスを付けて、難しいが実践的な設定を考える。
HASは主に2つの部分から構成される: 最初の部分は、ビデオの連続的なフレームレベルのハイライト分布を見つけることである。
第2の部分は、MLLMの注目ステアリングベクトルとしてハイライト分布を適用し、ビデオのより深い理解を目標とし、モデル推論時間の間、ハイライトフレームにより多くの注意を向け、強調フレームを忘れることなく、より少ないハイライトフレームに関するすべての情報を失うのを避けることである。
我々は、様々なベンチマークでHASを評価し、ビデオ要約において説得力のある性能を示した。
関連論文リスト
- SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM [36.28285195488772]
大規模言語モデル(LLM)は、テキスト理解において例外的な能力を示した。
Vid-LLMは高品質なフレームレベルのセマンティック情報を同時に保持するのに苦労する。
この制限は、Vid-LLMの微細なビデオ理解への進歩を妨げる。
論文 参考訳(メタデータ) (2026-02-03T14:39:16Z) - Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding [33.58579390725519]
Video-MTRは、反復的なキーセグメントの選択と質問理解を可能にするために設計された強化されたマルチターン推論フレームワークである。
単一のターンで予測を生成する従来のビデオ推論パイプラインとは異なり、Video-MTRは複数のターンで推論を実行する。
中間推論プロセスを保証するため,新たな二段階報酬システムを導入する。
論文 参考訳(メタデータ) (2025-08-28T06:55:08Z) - Episodic Memory Representation for Long-form Video Understanding [52.33907540905242]
大きなビデオ言語モデルは、一般的なビデオ理解において優れているが、長い形式のコンテキストウィンドウの制限に苦労する。
人間の記憶の原理にインスパイアされたトレーニングフリーのフレームワークであるVideo-EMを紹介する。
Video-EMでは、各ベースラインに対して4-9%のパフォーマンス向上を実現し、フレームの削減を実現している。
論文 参考訳(メタデータ) (2025-08-13T04:33:07Z) - Video Summarization with Large Language Models [41.51242348081083]
本稿では,近年のLarge Language Models (LLM) の機能を活用したビデオ要約フレームワークを提案する。
LLM-based Video Summarization (LLMVS) と呼ばれる我々の手法は、ビデオフレームをMulti-Modal Large Language Model (MLLM) を用いて一連のキャプションに変換する。
実験の結果,提案手法は標準ベンチマークにおける既存手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2025-04-15T13:56:14Z) - VaQuitA: Enhancing Alignment in LLM-Assisted Video Understanding [63.075626670943116]
本稿では,映像情報とテキスト情報の相乗効果を向上するための最先端フレームワークであるVaQuitAを紹介する。
データレベルでは、フレームを均一にサンプリングする代わりに、CLIPスコアランキングでガイドされるサンプリング手法を実装している。
機能レベルでは、Visual-Query Transformerと一緒にトレーニング可能なVideo Perceiverを統合します。
論文 参考訳(メタデータ) (2023-12-04T19:48:02Z) - Let's Think Frame by Frame with VIP: A Video Infilling and Prediction
Dataset for Evaluating Video Chain-of-Thought [62.619076257298204]
我々は、少数のビデオ推論のシーケンシャルな理解として、フレーミングビデオ推論を動機付けている。
VIPは、ビデオチェーンオブ思考を通してモデルの推論能力を調べるために設計された、推論時の課題データセットである。
我々は、VIP上でGPT-4、GPT-3、VICUNAをベンチマークし、複雑なビデオ推論タスクのパフォーマンスギャップを実証し、今後の作業を促進する。
論文 参考訳(メタデータ) (2023-05-23T10:26:42Z) - MHSCNet: A Multimodal Hierarchical Shot-aware Convolutional Network for
Video Summarization [61.69587867308656]
本稿では,MHSCNetと呼ばれるマルチモーダル階層型ショット・アウェア・畳み込みネットワークを提案する。
学習したショット認識表現に基づいて、MHSCNetは、ビデオのローカルおよびグローバルビューにおけるフレームレベルの重要度スコアを予測することができる。
論文 参考訳(メタデータ) (2022-04-18T14:53:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。