論文の概要: TRINITY: A Multi-Perspective Benchmark for Personal-Style Video Highlight Detection
- arxiv url: http://arxiv.org/abs/2608.29577v1
- Date: Sun, 30 Aug 2026 05:46:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.0011
- Title: TRINITY: A Multi-Perspective Benchmark for Personal-Style Video Highlight Detection
- Title(参考訳): TRINITY:Personal-Style Video Highlight Detectionのためのマルチパースペクティブベンチマーク
- Authors: Qianqian Chen, Hyun Bin Kim, Denzel Elden Wijaya, Yang Yi, Bo Liu, Yangkai Ding,
- Abstract要約: 従来のビデオハイライト検出は、狭くイベント中心の唾液度の定義に依存している。
TRINITYは、ハイライト・サリエンシを3つの相補的な次元、イベント、感情、自然に分解するマルチパースペクティブ・ベンチマークである。
我々の手法は最先端のベースラインを著しく上回り、HiSum氏では+7.15/+3.62 mAP、YouTube Highlightsでは+10.82 mAPを達成した。
- 参考スコア(独自算出の注目度): 5.65579539227437
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Traditional video highlight detection relies on a narrow, event-centric definition of saliency, which often fails to generalize to unconstrained personal videos where highlights are heterogeneous and perspective-dependent. To address this, we introduce TRINITY, a multi-perspective benchmark that decomposes highlight saliency into three complementary dimensions, Event, Emotion, and Nature, within a unified temporal framework. Leveraging this multi-faceted view, we propose a shared-backbone multi-branch architecture designed for parallel multi-perspective prediction via view-specific experts. Comprehensive experiments demonstrate that our method significantly outperforms state-of-the-art baselines, achieving gains of +7.15/+3.62 mAP (rho=15%/50%) on Mr. HiSum and +10.82 mAP on YouTube Highlights. These results validate that multi-perspective modeling provides a more robust and comprehensive formulation of video saliency, especially for complex real-world scenarios. The benchmark and relevant codes will be released upon acceptance. The benchmark is available at https://huggingface.co/datasets/vanilladucky/TRINITY and the code is available at https://github.com/vanilladucky/TRINITY.
- Abstract(参考訳): 従来のビデオハイライト検出は、狭くイベント中心のサリエンシの定義に依存しており、ハイライトが不均一で視点に依存した、制約のないパーソナルビデオに一般化できないことが多い。
これを解決するために,イベント,感情,自然の3つの相補的な次元にハイライトサリエンシを分解するマルチパースペクティブなベンチマークであるTRINITYを紹介した。
この多面的ビューを活用することで、ビュー固有の専門家による並列多面的予測のために設計された共有バックボーン型マルチブランチアーキテクチャを提案する。
総合的な実験により,本手法は最先端のベースラインを著しく上回り,HiSum氏の+7.15/+3.62 mAP(rho=15%/50%)とYouTube Highlightsの+10.82 mAPを達成できた。
これらの結果は、特に複雑な実世界のシナリオにおいて、マルチパースペクティブ・モデリングがより堅牢で包括的なビデオ・サリエンシの定式化を提供することを示す。
ベンチマークと関連するコードは、受理時にリリースされる。
ベンチマークはhttps://huggingface.co/datasets/vanilladucky/TRINITYで、コードはhttps://github.com/vanilladucky/TRINITYで入手できる。
関連論文リスト
- MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs [40.317798580235]
VLMの最近のベンチマークは、単一の視点または限られた視点の知覚を主に評価し、視点をまたいだ観察を一貫性のある世界中心の(偏心的な)3Dメンタルモデルに統合するコア認知能力を未検証のまま残している。
我々は,総合的な3Dシーン理解のためのマルチビュー統合を評価するための診断ベンチマークであるMultiView-Benchを紹介する。
情報的視点を積極的に選択し、知覚し、多視点エビデンスを融合するマルチエージェントフレームワークであるViewNavigatorを提案する。
論文 参考訳(メタデータ) (2026-07-09T22:22:42Z) - TrackRef3D: Multi-View Consistent Track-then-Label for Open-World Referring Segmentation in 3D Gaussian Splatting [10.787720313658093]
本稿では,3次元ガウススプラッティング(3DGS)におけるオープンワールド参照セグメンテーションを実現する完全自動パイプラインであるTrackRef3Dを提案する。
本稿では,同義語クラスタリングとトラジェクティブ・アウェア投票を通じて,クロスビュー予測を集約し,標準的セマンティック・アイデンティティを確立するトラジェクティブ・アウェア・セマンティック・コンセンサス・モジュール(TSCM)を提案する。
論文 参考訳(メタデータ) (2026-05-26T05:49:12Z) - Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding [98.3098451637867]
Video-MME-v2は、ビデオ理解の堅牢性と忠実さを厳格に評価するために設計された総合的なベンチマークである。
データ品質を保証するため、Video-MME-v2は厳格に制御された人間のアノテーションパイプラインを通して構築される。
論文 参考訳(メタデータ) (2026-04-06T17:59:56Z) - MVInverse: Feed-forward Multi-view Inverse Rendering in Seconds [19.94963757122156]
多視点逆レンダリングは、幾何、材料、照明を複数の視点で一貫して回復することを目的としている。
本稿では,RGB画像から空間変化アルベド,金属,粗さ,拡散シェーディング,表面正規度を直接予測するフィードフォワード多視点逆レンダリングフレームワークを提案する。
提案手法は,多視点整合性,物質的および正規推定品質,実世界の画像への一般化という観点から,最先端の性能を実現する。
論文 参考訳(メタデータ) (2025-12-24T06:59:29Z) - Open-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence [70.2803680525165]
我々は、明示的な証拠をビデオ推論に統合する非エージェントフレームワークであるOpen-o3 Videoを紹介した。
このモデルは、キーオブジェクトとバウンディングボックスをその答えとともに強調し、推論を具体的な視覚的な観察で基礎付けることができる。
V-STARベンチマークでは、Open-o3 Videoは最先端のパフォーマンスを達成し、mAMを14.4%、mLタイムスタンプを24.2%向上させた。
論文 参考訳(メタデータ) (2025-10-23T14:05:56Z) - Multimodal Referring Segmentation: A Survey [93.24051010753817]
マルチモーダル参照セグメンテーション(Multimodal reference segmentation)は、テキストやオーディオフォーマットでの参照表現に基づいて、画像、ビデオ、および3Dシーンなどのターゲットオブジェクトを視覚シーンに分割することを目的としている。
過去10年間で、畳み込みニューラルネットワーク、トランスフォーマー、および大規模言語モデルの進歩によって、マルチモーダルコミュニティにおいて大きな注目を集めてきた。
論文 参考訳(メタデータ) (2025-08-01T02:14:00Z) - Joint Depth Prediction and Semantic Segmentation with Multi-View SAM [59.99496827912684]
我々は,Segment Anything Model(SAM)のリッチなセマンティック特徴を利用した深度予測のためのマルチビューステレオ(MVS)手法を提案する。
この拡張深度予測は、Transformerベースのセマンティックセグメンテーションデコーダのプロンプトとして役立ちます。
論文 参考訳(メタデータ) (2023-10-31T20:15:40Z) - Spatio-Temporal Self-Attention Network for Video Saliency Prediction [13.873682190242365]
3D畳み込みニューラルネットワークは、コンピュータビジョンにおけるビデオタスクに対して有望な結果を得た。
本稿では,ビデオ・サリエンシ予測のための時空間自己注意3ネットワーク(STSANet)を提案する。
論文 参考訳(メタデータ) (2021-08-24T12:52:47Z) - Self-supervised Human Detection and Segmentation via Multi-view
Consensus [116.92405645348185]
本稿では,トレーニング中に幾何学的制約を多視点一貫性という形で組み込むマルチカメラフレームワークを提案する。
本手法は,標準ベンチマークから視覚的に外れた画像に対して,最先端の自己監視的人物検出とセグメンテーション技術に勝ることを示す。
論文 参考訳(メタデータ) (2020-12-09T15:47:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。