論文の概要: CASTLE2026 Team WDL Technical Report
- arxiv url: http://arxiv.org/abs/2606.00712v1
- Date: Sat, 30 May 2026 12:41:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.669127
- Title: CASTLE2026 Team WDL Technical Report
- Title(参考訳): CASTLE2026 チームWDL技術報告
- Abstract要約: CASTLE Challenge @ EgoVis 2026は、600時間以上のマルチパースペクティブな録音に答える、長めのエゴシックなビデオ質問を評価している。
我々はQwenに基づくエビデンスを考慮したマルチモーダル推論パイプラインを提案する。
我々のシステムは、質問ヒントを解析し、ASRチャンクを検索し、補助画像を取り付けて、候補となるビデオフレームをサンプルし、質問を静的な視覚、音声/テキスト、時間、混合タイプに、特別なプロンプトでルーティングする。
- 参考スコア(独自算出の注目度): 13.267258798162956
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The CASTLE Challenge @ EgoVis 2026 evaluates long-form egocentric video question answering over 600+ hours of multi-perspective recordings. Each four-choice question requires evidence from videos, transcripts, auxiliary photos, people, days, rooms, and temporal context. We propose an evidence-aware multimodal reasoning pipeline based on Qwen. Our system parses question hints, retrieves ASR chunks, attaches auxiliary images, samples candidate video frames, and routes questions into static visual, speech/text, temporal, and mixed types with specialized prompts. Multiple inference passes are aggregated by confidence-weighted voting and converted into the official Codabench format. In ablation, LoRA improves the score from 0.21 to 0.50, and more sampled frames further raise it to 0.58. Our final system ranks first in the CASTLE Challenge @ EgoVis 2026.
- Abstract(参考訳): CASTLE Challenge @ EgoVis 2026は、600時間以上のマルチパースペクティブな録音に答える、長めのエゴシックなビデオ質問を評価している。
4つの質問には、ビデオ、テキスト、補助写真、人々、日、部屋、時間的文脈からの証拠が必要である。
我々はQwenに基づくエビデンスを考慮したマルチモーダル推論パイプラインを提案する。
我々のシステムは、質問ヒントを解析し、ASRチャンクを検索し、補助画像を取り付けて、候補となるビデオフレームをサンプルし、質問を静的な視覚、音声/テキスト、時間、混合タイプに、特別なプロンプトでルーティングする。
複数の推論パスは、信頼度の高い投票によって集約され、公式のCodabenchフォーマットに変換される。
アブレーションでは、LoRAはスコアを0.21から0.50に改善し、より多くのサンプルフレームは0.58に上昇する。
最終システムはCASTLE Challenge @ EgoVis 2026にランクインします。
関連論文リスト
- 3rd Place at CVPR 2026 CASTLE Challenge: Agentic Multi-View Long-Context Video Understanding via Hierarchical Knowledge Graph Retrieval [0.8594140167290097]
本稿では,CVPR 2026ワークショップにおけるCASTLE 2026 Challengeの優勝方法論について述べる。
我がチームは世界3位を獲得した。
ベースとなるデータセットは、エゴとエクソカメラのソースによって撮影された600時間以上の同期映像で構成されている。
論文 参考訳(メタデータ) (2026-06-01T09:01:32Z) - FROST-STA: Frozen Dense Features for the Ego4D Short-Term Object Interaction Anticipation [4.781417767575192]
本報告では,EgoVis 2026におけるEgo4D Short-Term Object Interaction Precipation (STA) Challengeへの提案であるFROST-STAについて述べる。
各クエリ時間について、このモデルは、アクティブオブジェクトボックス、名詞ラベル、動詞ラベル、TTC(Time-to-Contact)、信頼度を含むランク付けされた構造化仮説を生成する。
FROST-STAは、V-JEPA 2.1 STA評価プロトコルをベースにしているが、オブジェクト中心のデコード、マルチヘッド予測、提案指向のトレーニングとアンサンブルのレシピを使用することで、この問題に適応している。
論文 参考訳(メタデータ) (2026-05-30T12:07:32Z) - CuriosAI Submission to the CASTLE Challenge at EgoVis 2026 [0.7777489763207263]
CASTLE 2026は、600時間以上の同期マルチビューエゴセントリックビデオに対して185のマルチチョイス質問を行う。
我々は、人ごとのタイムライン、話者解決された文字起こし、マルチVLMキャプションアンサンブルを含む、共有マルチモーダル前処理層上での2つのアプローチを探索する。
論文 参考訳(メタデータ) (2026-05-27T00:40:07Z) - MARS: Technical Report for the CASTLE Challenge at EgoVis 2026 [84.71667602630663]
本稿では,EgoVis 2026におけるCASTLE Challengeについて紹介する。
参加者はCASTLE 2024データセットに対して185のクローズドフォームの質問に答えなければならない。
MARSは、タスクをマルチモーダルソース上のエージェントエビデンス選択問題として扱う。
論文 参考訳(メタデータ) (2026-05-18T10:19:32Z) - Adverse-to-the-eXtreme Panoptic Segmentation: URVIS 2026 Study and Benchmark [61.92065556649544]
最初の挑戦は17人の登録参加者と47人の応募者を集め、4チームが最終フェーズに到達した。
この課題は、悪天候下での汎視的セグメンテーションのためのマルチセンサーベンチマークであるMUSESデータセットに基づいている。
論文 参考訳(メタデータ) (2026-04-18T13:02:51Z) - NTIRE 2026 Challenge on Video Saliency Prediction: Methods and Results [123.0965074023145]
本稿では,NTIRE 2026 Challenge on Video Saliency Predictionについて概説する。
課題参加者のゴールは、提供されたビデオシーケンスの自動サリエンシマップ予測手法を開発することである。
この挑戦のために、オープンライセンスで2000の多様なビデオからなる新しいデータセットが準備された。
論文 参考訳(メタデータ) (2026-04-16T09:36:58Z) - ReLER@ZJU-Alibaba Submission to the Ego4D Natural Language Queries
Challenge 2022 [61.81899056005645]
ビデオクリップとテキストクエリが与えられた場合、この課題のゴールは、クエリに対する回答が得られるビデオクリップの時間的モーメントを見つけることである。
本稿では,言語クエリとビデオクリップの相関関係を明らかにするために,マルチスケールのクロスモーダル変換器とビデオフレームレベルのコントラスト損失を提案する。
実験の結果,本手法の有効性が示された。
論文 参考訳(メタデータ) (2022-07-01T12:48:35Z) - AIM 2020 Challenge on Video Temporal Super-Resolution [118.46127362093135]
Video Temporal Super-Resolution (VTSR) の第2回AIMチャレンジ
本稿では,ビデオ・テンポラル・スーパー・リゾリューション(VTSR)における第2回AIM課題について報告する。
論文 参考訳(メタデータ) (2020-09-28T00:10:29Z) - AIM 2019 Challenge on Video Temporal Super-Resolution: Methods and
Results [129.15554076593762]
本稿では,ビデオ時空間超解像(フレーム)におけるAIMの最初の課題についてレビューする。
低フレームレート(15fps)のビデオシーケンスから、チャレンジ参加者はより高いフレームレート(60fps)のビデオシーケンスを提出するよう求められる。
ハンドヘルドカメラで撮影した多様なビデオから得られたREDS VTSRデータセットをトレーニングおよび評価目的で使用した。
論文 参考訳(メタデータ) (2020-05-04T01:51:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。