論文の概要: The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering
- arxiv url: http://arxiv.org/abs/2608.04589v1
- Date: Wed, 05 Aug 2026 08:51:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.789141
- Title: The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering
- Title(参考訳): 2026年のEgoVisにおける最初のEgoCrossチャレンジ: クロスドメインなEgocentric Video Question Answering
- Abstract要約: EgoCrossはドメイン横断のエゴセントリックなビデオ質問応答ベンチマークである。
マルチモーダルな大規模言語モデルが日常シナリオを超えて一般化できるかどうかを評価するように設計されている。
最初のEgoCross ChallengeはCVPR 2026のThird EgoVis Workshopで開催された。
- 参考スコア(独自算出の注目度): 196.78334982965507
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: EgoCross is a cross-domain egocentric video question answering benchmark designed to evaluate whether multimodal large language models can generalize beyond common daily-life scenarios. The first EgoCross Challenge was hosted at the Third EgoVis Workshop at CVPR 2026 and evaluated models on first-person videos from four target domains: surgery, industrial assembly, extreme sports, and animal perspectives. Each test example consists of an egocentric video clip, a question, and four candidate answers, from which the model must select the correct option. This technical report introduces the challenge task, benchmark resources, and two official Codabench tracks. The Source-Limited Track restricts participants to the official baseline model and a small support set, whereas the Open-Source Track permits broader choices of models and training data under rules that prohibit the manual construction of target-domain training data. In total, the challenge received more than 1,500 submissions from over 130 participants, with 19 teams participating in the Open-Source Track and 38 teams in the Source-Limited Track. We further present the official leaderboard results and summarize the winning solutions from both tracks. We hope that this report will serve as a useful technical reference for advancing cross-domain egocentric video understanding. All resources, including the challenge data, baseline implementation, and code released by the winning teams, are made publicly available.
- Abstract(参考訳): EgoCrossは、マルチモーダルな大規模言語モデルが一般的な日常シナリオを超えて一般化できるかどうかを評価するために設計された、ドメイン横断のエゴセントリックなビデオ質問応答ベンチマークである。
第1回EgoCross ChallengeはCVPR 2026の第3回EgoVisワークショップで開催され、手術、工業組立、極端なスポーツ、動物の観点からの4つの対象領域からのファースト・パーソン・ビデオのモデルの評価が行われた。
それぞれのテスト例は、エゴセントリックなビデオクリップと質問と4つの候補回答で構成され、そこからモデルが正しい選択肢を選択する必要がある。
このテクニカルレポートでは、チャレンジタスク、ベンチマークリソース、および2つの公式Codabenchトラックを紹介している。
Source-Limited Trackは参加者を公式のベースラインモデルと小さなサポートセットに制限する一方、Open-Source Trackはターゲットドメインのトレーニングデータの手動構築を禁止するルールの下で、モデルとトレーニングデータの幅広い選択を許可する。
合計で130人以上が参加し、19チームがオープンソーストラックに参加し、38チームがソースリミテッドトラックに参加した。
さらに、公式のリーダーボードの結果を提示し、両方のトラックから勝利のソリューションを要約します。
このレポートは、ドメイン横断のエゴセントリックなビデオ理解を促進する上で有用な技術的参考になることを期待している。
チャレンジデータ、ベースライン実装、勝利したチームによってリリースされたコードを含むすべてのリソースが公開されています。
関連論文リスト
- OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026 [73.31700707400647]
我々は、EgoCrossを堅牢なクロスドメインエンボディビデオ推論問題として定式化する。
時間的境界あいまいさ、ドメイン間セマンティックミスマッチ、およびクローズドオプションによる決定不安定性の3つの主要な課題を特定します。
我々の提出物はソース制限トラックで66.35%、オープンソーストラックで66.77%、両リーダーボードで2位である。
論文 参考訳(メタデータ) (2026-05-23T09:09:12Z) - NTIRE 2025 XGC Quality Assessment Challenge: Methods and Results [107.50621348972328]
NTIRE 2025 XGC Quality Assessment Challengeは、CVPR 2025のNTIRE(New Trends in Image Restoration and Enhancement Workshop)と共同で開催される。
課題は、ユーザ生成ビデオ、AI生成ビデオ、会話ヘッドの3つのトラックに分けられる。
各トラックの参加チームはベースラインを上回り、3トラックのフィールドの開発に寄与する手法を提案している。
論文 参考訳(メタデータ) (2025-06-03T13:39:57Z) - EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation [54.32133648259802]
CVPR 2024のEgoVis Challengesには、Ego4Dチャレンジの5トラックとEPIC-Kitchensチャレンジの3トラックが含まれています。
ビデオ言語2towerモデルを構築し,厳密に整理された自我中心型ビデオデータを活用することにより,EgoVideoという新しい基礎モデルを導入する。
このモデルは、エゴセントリックなビデオの特徴に特化して設計されており、当社のコンペティションへの強力なサポートを提供する。
論文 参考訳(メタデータ) (2024-06-26T05:01:37Z) - The 7th AI City Challenge [87.23137854688389]
AIシティチャレンジの第7版では、コンピュータビジョンと人工知能の交差点にある2つのドメインを強調している。
2023年大会には5つのトラックがあり、46カ国508チームからの参加要請が過去最高となった。
参加チームのトップパフォーマンスは強いベースラインを確立し、提案されたチャレンジトラックで最先端の成績を上げました。
論文 参考訳(メタデータ) (2023-04-15T08:02:16Z) - Egocentric Video-Language Pretraining @ EPIC-KITCHENS-100 Multi-Instance
Retrieval Challenge 2022 [22.299810960572348]
EPIC-KITCHENS-100 Multi-Instance Retrieval (MIR) のためのビデオ言語事前学習ソリューション citekevin2022egovlp を提案する。
ベストシングルモデルは、47.39% mAP と 61.44% nDCG のチャレンジテストセットで高い性能を得る。
論文 参考訳(メタデータ) (2022-07-04T11:32:48Z) - The 6th AI City Challenge [91.65782140270152]
2022年のAIシティチャレンジの4つのチャレンジトラックは、27カ国254チームからの参加要請を受けた。
参加チームのトップパフォーマンスは強いベースラインを確立し、提案されたチャレンジトラックで最先端の成績を上げました。
論文 参考訳(メタデータ) (2022-04-21T19:24:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。