論文の概要: CuriosAI Submission to the CASTLE Challenge at EgoVis 2026
- arxiv url: http://arxiv.org/abs/2605.27800v1
- Date: Wed, 27 May 2026 00:40:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.625594
- Title: CuriosAI Submission to the CASTLE Challenge at EgoVis 2026
- Title(参考訳): EgoVis2026におけるCASTLEチャレンジへのCuriosAIの参加
- Authors: Yuto Kanda, Hayato Tanoue, Takayuki Hori,
- Abstract要約: CASTLE 2026は、600時間以上の同期マルチビューエゴセントリックビデオに対して185のマルチチョイス質問を行う。
我々は、人ごとのタイムライン、話者解決された文字起こし、マルチVLMキャプションアンサンブルを含む、共有マルチモーダル前処理層上での2つのアプローチを探索する。
- 参考スコア(独自算出の注目度): 0.7777489763207263
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: CASTLE 2026 asks 185 multiple-choice questions over 600+ hours of synchronized multi-view egocentric video. We explore two approaches on top of a shared multimodal preprocessing layer, including per-person timelines, speaker-resolved transcripts, and multi-VLM caption ensembles. Approach A, SVA: Search-Verify-Answer, is a three-stage pipeline that hierarchically narrows to a primary window, verifies sub-windows with a VLM under four anti-confabulation rules, and fuses evidence with an LLM judge under an evidence-priority hierarchy. Approach B, TMKG: Temporal-Multimodal-Knowledge-Graph, is the contrast: it builds a temporal multimodal knowledge graph, locates a primary cell via graph search, and produces the final answer with a single grounded VLM. SVA reaches a leaderboard accuracy of 0.50 and is our final challenge submission; TMKG reaches 0.35.
- Abstract(参考訳): CASTLE 2026は、600時間以上の同期マルチビューエゴセントリックビデオに対して185のマルチチョイス質問を行う。
我々は、人ごとのタイムライン、話者解決された文字起こし、マルチVLMキャプションアンサンブルを含む、共有マルチモーダル前処理層上での2つのアプローチを探索する。
Approach A, SVA: Search-Verify-Answerは3段階のパイプラインで、階層的に一次ウィンドウに狭められ、VLMでサブウィンドウを検証する。
アプローチB(TMKG: Temporal-Multimodal-Knowledge-Graph)は、時間的マルチモーダルな知識グラフを構築し、グラフ探索によって一次セルを探索し、単一の接地VLMで最終的な答えを生成する。
SVAはリーダーボードの精度0.50に達し、最終挑戦であるTMKGは0.35に達する。
関連論文リスト
- TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge [71.10535279591527]
我々は,CVPR 2026 EPIC-KITCHENS-100 MIRチャレンジに対して,TempRetと呼ばれるソリューションを提示する。
当社のアプローチは,CLIPベースのデュアルエンコーダのバックボーン上に構築されており,時間的および横断的な課題に対処するための2つの重要なコンポーネントを導入している。
EK-100 MIRベンチマークでは,平均mAPは67.97%,平均nDCGは82.92%であった。
論文 参考訳(メタデータ) (2026-05-23T08:37:39Z) - ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance [56.15563109738998]
ForeSeaは3段階のプラグアンドプレイパイプラインを備えたAI法医学検索システムである。
ForeSeaは従来のビデオRAGモデルよりも精度を3.5%向上し、一時IoUは11.0向上した。
論文 参考訳(メタデータ) (2026-03-24T07:15:28Z) - HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering [13.370338205427911]
長文のビデオ質問応答には、時間的コンテキストの拡張に対する推論が必要である。
類似性ベースのセレクタは高速だが、合成クエリを1つの高密度ベクトルに分解する。
このギャップを埋めるトレーニング不要のフレームワークであるHiMuを紹介します。
論文 参考訳(メタデータ) (2026-03-19T07:11:53Z) - MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks [67.31276358668424]
AV-HaystacksQAという新しいタスクを導入し、クエリに応答して、異なるビデオにまたがる有能なセグメントを識別し、それらをリンクして最も有意義な回答を生成する。
AVHaystacksは、マルチビデオ検索および時間的グラウンドタスクにおけるLMMの能力を評価するために設計された3100の注釈付きQAペアからなるオーディオビジュアルベンチマークである。
提案するAVHaystackのQAタスクにおけるBLEU@4およびGPT評価スコアの基準値よりも89%と65%の相対的な改善を実現し、モデルに依存しないマルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-08T06:34:29Z) - Multi-hop Evidence Pursuit Meets the Web: Team Papelo at FEVER 2024 [1.3923460621808879]
大規模言語モデル(LLM)の推論能力と,現代の検索エンジンの検索能力を組み合わせることで,この処理を自動化できることが示されている。
マルチホップエビデンス追跡戦略の下で,LSMと検索を統合した。
提案システムでは,開発セットで.510 AVeriTeC,テストセットで.477 AVeriTeCを達成した。
論文 参考訳(メタデータ) (2024-11-08T18:25:06Z) - MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs [88.28014831467503]
本稿では,包括的なベンチマークであるMMDUと,大規模命令チューニングデータセットであるMMDU-45kを紹介する。
MMDUは最大18k画像+テキストトークン、20イメージ、27ターンを備えており、これは以前のベンチマークの少なくとも5倍長くなる。
MMDU-45k上のフネ調整型オープンソースLVLMは、このギャップに適応し、より長く正確な会話を生成することを実証する。
論文 参考訳(メタデータ) (2024-06-17T17:59:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。