論文の概要: DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding
- arxiv url: http://arxiv.org/abs/2608.06869v2
- Date: Tue, 11 Aug 2026 08:50:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.424698
- Title: DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding
- Title(参考訳): DAEP:医療用ビデオコーパス仮設アンサーグラウンドの難易度を考慮したエビデンスプランニング
- Authors: Tianjian He, Yujie Liu, Zhiping Huang, Changbo Xu,
- Abstract要約: DAEPは、サブタイトル、視覚的、手続き的コンテキストのエビデンスでビデオをランク付けし、ハイスコアのアンカーをテンポラリなスパンに拡大し、最終的なアウトプットのために再ランクする。
公式評価では、BIGCは平均スコア0.2728の10のシステムの中で第1位である。
- 参考スコア(独自算出の注目度): 3.789791170910229
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We describe DAEP, team BIGC's submission to NLPCC 2026 Shared Task 1 Track 3: Difficulty-Aware Temporal Answer Grounding in Video Corpus (DA-TAGVC). The task requires retrieving the target video from 50 candidates and localizing the answer-supporting span. DAEP ranks videos with subtitle, visual, and procedural-context evidence, expands high-scoring anchors into temporal spans, and reranks spans for final output. Its main design is to convert the task-provided simple/complex input label into an inference-time evidence plan controlling modality weights, Top-K aggregation, boundary threshold, expansion length, and reranking strength. In the official evaluation, BIGC ranks first among ten systems with an Average score of 0.2728. Validation ablations show that visual evidence, procedural context, and difficulty-aware planning improve ranking quality, with the largest gain on complex questions.
- Abstract(参考訳): NLPCC 2026 Shared Task 1 Track 3: Difficulty-Aware Temporal Answer Grounding in Video Corpus (DA-TAGVC)について述べる。
このタスクでは、50の候補から対象のビデオを検索し、回答をサポートするスパンをローカライズする必要がある。
DAEPは、サブタイトル、視覚的、手続き的コンテキストのエビデンスでビデオをランク付けし、ハイスコアのアンカーをテンポラリなスパンに拡大し、最終的なアウトプットのために再ランクする。
その主な設計は、タスク提供された単純/複雑入力ラベルを、モダリティウェイト、Top-Kアグリゲーション、バウンダリ閾値、拡張長、およびリグレード強度を制御する推論時エビデンスプランに変換することである。
公式評価では、BIGCは平均スコア0.2728の10のシステムの中で第1位である。
検証は、視覚的証拠、手続き的文脈、困難な計画がランク付け品質を向上し、複雑な質問に対して最大の利益をもたらすことを示している。
関連論文リスト
- Evidence-Backed Video Question Answering [90.93225758130426]
既存の説明可能性の取り組みは、テキストの合理性やまばらなバウンディングボックスに依存している。
E-VQA(Evidence-Backed Video Question Answering)を提案する。
これをサポートするために,識別的および生成的画素レベルのグラウンド化のための最初の人為的検証ベンチマークST-Evidenceを導入する。
論文 参考訳(メタデータ) (2026-07-13T17:49:10Z) - Overview of the NLPCC 2026 Shared Task 1: Difficulty-Aware Multilingual and Multimodal Medical Instructional Video Understanding Evaluation [10.95548386417167]
DA-MIVQAは、回答に必要な証拠の種類と複雑さに応じて、質問を明確に区別することで、過去の多言語およびマルチモーダルな医療ビデオベンチマークを拡張している。
本稿では,DA-MIVQAのタスクモチベーション,データセット構築,評価プロトコル,参加者概要,競争結果,代表システムについて述べる。
論文 参考訳(メタデータ) (2026-07-07T09:24:48Z) - 3rd Place at CVPR 2026 CASTLE Challenge: Agentic Multi-View Long-Context Video Understanding via Hierarchical Knowledge Graph Retrieval [0.8594140167290097]
本稿では,CVPR 2026ワークショップにおけるCASTLE 2026 Challengeの優勝方法論について述べる。
我がチームは世界3位を獲得した。
ベースとなるデータセットは、エゴとエクソカメラのソースによって撮影された600時間以上の同期映像で構成されている。
論文 参考訳(メタデータ) (2026-06-01T09:01:32Z) - Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding [38.87967229483403]
Video-TwGは、新しいThink-with-Groundingパラダイムを採用したカリキュラム強化フレームワークである。
Video-TwGは、複雑な補助モジュールや注釈付き推論トレースに頼ることなく、簡単にエンドツーエンドでトレーニングすることができる。
提案アルゴリズムは, 微粒な接地報酬, 自己確認擬似報酬, 精度保証機構を特徴とする。
論文 参考訳(メタデータ) (2026-02-21T03:16:23Z) - VideoExplorer: Think With Videos For Agentic Long-Video Understanding [117.68219930263153]
ロングビデオ理解はコンピュータビジョンにおいて難しい問題である。
ビデオによる思考の原則に基づくフレームワークであるVideoExplorerを提案する。
静的なコンテキストを推論する代わりに、VideoExplorerは、サブクエストを反復的に定式化し、関連するモーメントを特定し、タスク指向で時間的にスケーラブルなビデオ理解を実行する。
論文 参考訳(メタデータ) (2025-06-12T15:39:10Z) - SAMA: Towards Multi-Turn Referential Grounded Video Chat with Large Language Models [93.73583158211115]
ビデオにおけるきめ細かい時間的理解の獲得は、現在のビデオ大マルチモデル(ビデオLMM)にとって大きな課題である。
私たちは、データセット、モデル、ベンチマークの3つの中核的な側面に貢献しています。
まず,ビデオ理解,グラウンドニング,マルチターンビデオチャットの共用学習を実現するため、15Kビデオからなる大規模データセットであるSAMA-239Kを紹介する。
第2に,広義の時間的コンテキストアグリゲータとセグメンションモデルを組み合わせたSAMAモデルを提案する。
論文 参考訳(メタデータ) (2025-05-24T18:13:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。