論文の概要: A Quantitative Evaluation Framework for Temporal Explainability in Echocardiographic Video Segmentation
- arxiv url: http://arxiv.org/abs/2609.08043v1
- Date: Mon, 07 Sep 2026 22:58:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.532643
- Title: A Quantitative Evaluation Framework for Temporal Explainability in Echocardiographic Video Segmentation
- Title(参考訳): 心エコー画像分割における時間的説明可能性の定量的評価フレームワーク
- Authors: Jiyoo Noh, Jonathan H. Chan,
- Abstract要約: 深層学習は、心エコービデオセグメンテーションにおいて最先端のパフォーマンスを達成し、時間情報を組み込んだモデルが増えている。
本研究では, 時間的一貫性, 突発性運動, 解剖学的重複, 時間的重複を測定する4つの相補的指標を用いてGrad-CAMの説明を評価するための定量的枠組みを提案する。
- 参考スコア(独自算出の注目度): 0.0687531213383208
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deep learning has achieved state-of-the-art performance in echocardiographic video segmentation, with an increasing number of models incorporating temporal information. However, quantitative evaluation of temporal explainability remains largely unexplored. We propose a quantitative framework for evaluating Grad-CAM explanations using four complementary metrics measuring temporal consistency, saliency motion, anatomical overlap, and temporal overlap. Using EchoNet-Dynamic, we compare a baseline 2D U-Net with ConvLSTM U-Net models trained across multiple temporal strides. While segmentation performance remained comparable across all models, intermediate ConvLSTM explanations exhibited substantially lower saliency consistency and greater centroid motion than final prediction explanations. Temporal Bottleneck explanations were significantly more stable than Encoder Bottleneck explanations across all strides, while final ConvLSTM Decoder3 explanations were broadly comparable to those of the 2D U-Net. Importantly, conventional frame-wise explanation metrics cannot determine whether variation in intermediate explanations reflects meaningful temporal feature evolution or explanation instability. These findings establish a preliminary quantitative framework for temporal explainability and motivate temporal-aware XAI methods that explicitly account for evolving representations in medical video models.
- Abstract(参考訳): 深層学習は、心エコービデオセグメンテーションにおいて最先端のパフォーマンスを達成し、時間情報を組み込んだモデルが増えている。
しかし、時間的説明可能性の定量的評価はほとんど未解明のままである。
本研究では, 時間的一貫性, 突発性運動, 解剖学的重複, 時間的重複を測定する4つの相補的指標を用いてGrad-CAMの説明を評価するための定量的枠組みを提案する。
EchoNet-Dynamicを使用すると、ベースラインの2D U-NetとConvLSTM U-Netモデルを比較する。
セグメンテーション性能は全モデルに匹敵するものの、中間的ConvLSTM説明は最終的な予測説明よりも唾液濃度の整合性やセントロイド運動が著しく低かった。
テンポラル・ボトルネックの説明はエンコーダ・ボトルネックの説明よりもはるかに安定しており、最後の ConvLSTM Decoder3 の説明は2D U-Net の説明と大きく同等であった。
重要なことは、従来のフレームワイドな説明尺度では、中間的説明の変動が意味のある時間的特徴の進化や説明の不安定性を反映するかどうかを判断できないことである。
これらの知見は、時間的説明可能性のための予備的な定量的枠組みを確立し、医用ビデオモデルにおける表現の進化を明示的に考慮する時間的認識XAI法を動機づける。
関連論文リスト
- TTGBench: Benchmarking Topological Evolution and Semantic Drift in Text-attributed Temporal Graphs [24.36945438269572]
時間グラフ学習は動的システムの進化をモデル化し、構造的相互作用と意味的状態の両方が時間とともに変化する。
構造と意味の進化を共同で評価する新しいベンチマークである textbfTTGBench を導入する。
本稿では,時間グラフニューラルネットワーク(TGNN)とLarge Language Model(LLM)に基づくパラダイムを用いた17の最先端手法の総合評価を行う。
論文 参考訳(メタデータ) (2026-09-08T04:19:11Z) - Distilling Temporal Coherence into 2D Networks for Transrectal Ultrasound Prostate Video Segmentation [2.65131397683555]
経直腸超音波(TRUS)における前立腺のリアルタイムビデオセグメンテーションは画像誘導的介入に不可欠である。
本稿では,時間的コヒーレンスをトレーニング中に2次元ネットワークに蒸留する時間的一貫性学習フレームワークを提案する。
前立腺は幾何学的安定性を示し,周囲の音環境は生理的動きや振動子圧力によって変動する。
論文 参考訳(メタデータ) (2026-06-30T06:27:02Z) - From Prompts to Pavement Through Time: Temporal Grounding in Agentic Scene-to-Plan Reasoning [1.2777067998526854]
本研究は, エージェント間コミュニケーションにおける時間的条件付けが, 意味的・論理的一貫性の低下を伴わずにコヒーレンスを維持・強化できるかどうかを考察する。
その結果,時間的条件付けは推論スタイルに反するが,標準NLPに基づく正当性測定では統計的に有意な改善は得られなかった。
これらの結果から,プロンプトベースの時間的接地限界を明らかにし,時間的シーンから計画的推論のための最初の経験的基準を確立した。
論文 参考訳(メタデータ) (2026-05-19T13:18:35Z) - Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models [154.39583176906893]
大規模言語モデル(ML)は高度な理解を持ち、シーンにおける幻覚の傾向が高い。
これは、時間的モニタリングの失敗、オブジェクトの動的アイデンティティ、状態、そして時間とともに関係を永続的に追跡する能力に起因している、と我々は主張する。
既存のベンチマークでは、局所的な視覚的手がかりや統計的先行によってしばしば解決される1つの最終回答クエリに頼って、この欠陥を曖昧にしている。
論文 参考訳(メタデータ) (2026-05-09T14:32:36Z) - Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding [56.7383554589569]
人間のような知性には長いビデオ理解が不可欠であり、時間的文脈を超越したコヒーレントな認識と推論を可能にする。
強化学習に基づく投機的時間的推論フレームワークであるSpecTempを提案する。
我々はSpecTempが競争精度を維持するだけでなく、既存の思考とフレームの手法と比較して推論を著しく加速することを示した。
論文 参考訳(メタデータ) (2025-11-30T09:27:59Z) - Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models [56.851611990473174]
動的ビジュアルコンテンツに対する推論は、大きな言語モデルにとって依然として中心的な課題である。
本稿では,時間的精度と推論一貫性を両立させる強化学習手法を提案する。
結果のモデルであるVideo R2は、複数のベンチマークでTAC、VAS、精度を一貫して向上させる。
論文 参考訳(メタデータ) (2025-11-28T18:59:58Z) - Causality Matters: How Temporal Information Emerges in Video Language Models [17.570777893613137]
ビデオ入力における位置エンコーディングの除去や修正は、時間的理解の性能の低下を最小限に抑えることが判明した。
この振る舞いを説明するために、我々は時間的情報がモデルにどのように組み込まれているかを追跡するための重要な分析実験を行った。
そこで我々は,2つの効率重視戦略を提案する。
論文 参考訳(メタデータ) (2025-08-15T16:33:14Z) - MOOSE: Pay Attention to Temporal Dynamics for Video Understanding via Optical Flows [21.969862773424314]
MOOSEは、光フローと空間埋め込みを統合し、時間情報を効率的にモデル化する新しい時間中心ビデオエンコーダである。
従来のモデルとは異なり、MOOSEはビデオモデルをスクラッチからトレーニングする代わりに、リッチで広く訓練済みの視覚的および光学的フローエンコーダを利用する。
論文 参考訳(メタデータ) (2025-06-01T18:53:27Z) - TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models [75.42002690128486]
TemporalBenchは、ビデオの微細な時間的理解を評価するための新しいベンチマークだ。
ビデオクリップの時間的ダイナミクスを詳述した2Kの高品質な人間のアノテーションから派生した10KのビデオQ&Aペアで構成されている。
GPT-4oのような最先端のモデルは、TemporalBench上で38.5%の質問応答精度しか達成していない。
論文 参考訳(メタデータ) (2024-10-14T17:59:58Z) - Interpretable Time-series Representation Learning With Multi-Level
Disentanglement [56.38489708031278]
Disentangle Time Series (DTS)は、シーケンシャルデータのための新しいDisentanglement Enhanceingフレームワークである。
DTSは時系列の解釈可能な表現として階層的意味概念を生成する。
DTSは、セマンティック概念の解釈性が高く、下流アプリケーションで優れたパフォーマンスを実現します。
論文 参考訳(メタデータ) (2021-05-17T22:02:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。