論文の概要: FrameONE: Hierarchical Motion Modeling for Universal Multi-View Echocardiographic Keyframe Detection
- arxiv url: http://arxiv.org/abs/2607.00748v1
- Date: Wed, 01 Jul 2026 10:31:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.854969
- Title: FrameONE: Hierarchical Motion Modeling for Universal Multi-View Echocardiographic Keyframe Detection
- Title(参考訳): FrameONE:Universal Multi-View Echocardiographic Keyframe Detectionのための階層型モーションモデリング
- Abstract要約: マルチビュー心エコー検出のための統合エンドツーエンドフレームワークであるFrameONEを提案する。
ビュー内マルチタスク学習は、外観バイアスを減らし、各ビュー内の動きに着目した表現を促進する。
ビュー間ジェネラルモーション学習モジュールは、ビュー固有のパターンからビューに依存しないダイナミクスを分離し、ビューをまたいだ共有でフレキシブルなモーション表現学習を可能にする。
- 参考スコア(独自算出の注目度): 21.820096793585293
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Accurate detection of end-systole (ES) and end-diastole (ED) frames is fundamental to echocardiographic assessment. Existing methods are typically developed in a view-specific manner, depend on auxiliary annotations or intensive visual modeling, which limits their generalizability. In multi-view modeling, keyframe detection is driven by shared cardiac motion, yet large appearance differences and motion patterns make unified modeling challenging. To address these issues, we propose FrameONE, a unified end-to-end framework for multi-view echocardiographic keyframe detection. FrameONE introduces a Hierarchical Motion Modeling strategy: an intra-view multi-task learning reduces appearance bias and promotes motion-focused representations within each view; an inter-view general motion learning module further separates view-agnostic dynamics from view-specific patterns, enabling shared yet flexible motion representation learning across views. Extensive experiments on 25,872 videos spanning four standard views demonstrate that FrameONE achieves state-of-the-art keyframe detection accuracy with strong cross-view generalization. Code is available at https://github.com/szuboy/FrameONE.
- Abstract(参考訳): 心エコー検査では,エンドシストール (ES) とエンドシストール (ED) の正確な検出が重要である。
既存の手法は一般的にビュー特有の方法で開発され、補助的なアノテーションや集中的な視覚的モデリングに依存し、それらの一般化性を制限する。
多視点モデリングでは、キーフレーム検出は共有心臓運動によって駆動されるが、外観の違いが大きく、動作パターンが統一的なモデリングを困難にしている。
これらの問題に対処するために,多視点エコー鍵フレーム検出のためのエンドツーエンド統合フレームワークであるFrameONEを提案する。
FrameONEは階層型モーションモデリング戦略を導入している: ビュー内マルチタスク学習は外観バイアスを減らし、各ビュー内の動きに着目した表現を促進する。
4つの標準ビューにまたがる25,872本の動画の大規模な実験により、FrameONEは強力なクロスビューの一般化によって最先端のキーフレーム検出精度を達成することを示した。
コードはhttps://github.com/szuboy/FrameONE.comで入手できる。
関連論文リスト
- Motion-Conditioned Multi-View Fusion for Myocardial Infarction Localization from Echocardiography [12.278137794889288]
MCF-Netは、エコー解析のための新しい動き誘導多視点融合フレームワークである。
心臓運動の手がかりと基礎モデル表現を融合させ、梗塞を局在させる。
セグメントレベルのMIローカライゼーションでは、MCF-Netは72.4%のF1と84.9%の精度を実現し、最先端のモーションオンリー、ビジョンオンリー、融合ベースラインを上回っている。
論文 参考訳(メタデータ) (2026-07-16T17:56:56Z) - Attend to Anything: Foundation Model for Unified Human Attention Modeling [23.199307554176016]
我々は、様々な画像、ビデオ、音声・視覚的タスク、シーン間で注目モデリングを統合するマルチモーダル基盤モデルであるAttend to Anything Model (AAM)を提示する。
AAMは、ハイパボリック空間に階層的な埋め込みを持つ言語プロンプトを通じて実装された、一般から特定の階層で組織された認知的包含関係として、注意を再構築する。
16のベンチマークの実験では、AAMは様々なシナリオで平均6%の最先端メソッドを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-02T12:00:21Z) - HVD: Human Vision-Driven Video Representation Learning for Text-Video Retrieval [11.757493828625869]
人間ビジョン駆動(Human Vision-Driven, HVD)モデルは、人間の視覚的な焦点を捉え、最先端のパフォーマンスを達成する。
本フレームワークは,2つのキーコンポーネントから構成される粗大なアライメント機構を確立する。
5つのベンチマークの実験では、HVDは人間のような視覚的焦点をキャプチャするだけでなく、最先端のパフォーマンスも達成している。
論文 参考訳(メタデータ) (2026-01-22T17:57:42Z) - FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning [65.42201665046505]
現在のビデオ理解モデルは、各質問の特定の推論条件にかかわらず、固定されたフレームサンプリング戦略に依存し、所定の視覚入力を処理する。
この静的アプローチは、視覚的エビデンスを適応的に収集する能力を制限し、広範囲の時間的カバレッジやきめ細かい空間的詳細を必要とするタスクにおいて、最適以下のパフォーマンスをもたらす。
Frame-Interleaved Chain-of-Thought (FiCOT)を通して、モデルが推論中に視覚情報を動的に要求することを可能にする強化学習で訓練されたエンドツーエンドフレームワークであるFrameMindを紹介する。
従来のアプローチとは異なり、FrameMindは複数のターンで動作し、モデルがテキスト推論とアクティブな視覚知覚を交互に切り替え、ツールを使って抽出する。
論文 参考訳(メタデータ) (2025-09-28T17:59:43Z) - From Sight to Insight: Unleashing Eye-Tracking in Weakly Supervised Video Salient Object Detection [60.11169426478452]
本稿では,弱い監督下での健全な物体の検出を支援するために,固定情報を導入することを目的とする。
特徴学習過程における位置と意味のガイダンスを提供するために,位置と意味の埋め込み (PSE) モジュールを提案する。
Intra-Inter Mixed Contrastive (MCII)モデルは、弱い監督下での時間的モデリング能力を改善する。
論文 参考訳(メタデータ) (2025-06-30T05:01:40Z) - Framer: Interactive Frame Interpolation [73.06734414930227]
Framerのターゲットは、ユーザのクリエイティビティに応じて、2つのイメージ間のスムーズな遷移フレームを生成することだ。
提案手法は,選択したキーポイントの軌道を調整し,遷移過程のカスタマイズを支援する。
ここでは,キーポイントと軌道を自動的に推定するモジュールを導入する。
論文 参考訳(メタデータ) (2024-10-24T17:59:51Z) - Graph-Jigsaw Conditioned Diffusion Model for Skeleton-based Video Anomaly Detection [7.127829790714167]
スケルトンに基づくビデオ異常検出(SVAD)はコンピュータビジョンにおいて重要な課題である。
本稿では,Skeleton-based Video Anomaly Detection (GiCiSAD) のためのグラフ-Jigsaw条件付き拡散モデル(Graph-Jigsaw Conditioned Diffusion Model)を提案する。
広く使われている4つの骨格ベースのビデオデータセットの実験では、GiCiSADはトレーニングパラメータが大幅に少ない既存の手法よりも優れていた。
論文 参考訳(メタデータ) (2024-03-18T18:42:32Z) - Slow-Fast Visual Tempo Learning for Video-based Action Recognition [78.3820439082979]
アクション・ビジュアル・テンポ(Action visual tempo)は、アクションのダイナミクスと時間スケールを特徴付ける。
以前の方法は、複数のレートで生のビデオをサンプリングするか、階層的にバックボーンの特徴をサンプリングすることによって、視覚的テンポをキャプチャする。
単一層における低レベルバックボーン特徴からアクション・テンポを抽出するための時間相関モジュール(TCM)を提案する。
論文 参考訳(メタデータ) (2022-02-24T14:20:04Z) - Background-Click Supervision for Temporal Action Localization [82.4203995101082]
時間的行動ローカライゼーションの弱さは、ビデオレベルのラベルからインスタンスレベルのアクションパターンを学習することを目的としており、アクションコンテキストの混乱が大きな課題である。
最近の作業の1つは、アクションクリックの監視フレームワークを構築している。
同様のアノテーションのコストを必要とするが、従来の弱い教師付き手法と比較して、着実にローカライズ性能を向上させることができる。
本稿では,既存の手法の性能ボトルネックが背景誤差に起因していることを明らかにすることにより,より強力なアクションローカライザを,アクションフレームではなく,バックグラウンドビデオフレーム上のラベルでトレーニングできることを見出した。
論文 参考訳(メタデータ) (2021-11-24T12:02:52Z) - Learning Monocular Depth in Dynamic Scenes via Instance-Aware Projection
Consistency [114.02182755620784]
本稿では,複数の動的物体の6-DoF動作,エゴモーション,深度を,監督なしで一眼レフカメラで明示的にモデル化する,エンドツーエンドのジョイントトレーニングフレームワークを提案する。
筆者らのフレームワークは,最先端の深度・動き推定法より優れていた。
論文 参考訳(メタデータ) (2021-02-04T14:26:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。